LMArena Text
让用户匿名比较两个模型的回答并投票,衡量真实用户更偏好哪个模型。
最新评分: · 20 个品牌
热门公开评分,一页看完。
已发布 9 项公开评分
让用户匿名比较两个模型的回答并投票,衡量真实用户更偏好哪个模型。
通过需要自主规划和执行的编程任务,衡量模型独立解决代码问题的能力。
通过银行客服中的知识检索、长对话和工具调用,衡量智能体完成真实业务请求的能力。
通过博士专家编写的生物、物理和化学难题,衡量模型的高阶科学知识与推理能力。
通过高难度竞赛数学题,衡量模型的数学推理与解题能力。
通过高难度竞赛数学题,衡量模型的数学推理与解题能力。
通过真实开源项目的 GitHub 问题和测试,衡量模型理解代码仓库并正确修复问题的能力。
通过持续收集的新竞赛编程题,衡量模型生成可通过测试代码的能力,同时降低训练数据污染。
通过真实终端环境中的软件、系统和数据任务,衡量智能体独立操作计算机的能力。