01 谁是王者?
同一榜单、题集与候选策略下,至少两个有效对象才能排名。按榜单登记的计分精度取第一,并列者共同持有。独立原始实测不额外舍入;LiveBench 来源发布榜按官网全科显示与本站已声明的两位小数计分。
至少十个候选时:王者优先,其余前 10% 为头部、前 50% 为主力,其余已测为追赶。边界向上取整,同分同级。
不足十项只显名次;无成绩为待测。
ARENA V2.1 / 比较规则
人物帮助识别;具体型号、配置与有来源的数据负责判断。
同一榜单、题集与候选策略下,至少两个有效对象才能排名。按榜单登记的计分精度取第一,并列者共同持有。独立原始实测不额外舍入;LiveBench 来源发布榜按官网全科显示与本站已声明的两位小数计分。
至少十个候选时:王者优先,其余前 10% 为头部、前 50% 为主力,其余已测为追赶。边界向上取整,同分同级。
不足十项只显名次;无成绩为待测。
先选择任务,再筛选模态、开放权重、预算和上下文。满足能力门槛后,才能推荐低成本候选。
缺少适用评测时,只能比较已知规格与报价。编程答题不能代表工程代理能力,上下文不能代替长文实测。
当前编程、推理、数据分析与写作分别采用 LiveBench 对应子榜;语言只提供写作的部分证据,长文准确率仍缺测。API 报价配置尚未与评测配置对应,不授予能力—成本性价比称号。
只有连续两日成功且可比的快照才生成涨跌;新入榜、候选池增减、配置变化与指数重拟合单独解释。
同条件复测成绩较低,只说明本次成绩回落。名次下降可能由新模型加入引起,不断言模型“变笨”。
失败保留上次成功版本,并提示滞后。
API 固定工作量:输入 tokens × 输入单价 / 1,000,000 + 输出 tokens × 输出单价 / 1,000,000。必须同提供商、端点、批次、币种与收费条件。
评测成功任务成本:由对应评测任务和计费边界决定。不能与每百万 token 单价、订阅费或部署费用混排。未知价格不等于免费,贵也不代表更强。
只有明确上下界的同项原始成绩才显示能力条。ECI 是无界来源指数,不显示百分制能力条;点估计第一不代表显著领先,置信区间与拟合版本必须保留。
来源发布榜保留各行原有配置,与本站同条件原始测量分开。不同榜单不平均成一个“战力”。
查看当前来源与启用状态 →