Arena上线AutoEval:AI先模拟真人打分,新模型1小时就能出分
据动察 Beating 监测,大模型竞技评测平台 Arena 推出 AutoEval,用奖励模型(学习真人偏好的评分模型)模拟用户投票,为新模型快速生成排行榜分数。新模型发布后,不用等待数天积累真人票数,最快不到 1 小时就能获得预估排名。该分数会标注为 AutoEval,后续再由真人投票结果校正。
这套系统基于数百万组真实用户偏好数据训练。评测时,AutoEval 会比较不同模型的回答质量,并按照 Arena 原有排行榜规则计算分数。目前它支持文本、视觉、生图和代码模型评测。
Arena 回测显示,AutoEval 与后续真人排名的相关性超过 0.98。两款模型真实分差超过 10 分时,它判断胜负的准确率超过 90%;分差超过 15 分时达到 100%。但当模型差距小于 5 分时,仍难以稳定区分。