OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍
据动察 Beating 监测,OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。
OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。
但问题在于,Opus 5 用的也是这套通用框架。它以 High 推理档拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 档也只有 13.3%。框架确实拖累了 GPT-5.6,却没有同样拖垮 Opus 5。
不管 OpenAI 怎么狡辩,Opus 5 在这项全球最难 AI 评测里就是明显强于 GPT-5.6。