GPT-5.6 Sol 解决数学难题,但 ARC-AGI-3 基准测试曾遇瓶颈
GPT-5.6 Sol 已被用于解决数学中的开放问题,但在 ARC-AGI-3(一个 2D 益智游戏基准测试)中最初表现不佳。调查发现,标准测试框架在每次移动后丢弃了模型的推理,并在上下文填满时丢弃了早期动作。通过启用 Responses API 的保留推理和上下文压缩功能,模型的得分提高了 188%,同时输出令牌减少了 6 倍,这表明基准测试分数不仅反映模型本身,还反映了测试框架和设置。
GPT-5.6 Sol 已被用于解决数学中的开放问题,但在 ARC-AGI-3(一个 2D 益智游戏基准测试)中最初表现不佳。调查发现,标准测试框架在每次移动后丢弃了模型的推理,并在上下文填满时丢弃了早期动作。通过启用 Responses API 的保留推理和上下文压缩功能,模型的得分提高了 188%,同时输出令牌减少了 6 倍,这表明基准测试分数不仅反映模型本身,还反映了测试框架和设置。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
OpenAI发现,仅通过启用两个API设置,GPT-5.6 Sol在ARC-AGI-3基准测试上的得分提升了188%,同时输出token减少了6倍。这一发现揭示了基准测试分数并非单纯反映模型能力,而是模型、测试框架和设置共同作用的结果。
OpenAI在X上发文称,GPT-5.6 Sol已被用于解决数学开放问题,但在ARC-AGI-3基准测试中表现挣扎。ARC-AGI-3测试模型学习不熟悉的2D游戏而无需指令的能力。这一反差引发了关于模型真实认知能力的疑问。
OpenAI调查发现,标准测试框架在每次移动后丢弃GPT-5.6 Sol的推理,并在上下文填满时丢弃早期动作。这意味着模型必须不断重新开始,无法利用已学到的经验。这并非模型能力不足,而是测试框架设计限制了其表现。
OpenAI使用Responses API实现了新的测试框架,并启用了两个设置:保留推理和上下文压缩。在公开数据集上,GPT-5.6 Sol的得分提升了188%,同时输出token减少了6倍。这一结果凸显了API设置对模型性能的巨大影响。
OpenAI指出,基准测试分数反映的是模型以及用于运行它的框架和设置。对于长期运行的智能体,保留推理和压缩上下文能让模型基于已学内容继续构建。OpenAI希望这些实验提醒开发者,评估很少孤立地衡量模型,而是衡量API设置、框架设计和提示等隐性选择的组合。
本文信息全部来自OpenAI官方X账号的系列推文,属于第一方来源。但推文内容本身是OpenAI的自我报告,缺乏独立第三方验证。文中提到的“解决数学开放问题”未提供具体细节,其范围和重要性无法确认。
GPT-5.6 Sol在ARC-AGI-3上的分数翻三倍并非模型本身突然变强,而是通过优化测试框架释放了其已有能力。这一案例提醒我们,基准测试分数应谨慎解读,它反映的是模型、框架和设置的组合效果,而非模型能力的纯粹度量。
主报道
主报道来源
另有 2 个来源报道