OpenAI通过保留推理与压缩设置让GPT‑5.6在ARC‑AGI‑3基准成绩提升三倍

0 阅读3分钟前沿
OpenAI通过保留推理与压缩设置让GPT‑5.6在ARC‑AGI‑3基准成绩提升三倍

背景

ARC‑AGI‑3 是一套用于衡量 AI 代理在未知 2D 解谜游戏中学习与推理能力的基准。此前,OpenAI 的 GPT‑5.6 Sol 在该基准公开任务集上仅取得 13.3% 的相对人类行为效率(RHAE),远低于人类约 48% 的水平。

实验设置

研究团队对比了两种评估环境:

  • 官方通用 Harness:采用滚动截断窗口,且在每一步动作后丢弃模型的私有推理信息。
  • Responses API 定制 Harness:启用 保留推理(将模型内部思考消息保存在对话历史中)和 压缩(在上下文超限时进行摘要压缩而非直接删去旧信息)。

关键发现

  • 分数提升:开启两项设置后,GPT‑5.6 Sol 的得分从 13.3% 上升至 38.3%,相当于原始成绩的近三倍。
  • 效率提升:输出 token 数量下降约 6 倍,说明模型在保留推理后能够更快决定行动,减少重复思考。
  • 行为改进:保留推理使模型能够在连续回合中复用之前的计划与洞见,学习曲线更平滑;压缩则防止重要的早期观察被滚动截断抹去,保持长期记忆。

“模型在每一步都必须重新‘从头思考’,是导致低分的根本原因。”——OpenAI 研究团队

影响与建议

  1. 评估工具箱的重要性:公开基准的得分往往受限于评估 harness 的实现细节,单纯比较模型本身可能产生误导。
  2. 生产环境最佳实践:对外 API 开发者应使用 OpenAI 的 Responses API,并默认开启 retain reasoningcompaction,以匹配 ChatGPT 与 Codex 的真实部署表现。
  3. 对比评测的公平性:在比较不同供应商的模型时,建议统一使用上述设置,以确保评测结果可复现且具备实际参考价值。

展望

此次实验表明,模型能力的发挥与评估环境同等重要。随着更复杂的代理任务涌现,如何在 API 层面提供灵活且高效的上下文管理,将成为提升大模型实际应用效能的关键方向。OpenAI 将继续优化 Responses API,帮助开发者在真实产品中充分释放 GPT‑5.6 乃至后续模型的推理潜能。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。