OpenAI推出GPT‑5.6 将智能与效率同步提升,推算成本减半

0 阅读3分钟前沿
OpenAI推出GPT‑5.6 将智能与效率同步提升,推算成本减半

关键升级

OpenAI 本次推出的 GPT‑5.6 系列包括三款模型:

  • GPT‑5.6 Sol:最高推理能力,单 token 成本仅为竞争对手 Claude Fable 5 的一半。
  • GPT‑5.6 Terra:在常规智能基准上保持 GPT‑5.5 水平,却以 50% 成本提供服务。
  • GPT‑5.6 Luna:面向高吞吐场景,成本比 Sol 低 80%。

这些模型的核心目标是“更高的智能·更低的费用”,通过多层堆叠的系统优化实现了前所未有的效率提升。

推理层面的效率提升

OpenAI 对整个推理栈进行了全链路改造。

  • 负载均衡:依据地理位置、加速器类型和缓存状态动态分配请求,显著降低空闲 GPU 时间。
  • 内核优化:利用 GPT‑5.6 Sol 自动生成的 Triton 与 Gluon 内核代码,减少内存搬迁与同步开销,整体服务成本下降约 20%。
  • 投机解码(Speculative Decoding):通过并行草稿模型验证多个 token,提升 token 生成效率 15% 以上。
  • KV 缓存管理:自动化调参实现批处理、分片与缓存命中率的最优组合,使相同硬件能够处理更多并发请求。

这些技术的叠加,使得在相同算力下,OpenAI 能够提供更高的吞吐量和更低的延迟。

Agentic Harness 的改进

ChatGPT Work 与 Codex 在复杂任务中依赖多轮模型调用和工具链。GPT‑5.6 通过 Agentic Harness 实现了以下优化:

  • 避免上下文膨胀:采用延迟发现机制,仅在必要时加载插件和工具,防止无效信息占用上下文窗口。
  • 精确前缀缓存:将模型可见历史设为追加式,保证相同前缀的计算可被复用,显著提升缓存命中率。
  • 重复工作复用:对常见的工具调用模式进行抽象,跨轮次复用计算结果,降低每轮额外开销。

这些改进让一次完整的用户请求(可能包含 30 次模型调用)整体耗时下降约 30%,成本进一步压缩。

市场与成本影响

截至发布,OpenAI 已拥有超过 10 亿活跃用户和 200 万企业客户。GPT‑5.6 的成本优势将直接提升这些用户的使用频率和业务规模。OpenAI 表示,未来将继续在模型效率与算力利用率上投入研发,以确保 AGI 价值能够以更低的门槛惠及全人类。

“我们相信,通过持续的底层优化,智能的每一次进步都应伴随成本的同步下降。”——OpenAI 技术团队

结语

GPT‑5.6 标志着生成式 AI 从单纯追求更大模型向“更聪、更省”双向进化的关键节点。对于企业而言,这意味着在保持业务创新的同时,能够显著降低 AI 运营支出;对于个人用户,则意味着更流畅、更经济的交互体验。后续的生态适配和第三方工具集成将进一步放大这一效益。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。