GPT-5.6开始自我优化:改写底层代码,成本降低20%
OpenAI在最新技术报告中披露,GPT-5.6已开始在生产环境中自我优化,包括分析流量、调整路由、改写底层Kernel和优化推测解码模型,使服务成本降低20%,Token生成效率提升15%以上。这标志着AI递归自进化(RSI)的初步实现,但人类仍保留最终控制权。
OpenAI在最新技术报告中披露,GPT-5.6已开始在生产环境中自我优化,包括分析流量、调整路由、改写底层Kernel和优化推测解码模型,使服务成本降低20%,Token生成效率提升15%以上。这标志着AI递归自进化(RSI)的初步实现,但人类仍保留最终控制权。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
OpenAI 在最新技术报告中披露,GPT-5.6 已投入生产环境,自主分析流量、改写底层 Kernel 并优化推测解码,使服务成本降低 20%、Token 效率提升 15% 以上。这被视为递归式自我改进(RSI)的早期实践,但人类仍保留关键控制权。
据 OpenAI 技术报告披露,GPT-5.6 已被部署到真实生产环境,承担四项具体优化任务。首先,它分析生产流量,识别不同机器和服务节点间的负载不均,并测试新的路由策略以优化请求分配。其次,它深入模型的 forward pass,寻找可提前计算、省略或并行执行的部分,并通过 Codex 改写生产环境中的 Triton 和 Gluon Kernel。第三,它为自己的 draft model 设计方案,自动运行数百次实验测试不同模型大小、结构和特征,并在训练不稳定或硬件故障时主动介入。第四,针对短对话、长上下文、代码任务等不同负载,自动搜索 batching、sharding 和 KV Cache 管理的更优组合。
这四项任务构成了一条完整的工程反馈回路:观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再将有效改进部署回承载自身运行的系统。报告作者包括 Triton 之父 Philippe Tillet,暗示底层 GPU 编程工具链的演进——从教人类写 Kernel 到让模型自己改写 Kernel。
OpenAI 报告称,GPT-5.6 的自我优化使端到端服务成本降低 20%,Token 生成效率提升 15% 以上。这些数字来自真实生产环境的测量,但报告未披露具体基准和测量方法。成本降低可能来自多个环节的累积效应,包括路由优化、Kernel 改写和推测解码改进。效率提升则部分归因于 Agent Harness 对循环开销的削减。
尽管 GPT-5.6 开始参与改造自身运行环境,但人类仍保留关键决策权。优化目标、工具权限、评测指标以及代码能否进入生产环境,均由人类决定。这意味着当前实践并非完全的递归式自我改进,而是 human-in-the-loop 的受限版本。报告也指出,模型内部优化之外,外部 Agent 循环仍存在大量重复开销,例如一次用户请求可能触发模型数十次思考-工具调用循环。
为此,OpenAI 搭建了由 Rust 编写的 Agent Harness,通过两项关键优化减少重复工作:一是延迟工具发现,仅在需要时才向模型展示对应工具,并将工具返回内容默认限制在 1 万 Token 以内;二是采用只追加、不回写的缓存策略,保持 Prompt 缓存前缀不变,使 GPU 仅处理新增内容。这些优化与模型自我改进共同构成效率提升的双重来源。
报告还透露了一个反直觉的趋势:在 GPT-5.6 内部测试期间,每名活跃研究人员的日均输出 Token 超过了 GPT-5.5 时期峰值的两倍。过去半年,OpenAI 用于内部编程推理的研究算力占比增长了 100 倍,内部 Agent Token 用量增长了约 22 倍。这些数字表明,AI 效率提升并未减少资源消耗,反而因更低的成本和更好的可用性刺激了用量增长。不过,报告未明确这些增长是否直接归因于 GPT-5.6 的自我优化,也可能包含其他因素。
本文信息主要来自 OpenAI 官方技术报告及量子位的报道。报告为第一手来源,但部分细节(如具体优化机制、测量方法)未完全公开。量子位作为二级报道,其转述与报告一致。所有数字和结论均标注来源,推理部分已明确区分。
GPT-5.6 的自我优化标志着 RSI 从概念走向工程实践,但人类仍保留关键控制权。成本降低和效率提升已产生可量化收益,同时 AI 用量的激增揭示了效率悖论:更便宜、更好用反而导致更多消耗。未来 RSI 的演进将取决于人类如何平衡自主性与安全性。
主报道
主报道来源