GPT-5.6 Sol自我优化内核:效率再飙20% 成本砍半!


OpenAI用一半成本吊打Claude,效率翻倍还能自我进化,这谁顶得住?

GPT-5.6家族用Sol、Terra、Luna三把刀切进AI市场,Sol推理性能碾压Claude Fable 5且成本砍半,Terra价格减半性能持平前代,Luna直接便宜八成。这背后是推理栈、智能体套件和模型本身的连环优化,负载均衡、推测解码、内核重写、缓存命中率提升,每个环节抠出20%效率。Sol还自己动手写代码调内核,AI开始优化AI,效率曲线要起飞了。

智能体正在吃掉自己的尾巴

AI模型跑得快不算真本事,跑得巧才算。GPT-5.6这次玩了个狠活,让最强模型Sol去优化其他模型的运行方式。这就像让班里最聪明的学生去设计整个班级的学习方法,结果全班成绩都上去了。Sol在Codex里分析生产流量,找出负载不均衡的漏洞,测试新路由策略,然后不断调整这些经验法则。单是负载均衡这一项改进,就让服务模型成本大幅下降。

推理栈是模型跑起来的那套系统,负责把训练好的模型变成实际回答。OpenAI的工程师们发现,模型本身再高效,如果请求分配不均匀、硬件闲着、数据搬运太慢,费用照样高得吓人。他们把整个流程拆成路由、调度、内核、缓存、模型实现五个层面,每一层都抠出一点效率,叠在一起就是大丰收。

Sol还干了件更狠的事,它自己重写了生产内核。内核就是GPU上跑数学运算的核心代码,这活儿以前全靠工程师手写。Sol在Triton和Gluon这两个开源GPU编程语言上特别擅长,它直接动手优化代码,把端到端服务成本压低了百分之二十。更绝的是OpenAI还搞了个验证工具叫FpSan,专门检查Sol写的代码对不对,形成了AI写代码、AI检查代码的闭环。

推测解码让模型学会抢跑

推测解码是个聪明的把戏,旁边跑个小模型当草稿手,先猜几个词出来,大模型只要一次性验证这些词对不对。猜对了就省掉大模型逐词生成的时间,一次大模型计算能吐出好几个词。Sol自己设计了上百次实验来改进这个小模型,调整它的尺寸、结构和特征,还全程盯着训练过程,碰到硬件故障或训练不稳就自己出手干预。这套操作把生成效率往上推了超过百分之十五。

KV缓存是另一个省钱利器,模型处理没缓存过的输入时,要花一次密集计算建缓存。生成输出时反复读取和扩展这个缓存。但怎么配置缓存、怎么分片、怎么管理,全看具体任务是什么,提示长度、输出长度、批次大小、缓存命中率都不一样。以前配置空间太大没法系统调优,工程师只能靠大概经验。Sol进场后分析生产任务,生成候选配置,评估哪个最好,把引擎和模型的配置针对每个场景都调到最优。

整个推理优化就是个持续反馈圈,量生产行为、找最大差距、改系统、验证改完对整个流程有好处而不是光对某个测试有用。Sol和Codex加速了这个圈的每一环,团队能探索更多点子、更快响应任务变化、造出延迟更低、容量更大、用户成本更低的推理栈。

智能体套件专治重复劳动

ChatGPT Work和Codex干活时得一次次调用模型和工具,改个代码可能要查源码、搜部署记录、读事故报告、编辑文件、跑测试,每一步都要发一次请求。准备上下文、传数据、跑推理、调工具、启动进程,这些都耗时间和算力。一个任务要是要三十次模型请求,每次多花一秒就是三十秒。智能体套件就是专门砍掉这些重复开销的Rust编排层,把模型、工具和用户环境串起来。

上下文膨胀是个大坑,智能体权限越多,能用的工具、插件、对话历史就越多,上下文窗口动不动就爆。这不但费钱还让模型分心,该想的想不明白。套件搞了个延迟发现机制,集成的工具和插件只在需要的时候才暴露出来。每个工具的输出默认限制在一万个token以内,除非模型特别要求更多。

提示缓存得靠前缀不变才能复用计算。智能体套件把所有模型能看到的历史都搞成只追加模式,新消息、工具结果、环境更新全往尾巴上接,不往中间插。工具按固定顺序出牌,运行时的审批策略在执行时应用而不是塞进工具定义里。这套设计让Codex和ChatGPT Work的提示缓存命中率特别高。

GPT-5.6拿出的效率成果是多年在模型、推理、智能体套件各层累积改进的结果。Sol自己搞定这么多改进让人对优化速度更乐观,OpenAI会继续在内核优化和基础架构上做文章,把这些持续改进变成用户手里更便宜好用的智能。

AI开始自己优化自己的运行效率,这条曲线恐怕要比摩尔定律还陡。开源工具加自研模型加自我进化,这套组合拳打出来,同行连尾灯都看不见。

原文期刊:OpenAI官方博客