新闻资讯

Opus 5.5和GPT-6 Luna发布,满屏都是姚顺雨梁文锋影子:推理与缓存成新战场

作者: admin | 发布于: 2026-09-26 15:26 | 分类: 科技资讯
Opus 5.5和GPT-6 Luna发布,满屏都是姚顺雨梁文锋影子:推理与缓存成新战场

刚发布的Opus 5.5和GPT-6 Luna,一眼看去,全是姚顺雨和梁文锋的影子。说白了,就是天下文章一大抄,看你会抄不会抄。这两家巨头把预训练做到极致后,为了提升智能并压低算力成本,干脆开辟了全新战场。

一个对上下文下手,一个对缓存动手。这路子,跟当年的混元和DeepSeek简直如出一辙。 先看一组硬核数据。Artificial Analysis的智能指数里,有个指标叫“跑完一道题平均要输出多少token”。

榜单显示,Claude Opus 5.5在max档位下,平均每题要吐出11.9万个输出token。其中8.4万个用于“思考”,剩下3.5万个才是最终答案。反观OpenAI的GPT-6 Astra,同一档位下只用了2.7万个token。

差距一目了然。 大模型想提升智能,传统路线是预训练阶段堆数据、堆算力。智力直接放进模型权重里,一次训练、反复使用。这种模型在推理时几乎不做额外思考。训练时数据质量越高,模型智能水平就越高。但这条路有个致命弱点,怕遇到没见过的题型。

传统模型的泛化能力靠插值,在训练数据覆盖的分布附近表现不错。一旦碰上陌生题型或多步推理题,就开始瞎编。因为智力全锁在权重里,权重没见过的模式,推理时根本补不出来。 打个比方,这就好比你围着木桩练了很久的拳法。

真上了战场,对手不仅不站定,还拿起了武器。你那一身本事瞬间使不出来。另一条路是test-time路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理。想得越久,答得越好。智力不再只依赖权重,还来自每次调用时的现场推理。

换句话说,智力被搬进了上下文里。 Opus 5.5走的正是test-time路线。官方明确声明,除非特别注明,所有成绩都在“最大力度的自适应思考”下跑出。而且从这一代开始,Opus 5.5取消了“关闭thinking模式”的选项。

这等于变相承认,推理过程本身就是模型的一部分。代价也很明显,思考过程消耗更多token,成本随任务难度飙升。Opus 5.5的核心逻辑是,该训练的数据都差不多训完了,预训练边际收益见顶。智能的增量,只能从推理里找。

这种从上下文中挖智能的思路,姚顺雨早就提出来了。2023年,他提出Tree of Thoughts概念,本质就是一种test-time。推理时展开多条思路,边想边搜索最优解。同年,他还推出ReAct架构,让模型“推理”和“行动”交替进行。

2025年4月,姚顺雨发表博客《The Second Half》。文章核心判断是,AI上半场拼训练方法和模型,比参数、数据、算力。下半场拼使用和评估模型,增量正从训练挪到推理与行动。 他在文中写道,把推理放进动作空间后,我们才获得“针对不同决策灵活分配推理时算力”的能力。

姚顺雨把“思考”称为一种“奇怪的动作”。强化学习里的动作是用来改变环境的,比如打开箱子,箱子状态就变了。动作的意义在于让世界变化,从而换取奖励。但思考不同,就算想一万遍,箱子也不会自己开。姚顺雨举例,两个盒子,一个装100万美元,一个空的,期望收益是50万。

往里塞无数空盒子,期望收益会越来越低,因为要在无穷多个盒子里挑出那个有钱的。 但如果加入“推理”这个动作,模型反而更强,更容易选中那个装钱的盒子。姚顺雨解释,那些“空盒子”,你在生活和游戏里都见过。挑选它们的过程,本身就是在为选中装钱盒子做准备。

Opus 5.5,就是把姚顺雨的这套理念工程落地了。 再看GPT-6 Luna,重点不在“怎么想”,而在“怎么便宜地想”。输入0.1美元/百万token,输出0.5美元/百万token,比上一代GPT-5.6 Luna直接砍半。

如果缓存命中,读一次缓存只要0.01美元/百万token,比标准输入价便宜90%。模型每次调用,都得把全部上下文“读一遍”。系统提示、长文档、历史对话,一个字不能少。但这段上下文重复度极高。Agent每多走一步,前面那一大坨都要重读。

长上下文,就成了烧钱黑洞。 GPT-6 Luna用的缓存复用技术,解决的正是这事。同一段上下文,算过一次就存起来,下次直接读缓存,不重算。于是“重复的部分”,从最贵变成最便宜。但这套操作,DeepSeek早就玩过了。

2026年8月2日,DeepSeek上线“磁盘上下文缓存”,把重复内容缓存在磁盘阵列上,命中时直接取用,跳过重算。当时公告写明,缓存命中价砍到0.1元/百万token,比未命中便宜90%,和GPT-6 Luna一模一样。

到了V4 Flash,命中0.02元,未命中1元,差了50倍。 GPU显存贵,能存的KV cache容量有限。硬盘便宜且容量大,把KV cache存进去,成本大幅降低。OpenAI现在的prompt caching和DeepSeek原理几乎相同,同一段前缀算过一次存起来,下次直接读。

不光价格,架构也对齐了。GPT-6 Luna上下文窗口105万token,DeepSeek V4是100万token,两边基本一致。 但100万上下文的KV cache,按标准注意力机制算,一半模型根本扛不住。

DeepSeek用了MLA架构,把Key和Value联合压缩进低维潜空间,缓存潜向量,用时再上采样还原。DeepSeek-V2技术报告显示,MLA把KV cache砍掉93.3%,生成吞吐提升到5.76倍。

到了V4,又叠加压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token上下文下,KV cache只有上一代V3.2的10%。 OpenAI还“偷师”了一招:推测解码。官方博客说,他们跑一个更小的draft模型,让它和主模型并行猜接下来几个token,主模型再批量验收。

猜对了,一次前向就能吐好几个token。官方表示,这项改进让token生成效率提升15%以上。这个思路在2024年的DeepSeek V3里就有,用的是MTP,即多token预测。 DeepSeek的做法是在主干模型后面挂一个MTP头,训练时和主干一起训,共享hidden state。

推理时这个头知道主模型内部状态,猜得准、验收通过率高。这个头可以丢掉不影响主干,也能留着当草稿机。OpenAI则是外挂一个独立小模型打草稿。两个模型各跑各的,草稿不知道主模型在想啥,猜完由主模型验收。

方法虽不同,思想却一样:小的先猜、大的批量验,把串行解码变并行。 以前,定义模型的是硅谷。国内AI公司因算力受限,会把定义转化成更便宜的解决办法。这一轮,反过来了。学术范式和工程范式,都是中国公司搞出来的。

美国巨头负责最后一步,把它做成产品,卖给全世界。过去几年,大厂资源、人才、注意力全押在预训练主战场。大家按Scaling Law堆数据、堆算力、刷榜单。结果头部公司陷入困境,优质数据几乎训完,预训练边际收益递减。

这时,行业增量自然转向第二战场,比如推理时怎么想、上下文怎么用、长上下文怎么便宜。这就像武林里,大门派花几十年练一门功夫。练到最后发现,武功到顶就不涨,以前不起眼的“旁门左道”反而更能提功力。这里有个反直觉点,主战场优势到了第二战场,反倒成了累赘。

手里攥着最多算力和数据的一方,恰恰最没动力抠成本、抠效率。头部公司觉得“反正堆卡就能解决,何必费劲想聪明办法”。省显存、省钱,从一开始就不是他们的议题,甚至有点掉价。 只有算力吃紧的一方,才会把钱花在刀刃上。

DeepSeek的MLA、磁盘缓存、稀疏注意力,本质都是“穷则思变”。当年它们是“没钱的替代方案”,是没办法的办法。可真到全行业拼效率时,这些“土办法”突然成了硬通货。于是出现了国外“偷师”国内的现状。