• 邮箱
  • 电话
  • 营业时间 每日 8:00-次日 2:00

阿莫迪偷师姚顺雨,奥特曼偷师梁文锋

常言道,天下文章一大抄,关键在于能否抄出精髓。

近期发布的Opus 5.5和GPT-6 Luna,从外观来看,这两个模型明显蕴含着姚顺雨和梁文锋的思路。

或许是因为两家公司都已将预训练推向极致,为了增强模型的智能并降低算力成本,这两个新模型不约而同地选择了开拓新领域。

Opus 5.5聚焦于上下文处理,而GPT-6 Luna则专注于缓存优化。

这我可太熟悉了!一个是混元,另一个是DeepSeek!

不过,不得不说,阿莫迪和奥特曼确实模仿得有模有样。

阿莫迪借鉴姚顺雨

先看一组数据,Artificial Analysis的智能指数中,有一项统计是“完成一道题平均需要输出多少token”。

在这份榜单上,Claude Opus 5.5在max档位下,每题平均输出11.9万个token,其中8.4万个属于“思考”部分,3.5万个是最终答案。而OpenAI的GPT-6 Astra,在同一档位下仅使用了2.7万个token。

大模型要提升智能水平,传统方法是在预训练阶段堆积数据和算力,将智力嵌入模型权重中,一次训练,反复使用。

这种模式的模型在推理时几乎不进行额外思考。训练数据价值越高,模型的智能水平就越高。

但传统路线面对陌生题型时容易出问题,传统模型的泛化属于插值。在训练数据覆盖的分布附近,它表现良好。一旦遇到未见过的题型或需要多步推理的问题,它就开始胡编乱造。因为它的“智力”全在权重中,权重未见过的模式,推理时也无法弥补。

这就像你对着木桩苦练拳法,结果上战场后,对方不会静止不动,还会使用武器。

另一条路线是test-time路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理,思考越久,答案越好。智力不再仅来自权重,还来自每次调用时的实时推理。

换句话说,智力被转移到了上下文中。

Opus 5.5走的就是test-time路线。

官方有一条声明:除非特别注明,所有成绩都基于“adaptive thinking at max effort”(最大力度的自适应思考)。

而且从这一代开始,Opus 5.5不再提供“关闭thinking模式”的选项。这变相表明,推理过程已成为模型的一部分。

代价是思考过程会消耗更多token,成本也会随任务难度上升。Opus 5.5的核心逻辑是,该训练的数据已基本完成,预训练边际收益见顶,因此智能的增量只能从推理中获取。

这种从上下文中寻找智能的逻辑,姚顺雨很早就提出了。

2023年,姚顺雨提出了Tree of Thoughts(思维树)概念,其本质就是一种test-time方法。

推理时展开多条思路,边思考边搜索最优解。

同年,他还提出了ReAct架构,让模型“推理”和“行动”交替进行。

2025年4月,姚顺雨发表了博客《The Second Half》。

文章的核心观点是,AI的上半场,比拼的是“训练方法与模型”,例如更大的参数、更多的数据、更强的算力。到了下半场,比拼的是“如何使用与评估模型”,增量正从“训练”转向“推理与行动”。

他在文中写道,“把推理放进动作空间之后,我们才获得了‘针对不同决策灵活分配test-time compute(推理时算力)’的能力。”

姚顺雨将“思考”称为一种“奇怪的动作”。

RL中的动作是用来改变环境的,比如打开一个箱子,箱子的状态就会改变。动作的意义在于“让世界发生变化,从而获得奖励”。

但思考不会,即使想了一万遍,箱子也不会自动打开。

姚顺雨在文章中举例,有两个盒子,一个装有100万美元,另一个是空的,此时期望收益是50万。

现在加入无数个空盒子,期望收益会越来越低,因为要从无穷多个盒子中挑选那个100万美元的盒子。

然而,如果将“推理”这个动作加入后,模型反而更强,更容易选中那个100万美元的盒子。

姚顺雨解释,那些“空盒子”,你在生活和各种游戏中都见过。挑选它们的过程本身,就是在为“选中那个装钱的盒子”做准备。

Opus 5.5,就是将姚顺雨的这个理念工程化实现了。

奥特曼效仿梁文锋

如果说Opus 5.5的重点是“如何思考”,那么GPT-6 Luna的重点就是“如何低成本地思考”。

GPT-6 Luna输入0.1美元/百万token,输出0.5美元/百万token,比上一代GPT-5.6 Luna直接减半。

如果缓存命中,那么读取一次缓存的价格是0.01美元/百万token,比标准输入价便宜90%。

模型的每次调用,都要将你提供的全部上下文“读一遍”。比如系统提示、长文档、历史对话,一个字都不能少。

但这段上下文重复度极高。Agent每多走一步,前面那一大段都要重读一遍。长上下文,就成了烧钱的黑洞。

GPT-6 Luna使用的缓存复用(prompt caching/KV cache复用),要解决的就是这个问题。同一段上下文,计算过一次就存起来,下次直接“读缓存”,不重新计算。于是“重复的部分”,从最贵变成了最便宜。

但这套操作,DeepSeek早已实现。

2026年8月2日,DeepSeek上线了“Context Caching on Disk”(磁盘上下文缓存),将重复内容缓存在磁盘阵列上,命中时直接取用,跳过重新计算。

当时公告写明,缓存命中价降至0.1元/百万token,比未命中便宜正好也是90%,与GPT-6 Luna相同。

到了V4 Flash,命中0.02元、未命中1元,相差50倍。

GPU显存非常昂贵,因此能存储的KV cache容量有限。但硬盘便宜且容量大,将KV cache存入后成本会大幅降低。

OpenAI现在做的prompt caching与DeepSeek原理几乎相同,同一段前缀计算过一次存起来,下次直接读取。

不仅价格,还有架构。

GPT-6 Luna的上下文窗口是105万token,DeepSeek V4是100万token,两者几乎对齐。

但是,100万上下文的KV cache,按标准注意力机制计算,一半的模型根本承受不住。

为此,DeepSeek使用了MLA架构,将Key和Value联合压缩进一个低维潜空间,缓存那个潜向量,用时再进行上采样还原。

DeepSeek-V2的技术报告提到,MLA将KV cache削减了93.3%,生成吞吐提升到5.76倍。到了V4,又叠加了压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token上下文下,KV cache只有上一代V3.2的10%。

此外,OpenAI还“借鉴”了一招:推测解码。

OpenAI在官方博客中表示,他们运行一个更小的draft(草稿)模型,让它与主模型并行地“猜测”接下来几个token,主模型再批量验收。

猜对了,一次前向就能输出多个token。OpenAI官方称,这一改进使token生成效率提升了15%以上。

这个思路在2024年的DeepSeek V3中就已存在,DeepSeek使用的是MTP(Multi-Token Prediction,多token预测)。

其做法是在主干模型后直接挂一个MTP头,训练时与主干一起训练,共享主干的hidden state。推理时这个头知道主模型内部状态,猜得准,验收通过率高。

这个头可以直接丢弃不影响主干,也可以保留作为草稿机。

OpenAI相当于外挂了一个独立的小模型来打草稿。两个模型各自运行,草稿不知道主模型在想什么,只是猜测后由主模型验收。

虽然方法不同,但两者的思想一致。小的先猜,大的批量验,将串行解码变为并行。

天下文章一大抄

过去,定义模型的是硅谷,国内AI公司因算力有限,往往将这些定义转化为更廉价的解决方案。

这一轮,情况反过来了。学术范式和工程范式,都是由中国公司开创的。

美国的巨头们则负责最后一步,将其做成产品,销售到全球。

过去几年,大厂的资源、人才、注意力全部集中在预训练这个主战场上。

大家根据Scaling Law来堆数据、堆算力、刷榜单。但头部公司都陷入了前文提到的Anthropic如今的困境,优质数据几乎全部训练完成,模型预训练边际收益递减。

那么这时,行业的增量自然会出现在第二战场,比如推理时如何思考(test-time compute)、上下文如何利用(context learning)、长上下文如何降低成本(caching/MLA/稀疏注意力)。

这好比武林中,大门派花了几十年练习一门功夫。练着练着发现,武功练到一定程度就不再进步,反而以前那些不起眼的“旁门左道”更能提升功力。

这里还有个反直觉的地方,主战场上的优势,到了第二战场,反而成了“累赘”。

手中握有最多算力和数据的一方,恰恰最没有动力去抠成本、抠效率。头部公司已形成“反正我堆卡就能解决问题,何必费劲去想更聪明的办法?”的想法。这就导致节省显存、节省成本这件事,从一开始就不是他们的议题,甚至有点“掉价”。

只有算力紧张的一方,才会把每一分钱都用在刀刃上。

DeepSeek的MLA、磁盘缓存、稀疏注意力,本质上都是“穷则思变”。

当年它们只是“没钱的替代方案”,是无奈之举。可真到全行业开始比拼效率时,这些“土办法”忽然成了最硬的通货。

于是才出现了国外“偷师”国内的现状。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。用户可通过龙8登录入口获取更多资讯。