十万卡集群扎堆上线,Scaling Law 却被几家大厂自己踩了刹车

九月这一个月,发布密度已经超过了过去半年

如果只看时间轴,刚过去的这一个月相当密集。九月初有新一代旗舰模型亮相,月中又有一轮基于新架构的版本更新,中旬还有把参数推到万亿级以上的新模型。几个实验室把原本分散在半年里的发布节奏压缩到了一个月。

这种密度本身就是一个信号。它意味着训练侧的产能已经不再是瓶颈,排队等算力的阶段过去了,现在比的是谁能更快把新想法跑完一轮完整训练。

十万卡这个数字,意味着什么

本轮最直观的一个指标是集群规模。有模型在训练中投入了超过十万块 GPU,这在两年前还是路线图上的目标,现在已经出现在正式的技术说明里。

规模到这个量级之后,问题的性质就变了。一万卡以内,主要矛盾是单卡性能和机内互联;到十万卡,通信拓扑、故障恢复、检查点写入和电力调度全都变成一等公民。业内一个常被引用的经验值是:在这种规模上,单个加速器每天出故障都是常态,训练任务能不能跑完,主要取决于容错系统做得好不好,而不是算得快不快。

所以「十万卡」这个数字真正的意义不在算力总量,而在于它把大规模训练的工程门槛抬高了一个数量级——有能力组织起这种规模集群的团队,数量比能训出好模型的团队少得多。

新架构这条路:有人干脆不跟规模硬碰

和堆规模并行的另一条线是换架构。九月中旬发布的某一个版本就是在架构层面动了刀,试图在同等算力下拿到更好的长上下文表现或者更低的推理成本。

这条路的价值在于它绕开了「加卡就涨分」的线性假设。前几年大家发现,只要同时放大参数、数据和算力,损失就会平滑下降,这条经验规律养出了一整套「堆资源」的工程实践。但如果架构本身效率不高,堆到十万卡只是把低效放大十万倍。

现在的情况是两条路同时在跑:一条继续把集群做大规模,用工程能力换时间;另一条在模型结构、注意力机制和训练目标上找更省算力的路子。前者是资本的比拼,后者是研究品味的比拼。

参数顶到 2.1 万亿,算力换分数的老逻辑还在

九月中旬亮相的另一款模型把参数量推到了 2.1 万亿级别。在推理成本被反复强调的当下,还有团队选择这个方向,说明「规模仍然有效」这件事在实验室内部并没有被否定。

这里有个容易被忽略的区别:预训练阶段的规模效益和推理阶段的成本效益不是一回事。一个模型可以在训练时用掉海量算力,再通过蒸馏、量化或者稀疏化把推理成本压到可接受的水平。这条路已经被验证过,所以「参数变大」和「推理变贵」并不必然挂钩。

真正被质疑的其实是另一端——为了让损失下降最后那零点几个百分点,需要付出的算力是不是值得。这个问题在算力便宜的时候没人问,在电力开始成为约束之后就成了必答题。

「三方口头共识」:都说要降速,但没有一方真的停

有意思的是,同一段时间里,几家头部实验室的负责人在公开场合都谈到了「需要谨慎」「不能一味加速」这类表述。措辞各不相同,但方向罕见地一致。

问题在于,表态和行动之间有明显落差。这几家在同一时期都在扩集群、加数据、延长训练时间。行业里对这件事的解读偏务实:公开场合的谨慎表态,一部分是监管和舆论压力下的必要姿态,另一部分是技术人员对风险的真实担忧,但这两件事并不矛盾——担忧归担忧,竞赛不等人。

用一个更直白的说法,现在的局面是「谁先停下来谁吃亏」。在缺少可执行的协调机制之前,这种口头共识的实际约束力接近于零。

思维链变得不可监控,这才是最值得警惕的部分

比规模更值得讨论的,是模型推理过程的可观测性在下降。

早期的推理模型会把完整的中间步骤输出出来,人可以顺着看它怎么一步步走到答案。新一代模型在内部做了更多压缩和并行计算,对外呈现的「思考过程」和实际计算过程之间的对应关系越来越弱。也就是说,我们能看到一段看似合理的推理说明,但它未必就是模型真正在做的事情。

这件事的麻烦在于它同时影响两件事:一是安全审查——你没法审计一个你自己都看不到的决策过程;二是可靠性评估——如果一个模型给出的结论正确但推理说明是编的,那你没法判断它在下一次会不会给出同样自信的错误答案。

目前公开讨论的应对方向包括可解释性研究、外部行为监控和推理过程的一致性校验,但都还没有形成行业标准。这一块大概率会成为接下来一两年最集中的技术争论点。

普通用户能感知到什么

从使用者角度看,这一轮变化短期内的体现其实很具体。训练侧拼的是资本和工程能力,推理侧拼的是效率,两者的节奏已经明显脱钩——你可能在同一个星期里既看到某个模型能力大幅提升的新闻,也看到另一个模型因为成本控制被砍掉一半参数量。对普通用户来说,感受到的不是参数,而是工具的稳定性、价格和响应速度。

从使用者角度看,这一轮变化短期内的体现其实很具体。

  • 版本迭代变快,同一款产品可能在两个月内经历两三次能力变化,使用习惯容易被打破
  • 长上下文和更长的持续任务能力在变好,但代价是响应速度的不稳定
  • 订阅价格和调用成本的方向不一致:训练侧还在烧钱,推理侧的单价在往下走
  • 模型给出的「解释」需要更谨慎地对待,别把它当作可信的推理记录

回到最初那个问题:Scaling Law 是不是撞墙了。从目前的证据看,说撞墙为时过早,但它已经从一个技术规律变成了一个需要算经济账的工程判断。能不能继续堆,取决于电力、资金和收益三者的平衡,而这三项在不同公司之间的差别,比算法上的差别大得多。

发表评论