十万卡集群扎堆上线,Scaling Law 却被几家大厂自己踩了刹车
九月这一个月,大模型发布密度明显上了一个台阶:单集群超过十万块 GPU 的模型出现,新架构、新参数上限接连刷新。但同一个时间窗口里,几家头部实验室又在公开场合谈「降速」,一边扩集群一边说要谨慎。这一轮争论的核心,其实是算力换分数的老路还能走多远,以及推理过程越来越不可监控这件事到底意味着什么。下面把各方观点与时间线理一理。
关注本站头条账号,内容更精彩
九月这一个月,大模型发布密度明显上了一个台阶:单集群超过十万块 GPU 的模型出现,新架构、新参数上限接连刷新。但同一个时间窗口里,几家头部实验室又在公开场合谈「降速」,一边扩集群一边说要谨慎。这一轮争论的核心,其实是算力换分数的老路还能走多远,以及推理过程越来越不可监控这件事到底意味着什么。下面把各方观点与时间线理一理。
9 月 10 日 DeepSeek 发布 V4.1-Flash,一周内就登上第三方评测机构新建的私有榜单首位,把此前领跑的 GPT-6 Astra 和 Claude Fable 挤到身后。同一天前后,月之暗面的 Kimi K2.8 把百万上下文向所有会员开放,开源阵营这边还有 2B 参数的端侧模型冲进手机。本文梳理这一周国产大模型在打什么。
Anthropic 于 9 月 2 日正式发布新一代旗舰模型 Claude Fable 5.1 与 Claude Mythos 5.1,性能较 Fable 5 大幅跃升,缓存读取价格下调 75%。典型工作负载成本降低约 25%,复杂智能体任务最高可节省 45%,被视为该公司 IPO 前的一次关键能力展示。