DeepSeek 又抢了一次头条:新模型登顶第三方榜单,顺手把百万上下文的账单打下来了

这一周的大模型圈节奏相当快:新榜刚建出来三天就被改了两次排名,两家中国公司接连发新模型,开源社区那边也没闲着。

先说最直接的信号。DeepSeek 在 9 月 10 日发布了 V4.1-Flash,随后登上第三方评测机构新建的私有榜单首位,把此前占据该位置的 GPT-6 Astra 和 Claude Fable 挤了下去。榜单在三天内调整了两次,说明这一轮模型迭代的速度已经快到评测体系自己都跟不上。

552B 参数只激活一小部分:成本是怎么压下来的

V4.1-Flash 的规格里有几个数字值得单独拎出来看。

它是一个 552B 参数的多模态混合专家(MoE)模型,采用因果编码器—解码器结构,输入侧激活约 8B 参数,输出侧激活约 16B。也就是说,虽然总参数量看着很吓人,但每次推理真正参与计算的只有很小一部分。这是 MoE 最核心的价值所在——用总参数换能力上限,用激活参数控制单次成本。

第二个数字是上下文长度:100 万 token。这个量级基本等于把一整本技术手册或者一个中型代码仓库直接塞进去。

第三个数字最有实际意义:KV 缓存占用降低 75%。跑长上下文推理时,KV 缓存是显存和内存的主要消耗源,把它压掉四分之三,意味着同样的硬件能服务更长的对话、更多的并发。对按 token 计费的用户来说,这才是「账单变小」的真正原因。

DeepSeek 同时宣布停掉原来的 V4-Flash 系列,并把 V4-Pro 的 API 请求全部路由到 V4.1,等于是用一次发布完成了产品线的收口。这种做法对开发者比较友好:不用在新旧模型之间做迁移取舍,接口不变、模型变了。

如果你只是在网页端偶尔用一下,这些变化你几乎感知不到。但如果你在用 API 做长文档处理、代码库问答这类场景,成本结构的变化是实打实的。

Kimi 换了另一种打法:把百万上下文拉进所有会员

月之暗面在 9 月 11 日把 K2.8 Preview 全量上线到自己的编程和办公产品上,官方称综合性能接近旗舰 K3。几个关键变化:支持低、高、最高三档思考强度,可以输入图片和视频,100 万上下文对所有会员开放。

最后这一条是有讲究的。此前 K3 的百万上下文要 199 元档以上才能用,现在把同样的能力下放到全会员,本质上是用旗舰的「参数规模」守高端、用次旗舰的「性价比」抢用户。在两家都在打价格和成本的时候,这种分层策略比赛参数更实际。

顺便说一句,这家公司 8 月的年度经常性收入突破了 10 亿美元,年底目标是 20 亿,并且已经递交了港交所上市申请。这个背景很重要——一家正在冲上市的公司,最需要的恰恰是一个成本可控、能承接海量用户的「主力机型」,而不是一味堆旗舰。K2.8 的定位就是干这个的。

真正的变量在端侧:2B 的小模型开始跑进手机

如果说榜单和参数是台面上的热闹,那端侧这条线才是这一周最值得关注的方向。

开源社区这边放出了一个 2B 参数的稠密模型,在第三方智能指数 4B 以下的档位排名第一,智能体能力指数以 20 分对 9 分领先第二名。它的卖点不是「多强」,而是「多小」:能在 vLLM、SGLang、llama.cpp 这些常用框架上本地跑。

有人在本地把它当成一个小型的调查智能体来用:给一句「上周收入下降,查明原因、量化影响并产出带证据的事件报告」,模型自己查订单、流量、支付、退款和部署日志,完成多步分析。也有人在手机上试着做了一个离线的即时通讯助手——不联网,模型就跑在设备上。

研究者给这个现象起了个名字,叫「能力密度定律」:同等硬件上能承载的模型能力,大约每三个半月翻一倍。这个说法还谈不上共识,但它指出的趋势很清楚——终端侧能做的事情正在快速变多。

对普通用户来说,这件事的意义在于隐私和可用性:如果摘要、翻译、简单问答都能在设备上完成,就不必把原始内容传到云端。当然,2B 级别的模型在复杂推理上依然无法和云端旗舰比,短期内更可能是「本地处理日常琐事、复杂问题交给云端」的分工。

开源阵营的另一条线:奥数金牌和「小模型打大模型」

同一周还有两个值得记录的动作。

一是某家芯片厂商公开了其开源模型在 2026 年国际数学奥林匹克中拿到 30/42 分的训练配方——达到金牌线,而且全程只用自然语言证明,不依赖形式化定理证明器、外部工具或联网。三个专用检查点分工负责生成、验证和迭代修正,最后由高算力阶段挑出最终答案。配套开源的还有训练数据、训练与推理代码,以及一道包含 200 题的新基准。

二是这家厂商同时表态:经过定向训练,其最小的模型在特定预测任务上的正确率大幅超过大得多的版本。也就是说,在垂直场景里,小模型加领域训练,完全可以打赢参数规模是它一到二十倍的通用模型。这句话如果成立,意味着未来大量的行业应用不需要追求「最大参数」,而是追求「最合适的训练数据」。

把这一周串起来看,主线其实很清晰:云端在拼上下文的长度和单位成本,端侧在拼能力密度,而开源在拼「用更少的算力拿到可用的结果」。三条线指向同一个方向——大模型正在从「比谁更大」,转向「比谁更便宜、更靠近用户」。

网友评论

  • 「KV 缓存降 75% 这个比参数量重要多了,长文档终于不肉疼。」
  • 「百万上下文下放全会员,这才是真卷。」
  • 「2B 模型在手机上离线跑助手,这个方向比刷榜有意思。」
  • 「榜单三天改两次,说明评测本身也快跟不上了。」
  • 「小模型加领域数据打赢大模型,这话行业里早就有人这么干了。」

以上评论仅代表网友个人观点,不代表官方立场。