这次发布的到底是个什么模型
Mistral Large 4(简称 ML4,内部外号 Le Chonk)在 10 月 6 日放出公开预览,是 Mistral 目前「最大、最能打」的旗舰。它采用原生多模态的混合专家架构(MoE):总参数约一万亿(模型页标注 1.05 万亿),但每次推理只激活其中约 490 亿个参数;原生支持文本与图像输入,带一个 16 亿参数的视觉编码器,训练数据覆盖超过 160 种语言,包含全部欧盟官方语言。官方把它的定位放在推理、编码与智能体(agent)任务上。
一个值得记住的架构细节是:总参数决定「要把多大的模型装进显存」,激活参数决定「单次前向推理要算多少」。1.05 万亿总参数意味着本地部署至少要扛住整张权重的显存占用,而 490 亿激活参数只决定单步算力成本——这也是 MoE 能在「规模」和「单条请求成本」之间腾挪的关键。官方称它在自家欧洲数据中心、用约三千八百到四千块英伟达 Grace Blackwell GPU 从零训出来,没有借租来的超大规模公有云算力,这一点后面会专门讲为什么重要。
上下文窗口方面,Mistral 文档写的是一百万 token。不过独立评测机构 Artificial Analysis 记录为 524288、OpenRouter 列的是 512K,与官方口径有差异。稳妥起见,真要拿它处理超长文档,最好先用一次真实请求确认上限,别直接按一百万 token 去设计流程。
横向对比:它到底站在第几梯队
判断一个新模型,最直观的办法是把它和同级选手放在同一张表里。下面按「闭源前沿 / 中国开源 / 欧美开源」三组来比,分数大多来自 Mistral 自测或 Artificial Analysis 的运行,统一口径的独立复现还要等权重放出后才有。
闭源前沿(参照线)
- GPT-6 Astra:Dense 200 视觉定位 41%(ML4 反超到 42%);DIOR-RSVG 卫星目标定位 68%(ML4 73%);但在网络安全「复现并修补漏洞」测试上得分近零,原因是直接拒绝执行。
- Claude Opus 5:Surge AI 盲评人类打分 4.22,ML4 以 3.74 排第二;但 Claude Opus 5.5 在同样的网络安全复现测试上同样近零。
- Gemini 4 Argon:Artificial Analysis 智能指数位居闭源前列,是 ML4 在通用智能上的对标对象。
中国开源(同场竞技,且部分单项更高)
- DeepSeek V4 Pro 0813:DeepSWE v1.1 约 57%,Coding Agent Index 略低于 ML4,金融评测 Finch 67% 与 ML4 并列,AA-Briefcase 长程知识工作低于 ML4。
- Qwen 3.8 Max:DeepSWE 约 51%,Coding Agent Index 低于 ML4。
- GLM-5.3:DeepSWE v1.1 公开榜约 66.9% 至 69%(高于 ML4 自测的 61.7%),Surge AI 盲评 3.60;Artificial Analysis 智能指数领先 ML4。
- Kimi K3:DeepSWE 公开榜约 67.5%,Surge AI 盲评 3.59,均高于或接近 ML4 的单项自测值。
欧美开源(ML4 的主场)
- Mistral Large 4:DeepSWE v1.1 61.7%、Terminal-Bench 4 为 28.3%、Coding Agent Index 49.8%(领先 DeepSeek V4 Pro 与 Qwen 3.8 Max);Cybench 93%、网络安全复现测试 82%(全球第一);AutomationBench 59.9%、AA-Briefcase 1393 Elo;Artificial Analysis 智能指数从 Large 3 的 9 跳到 38.4。
把表读薄一点:在「美国与欧洲开发的开放权重模型」里,ML4 确实是当前最强;但放到全球开源阵营,中国几家的 DeepSWE、智能指数单项并不输甚至更高。ML4 的真正护城河集中在网络安全与企业级工作流,而不是把每一项榜单都刷到第一。
网络安全:它最硬的一张牌,以及那句「对手压根不接活」
ML4 这次最强调的能力是网络安全。官方给出的数字:Cybench 解出率 93%,「复现并修补真实开源漏洞」测试拿到 82%,并称这是所有模型里的最高分。Artificial Analysis 的 CyberGym-E2E 榜单上,ML4 预览版也以 81.7% pass@1 排第一。
这里有个被反复提及、但容易误读的细节:Claude Opus 5.5、GPT-6 Astra 这类闭源前沿在这些攻防测试上得分接近零,原因是它们出于安全策略直接拒绝执行相关任务。换句话说,ML4 的「领先」一部分建立在对手压根不参与的前提上——比的不是「更聪明」,而是「愿意接这活」。但这张牌对企业的价值是真实的:防守软件往往从「证明一个漏洞确实存在」开始,而这恰恰是被闭源模型安全过滤器挡住的环节。Mistral 给合作方(网络安全公司、受信任伙伴、监管机构)一个限制更少、网络攻防能力更强的测试版本,正在于此。
需要冷静看待的是:ML4 在 JailbreakBench、StrongREJECT、AgentHarm 等越狱与滥用测试上的拒绝率,反而高于其它被测开源模型——也就是说,它在「能干活」和「不乱干活」之间做了更细的取舍,而不是无差别放开。这对企业安全团队是加分项。
从 Large 3 到 Large 4:一次架构级跃迁
和上一代 Large 3 比,ML4 不是小修小补。Large 3 是 6750 亿总参数、410 亿激活、每百万输入 0.50 美元、输出 1.50 美元、Apache 2.0 许可、纯指令模型(不推理);Large 4 是 1.05 万亿总参数、490 亿激活、列表价每百万输入 1.36 美元(输出 4.18 美元,预览期打到半价 0.68 与 2.09)、自定义许可、指令与推理合一的混合模型。价格涨了约 2.7 倍,换来的是推理能力和智能指数的大幅跃升。
「指令与推理合一」是这次最关键的架构变化:Large 3 收到问题就写,Large 4 会先在自己内部「想一会儿」再输出,外显表现就是响应更慢、但难题更准。从外部评测看,这个推理 pass 直接把 Artificial Analysis 智能指数从 9 拉到 38.4。对需要多步推理、代码、智能体的场景,这一代的提升是实打实的。
市场前景:欧洲的「第三种选择」,能走多远
把 ML4 放回市场里看,它真正想占的位置是「美国闭源」和「中国开源」之间的第三极。法国总统马克龙此前就用「AI 的第三种选择」来形容这种路线。对欧洲企业与公共机构,吸引力很直接:数据留在自己地盘、合规跟着欧盟法规走、不会被某家美国公司的政策变动卡脖子。
「在欧洲自己的数据中心从零训练」这件事,卖点不只是情怀。它意味着算力供应链不依赖美国公有云,监管与数据主权都在欧盟辖区内——对金融、法律、芯片设计这些对合规和可控性要求极高的行业,这是闭源 API 给不了的确定性。Mistral 9 月的 D 轮约 30 亿欧元(欧洲科技史上最大股权融资),公司估值约 210 亿欧元(约 240 亿美元),背后站着 ASML、三星这类硬核产业资本,钱主要就是为自有算力铺路。
但有两个变量会决定它能不能走远。第一是许可:Large 3 是 Apache 2.0,Large 4 换成自定义许可,完整条款随 10 月底权重一起放出。自定义许可意味着 Mistral 手里多了一个法律抓手——企业自托管前必须逐字看清条款,别想当然按 Apache 2.0 的自由度去规划。第二是「开放权重」的成色:在权重真正放出、且被第三方独立复现之前,所有分数都还是厂商自测。开源社区向来「用脚投票」,等 10 月 27 日前后的权重与架构报告落地,才是它真正接受检验的时刻。
用户热点:社区到底在吵什么
从社区讨论看,大家关心的点和厂商宣传稿并不完全一致。几个高频话题:
- 「一万亿参数还叫小胖墩」:Le Chonk 这个外号本身就成了梗,调侃的是参数确实不小。
- 自托管的现实门槛:很多人喊「月底开源我第一时间本地跑」,但 1.05 万亿参数在 BF16 下约需 2TB 显存、FP8 约 1TB、4-bit 量化也要约 500GB——这还只是权重,不含 KV cache 与激活。对绝大多数开发者,前期走 API 比硬上本地更现实,所谓「数据留在自己机器」短期更多是心理安慰。
- 许可隐忧:从 Apache 2.0 退回自定义许可,让不少人担心「开放」会不会打折扣,尤其商用与再分发条款。
- 「等独立基准」:最理性的声音集中在一点——厂商自测分数先打个折,等第三方复现再说。毕竟 DeepSWE 公开榜上 GLM-5.3、Kimi K3 都已高于 ML4 的自测值,单一榜单的「第一」并不等于全面领先。
对开发者和企业来说,现在该怎么做
如果你在做需要敏感数据、又想要前沿能力的业务,ML4 这类「可自托管的前沿开放权重」是最值得盯的方向之一:数据不出自己机房,合规好交代,还能针对自家场景微调。金融、法律、芯片设计这些 Mistral 点名的早期场景,恰恰是对数据可控性和合规最严格的地方。
但落到行动,建议分两步走:现在用预览 API 把真实任务跑一遍,重点验证网络安全、代码智能体、长文档理解这几项它主打的能力是否真对你的场景有用;至于自托管,等 10 月底权重放出、且有人独立复现基准之后,再决定要不要为它准备多卡硬件。不要因为宣传稿就提前规划产线。普通开发者则多了一个真能选的选项——过去在「闭源但强」和「开源但弱一截」之间二选一,现在欧洲这条路把差距明显缩小了,只是别把它神化。
值得盯紧的几个时间点
接下来一个月有几个关键节点:10 月底(约 10 月 27 日)权重与完整许可条款放出,这是「开放权重」从名号变现实的时刻;同期 Mistral 会补发架构白皮书与后训练方法说明,可据此核对专家数、路由方案、层结构这些目前缺失的细节;第三方基准(DeepSWE、AA 智能指数、各类安全榜)的独立复现结果会陆续出炉,那才是判断 ML4 真实排位的依据。对关心欧洲 AI 主权与企业可控部署的人来说,这颗「小胖墩」值得持续跟踪——但它能不能稳住「第三种选择」的位置,要看下一次中国开源模型发布前,权重与生态能不能真正落地。


