Meta 在普通聊天窗口里解出五道开放数学题:消费级 AI 第一次摸到科研门槛

AI最新资讯 2026-10-11 22 0

十月初,Meta 的研究博客悄悄发了一篇帖子,标题叫「Solving Open Research Problems Together」。点进去看,内容却相当硬核:六篇正儿八经的数学论文,其中五篇给出了此前无人解答的开放数学问题的答案。真正让人意外的不是题目多难,而是这些论文的工作方式——参与证明的模型 Muse Spark,既没有专用研究脚手架,也没有封闭的内部系统,就是普通用户每天打开的那个 meta.ai 聊天窗口。换句话说,做科研这件事,第一次被搬进了消费级产品里。这件事值得掰开讲讲:开放数学问题到底是什么?消费级模型解决它们又意味着什么?

事件回顾:六篇论文,五道开放问题

Meta AI 应用聊天窗口启动界面截图

按 Meta 官方博客的说法,过去几个月里,他们邀请了一批数学家用 Muse Spark 1.1 和 1.2(开启 Thinking 模式)合作探索多个数学领域的问题,最终整理出六篇论文,十月二日一次性放出。其中五篇给出了「此前开放的研究问题」的答案,覆盖概率论、偏微分方程、群论、优化和非结合代数五个方向;剩下第六篇是数论与弦论的交叉扩展,Meta 自己也没把它算进「解决开放问题」之列。

几点规则值得注意。每篇论文都附有「Statement of AI Use」,明确标出哪些段落由研究者主笔、哪些段落由 AI 起草;每个团队背后还有第二组数学家负责复核。Meta 的表述也相当克制:目标是「帮助研究者产出别人能理解、能接着做的数学洞见」,而不是「量产论文」。这种把 AI 参与度写在明面上的做法,在今年的 AI 科研成果里算是比较坦诚的。

先补课:什么是开放数学问题

Google DeepMind 官方 AI 研究视觉图

很多人对「开放数学问题」没什么概念,这里多说两句。它不是奥数题,也不是考研压轴题——那类题目再难,答案也是存在的,出题人手里握着标准答案。开放问题则完全不同:它是数学共同体公认的、至今没人知道答案的问题,可能悬置几十年,甚至上百年。你可以去证明它成立,也可以去推翻它,前提是你得先找到一条走得通的路,而这条路是否存在,本身就没人知道。

打个比方,解竞赛题像在有终点线的跑道上比速度,攻开放问题则像在没有地图的荒原里找路,走多久能到、能不能到,都是未知数。这也是为什么数学界对「AI 解出开放问题」格外敏感——竞赛金牌证明的是模型会考试,开放问题才触及「能不能做研究」这个核心。今年早些时候,各家模型在高中奥赛上刷出金牌级成绩时,Meta 自己就说过,那些结果「启发了我们去看 AI 能否帮助科学家解决开放研究问题」。

六篇论文都解决了什么

五道开放问题各有看点,挑几道展开讲讲。概率论那篇处理的是「高斯随机点能否被一个椭球恰好拟合」的经典问题:把一堆随机散布在高维空间里的点,找一个居中的椭球把它们全部穿过——能做到的临界点在哪里?论文给出了一个清晰的阈值:低于它,椭球几乎必然存在;高于它,几乎必然不存在。这是悬了很多年的猜想,结论对理解「精确数据拟合的极限」有标尺意义。

偏微分方程那篇更有画面感。它研究一类源自激光物理的波动模型:波在向内聚集与向外扩散两种效应的拉锯中,会不会在有限时间内坍缩?论文证明,对径向对称、负能量的情形,答案是肯定的——坍缩不可避免,而且发生在有限时间内。这道题是二〇一五年留下的开放问题,还印证了二〇〇二年计算机模拟作出的预测。群论那篇则是「找反例」路线:模型写了一段搜索程序,在三百八十四阶的有限群里找到了一个具体反例,直接推翻了二〇二四年的一个猜想。反例这类结果最大的好处是可验证——一个反例就够了,别人拿程序跑一遍就能核对。

关键细节:这一切发生在普通聊天窗口里

如果说六篇论文是结果,那工作方式才是这条新闻真正值得记住的部分。数学家们用的不是什么秘密武器:就是 meta.ai 的普通聊天界面,Muse Spark 开 Thinking 模式,没有任何定制的研究脚手架、没有专门的证明器流水线、没有智能体集群。人类负责选题、把关方向、判断哪些思路值得追;模型负责展开计算、写搜索程序、起草和修改论证段落。Meta 在博客里把它形容为「尝试、重试、犯新错误再解决它们,有时回到起点」的过程。

对普通用户来说,这个细节比五道题的答案更有冲击力。你在自家聊天窗口里能接触到的那同一个模型,经过合格的数学家驱动,就能产出研究级的论证工作。它的日常工作流,说白了和现在用编程助手写代码差不多:人是审稿人,模型是那个手速飞快、偶尔一本正经胡说八道的搭档,所以每一行都得亲自读过。

对照专用研究系统:差别在哪

看这条新闻,很容易联想到此前 OpenAI 那次一次性放出七百二十二篇数学手稿的事件——那是专用科研管线大规模冲量的路线。Meta 这次正好是另一极:不追求量,六篇论文,几个月磨出来,全程在消费级产品里完成,还把 AI 与人的分工写在每篇论文里。两条路线放在一起看,脉络其实很清楚:竞赛成绩已经卷到头之后,大家都在回答同一个问题——通用聊天模型到底能不能承担真正的科研劳动。

区别还不只是路线。专用研究系统通常有形式化验证、专用定理证明器这类「安全网」,而 Meta 这次依靠的是人力复核——第二组数学家逐篇检查。这引出了一个绕不开的争议。

冷静看待:撞车、审稿与「开放」的保质期

这份成绩单需要打几个折扣来看。第一,Meta 自己在博客里承认,五道「开放问题」里有三道,在他们的论文挂出之前,已经被别的团队独立解决了:椭球拟合阈值在今年八月的七周里被三组人先后证明;群论反例被一个叫 Nilradical 的 AI 智能体在九月抢先报出,而且对方附带了机器可验证的形式化证明;演化代数反例也有独立版本。真正没有撞车的只有两道。当然,独立撞车恰恰说明这些问题「到了能被解决的时候」,Meta 的参与工作也的确是独立完成的,但「五道」这个数字听听就好。

第二,审稿是短板。六篇论文的复核者都来自 Meta 自己组织的协作网络,没有任何期刊的外部评审。反例类结果几天内就能被社区机械验证,长证明则要等期刊审稿人表态。在那之前,把它们当作「来自利益相关方的有希望的声明」来读,是比较稳妥的姿态。

同一周的两条延伸:水印检测与 AI 生物学

这批论文发布前后还有两条动态可以顺带一提。DeepMind 上线了 SynthID Detector,一个面向公众的合成内容水印检测工具,用来识别带 SynthID 水印的 AI 生成内容;Meta 和 Google DeepMind 则一起向一个获得扎克伯格支持的 AI 生物学项目投入三亿美元,该项目整体规模约十八亿美元。一个管「识别 AI 造了什么」,一个赌「AI 能发现什么」,加上聊天窗口里解决数学问题,同一周里发生的这三件事,恰好拼出了 AI 能力边界的三个方向。

对普通用户,这意味着什么

回到大家关心的问题上:这跟我有什么关系?直接的答案是,暂时没什么关系——你不需要也不会在聊天窗口里证明定理。但间接的影响会慢慢渗出来。其一,模型的深度推理能力在往消费级产品里下沉,你处理复杂长任务(写长报告、捋复杂账目、排查技术问题)的体验会跟着变好;其二,「AI 做科研」从演示变成现实后,教育、医疗、材料这些领域的辅助工具会加速出现;其三,AI 产出的内容越来越多、越来越专业,学会核验和交叉求证,正在变成基本素养。

如果只记一句话:今年的关键变化不是 AI 又考了多少分,而是普通聊天窗口里的模型,第一次被证明能参与真正的科学发现。至于这扇门后面是什么,接下来的几个月应该会比现在清楚得多。

相关阅读

相关文章

OpenAI GPT-6 智能界面 Intelligent UI 全面登陆 ChatGPT:答案变成图表、表格与交互控件
AMD 82亿美元收购 World Labs(李飞飞):切入世界模型/物理AI/机器人,苏姿丰亲自操盘
Anthropic 发布 Claude Haiku 5.5:平均运行成本直降 75%、小模型价格战追平 GPT-6 Luna
Cloudflare 开源决策模型 Clef/Clef-flash:比 Jev 快 13 倍,还能看图
Nvidia 押注的 Reflection AI 发布首个开源模型 Beam:501B 稀疏 MoE,主打推理效率
万亿参数的 Le Chonk 来了:Mistral Large 4 发布,月底还要把权重开源