根据 观察 Beating 的监测,谷歌 DeepMind 发布了 AI 共同数学家,这是供数学家使用的多 Agent 交互式研究工作站。该系统在目前最困难的研究级数学基准 FrontierMath Tier 4 上取得了 47.9% 的准确率(解答了 23/48 题),直接超过了之前最高纪录的 GPT-5.5 Pro,后者为 39.6%。
这套系统没有采用新一代基础设施,而是直接采用了 Gemini 3.1 Pro。该模型单独运行 Tier 4 仅有 19% 的准确率,但在加入 Agent 框架后,成绩翻了一番还多。DeepMind 设计了多层架构:顶层是一个「项目协调人」,负责将研究任务拆分为多个工作流,然后将其分配给文献检索、编码和推理任务的子 Agent。编写的证明还必须经过多个「审稿 Agent」组成的评审会审查,只有通过才能提交。这个庞大的框架证明了:在顶尖数学推理领域,通过编排可以释放出的能力增量,可能比更换模型还要大。
盲测是由 Epoch AI 执行的,为防止作弊,深度 Mind 德团队从未见过题目,每道题允许运行 48 小时。结果不仅名列前茅,而且该系统还解答了三道以往所有模型无法解决的问题。
虽然它名义上是一个助手,但更像是一个擅长开启思路的同事。群论专家 Marc Lackenby 在实际研究中使用它解决了 Kourovka 笔记本中的一个公开猜想。有趣的是,一开始系统提出的策略被其审查 Agent 标记为「有缺陷」,但 Lackenby 发现了支撑案例中精巧思路,自行填补了漏洞,最终完成了证明。
目前,AI 共同数学家仅对少数数学家进行内测。