lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

DeepMind は、AI 数学研究アシスタントを発表しました:マルチエージェントアーキテクチャが GPT-5.5 Pro を打ち負かし、さらにこれまで「誰も解けなかった」難問を解決しました。

根据 观察 Beating 的监测,谷歌 DeepMind 发布了 AI 共同数学家,这是供数学家使用的多 Agent 交互式研究工作站。该系统在目前最困难的研究级数学基准 FrontierMath Tier 4 上取得了 47.9% 的准确率(解答了 23/48 题),直接超过了之前最高纪录的 GPT-5.5 Pro,后者为 39.6%。

这套系统没有采用新一代基础设施,而是直接采用了 Gemini 3.1 Pro。该模型单独运行 Tier 4 仅有 19% 的准确率,但在加入 Agent 框架后,成绩翻了一番还多。DeepMind 设计了多层架构:顶层是一个「项目协调人」,负责将研究任务拆分为多个工作流,然后将其分配给文献检索、编码和推理任务的子 Agent。编写的证明还必须经过多个「审稿 Agent」组成的评审会审查,只有通过才能提交。这个庞大的框架证明了:在顶尖数学推理领域,通过编排可以释放出的能力增量,可能比更换模型还要大。

盲测是由 Epoch AI 执行的,为防止作弊,深度 Mind 德团队从未见过题目,每道题允许运行 48 小时。结果不仅名列前茅,而且该系统还解答了三道以往所有模型无法解决的问题。

虽然它名义上是一个助手,但更像是一个擅长开启思路的同事。群论专家 Marc Lackenby 在实际研究中使用它解决了 Kourovka 笔记本中的一个公开猜想。有趣的是,一开始系统提出的策略被其审查 Agent 标记为「有缺陷」,但 Lackenby 发现了支撑案例中精巧思路,自行填补了漏洞,最终完成了证明。

目前,AI 共同数学家仅对少数数学家进行内测。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了