lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

プログラマーを本当に代替するにはまだ遠い:Agentが企業のプライベートコードに入っても、最高合格率はわずか4割

動察 Beating AI 速報、YC が孵化した AI データ企業 Specific Labs がプログラミング評価 Real-SWE を発表、実際の企業のプライベートコードを使って Coding Agent をテストすることに特化。タスクは企業の本番環境から直接取得され、税金計算、請求書移行、API 課金、顧客データ移行などを含む。コードも回答もネット上に公開されておらず、Agent は企業の業務ルールとコード構造を自力で把握しなければならない。


結果は Fable 5.1 が首位で、合格率はわずか 38.8%;GPT-6 Astra は 33.8%、Gemini 3.8 Flash は 31.2%。GLM 5.3 は 28.8% で4位、Grok 4.6、Kimi K3、GPT-5.6 Sol を上回った。現在公開されている10のタスクのうち、6つは全体合格率が15%未満で、さらに1つのタスクでは全モデルが失敗した。


最も意外だったのは GLM 5.3 だ。Real-SWE は、Agent が未知のプロジェクトでコードを継続的に読み、ルールを見つけ、多段階の変更を完了する能力をより試すものだ。智譜の研究員 Xiaopu Peng は、GLM-5.1 から長距離タスクの訓練を行っており、Real-SWE は公開 SWE ベンチマークよりもこうした能力に近いと応答し、これが GLM 5.3 がこのベンチマークで際立った成績を示した理由の一部を説明できると述べた。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了