動察 Beating AI 速報、YC が孵化した AI データ企業 Specific Labs がプログラミング評価 Real-SWE を発表、実際の企業のプライベートコードを使って Coding Agent をテストすることに特化。タスクは企業の本番環境から直接取得され、税金計算、請求書移行、API 課金、顧客データ移行などを含む。コードも回答もネット上に公開されておらず、Agent は企業の業務ルールとコード構造を自力で把握しなければならない。
結果は Fable 5.1 が首位で、合格率はわずか 38.8%;GPT-6 Astra は 33.8%、Gemini 3.8 Flash は 31.2%。GLM 5.3 は 28.8% で4位、Grok 4.6、Kimi K3、GPT-5.6 Sol を上回った。現在公開されている10のタスクのうち、6つは全体合格率が15%未満で、さらに1つのタスクでは全モデルが失敗した。
最も意外だったのは GLM 5.3 だ。Real-SWE は、Agent が未知のプロジェクトでコードを継続的に読み、ルールを見つけ、多段階の変更を完了する能力をより試すものだ。智譜の研究員 Xiaopu Peng は、GLM-5.1 から長距離タスクの訓練を行っており、Real-SWE は公開 SWE ベンチマークよりもこうした能力に近いと応答し、これが GLM 5.3 がこのベンチマークで際立った成績を示した理由の一部を説明できると述べた。