動察 Beating AI 速報、AI Agent スタートアップの NeoCognition が ApprenticeBench を発表した。これは AI が新人のように、入社後に一人で仕事を覚えられるかを専門に測定するものだ。第一版では、Agent が模擬のカリフォルニアの建設会社に入り、買掛金業務を行う。まず半年分の過去の請求書、会社のマニュアル、Odoo のチュートリアルを読み、その後 7 か月間にわたって 100 枚の請求書を連続処理する。その間にはルール変更や上司からのフィードバックにも遭遇する。
Fable 5.1 の最終成功率は 72%、GPT-6 Astra は 68% で、最良の人間の被験者でも 51% にとどまった。タスクは請求書の入力だけでなく、誤りの発見、コストコードの割り当て、サプライヤーへの連絡、承認フローの実行、そして履歴とフィードバックから会社の内部ルールを学ぶことも含む。両モデルとも GUI を直接操作した成績は API を呼び出す場合よりやや高く、これまで Computer Use でよく見られた性能低下はほぼ消えた。
ただし、「人間を超えた」というのはこの模擬職務においてのみ成り立ち、しかも人間のサンプルは 2 人だけだ。コストもより高く、Fable 5.1 は平均で 1 タスクあたり 18.23 ドルかかり、人間は約 7.21 ドルだった。人間はやればやるほど速くなるが、Agent は覚えることが増えるほどかえって遅くなる。