動察 Beating AI 速報、オープンソースの Computer Use ツール Cua が Cua Driver にオプションの Perception 視覚拡張を追加しました。Driver は元々、Web ページ構造とシステムアクセシビリティツリーを優先してボタンを探します。Canvas、ゲーム、リモートデスクトップ、または自前描画アプリでは、これらの構造が空になる場合があります。Perception はスクリーンショットを直接読み取り、画面をテキスト・種類・位置を持つ領域に分割し、Agent が操作を続けられるようにします。
初版では OmniParser でアイコンとコントロールを認識し、PP-OCR でテキストを読み取ります。解析プロセス全体はローカル CPU で完結し、GPU は不要で、スクリーンショットをネットワークに送信しません。公式実測では、1 枚のスクリーンショットあたり macOS で約 2~2.5 秒、Linux で 3.5~4 秒、Windows で 8~9 秒かかります。主にページ構造とアクセシビリティツリーが機能しない場合のフォールバックであり、デフォルトで毎ステップ視覚解析を実行するわけではありません。
Cua はまた、視覚操作による古いスクリーンショットの再利用を制限しています。各視覚認識は現在のスクリーンショットの `capture_id` に紐付けられ、その後のクリックは同じスクリーンショットに由来しなければなりません。スクリーンショットが 60 秒を超えた場合、またはすでに一度操作が実行された場合、Driver は使用を拒否し、インターフェース変化後に古い座標で誤クリックするのを防ぎます。
Cua は以前から `cua-som` と OmniParser による視覚的位置特定が可能でした。現在、この機能は Cua Driver に直接組み込まれ、上位の Agent は統一インターフェースを通じて認識結果を取得できます。モデル自体が画像を理解できなくても、これらのテキストと領域情報に基づいて次の操作を決定できます。
Perception はデフォルトのコンポーネントではなく、そのうち OmniParser 検出器は AGPL-3.0 を採用しています。Cua Driver は引き続き MIT ライセンスを維持します。