lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Cua DriverがAgentに「目」を追加:純粋なピクセルインターフェースでもボタンとテキストを認識可能

動察 Beating AI 速報、オープンソースの Computer Use ツール Cua が Cua Driver にオプションの Perception 視覚拡張を追加しました。Driver は元々、Web ページ構造とシステムアクセシビリティツリーを優先してボタンを探します。Canvas、ゲーム、リモートデスクトップ、または自前描画アプリでは、これらの構造が空になる場合があります。Perception はスクリーンショットを直接読み取り、画面をテキスト・種類・位置を持つ領域に分割し、Agent が操作を続けられるようにします。


初版では OmniParser でアイコンとコントロールを認識し、PP-OCR でテキストを読み取ります。解析プロセス全体はローカル CPU で完結し、GPU は不要で、スクリーンショットをネットワークに送信しません。公式実測では、1 枚のスクリーンショットあたり macOS で約 2~2.5 秒、Linux で 3.5~4 秒、Windows で 8~9 秒かかります。主にページ構造とアクセシビリティツリーが機能しない場合のフォールバックであり、デフォルトで毎ステップ視覚解析を実行するわけではありません。


Cua はまた、視覚操作による古いスクリーンショットの再利用を制限しています。各視覚認識は現在のスクリーンショットの `capture_id` に紐付けられ、その後のクリックは同じスクリーンショットに由来しなければなりません。スクリーンショットが 60 秒を超えた場合、またはすでに一度操作が実行された場合、Driver は使用を拒否し、インターフェース変化後に古い座標で誤クリックするのを防ぎます。


Cua は以前から `cua-som` と OmniParser による視覚的位置特定が可能でした。現在、この機能は Cua Driver に直接組み込まれ、上位の Agent は統一インターフェースを通じて認識結果を取得できます。モデル自体が画像を理解できなくても、これらのテキストと領域情報に基づいて次の操作を決定できます。


Perception はデフォルトのコンポーネントではなく、そのうち OmniParser 検出器は AGPL-3.0 を採用しています。Cua Driver は引き続き MIT ライセンスを維持します。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了