動察 Beating AI 速報、フランスのAI企業H CompanyがComputer UseモデルHolo4をリリース。27Bと35B-A3Bの2バージョンを含む。前者はQwen3.8 denseアーキテクチャに基づき、後者はQwen3.5 MoEアーキテクチャに基づいて追加のポストトレーニングを行ったもの。
H Companyは主にコンピュータ操作と長タスク実行能力を強化し、元の汎用モデルをさらにComputer Use向けのAgentモデルに訓練した。
教師あり微調整段階で、H Companyは合計1270億トークンを使用し、その約4分の3はタスクを正常に完了したAgent操作軌跡であり、デスクトップ、ウェブ、スマートフォン、MCP、APIをカバーしている。その後さらに強化学習を行い、「デスクトップとウェブ」および「ターミナル、MCP、API」の2種類の専門能力をそれぞれ訓練し、再び同一モデルに統合した。同社はまた、約1万件のソフトウェア操作タスクを自ら生成し、アプリ横断および長フローの作業の訓練に使用した。
H CompanyはまたAgent harnessを作り直し、モデルが数百ステップのタスクにおいて以前の操作を継続的に記憶し、コンピュータ上のshellを直接呼び出せるようにした。
効果は主に長タスクに現れている。Holo4 27BはOSWorld 2.0で61.7%を獲得し、Qwen3.8-27Bの公式スコアは48.0%であった。通常のOSWorldでは、Holo4が85.2%、Qwen3.8-27Bが84.3%であった。ただし、これらのスコアのharness、タスクバージョン、評価設定は完全には一致しておらず、厳密な同一条件での対照とは見なせない。