動察 Beating AI 速報、元DeepMind、Google Brain、Meta FAIRの研究者らが設立した米国のAI企業Rekaが、190億パラメータのモデルRho-1を発表した。1回の対話でテキスト、画像、動画を処理でき、ロボットの動作も出力できる。例えば、まず灯台の画像を生成し、次に灯台を動かし、動画の天気を変更し、最後に2つの動画の違いを追问できる。前に生成した内容はコンテキストに残り続け、別のモデルに再度渡す必要はない。
また、動画生成中に指示を受け続けることもサポートしている。動画が生成されている途中で、ユーザーが一時的に天気、運動方向、その他の内容の変更を要求すると、以降の映像がそれに合わせて調整される。ベース版の生成速度はリアルタイムの約0.79倍。蒸留版は生成ステップを99ステップから8ステップに圧縮し、Rekaの測定では約1秒で5.3秒の動画を生成できる。
ロボットも同じモデルに接続されている。Rho-1はカメラが次に何を見るかを予測しながら、ロボットの動作信号を出力し、別の計画モデルにどう動くかを決めさせる必要がない。現在公式が展示しているのはまだLIBEROシミュレーションタスクで、実機ロボットのテスト結果は公表されていない。
同様の統合モデルは今年すでに登場している。NVIDIA Cosmos 3もテキスト、画像、動画、音声、動作を統一的に処理できる。Rho-1はより連続的なインタラクションに重点を置き、同じコンテキスト内で繰り返し生成、修正、推論を続けることを重視して展示している。
Rho-1はゼロから訓練され、320台のH100を使用し、約3ヶ月間訓練された。現在の動画解像度は672×384で、長い動画では依然として映像構造のドリフトが発生する可能性があり、動画のローカライズと局所編集も十分に安定していない。モデルは現在研究プレビューのみで、重みとAPIはまだ公開されていない。