動察 Beatingのモニタリングによると、MiniMax H3チームはReddit AMAで、専用の画像モデルを開発中であり、ウェイトをオープンソース化する計画があることを明らかにした。このモデルは、テキストから画像を生成する機能と汎用的な画像編集機能を同一モデルに統合し、現在はポストトレーニング最適化段階に入っている。
このモデルはH3と同じアーキテクチャのコンセプトを採用している。H3のVAEエンコーダーを踏襲しつつ、画像生成専用にVAEデコーダーを個別設計する。MiniMaxが想定するワークフローは、まず画像モデルで初フレームを生成し、それをH3に渡して動画生成を継続するというものだ。
チームはまた、H3自体がすでに一定の画像生成・画像修正の可能性を示していると述べている。これまでモデルは「初フレーム+テキスト記述」に基づいて最終フレームを予測するよう訓練されており、画像編集に特化した訓練は行っていないが、複数の画像編集評価において強いゼロショット能力を示している。これがMiniMaxがこのアーキテクチャを画像モデルに拡張する重要な根拠となっている。