lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

MiniMaxが画像生成モデルを予告:H3アーキテクチャに基づき、画像生成・画像修正を単一モデルで対応

動察 Beatingのモニタリングによると、MiniMax H3チームはReddit AMAで、専用の画像モデルを開発中であり、ウェイトをオープンソース化する計画があることを明らかにした。このモデルは、テキストから画像を生成する機能と汎用的な画像編集機能を同一モデルに統合し、現在はポストトレーニング最適化段階に入っている。

このモデルはH3と同じアーキテクチャのコンセプトを採用している。H3のVAEエンコーダーを踏襲しつつ、画像生成専用にVAEデコーダーを個別設計する。MiniMaxが想定するワークフローは、まず画像モデルで初フレームを生成し、それをH3に渡して動画生成を継続するというものだ。

チームはまた、H3自体がすでに一定の画像生成・画像修正の可能性を示していると述べている。これまでモデルは「初フレーム+テキスト記述」に基づいて最終フレームを予測するよう訓練されており、画像編集に特化した訓練は行っていないが、複数の画像編集評価において強いゼロショット能力を示している。これがMiniMaxがこのアーキテクチャを画像モデルに拡張する重要な根拠となっている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了