動察 Beatingのモニタリングによると、千問(Qwen)は第3世代画像生成モデル「Qwen-Image-3.0」を発表した。新モデルは最大4.5kトークンの入力をサポートし、複雑なレイアウト、細かい文字、知識型画像の生成能力を重点的に向上させている。
長い指示文を用いて、新聞、試験問題、ショートドラマの絵コンテ、9マス情報図を生成できる。モデルは1枚の画像内で複数のテーマを処理し、同時に数式、図表、人物、中英文字を生成可能。公式が公開した9マス図には9種類の独立したコンテンツが含まれており、指示文は約3.7kトークンに及ぶ。
文字レンダリングもさらに強化された。千問によると、モデルは10pxの小さな文字を鮮明に生成でき、LaTeX数式、上付き・下付き文字、手書き注釈、新聞の密集レイアウトを処理可能。毛穴、髪の毛、紙や絵画の質感などのディテールもよりリアルになった。
Qwen-Image-3.0はネイティブで12言語、100以上のアートスタイル、多様なUIインターフェースをサポート。公式はさらに、ネットワーク接続による天気図生成、伝統絵画の修復、プロフェッショナルな情報図作成などの用途を紹介。単に美しい画像を生成するだけでなく、PPT、教育資料、デザイン、コンテンツ制作といった実用的なシーンを重視している。