1M AI ニュースによると、3 月 4 日、Google は Gemini 3.1 Flash-Lite プレビューバージョンをリリースしました。これは Gemini 3 シリーズの中で最速かつ最も低コストのモデルです。このモデルは Gemini 3 Pro アーキテクチャに基づき、混合専門家(MoE)デザインを採用しており、推論コストを下げるために一部のパラメータのみがアクティブ化されています。API の価格設定は、入力時に $0.25/百万 トークン、出力時に $1.50/百万 トークンであり、それぞれ Gemini 3.1 Pro($2/$18)の約 1/8 となっています。
性能面では、Gemini 2.5 Flash と比較して、最初のトークンの遅延時間が 2.5 倍短縮され、出力速度が 45% 向上し、秒間 363 トークンに達しました。最大 100 万トークンの入力と 6.4 万トークンの出力をサポートし、テキスト、画像、音声、ビデオの入力を受け付けます。内部ベンチマークテストの 11 項目のうち、Flash-Lite は GPT-5 mini や Claude 4.5 Haiku を上回り、GPQA Diamond(博士レベルの科学的質問応答)は 86.9%、MMMU-Pro(マルチモーダル推論)は 76.8%、LiveCodeBench(コード生成)は 72.0% です。
このモデルには調整可能な「思考レベル」が組み込まれており、開発者は AI ステュディオと Vertex AI でモデルの推論の深さを制御し、品質とコストを高頻度シナリオでバランスさせることができます。現在、Gemini API(Google AI ステュディオ)および Vertex AI を介したプレビューアクセスが提供されています。