動察 Beatingのモニタリングによると、Cartesiaは次世代リアルタイム音声合成モデルSonic 3.6を発表し、現在ベータ版を公開中です。このモデルは44言語に対応し、Artificial AnalysisのTTSランキングで2つの1位を同時に獲得しました。
Provider Voiceは各モデルのネイティブ音声を使用したブラインドテストで、Sonic 3.6はアリババのQwen-Audio-3.0-TTS-Plus、SpeechifyAI Simba 3.2、Google Gemini 3.1 Flash TTSを上回りました。Controlled Voiceでは全モデルが同一のクローン音声を使用し、モデル自体の性能比較に重点を置いていますが、Sonic 3.6は依然として1位です。
Artificial Analysisの測定によると、Sonic 3.6の生成速度は毎秒136.1文字で、ElevenLabs Eleven v3は46.7、Gemini 3.1 Flash TTSは24.2です。
価格は100万文字あたり49ドルで、Eleven v3の半分以下ですが、Qwenの27.6ドルやSimba 3.2の10ドルよりは依然として高価です。