動察 Beating AI 速報、テンセント混元が15億パラメータの音声生成・編集モデル AuK をオープンソース化、公式はこれを「音声版 Nano Banana」と呼んでいる。声のクローン、歌詞の変更、感情の切り替え、訛りの除去、話速とピッチの調整、ノイズ除去、複数話者および音楽の分離まで、すべて同じモデルに詰め込まれ、自然言語で制御できる。
AuK は既存の録音を直接編集できる。数文字言い間違えた場合、その数文字だけを修正すればよく、全体を録り直す必要はない。内容を変えずに、感情、音色、訛りを変えることもできる。歌詞の変更、笑い声や咳の除去、通常の話し声をささやき声に変えることもサポートしている。声のクローンも、先に参照録音の文字起こしを用意する必要はなく、音声の一部と新しいテキストだけで生成できる。
公式テストでは、AuK は音声生成および汎用音声編集の複数の評価でトップに立っている。SpeechEditBench のスコアは 49.73 で、2位の Ming-UniAudio は 28.70 だった。高速版の AuK-Flash は蒸留後、推論がわずか4ステップで済み、速度は約4.5倍速い。ただし論文も、AuK は現時点ですべての気軽な自然言語指示を安定して理解できるわけではなく、依然として Prompt Enhancer によってタスクを判断し、パラメータを整理し、指示を書き換える必要があると認めている。コードとモデルの重みはすでに公開されており、MIT ライセンスを採用している。