lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

小红书がオープンソースの全連続自己回帰TTSモデルdots.ttsを公開、ゼロショット音声クローンに対応

動察 Beatingのモニタリングによると、小紅書(RED)のhi labは、20億パラメータのエンドツーエンド自己回帰テキスト音声変換(TTS)モデル「dots.tts」をオープンソース化し、Apache 2.0ライセンスのもとで完全な推論およびファインチューニングコードを公開しました。公開された重みには、基本の事前学習バージョン、自己修正アライメント(SCA)ファインチューニングバージョン、および低遅延推論蒸留バージョンが含まれています。

従来の離散オーディオコーデックトークン(Discrete Codec Tokens)に依存するTTSアーキテクチャ(例:VALL-E、CosyVoice、ChatTTSなど)とは異なり、dots.ttsは完全に連続的でエンドツーエンドの自己回帰フローマッチングアーキテクチャを実現し、パイプライン全体で離散トークンを一切使用しません。dots.ttsは、48 kHzサンプリングレートのAudioVAEから抽出された連続特徴量を、セマンティックエンコーダー、バックボーン言語モデル(Qwen2.5-1.5B-Baseから初期化され、BPEテキストを直接処理し、ピンイン入力を不要とする)、および自己回帰フローマッチング音響ヘッドと組み合わせ、連続潜在変数を予測し、ジェネレーターによって音声に再構築します。連続特徴量を直接予測するため、dots.ttsは離散量子化による音質損失を回避し、発音の細部、音色の類似性、感情表現力を保持します。

dots.ttsは約150万時間の音声データで事前学習されています。Seed-TTS-Eval評価では、dots.ttsは中国語、英語、および中国語難易度テストセットにおいて、文字誤り率(WER)がそれぞれ0.94%、1.30%、6.60%、類似度スコア(SIM)が81.0、77.1、79.5であり、いずれもオープンソースのSOTAレベルに達しています。24言語のMiniMax Multilingualベンチマークでは、平均話者類似度が83.9に達しました。小紅書はHugging Face上でGradio体験スペースを提供し、ユーザーがオンラインでゼロショット音声クローンをテストできるようにしています。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了