lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Metaの新ASRモデルがリアルタイム文字起こしで首位に、1時間わずか0.18ドル

動察 Beating AI 速報、Meta Superintelligence Labs が Muse Voice Transcribe を発表。リアルタイム音声の文字起こし、話者の識別、ユーザーが話し終えたタイミングの判定を、すべて1つのモデルに統合。最長で1時間以上の音声を処理でき、20人以上の話者を同時に区別可能。


Artificial Analysis の英語リアルタイム文字起こしテストでは、WER(単語誤り率、低いほど良い)は3.1%。GPT Live Transcribe は3.9%、Gemini 3.5 Transcribe Live は4.0%。Muse Voice Transcribe は発話終了後、約0.16秒で最終テキストを出力する。


すべての単語に同じ待機時間を固定しているわけではない。モデルは80msの音声を毎回読み取り、継続して聞くか出力を開始するかを自ら判断。簡単な単語はより速く書き出せ、難しい単語はより多くのコンテキストを聞いてから確定する。Meta は強化学習を用いて、精度と遅延を同時に最適化している。


モデルは70以上の言語でトレーニングされ、そのうち25言語は重点的に検証済み。さらに、一文内での中国語と英語の混在も直接認識可能。現在は Meta AI for Mac と Muse Code に統合され、Meta Model API も公開。価格は1000分あたり3ドル、つまり1時間あたり0.18ドル。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了