lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Google最強の音声書き起こしモデル登場:精度はトップ5入り、ただしElevenLabsにはまだ及ばず

動察 Beating AI 速報、Google が Gemini 3.5 Transcribe を発表。これは現在最も正確な Google 音声書き起こしモデルであり、Google が専用書き起こしモデルに初めて Smart モードを搭載したもの。モデルはリアルタイム版と録音書き起こし版の2種類があり、現在 Gemini API で公開ベータテストが開始されている。Artificial Analysis の評価では、非ストリーミング WER(単語誤り率、低いほど良い)は 2.6%、リアルタイム版は 4.0%。最終的な書き起こし遅延は前世代の Chirp 3 と比較して 70% 短縮された。


Smart モードは、音声を単に一字一句テキストに変換するだけではない。例えば「火曜日に会議、いや、水曜日」と言えば、「水曜日」だけが直接残る。「えーと」「あー」などの口癖も自動的に削除され、口語を段落、リスト、日付、数字に整理することも可能。会議の議事録で原文が必要な場合は、従来の逐語書き起こしモードを引き続き使用できる。


このモデルは 85 以上の言語に対応し、途中での言語切り替えも可能で、カスタム専門用語も追加できる。録音書き起こしは約 1 分あたり 0.005 ドル、つまり 1000 分あたり 5 ドル。リアルタイム版は約 1 分あたり 0.009 ドル。独立したランキングでは、OpenAI GPT Transcribe の 3.3% よりも正確だが、ElevenLabs Scribe v2 にはまだ及ばない。後者の WER は 2.2% で、1000 分あたり約 3.67 ドル。


このモデルはすでに Android の Rambler と macOS 版 Gemini に使用されており、今後 Chrome にも導入される予定。その際には、ウェブページの入力ボックスで直接話して文字入力ができるようになる。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了