Googleは、音声を高精度にテキスト化する新モデル「Gemini 3.5 Transcribe」を発表した。リアルタイム会話、議事録、コール分析、音声エージェントなど、企業が扱う音声データを業務フローへつなぐ基盤になり得る。
従来の音声認識と何が違うのか
Gemini 3.5 Transcribeは、単に聞こえた音を文字にするだけではない。自己修正や言い淀みを理解し、フィラーを取り除き、読みやすい文へ整形する。Googleによれば、ストリーミングと録音処理の2系統で提供され、前者はサブ秒レイテンシの対話用途、後者は話者分離や単語単位のタイムスタンプを含む処理に向く。
数字で見る改善
GoogleはArtificial Analysisの測定として、ストリーミングの平均WERを4.0%、非ストリーミングを2.6%と説明している。さらにFLEURSベンチマークでは、主要言語・地域のセットでストリーミング5.50%、非ストリーミング5.04%のWERを示したという。
用途 | 特徴 | 企業での使い道 |
|---|---|---|
リアルタイム | サブ秒レイテンシ | 音声エージェント、ライブ字幕 |
録音処理 | 話者分離、タイムスタンプ | 会議録、通話分析、監査ログ |
文脈理解 | 専門語や修正意図を反映 | 医療、法務、製造現場の記録 |
現場でのインパクト
日本企業では、会議、商談、問い合わせ、現場報告など、音声のまま眠っている情報が多い。高精度な文字起こしがAPIで扱いやすくなれば、要約、CRM入力、ナレッジ化、FAQ更新まで自動化しやすくなる。特に多言語対応やカスタム語彙は、専門用語が多い業界で効く。
注意点
音声は個人情報や機密情報を含みやすい。導入時は録音同意、保存期間、利用目的、アクセス権限を明確にする必要がある。精度が高くなっても、重要な契約・医療・人事判断では人間の確認を残すべきだ。
参考リンク:Google Blog


.png&w=384&q=75)