Google、Gemini 3.5 Transcribeを発表──音声入力は「文字起こし」から業務実行の入口へ

Google、Gemini 3.5 Transcribeを発表──音声入力は「文字起こし」から業務実行の入口へ

Googleは、音声を高精度にテキスト化する新モデル「Gemini 3.5 Transcribe」を発表した。リアルタイム会話、議事録、コール分析、音声エージェントなど、企業が扱う音声データを業務フローへつなぐ基盤になり得る。

従来の音声認識と何が違うのか

Gemini 3.5 Transcribeは、単に聞こえた音を文字にするだけではない。自己修正や言い淀みを理解し、フィラーを取り除き、読みやすい文へ整形する。Googleによれば、ストリーミングと録音処理の2系統で提供され、前者はサブ秒レイテンシの対話用途、後者は話者分離や単語単位のタイムスタンプを含む処理に向く。

数字で見る改善

GoogleはArtificial Analysisの測定として、ストリーミングの平均WERを4.0%、非ストリーミングを2.6%と説明している。さらにFLEURSベンチマークでは、主要言語・地域のセットでストリーミング5.50%、非ストリーミング5.04%のWERを示したという。

用途

特徴

企業での使い道

リアルタイム

サブ秒レイテンシ

音声エージェント、ライブ字幕

録音処理

話者分離、タイムスタンプ

会議録、通話分析、監査ログ

文脈理解

専門語や修正意図を反映

医療、法務、製造現場の記録

現場でのインパクト

日本企業では、会議、商談、問い合わせ、現場報告など、音声のまま眠っている情報が多い。高精度な文字起こしがAPIで扱いやすくなれば、要約、CRM入力、ナレッジ化、FAQ更新まで自動化しやすくなる。特に多言語対応やカスタム語彙は、専門用語が多い業界で効く。

注意点

音声は個人情報や機密情報を含みやすい。導入時は録音同意、保存期間、利用目的、アクセス権限を明確にする必要がある。精度が高くなっても、重要な契約・医療・人事判断では人間の確認を残すべきだ。

参考リンク:Google Blog

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。