Googleが音声認識AI「Gemini 3.5 Transcribe」発表 「えーと」や言い直しを自動で整理

何が起きた?
Googleは2026年8月26日、新しい音声文字起こしAI「Gemini 3.5 Transcribe」を発表しました。
人が話した内容を文字にするだけでなく、「えーと」「あのー」といった言い淀みや、途中での言い直しを自動的に整理し、読みやすい文章にできるのが特徴です。背景雑音やさまざまなアクセント、専門用語にも対応しやすくなっています。
録音済み音声向けの「Gemini 3.5 Transcribe」と、リアルタイム向けの「Gemini 3.5 Transcribe Live」が用意されています。開発者向けにはGemini APIを通じてパブリックプレビューとして提供が始まっています。
簡単にいうと
これまでの文字起こしが「聞こえた言葉をそのままメモする人」だとすれば、Gemini 3.5 Transcribeは**「話を聞きながら、読みやすいメモに整えてくれる人」**に近いものです。
たとえば、
「えーと、会議は火曜日……いや、水曜日の2時で」
と話したとします。
そのまま記録する「verbatim」モードでは、言い淀みや言い直しも残せます。一方、「smart」モードでは、それらを整理して「会議は水曜日の午後2時」のような読みやすい文章にできます。
Smart transcriptionでは、話した内容を段落や箇条書きに整えたり、日付や数字を読みやすい表記へ変換したりすることもできます。つまり、単に音声を文字へ置き換えるだけでなく、人があとで読みやすい形まで整えるのが特徴です。
それで何が変わる?
大きいのは、音声入力するときに「きれいに話さなければならない」という負担が減ることです。
スマートフォンに思いついたことをそのまま話したり、会議やインタビューを録音したりしても、あとから大量の「えーと」や言い直しを手作業で消す必要が減る可能性があります。
さらに、Gemini 3.5 Transcribeは85以上の言語・地域を自動認識でき、背景雑音やアクセントにも対応します。専門用語、略語、固有名詞などを最大1,000件まで登録し、認識しやすくする「カスタム語彙」にも対応しています。
そのため今後は、メールやメモをキーボードで打つ代わりに、普段の話し方のまま音声で入力する場面がさらに増えるかもしれません。
普通の文字起こしと何が違う?
Gemini 3.5 Transcribeでは、用途に応じて「そのまま記録する」か「読みやすく整理する」かを選べます。
「verbatim」は、言い淀み、繰り返し、言い直しなども含めて、話した内容をできるだけそのまま残します。
一方の「smart」は、「えーと」などを取り除き、言い直しを整理し、句読点や文章構造まで整えます。勝手にすべての音声を編集するわけではなく、目的によって使い分けられます。
文字起こし精度についてGoogleは、外部評価サービスArtificial Analysisによる測定として、平均の単語誤り率(WER)がリアルタイムでは4.0%、録音済み音声では2.6%だったと紹介しています。WERは低いほど文字起こしの間違いが少ないことを示す指標です。
またGoogleは、従来モデル「Chirp 3」と比べて、文字起こし結果が最終確定するまでの時間も大幅に改善したとしています。
ただし、これらの数字は特定の評価条件で測定された結果です。雑音の種類やマイク、話し方、言語などによって実際の精度は変わります。
AIによる音声認識なので、固有名詞や数字などを誤って認識する可能性もあります。重要な会議や契約、医療・法律など正確さが特に必要な場面では、元の音声との確認が引き続き必要です。
日本でも使える?
はい。Gemini 3.5 Transcribeは85以上の言語・地域に対応しており、日本語(ja-JP)も正式な対応言語に含まれています。
ただし、「日本語に対応している」ことと「Googleのすべての製品ですぐ日本語利用できる」ことは別です。
発表時点では、一般ユーザー向けにはmacOS版Geminiアプリで英語対応、Androidの「Rambler」は一部の国・言語で提供されています。Chromeにも今後、Web上の入力欄へ話しかけて文字を入力できる機能が追加される予定です。
つまり今回の発表は、単なる新しい文字起こしサービスというより、Googleがスマホやパソコンでの文字入力を、より自然な音声入力へ広げていく動きと見ることができます。
情報源
- Google「Introducing Gemini 3.5 Transcribe」
- Google AI for Developers「Audio transcription」
- Google DeepMind「Gemini 3.5 Audio Model Card」
- The Verge「Google’s new AI transcription edits out your ‘ums’ and ‘ahs’」
記事URLスラッグgoogle-gemini-3-5-transcribe