ニュース
「えーと」や「あー」を自動除去できる音声認識モデル「Gemini 3.5 Transcribe」
2026年8月28日 14:49
一般的な会話では、どうしても「えーと」や「あー」といった言いよどみが発生する。しかし、それがそのまま文字起こしされるとちょっとカッコ悪い。Googleが8月26日にリリースした最新音声認識モデル「Gemini 3.5 Transcribe」でこれが解決しそうだ。言いよどみだけでなく、背景雑音や専門用語、発話中の言い直しなどに対する補正能力を備え、生の音声を即座に整え、フォーマット済みテキストへ直接変換する。
すでに開発者向けにはGoogle AI StudioおよびGoogle Antigravityを通じたGemini APIとGemini Enterprise Agent Platformでパブリックプレビュー版が提供開始されている。また、一般消費者向けにもmacOS版Geminiアプリ、Android版GboardのRambler機能で展開が始まっており、近くChromeブラウザへの統合も予定されている。
Gemini 3.5 Transcribeは、スマートな書き起こし機能により、会話中の「えーと」や「あー」といった言いよどみを自動的に取り除くことができる。また、話し手が途中で言い直した際の発話修正も適切にテキストへ反映可能。さらに、関数呼び出しを介して、画像生成やファイル解析といった複雑なタスクをほかのGeminiモデルへ委任する機能も備えている。
高度な処理を行ないながらも、前世代の文字起こしモデル「Chirp 3」と比較して高速かつ高精度な動作を実現。最終的な文字起こしが完了するまでの遅延が70%短縮したほか、認識精度面では、ストリーミング環境で平均単語誤り率(WER)4.0%、非ストリーミング環境で2.6%を記録。多言語ベンチマークのFLEURSにおいてもChirp 3を上回る精度を示し、ストリーミング時5.5%、非ストリーミング時5.04%のWERを達成した。
このほか、85以上の言語の自動検出、専門用語に対応するカスタム語彙設定、録音データ内で最大3人の話者をタイムスタンプ付きで識別するマルチスピーカー認識などをサポートする。










![BRUCE WAYNE feat. Flo Milli, ATL Jacob [Explicit] 製品画像:4位](https://m.media-amazon.com/images/I/61ISSKA8rGL._SL160_.jpg)





![【Amazon.co.jp限定】 伊藤園 磨かれて、澄みきった日本の水 2L 8本 ラベルレス [ ケース ] [ 水 ] [ ペットボトル ] [ 箱買い ] [ ストック ] [ 水分補給 ] 製品画像:5位](https://m.media-amazon.com/images/I/41m8ly-SllL._SL160_.jpg)




