Google は、背景雑音や複雑な専門用語、発音の不明瞭さを正確に修正しながらテキスト変換を行う高精度な音声認識 AI モデル「Gemini 3.5 Transcribe」を正式発表しました。
要約
- 背景雑音や専門用語、言い淀みを自動で修正し、読みやすい文章へ高精度に変換する新しい音声認識 AI モデル「Gemini 3.5 Transcribe」が発表されました。
- Android 版「Gboard」アプリの「Rambler(AI 音声入力)」や macOS 版「Gemini」アプリなどで既に展開されており、今後は「Chrome」などにも順次拡大予定です。
概要
- 発表日:現地時間 2026 年 8 月 26 日(水)
- 対応言語:85 以上(方言やアクセントの違いにも自動対応)
- 話者識別:録音音声において最大 3 人までの発話者を自動で聞き分け、タイムスタンプ付きで記録可能
- 開発者向け API:リアルタイム会話向けの「Live API」と、録音済み音声解析向けの「Interactions API」の 2 種類を用意(「Google AI Studio」「Gemini Enterprise Agent Platform」を通じて提供)
- 利用シーン:Android 版「Gboard」アプリの「Rambler(AI 音声入力)」機能、macOS 版「Gemini」アプリの音声入力機能などで利用可能、近日中に「Chrome」へも展開予定



