Google DeepMind、Gemini 3.5 Transcribeを公開しリアルタイム音声文字起こしを高度化

Google DeepMindは、精度と知能を向上させた最新の音声認識モデル Gemini 3.5 Transcribe を導入しました。従来のモデルと比べてリアルタイム処理の正確性が高まっており、…
AIの動向が実務の判断材料になる更新です。 Google DeepMindは、精度と知能を向上させた最新の音声認識モデル Gemini 3.5 Transcribe を導入しました
Google DeepMindは、最新の音声認識モデルである Gemini 3.5 Transcribe を公開しました。このモデルは高精度かつ知能的なリアルタイム・トランスクリプション(音声文字起こし)を実現するために設計されており、Gemini Audioチームの主導で開発されました。従来の音声認識モデルが単なる音響データのテキスト化に留まっていたのに対し、本モデルはより文脈に即した正確な出力を提供することに重点を置いています。
Gemini 3.5 Transcribe では、リアルタイム性を維持しながら音声のニュアンスや専門用語をより正確に捉える能力が強化されました。これにより、会議やライブ配信などの遅延が許されない環境下においても、文脈の欠落を抑えた高品質な文字起こしが可能です。以前の世代と比較して、単語の誤認識率の低減と、話者の意図を汲み取ったインテリジェントなテキスト変換の両立が図られています。
現在はブラウザ上でのオーディオ要素のサポート状況に依存する形でプレビューや実装が進められており、具体的なAPIの利用条件や対応言語の詳細は順次公開される見通しです。開発者は従来の音声認識APIからの移行コストを検討する際、Gemini 3.5 系列特有の計算リソースや処理遅延の差分、およびオーディオデータの入力要件を精査する必要があります。
Related tools
この記事に関連するおすすめツール
比較検討しやすい導入候補を優先して表示しています。一部リンクは広告・アフィリエイトを含む場合があります。
出典: DeepMind Blog
要点を短く整理して掲載しています。詳細は出典を確認してください。

