Google、音声からテキストへの変換精度をさらに向上させるために Gemini 3.5 Transcribe を発表

📅 2026-08-27

要約:

Google は最近、Gemini シリーズの最新の音声テキスト変換モデルである Gemini 3.5 Transcribe をリリースし、これをシリーズ内で最も正確な音声認識モデルと呼びました。このモデルは開発者、企業、一般ユーザーに公開されており、騒がしい環境、複雑な専門用語、自然な口頭表現における音訳機能の向上に重点を置いています。

レポートによると、Gemini 3.5 Transcribe は専門分野における背景ノイズや複雑な語彙をより適切に処理できるそうです。 Googleによると、新モデルによりmacOSプラットフォームのGeminiアプリとAndroidプラットフォームのGboardキーボードのRambler機能のパフォーマンスが向上したという。開発者はこのモデルを使用して、音声エージェント、リアルタイム字幕ツール、通話後の分析プロセスなどのアプリケーションを構築できます。

Google によると、Gemini 3.5 Transcribe は、ユーザーの自然な発話パターンをキャプチャして、セマンティックな意図をより正確に理解し、カスタム語彙を識別し、ユーザーが音声を通じてタスクを完了できるようにするように設計されているとのことです。

機能レベルでは、新しいモデルには、自動自己修正、「えー」や「あのー」などの口頭でのつなぎ言葉の削除、出力テキストの自動フォーマットなど、多数の最適化機能が追加されています。同時に、ファイル分析や画像生成などのより複雑なタスクを他の Gemini モデルに委任して、より完全なマルチモデルのコラボレーション エクスペリエンスを形成することもできます。

精度の点で、Google は、Gemini 3.5 Transcribe の平均単語誤り率が、ストリーミング音声認識シナリオでは 4.0% であり、非ストリーミング シナリオでは 2.6% まで削減できると指摘しました。このモデルは、騒がしい環境での転写パフォーマンスが向上し、注文番号や郵便番号などの文字と数字で構成される重要な情報をより正確に識別できます。

言語サポートに関しては、Gemini 3.5 Transcribe は現在 85 の言語をカバーし、地域のアクセントやさまざまな方言をサポートしています。事前に録音された音声の場合、最大 3 人の話者に対してタイムスタンプ付きの音声属性認識を実行できます。さらに、モデルはユーザー定義の語彙に適応して、専門用語、特殊なスペル、業界名を識別できます。

Gemini 3.5 Transcribe は現在、Google AI Studio および Google Antigravity の Gemini API を通じてパブリック プレビューで利用できます。一般のユーザーは、Android および macOS プラットフォームで関連機能を体験できます。 Googleはまた、これをChromeブラウザに導入する予定で、ユーザーはWebページの入力ボックスに音声で直接テキストを入力できるようになる。

最近、Google は Gemini 製品ラインの進化を加速し続けています。同社は以前、ますます激化する AI モデルの価格競争に参加するために Gemini 3.7 Flash を発売しました。 Chrome for Android の Gemini も米国のすべてのユーザーに公開されており、Gemini Assistant も Waymo の新世代の自動運転タクシーに組み込まれています。

関連タグ

関連記事

コメント

0/500
验证码
コメントなし