Microsoft がリアルタイム文字起こしおよび音声合成モデル MAI-Transcribe-2-Streaming を発表、ストリーミング認識リストで 1 位にランクイン

📅 2026-10-02

要約:

Microsoft は、リアルタイム音声インタラクション用の 3 つの新しいモデル、つまり音声合成モデル MAI-Transcribe-2-Streaming と、音声合成モデル MAI-Voice-2.1 および MAI-Voice-2.1-Flash を発表しました。 Microsoftは、開発者がこれらを組み合わせて、聞きながら処理し、自然な音声で即座に応答できる音声アシスタントや会話型エージェントを構築することを望んでいる。

MAI-Transcribe-2-Streaming は、録音ファイルのみを処理できる以前の MAI-Transcribe-2 とは異なります。連続入力オーディオ ストリームを受信し、話者が話し終わる前に段階的なテキストの生成を開始できます。より多くのコンテキストが得られるにつれて改訂が続けられ、最終的には安定した結果が提出されます。 Microsoftは、このモデルは60の言語をサポートし、継続的かつ自動的に言語を認識できると述べた。最初の認識バッチは、音声を受信して​​から 100 ミリ秒をわずかに超える程度に現れると想定されており、音声エージェント、顧客サービス、会議や教室の字幕、音声入力などのシナリオに適しています。 Microsoft のディクテーションと字幕の社内テストでは、テキストが最も近い競合他社に比べて約 2 倍の速さで表示されることが示されました。これは同社自身のレビューに基づいた比較です。

Artificial Analysis のストリーミング文字起こしベンチマークでは、最終的および段階的なテキストの精度に関してモデルが 1 位にランク付けされています。公開されたテスト結果では、最終的に書き起こされた単語の誤り率は約 2.5% で、最終的なテキストは音声の終了が検出されてから約 0.13 秒後に提供されたということでした。このリストは当時 38 のモデルを比較し、約 8 時間のオーディオをテストし、AA-AgentTalk、VoxPopuli、および Earnings22 の 3 種類のコーパスをカバーしており、それぞれ総合的なウェイトの 50%、25%、25% を占めていました。単語エラー率が低いほど良いことになります。この結果は、この一連のベンチマークにおけるモデルのパフォーマンスを示すものであり、すべての言語、ノイズの多い環境、および現実世界のアプリケーションで同じ精度が達成できることを意味するものではありません。

MAI-Transcribe-2-Streaming は現在、音声 1 時間あたり 0.54 ドルで販売されており、このオファーは 2026 年末まで続きます。比較すると、非ストリーミング MAI-Transcribe-2 は、以前は 1 時間あたり 0.10 ドルで宣伝されていました。リアルタイム バージョンは継続的な対話に適しており、バッチ バージョンは音声文字起こしの録音に適しています。両者の価格は、同じ使用方法で単純に直接比較することはできません。

新しい音声合成モデル MAI-Voice-2.1 は、23 の言語と 26 の地域バリアントをサポートしており、話者のアイデンティティを保持し、対応する言語のローカルアクセントを採用しながら、同じ合成音声を異なる言語間で切り替えることができます。価格は 100 万文字あたり 22 米ドルです。低遅延かつ大規模なリクエスト用の MAI-Voice-2.1-Flash は、同じ言語をサポートしています。 Microsoftによれば、エンドツーエンドの遅延は約150ミリ秒で、45秒の音声を生成できるという。モデル推論速度は55%向上し、価格は同等モデルより約60%安くなりました。価格は 100 万文字あたり 15 ドルです。後者の速度と価格の利点は、Microsoft が公開した比較の中に含まれています。

どちらの音声モデルも、言語を超えたリアルタイムの音声クローン作成をサポートしていますが、許可され同意された参照音声を使用した場合にのみサポートされます。 Microsoft のドキュメントでは、この機能は制限付きアクセスとしてリストされており、参考音声の推奨時間は 5 ~ 60 秒であり、悪用に対する保護が含まれています。 MAI-Voice-2.1 は長いコンテンツ、ナレーション、オーディオブックに適していますが、Flash は音声エージェント、アシスタント、顧客サービスなどのリアルタイム シナリオに適しています。

3 つのモデルはすべて、Microsoft Foundry、MAI Playground、Vercel を通じて使用できます。 2 つの Voice モデルも OpenRouter に接続されており、Azure Voice Live を通じて呼び出すことができます。 LiveKit のサポートは後で開始される予定です。 Microsoft Azure のドキュメントでは現在、これらのモデルをパブリック プレビューとしてラベル付けしており、サービス レベル契約はなく、運用ワークロードでの直接使用は推奨されないと述べています。

詳細:

https://microsoft.ai/news/our-first-streaming-transcription-model/

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし