要約:
Microsoft は、Foundry プラットフォームのリアルタイム音声機能をさらに強化し、音声入力と音声出力を直接実行できるネイティブ音声エージェントを開発者に提供し、企業が Google Gemini Live と同様のリアルタイム会話型 AI エクスペリエンスを構築しやすくします。

Microsoft のアップデートの主な変更点は、Foundry Agent Service がネイティブのリアルタイム音声機能のサポートを開始することです。最初に音声をテキストに変換し、それをテキスト モデルに渡して処理し、最後にテキストを再び音声に変換する従来の AI エージェントのプロセスとは異なり、ネイティブ音声アーキテクチャでは、リアルタイム音声モデルがユーザーの音声入力を処理して音声応答を生成できるため、中間リンクとその結果生じる遅延が削減されます。
ユーザーにとって、これは AI エージェントがより自然に継続的な会話を行えることを意味します。ユーザーは、音声合成を開始する前に、音声認識が完了するか、モデルが完全なテキスト応答を生成するのを待つ必要はありません。このシステムは、人々の間のリアルタイムのコミュニケーション方法に近づけることができ、中断や方向転換の判断などの音声対話の重要な側面を処理できます。
Microsoft の機能は、Voice Live API に基づいて構築されています。このインターフェイスは、音声認識、生成 AI、テキスト読み上げ、方向転換検出、割り込み処理などの機能を統合リアルタイム音声インターフェイスに統合しており、開発者は複数の音声コンポーネントを個別に構築することなく、AI エージェントにリアルタイム音声対話機能を追加できます。
Foundry Agent Service を使用して AI エージェントを構築している企業にとって、これは、元のテキストベースのエージェントが、元のツールの呼び出し、ナレッジ ベース、メモリ、コンテンツ セキュリティ保護、エンタープライズ レベルのデータとサービスの統合機能を引き続き使用しながら、音声対話機能をさらに利用できることを意味します。
Microsoft は、音声エージェントが単に「回答を読む」ことができるチャットボットではなく、リアルタイムの音声通信中にツールを呼び出してタスクを実行できることを特に強調しています。たとえば、企業はこのテクノロジーを使用して、ユーザーが電話で AI エージェントと直接通信できる顧客サービス システムを構築できます。また、バリアフリー サービス、音声ファースト アプリケーション、自然な音声対話を必要とするさまざまな企業内システムにも使用できます。
技術的なアーキテクチャの観点から、Foundry は現在 2 つの主要な音声エージェント ルートをサポートしています。 1 つは従来の音声パイプラインで、ユーザーの音声をテキストに変換し、それを推論のためにテキスト モデルに渡し、最後に生成されたテキストを音声に変換します。もう1つは、今回注目するネイティブSpeech-to-Speech、speech-to-speechアーキテクチャです。リアルタイム音声モデルは、音声入力を直接処理し、音声出力を生成します。
ネイティブ音声アーキテクチャの最大の利点は、自然な会話のトーン、間、通信リズムをより適切に維持しながら、遅延を短縮できることです。継続的なコミュニケーションが必要なシナリオでは、この方法は、「音声認識 → テキスト モデル → 音声合成」という従来の多段階ソリューションよりも実際のリアルタイム会話に近くなります。
Microsoft は、Voice Live API のリアルタイム インタラクション機能の改善も続けています。最近のアップデートでは、新しいネイティブのリアルタイム音声タイプが追加され、エコー キャンセル、インテリジェントな終了検出、並列ツール呼び出しなどの機能がさらに改善されました。エコー キャンセルは、カスタム ハードウェアまたは非標準オーディオ リンク上で実行されている音声エージェントに特に適しています。これにより、クライアントが実際に再生した音をシステムが参照できるようになり、AIが自分の声を聞いた後の誤認識の問題が軽減されます。
マイクロソフトは、音声自体に加えて、エンタープライズ レベルの AI エージェント開発および運用プラットフォームとしての Foundry の位置付けも強化しています。 Foundry Agent Service は、インテリジェント エージェントのライフ サイクル管理を担当し、エンタープライズ レベルのセキュリティ、権限制御、ネットワーク分離、操作追跡および評価機能を提供します。これにより、企業は AI エージェントの運用、監視、音声通信のためのインフラストラクチャを一から構築する必要がなくなります。
Microsoft の動きは明らかに、Google が近年継続的に強化してきた Gemini Live も狙っています。 Gemini Live は、Google にとってリアルタイム音声 AI 機能を消費者にデモンストレーションするための重要な製品となっていますが、Microsoft は同様のリアルタイム音声機能を企業開発者に直接提供し、企業が独自のデータ、ツール、ビジネス プロセスに基づいて独自の音声インテリジェンスを構築できるようにすることを重視しています。
したがって、この 2 つの位置はまったく同じではありません。 Gemini Live は主に一般ユーザー向けに直接使用可能な AI 音声エクスペリエンスを提供しますが、Microsoft Foundry はより企業や開発者向けです。企業がリアルタイムの音声機能を顧客サービス、電話システム、社内業務、その他のプロフェッショナル アプリケーションに組み込めるようにすることに重点を置いています。
マイクロソフトは近年、単純なチャットボットから自律的にタスクを実行できるシステムまで AI エージェントの開発を推進しています。このシステムに音声機能が追加されたことで、ユーザーとエージェント間の対話は、キーボード入力からより自然なリアルタイム会話へと徐々に拡張されました。エージェントは質問に答えるだけでなく、ツールを呼び出したり、企業データにアクセスしたり、会話中に特定のタスクを完了したりすることもできます。
現在、Microsoft は、Foundry Agent Service、Voice Live、マネージド エージェントなどの機能を同じエンタープライズ AI プラットフォームに徐々に統合しています。これらのテクノロジーが成熟するにつれて、リアルタイムの音声カスタマー サービス、電話エージェント、音声オフィス アシスタント、その他の AI サービスを構築するために企業が自社で開発および維持する必要があるインフラストラクチャはさらに削減されるでしょう。
これは、AI 音声アシスタントをめぐる競争が、単に「チャットできるかどうか」というモデルの比較から、低遅延の音声インタラクション、より完全なツール呼び出し機能、より信頼性の高いエンタープライズ レベルのインフラストラクチャ、より便利な開発環境を提供できるモデルの比較へと移りつつあることも意味します。 Microsoft による Foundry へのネイティブ リアルタイム音声エージェントの追加は、エンタープライズ AI 市場における音声エージェント レイアウトをさらに拡大するための重要なステップです。
コメント