Microsoft は本日、自社開発の AI モデル キャンプをさらに拡大し、高忠実度の画像生成および編集モデル MAI-Image-2.5-Pro を正式に開始し、低遅延テキスト読み上げモデル MAI-Voice-2-Flash のパブリック ベータ版を開始したことを発表しました。

Microsoft のこれまでで最も正確な画像生成モデルとして、MAI-Image-2.5-Pro は、洗練された画像生成、二次編集、メイン ビジュアル ポスター デザイン、およびより正確なテキスト レンダリングを必要とするアプリケーション シナリオ向けに設計されています。価格戦略に関しては、このモデルはテキスト入力トークン 100 万あたり 5 米ドル、画像入力トークン 100 万あたり 8 米ドル、画像出力トークン 100 万あたり 106 米ドルで販売されます。現在、開発者とユーザーは、MAI Playground プラットフォームでこのモデルを無料で体験できます。
同時に、Microsoft は、顧客サービス ロボットなど、同時実行性が高く、遅延が少ない音声アプリケーション シナリオに焦点を当てた MAI-Voice-2-Flash をリリースしました。公式データによると、MAI-Voice-2-Flash は自然なイントネーションと高音質を維持しながら、動作速度が 2 倍になり、コストが 32% 削減されたとのことです。価格は 100 万文字あたり 15 米ドルです。
Microsoft は、中核事業の多くが自社開発の MAI シリーズ モデルに完全に統合されていることを明らかにしました。たとえば、Bing Image Creator は MAI-Image-2.5 によって駆動されるように完全に切り替えられ、PowerPoint のグラフ生成機能もこのモデルに接続されました。以前に採用されていたサードパーティ ソリューションと比較して、自社開発モデルに切り替えた後、GPU コストが最大 84% 削減されました。 OneDrive では、MAI-Image-2.5 を適用すると、画像編集の保存率が 26% 向上し、P95 の遅延が約 25% 削減されます。さらに、MAI-Voice-2-Flash は Dynamics 365 コンタクト センターで初めて使用され、GPU コストを最大 89% 節約し、開発者が音声対話エージェントを構築するために Azure Voice Live の一部として利用できます。多言語文字起こしモデル MAI-Transcribe-1.5 も、Dragon Copilot に 58 言語にわたるディクテーション サービスを提供することに成功しました。