要約:
Alibaba の Qwen チームは最近、新世代のネイティブ フルモーダル モデル Qwen3.8-Omni-Flash をリリースしました。これは、音声とビデオの理解と AI エージェント機能をさらに組み合わせたものです。
このモデルは、テキスト、画像、オーディオ、ビデオの 4 つの入力形式をサポートし、100 万トークンのコンテキスト ウィンドウを提供します。前世代の Qwen3.5-Omni-Plus と比較して、Qwen 関係者は、29 のベンチマーク テストの平均スコアが 25% 以上向上し、オーディオおよび音声とビデオの処理コストが大幅に削減されたと主張しています。

Qwen3.8-Omni-Flash の最大の変更点の 1 つは、音声認識、画像認識、その他の機能を単につなぎ合わせるのではなく、さまざまな種類の情報をモデル レベルからネイティブに処理することです。アリババはこれを利用して、モデルが音声やビデオのコンテンツを「理解」または「理解」できるようにするだけでなく、この情報を理解した後にさらにタスクを計画し、ツールを呼び出し、実際の作業を完了できるようにしたいと考えている。
オーディオ機能の点では、Qwen3.8-Omni-Flash のパフォーマンスが特に優れています。 Qwen が発表したデータによると、このモデルはいくつかのオーディオ ベンチマーク テストで Gemini 3.8 Flash を上回りました。たとえば、WildClawBench-MM マルチモーダル ツール呼び出しテストでは、Qwen3.8-Omni-Flash は 71.0 ポイントを獲得し、Gemini 3.8 Flash は 58.9 ポイントを獲得しました。 DailyOmni テストでは、Qwen が 85.1 ポイント、Gemini が 84.0 ポイントを獲得しました。 SpotSoundBench では、2 人はそれぞれ 67.2 ポイントと 39.7 ポイントを獲得しました。 MMAU テストでは、81.8 点と 76.9 点を獲得しました。
複数話者による会議の音声認識も、このアップグレードの焦点です。 Qwen が公開した AliMeeting テスト データによると、Qwen3.8-Omni-Flash の話者誤り率 DER は 3.35、話者帰属による単語誤り率 cpWER は 17.18 であるのに対し、前世代の Qwen3.5-Omni-Plus はそれぞれ 88.11 と 89.61 でした。つまり、今回のテストでは新型モデルが大幅に変更されることになる。
ただし、Qwen3.8-Omni-Flash はすべてのプロジェクトで Gemini 3.8 Flash を上回っているわけではありません。たとえば、AgenticVBench テストでは、Gemini 3.8 Flash は 45.0 ポイント、Qwen は 36.8 ポイントを獲得しました。 OmniGAIA では、それぞれ 78.6 点と 74.0 点を獲得しました。いくつかのビデオ理解テストでも、ジェミニは優位性を維持しました。したがって、Qwen が「Gemini に近づく」ことに重点を置いているのは、全体的なオーディオ機能、オーディオおよびビデオ機能に反映されており、すべてのマルチモーダル プロジェクトで全体的なリードを意味するものではありません。
Qwen3.8-Omni-Flash のもう 1 つの重要な変更点は価格です。 Qwen によれば、前モデルと比較して、音声入力の 1 時間あたりの推定コストが 98% 以上、音声とビデオ入力の 1 時間あたりのコストが 93% 以上低下したとのことです。公式の計算方法によると、いわゆる「時間当たり」のコストは、ビデオが 720p、1 秒あたり 1 フレームの入力条件を採用した場合、2 分の素材の処理価格に 30 を乗じて計算されます。
Alibaba Cloud が発表した現在の国際地域価格は、100 万トークン入力あたり 0.15 米ドル、キャッシュにヒットする入力トークンは 0.016 米ドル、100 万あたりの出力トークンは 0.47 米ドルです。中国本土とその他の一部の地域では価格が異なります。オーディオとビデオをモデル入力として直接使用できるため、この価格体系は、会議の録画、長時間の音声分析、ビデオ レビュー、字幕の生成、大量のメディア コンテンツの処理などのシナリオに特に適しています。
100 万トークンのコンテキスト ウィンドウは、この利点をさらに拡大します。 Qwen3.8-Omni-Flash の最大入力長は 992,000 トークンに近く、思考モードでの最大入力長は約 984,000 トークン、最大出力長は 131,000 トークンに達します。これは、開発者が、これまでのようにフレームを頻繁にスライスして抽出する必要がなく、非常に大規模なオーディオまたはビデオ コンテンツを処理するモデルに直接引き渡し、複数のモデルを使用して音声認識、視覚的理解、およびテキスト推論をそれぞれ完了できることを意味します。
Alibaba Cloud の公式情報によると、Qwen3.8-Omni-Flash は 113 の言語と方言の音声入力を処理でき、空間音声分析をサポートしています。関連するパラメーターを通じて、モデルは 2 チャンネルのステレオと 4 チャンネルの空間オーディオを処理できます。同時に、このモデルは関数呼び出し、ネットワーク検索、コンテキスト キャッシュなどの機能をサポートしており、より複雑なエージェント ワークフローで直接使用できます。
アプリケーションの方向性の観点から、Qwen チームは今回「インテリジェント デリバリー」に焦点を当てます。たとえば、モデルは長いビデオを分析し、主要なコンテンツを特定し、さらにツールを呼び出してビデオ編集、コンテンツの編成、会議の概要、字幕の生成などのタスクを完了できます。 Qwen はまた、マルチモーダル エージェント開発用の Qwen-MM-Plugins も発表し、開発者がオーディオおよびビデオ入力に基づいたインテリジェント エージェント アプリケーションをさらに構築できるように、Qwen-Live-Harness を発売する予定です。
前世代の Qwen3.5-Omni と比較して、このアップグレードの焦点は、従来の意味での認識精度を向上させるだけでなく、オーディオおよびビデオ AI の使用方法を変えることにもあります。以前は、マルチモーダル アプリケーションでは通常、ビデオ フレームを抽出して音声を転写し、その後、さまざまな結果を処理のために言語モデルに渡す必要がありました。 Qwen3.8-Omni-Flash は、これらのリンクを可能な限りネイティブのフルモーダル モデルに統合しようとし、100 万のトークン コンテキストを使用して長いオリジナル コンテンツを直接処理します。
Qwen3.8-Omni-Flash は現在、Alibaba Cloud Bailian を通じてサービスを提供しており、北京、シンガポール、香港、中国、東京、日本の東京、ドイツのフランクフルト、米国バージニアなどの地域をサポートしています。一部の Qwen の以前のモデルのように、モデル自体はウェイトを直接開きません。アリババは今回、主にサポートするマルチモーダルプラグインと関連開発ツールをオープンする。
全体として、この Qwen3.8-Omni-Flash アップデートの中核は、モデルの実行スコアを向上させるだけではなく、同時に低音ビデオ処理コストを削減し、コンテキスト スケールを拡大し、オーディオとビデオの理解とツールの呼び出しを組み合わせることにあります。特に、音声入力コストは 98% 以上削減されました。実際の利用コストが正式な計算レベルに達すれば、長時間にわたる会議の録画やポッドキャスト、生放送、ビデオ素材などの大規模な自動分析が容易になり、QwenとGoogle Geminiなどのマルチモーダルモデルとの競争がさらに激化するだろう。
コメント