要約:
DeepSeek は推論、コード、エージェントの機能を継続的に強化した後、ついに V4 に視覚的な入力を追加しました。 8月31日の朝、DeepSeekはハグにいた。 Face は DeepSeek-V4-Flash-Vision-Exp モデルの重みを公開しており、開発者はモデルの重みを直接ダウンロードして自分でデプロイできます。公式ウェアハウスには、モデル ファイルに加えて、ビジュアル エンコーダーやアライナーなどのコンポーネントの参照推論実装も含まれており、DFlash もカバーされています。 アテンション、MoE、ハイパーコネクション、DSpark、その他の部分。

ちょうど 10 日前、DeepSeek は、約 3,050 億パラメータの規模を持つ V4-Flash-Vision-Exp モデルを正式に発表しました。名前の「Exp」から、これが V4 シリーズ初の実験的なマルチモーダル モデルであることが簡単にわかります。 V4-Flash アーキテクチャに基づいて構築されています。ビジュアル モジュールを追加してトレーニングを続けることにより、モデルは画像を処理する能力を獲得します。
プレーン テキスト タスクに関しては、V4-Flash-Vision-Exp と V4-Flash は一般的に同等のレベルにあると関係者は述べました。主な違いは、新しいモデルは、テキストの説明だけに依存するのではなく、写真の内容を認識し、スクリーンショット内のテキストを読み取り、グラフを分析できることに加え、エージェントのワークフローの一部として写真を使用することもできることです。
DeepSeek が実証するケースには、要件に応じた PPT の作成、Web ページの読み取りと変更、動的な効果を備えたフロントエンド ページの生成などが含まれます。

これらのタスクに共通するのは、従来の意味での画像認識ではなく、モデルが最初に視覚的なコンテンツを理解し、次にコード、推論、ツール呼び出しを組み合わせて後続の操作を完了する必要があるということです。 DeepSeek が公開したベンチマーク テストから判断すると、ビジュアル機能を追加した後の V4 は、一部のマルチモーダル エージェント タスクでの比較に選択した Anthropic マルチモーダル大規模モデル Claude Opus 4.8 にすでに近づいています。
具体的には、ApexBench テストでは、V4-Flash-Vision-Exp の Pass@1 スコアは 36.5 で、Opus-4.8 の 39.4 よりも低かったです。チャートグラフィーはそれぞれ64.3と65.0で、その差は小さい。エージェントの最終試験では、DeepSeek は 27.3 を達成し、Opus-4.8 の 25.7 を上回りました。 ZeroBench の Pass@5 スコアは 35.0 で、これも Opus-4.8 の 34.0 よりも高いです。

4 つのマルチモーダル テスト データのうち、2 つが Opus-4.8 を超えました
新たに追加されたビジュアル モジュールによって、V4-Flash の元のテキスト エージェント機能が大幅に犠牲にされるわけではないことは注目に値します。
たとえば、ターミナル ベンチ 2.1 では、Vision バージョンのスコアは 83.9 でしたが、V4-Flash-0731 の以前のスコアは 82.7 でした。 DeepSWE は 54.4 から 59.3 に上昇し、公式にリストされている Opus-4.8 スコアの 58.0 を上回りました。ただし、NL2Repo はわずか 57.7 で、Opus-4.8 の 69.7 よりも大幅に低く、CyberGym は以前の 76.7 から 75.3 に低下しました。したがって、DeepSeek はそのプレーン テキスト機能を V4-Flash と「同等」であると要約しています。
一方で、視覚能力自体には限界があります。これは、高解像度の詳細を無限に読み取ることができる視覚システムではありません。
DeepSeek API ドキュメントによると、このモデルは JPEG、PNG、GIF、および WebP 画像をサポートしており、単一または複数の画像を受信できます。ただし、画像はモデルに入力する前にサイズに応じて拡大縮小されます。大きな画像は最終的に約 800 × 800 に相当する合計ピクセル ボリュームに圧縮され、各画像は最大 384 トークンを占有します。
このアプローチを選択する理由は、視覚入力によって生じる計算コストを制御するためです。ただし、画像のスケーリングは、特に小さなテキスト、ローカル テクスチャ、またはネイティブ解像度に依存するタスクの制限となる場合もあります。
しかし、何はともあれ、DeepSeek が最終的に V4 の目を補いました。
コメント