2025 年 1 月に DeepSeek-R1 が発売されました。この度、R1モデル発売1周年ということでDeepSeekの新モデル「MODEL1」が公開されました。北京時間 1 月 21 日、DeepSeek の公式 GitHub リポジトリは一連の FlashMLA コードを更新しました。 AI の助けを借りて、コード ファイルの総数: 114 (.py、.md、.txt、.sh、.cpp、.cu、.h ファイルを含む) が分析され、合計 31 回言及された未公開のモデル アーキテクチャ識別子「MODEL1」が発見されました。

FlashMLA は、NVIDIA Hopper アーキテクチャ GPU 向けに徹底的に最適化された DeepSeek のオリジナル ソフトウェア ツールで、特に大規模モデルの「推論生成」を高速化するように設計されています。このアルゴリズムの実装は、低コストと高性能を実現する DeepSeek モデル (V2 や V3 など) の重要なテクノロジーの 1 つである MLA (多層アテンション メカニズム) に基づいています。これは、モデル アーキテクチャ レベルでメモリ使用量を削減し、GPU ハードウェアの使用を最大化するために使用されます。
MODEL1 は、DeepSeek FlashMLA でサポートされる 2 つの主要なモデル アーキテクチャのうちの 1 つで、もう 1 つは DeepSeek-V3.2 です。と推測されていますMODEL1 は効率的な推論モデルである可能性があります。 V3.2 と比較してメモリ使用量が少なく、エッジ デバイスやコスト重視のシナリオに適しています。長いシーケンスの専門家になることもできます、16,000 以上のシーケンスに最適化されており、文書の理解やコード分析などの長いコンテキストのタスクに適しています。 16,000 以上のシーケンスに最適化された長いシーケンスのスペシャリストである場合もあります。文書の理解やコード分析などの長いコンテキストのタスクに適しています。
さらに、MODEL1 のハードウェア実装は複数の GPU アーキテクチャにまたがります。 NVIDIA H100/H200 (SM90 アーキテクチャ) には 2 つのバージョンがあります。model1_persistent_h64.cu は 64 ヘッド構成に使用され、model1_persistent_h128.cu は 128 ヘッド構成に使用されます。最新の B200 (SM100 アーキテクチャ) には専用の Head64 カーネル実装があり、SM100 の Head128 実装は MODEL1 のみをサポートし、V3.2 はサポートしません。DeepSeek が NVIDIA の新世代 GPU に適応するために MODEL1 のアーキテクチャを特別に最適化したのではないかと推測する人もいます。。
DeepSeekがリリースしてきた主なモデルは、究極の総合性能を追求した「オールラウンドアシスタント」のVシリーズと、複雑な推論に重点を置いた「問題解決器」のRシリーズの2つの技術ラインを代表するモデルです。
2024 年 12 月に発売された V3 は、DeepSeek にとって重要なマイルストーンです。その効率的な MoE アーキテクチャにより、強力な包括的なパフォーマンス基盤が確立されています。それ以来、DeepSeek は V3 を急速に反復し、推論機能とエージェント機能を強化するために V3.1 をリリースし、2025 年 12 月に最新の正式バージョン V3.2 をリリースしました。同時に、難しい数学や学術問題の解決に焦点を当てた特別バージョン V3.2-Speciale もリリースされました。
2025 年 1 月にリリースされた R1 は、強化学習を使用して数学的問題の解決やコード プログラミングなどの複雑な推論タスクで優れたパフォーマンスを発揮し、「深い思考」モードを開拓しました。
テクノロジーメディアの The Information は、月初めに次のようなニュースを伝えました。DeepSeek は、今年 2 月中旬の旧正月に、より強力なコーディング機能を備えた新世代の主力 AI モデル DeepSeek V4 を発売します。。
以前、DeepSeek研究チームは2つの技術論文を発表し、それぞれ「最適化された残差接続(mHC)」と呼ばれる新しいトレーニング方法と生物学にヒントを得た「AIメモリモジュール(エングラム)」を紹介しました。この動きにより、ユーザーは、DeepSeek が開発中の新しいモデルにこれらの最新の研究結果が統合されるのではないかと推測しています。