要約:
OpenAI と Anthropic が新世代の最先端モデルを発表し続ける中、Google は新しい主力人工知能モデル Gemini 4 Argon を正式にリリースし、より強力な長距離推論機能とより競争力のある価格でハイエンド モデル市場競争に再参入することを望んでいます。

Google は、Gemini 4 Argon を、ソフトウェア開発、エンタープライズ ナレッジ ワーク、ネットワーク セキュリティ防御などの分野に重点を置き、複雑で長期的なタスクに対応する最先端のモデルとして位置付けています。ただし、モデルはまだ完全には公開されていません。代わりに、追加のセキュリティ評価作業が継続される間、Google Fairwind プログラムに参加している一部のネットワーク セキュリティ防御組織に優先的にテストが与えられます。
以前の Gemini シリーズと比較して、Argon の最も重要なアップグレードの 1 つは、出力能力の大幅な向上です。 Google は、単一トランザクションの最大出力長を、以前の 64,000 トークンから 100 万トークンに増加しました。これは、モデルがタスクを頻繁に中断したり再開したりすることなく、より長い推論プロセスを 1 回のタスクで完了し、複雑なソフトウェア エンジニアリング プロジェクト、研究タスク、および大規模なワークフロー処理を実行できることを意味します。
パフォーマンスの点では、Google が公開した複数のベンチマーク テスト結果は、Gemini 4 Argon が複数の主要な領域で OpenAI の GPT-6 Astra や Anthropic の Claude Opus 5.5 を上回っていることを示しています。その中で、Argon は長期的なソフトウェア エンジニアリング能力を測定する DeepSWE v1.1 テストで 77.9% のスコアを達成しました。 Zapier AutomationBench 自動タスク ベンチマークのスコアは 51.3%。長時間ビデオ理解能力テストLVBenchでは91.7%のスコアを獲得しました。

Google はまた、Argon は金融、法律、税務、ソフトウェア開発などの実際の経済活動の能力を評価する Vals Index テストでも 1 位にランクされたと述べました。公式データによると、このモデルは多くの重要な AI ベンチマークで GPT-6 Astra および Claude Opus 5.5 を上回りました。
Google は、外部のテスト結果に加えて、Argon が社内で実際に使用されていることを明らかにしました。何千人もの従業員がこのモデルを使用して、プログラミング、調査、文書化などのタスクを完了しています。 Google が挙げた適用例には、量子アルゴリズムの最適化、データセンターのメモリ リソースの最適化、大規模な C および C++ コード ベースの Rust 言語への移行などのエンジニアリング プロジェクトが含まれます。
サイバーセキュリティは、Argon の重点強化分野の 1 つです。 Googleによると、このモデルはソフトウェアの脆弱性を自律的に特定、検証、修正できるという。 Google の Wiz セキュリティ チームは、「Scan for Good」プログラムを通じてセキュリティ調査タスクを実行するために Argon を使用しました。脆弱性修復機能を評価するために使用される CWE ベンチ v1 テストで、Argon は 68% のスコアを達成し、業界最高タイとなりました。
市場競争力を強化するために、Google は今回、より大幅に積極的な価格戦略を採用しました。 Gemini 4 Argon の初期価格は、入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 10 ドルです。 Google では、入力コンテンツのキャッシュを 95% 割引で提供しています。比較すると、価格は一部のハイエンドの競合モデルが現在請求している価格よりも大幅に低くなります。
パフォーマンスと価格は強力な競争力を示していますが、Google は今回、導入ペースを慎重に進めることを選択しました。同社は、ジェミニ4アルゴンはさらなる安全性試験と検証が完了するまで、限定された範囲でサービスを提供し続けると述べたが、その後のより広範囲な公開のスケジュールはまだ発表されていない。
コメント