要約:
マスク氏の人工知能会社である xAI は、新世代の大規模モデルである Grok 4.7 を正式にリリースし、これを現在最も強力なプログラミングおよびナレッジ ワーク モデルとして位置づけています。同社では、新モデルは複雑なタスクの処理能力を向上させるだけでなく、前世代製品と同等の動作速度や価格体系を維持し、より低コストで市場で競争できるとしている。

xAI によってリリースされた情報によると、Grok 4.7 は新しい大規模な基本モデルを採用し、トレーニング プロセス中により長い強化学習の最適化を実行します。以前のバージョンと比較して、新しいモデルはより複雑なトレーニング タスクにさらされており、多数のタスクが完了するまでに数時間かかるように設計されています。これにより、モデルは長期的な推論、自己検証、複雑なタスク管理において大幅な機能強化を実現できます。
xAI は、Grok 4.7 の最大の変更点の 1 つは、より強力な「セルフテスト機能」であると述べました。モデルは、質問に答えたり、コードを書いたり、複雑な知識タスクを実行したりするときに、自身の出力をより積極的にチェックできるため、エラー率が減少し、最終結果の信頼性が向上します。
同時に、非常に長いコンテキストを処理する新しいモデルの能力も向上しました。大きなドキュメント、複数ラウンドのタスク、長期にわたるプロジェクト作業に直面した場合でも、Grok 4.7 は、従来のモデルのようにコンテキストが増大しても明らかなパフォーマンスの低下を招くことなく、より安定した情報管理機能を維持できます。
実際の作業エクスペリエンスをさらに向上させるために、xAI は Grok Bot の動作フレームワークをネイティブに理解できるように Grok 4.7 を特別にトレーニングします。これは、1 回限りの質問と回答のシナリオに適しているだけでなく、長時間実行されるインテリジェント エージェントとしてワークフローに参加するのにも適していることを意味します。同社は、これにより一般知識の作業、継続的な会話、およびエンタープライズレベルのタスクにおけるモデルのパフォーマンスが向上すると考えています。
Grok 4.7 には、プログラミング機能に加えて、より強力なドキュメントおよびプレゼンテーション作成機能も備わっています。関係者らは、このモデルは専門的なレポート、ビジネス文書、プレゼンテーション資料をより適切に生成できるようになり、オフィスオートメーションの分野での適用範囲をさらに拡大することを期待していると述べた。
パフォーマンスに関して、xAI は一連の内部テスト結果を発表しました。
長期的なソフトウェア エンジニアリング能力を評価するために使用される CursorBench 4.0 テストでは、Grok 4.7 は 46.3% のスコアを達成しました。これは、Grok 4.6 の 40.4% と比較して大幅に向上しました。 DeepSWE ソフトウェア エンジニアリング テストでは、新モデルは 71% のスコアを達成し、業界の主要製品に近い競争力を維持し続けました。
電子工学分野の EEBench テストでは、Grok 4.7 は 64% のスコアを達成し、前世代と比較して 10 パーセント以上増加しました。大量の専門知識と複雑なワークフローを伴うオフィス タスクの場合、AA ブリーフケース テストにおけるモデルのパフォーマンスも向上しました。
法的分析の観点からは、Grok 4.7 は Harvey Legal Agent Benchmark テストで 19.6% のスコアを獲得しました。これは、前世代の製品と比較してさらに改善されました。医療推論の分野でも、HealthBench Professional のスコアが 48.5% から 56.7% に向上しました。
一般知識業務の分野では、xAI は GDPval と AA Briefcase の 2 つの評価結果を特に重視しました。同社は、これらのテストは弁護士、看護師、金融アナリストなどの専門家の実際の業務内容に近いものであると考えており、Grok 4.7はこれらのシナリオにおいて現行の最先端モデルと同等の競争力のあるレベルに達しているとしている。



価格は、このリリースのもう 1 つの重要なセールス ポイントです。

公式データによると、Grok 4.7 の入力価格は 100 万トークンあたり 2 米ドルのままで、出力価格は 100 万トークンあたり 6 米ドルであり、Grok 4.6 と一致しています。 xAI は、多くの場合数倍、さらには 10 倍のコストがかかる一部の最先端モデルと比較して、Grok 4.7 は同等レベルのタスクを低コストで完了できることを強調しています。
同社は、これを「同レベルのモデルの約半額で競争力のあるパフォーマンスを提供する」ソリューションとさえ説明しており、コスト優位性でさらなる市場シェアの拡大を期待しています。
セキュリティの面では、Grok 4.7 は新たに再構築されたセキュリティ保護システムを採用していると xAI は述べています。社内テストの結果によると、新モデルは、危険なリクエストの拒否、ジェイルブレイク攻撃への抵抗、高リスクコンテンツの特定の点で、Grok シリーズの最高レベルに達しています。
特にサイバーセキュリティやバイオセキュリティなどの機密分野では、危険または悪意のある使用を拒否しながら、正当な防御タスクに対処できるようにモデルが設計されています。公式データによると、Grok 4.7 は一部のネットワーク セキュリティ リスク テストとバイオセキュリティ評価で優れたパフォーマンスを達成しました。
現在、Grok 4.7 は API および Grok プラットフォームを通じてユーザーに公開されています。開発者は、プログラミング、知識 Q&A、ドキュメント作成、およびインテリジェント エージェント アプリケーション開発のためにこのモデルを呼び出すことができます。
Grok 4.7 の正式リリースにより、xAI は製品のイテレーションのペースをさらに加速しました。今年 7 月の Grok 4.5 のリリースから、8 月の Grok 4.6 のリリース、そして今回の Grok 4.7 のリリースまで、xAI は 3 か月足らずで 3 つのメジャー アップグレードを完了しました。競争の激しい人工知能市場にとって、Grok 4.7 は定期的なアップデートであるだけでなく、より高速なイテレーション、低価格、より強力な作業機能を通じて業界リーダーに挑戦するという xAI の戦略的意図を示しています。
コメント