要約:
Fable 5.1 と Mythos 5.1 がリリースされました。 8 つの公開ベンチマーク テストすべてで 1 位にランクされ、価格は最大 45% 下落しました。特に科学研究とコーディングの分野では、Fable 5 とその隣の GPT-5.6 Sol を明らかに置き去りにしています。より直観的な観点から見ると、現在 Fable 5.1 を中程度および低い推論レベルで実行している場合、パフォーマンスは基本的に非常に高い、または最も高い推論レベルの古いバージョンの Mythos 5 と同等です。この波の中で、「ファブル」は「ミュトス」を殺した。


価格の点では、Fable 5.1 ではキャッシュ読み取り価格が 100 万トークンあたり 0.25 米ドルに引き下げられ、75% 削減されました。
入力価格と出力価格は例 5 と一致しており、100 万トークンあたりそれぞれ 10 ドルと 50 ドルです。
値下げされたのは 1 つだけであるように見えますが、エージェント タスクではキャッシュの読み取りがコストの大部分を占めているため、実際の影響は比較的大きいです。
Anthropic が提供したデータによると、一般的なワークロードのコストは Fable 5 のコストよりも約 25% 低いです。高度にインテリジェントなタスクの場合、最大 45% を節約できます。

公式リリースビデオには次のようなメッセージがあります:
以前にクロードに処理を依頼したタスクが何であれ、Fable 5.1 はより多くのことを実行でき、最も困難な部分をより適切に実行できます。

これは、複数ステップのタスクの処理に優れているためです。
この種のタスクでは、2 番目のステップで小さなエラーが発生すると、40 番目のステップで全体が崩れてしまいますが、Fable 5.1 ではプロセス全体を通じて安定した出力を提供できます。
解決できない問題が発生した場合、どの解決策を試したのか、どこで行き詰まったのかが表示されます。
研究者の Flix Rieseberg 氏はまた、文章の面で、Fable 5.1 では太字フォントの使用が減り、タイトル、リスト、引用符の使用が減り、スタイルの手がかりに従いやすくなったと具体的に述べています。
私が言いたいのは、ところでスタイルのヒントをオープンソースにしてもらえませんか?ということです。

形式どおり、Fable 5.1 はすべてのユーザーに公開されていますが、Mythos 5.1 は、Trusted Access Program を通じて、精査されたサイバーセキュリティおよびライフ サイエンス組織のみが利用できます。
実践的な科学研究: タンパク質の設計、金星マップの生成、GPU アクセラレーション
Anthropic は、ランニング スコアに加えて、科学研究の分野における Fable 5.1 と Mythos 5.1 の実践的な結果も実証しました。
タンパク質設計の点では、Anthropic は Mythos 5.1 を使用してオープンソースのタンパク質設計とフォールディング ツールを使用して高親和性結合タンパク質を設計し、実験検証のために 2 つの外部機関に計画を送信しました。
3 つのターゲットにわたって、Mythos 5.1 設計の結合親和性は、Adaptyv Bio タンパク質設計コンペティションでの最良のソリューションよりも 10 倍高かった。 12 のターゲットすべてで、現在のタンパク質設計分野における一般的なヒット率が 10 ~ 15 パーセントであるのに対し、ヒット率は 50 パーセント近くでした。
高親和性結合タンパク質は、多くの一般的な医薬品開発プロセスの最初のステップであり、医薬品が低用量で効果を発揮できるかどうかを直接決定します。

天文学では、フェイブル 5.1 は、30 年以上前に NASA のマゼラン宇宙船によって撮影されたレーダー画像に基づいてニューラル ネットワークをトレーニングし、金星の表面の 3 分の 1 の新しい高解像度地形図を生成しました。
以前に入手可能な地形図は金星の 5 分の 1 しかカバーしておらず、解像度は 10 ~ 20 キロメートルでした。 Fable 5.1 では解像度が 2 ~ 3 キロメートルに向上し、高さの精度は以前より 25% 向上しています。この地図は CC ライセンスの下でオープンソースとして公開されており、今後の NASA VERITAS および ESA EnVision ミッションの参考として使用され、将来の観測のための重要な地質学的特徴を特定するのに役立ちます。

計算生物学の観点から見ると、Mythos 5.1 は、カスタム GPU カーネルを作成し、中間結果をキャッシュすることにより、7 つのオープンソース ディープ ラーニング モデルの実行速度を最大 2.5 倍向上させ、出力は完全に一貫しています。

実際の研究では、生物学者はこれらのモデルを何千回も実行し、ヒトの各遺伝子付近で考えられるすべての変異をテストする必要があるかもしれません。最適化されたモデルでは、GPU コストを 30% ~ 60% 削減できます。

この種の最適化は通常、パフォーマンス エンジニアリング チームが完了するまでに数週間かかりますが、多くの学術研究室にはそれを行う余裕がありません。ただし、Mythos 5.1 はオープン ソース コードのみに依存し、わずか数日でそれを実現しました。
Anthropic は、近い将来、これらの最適化をオープンソース化する予定です。
蒸留防止メカニズムはオンラインです
Fable 5.1 のリリースに伴い、いくつかの特別な規制と API の変更があります。
まず安全性について簡単に説明しましょう。
Fable 5.1 のネットワーク セキュリティ誤検知率は、Fable 5 よりも 60% 低くなります。現在、ソフトウェアの脆弱性を発見するために使用することが許可されていますが、エクスプロイトの開発は依然として禁止されています。侵入テスト、エクスプロイト生成、バイナリベースの脆弱性スキャンなどの二重目的タスクは、引き続き Opus シリーズ モデルにリダイレクトされます。
基礎的な生物学と医学に関する質問の誤検知率は 85% 減少しましたが、ライフ サイエンスの研究開発に関連するクエリは依然として Opus モデル処理にルーティングされており、専門家は Mythos 5.1 のライフ サイエンス検証プログラム (LSVP) を通じてアクセスを取得する必要があります。
次に、新しく追加された蒸留防止機構について説明します。
本日より、新しく登録された API アカウントは、思考連鎖記録を保持しながら、複数ラウンドの会話でクロード コンテキストを手動で編集できなくなります。
以前に公に記録された一般的な手法があります。それは、複数回の会話でクロードの以前のコンテキストを手動で改ざんしながら、思考連鎖の記録を意図的に保持するというものです。これにより、モデルは、別の命令セットの下で生成した推論を、新しい、場合によっては敵対的な命令セットの下で再生することができます。
この道路は現在通行止めとなっています。

このアプローチは、各思考チェーン ブロックに署名を追加することです。
ユーザーが後続のリクエストでアシスタントの応答を API に送信すると、システムはこの署名を使用して 2 つのことを行います。1 つは現在のモデルにこのブロックを読み取る権利があるかどうかを確認すること、もう 1 つはこのブロックの前の会話全体 (システム プロンプト ワード、ツール リスト、およびすべての履歴メッセージを含む) が最初に生成されたときとまったく同じであるかどうかを確認することです。
会話内の何かが触れられると、署名の検証は失敗します。
失敗後の処理は、開発者が設定したパラメータ prefix_mismatch_behavior によって異なります。デフォルト値は「error」で、ステータス コード 400 が直接返され、リクエストは拒否されます。 「drop_block」に設定されている場合、システムはブロックとその後のすべての思考チェーンを黙って削除し、リクエスト自体は通常どおり実行されます。
破棄された部分はカウントされず (人々はちょっと変わっています)、応答の input_transformations 配列にリストされます。

どのような操作が検証失敗の原因になりますか?
ドキュメントには、以前のユーザー/アシスタント/システム メッセージの編集、並べ替え、または削除、最上位のシステム プロンプト ワードの変更、ツール リストへの追加、削除、名前変更、会話履歴からの思考チェーン ブロックの削除と後続のブロックの保持、リクエスト間で異なるコンテンツを返した画像またはドキュメントの URL の参照などの詳細なリストが記載されています。
上記のいずれかを行うと、後続のすべての思考チェーン ブロックが無効になります。

逆に、一部の操作は安全です。
会話の最後に新しいメッセージを追加したり、履歴の先頭から思考チェーン ブロックを削除したり、max_tokens などのリクエスト パラメーターを変更したり、cache_control タグを増減したり、サーバー側の圧縮やコンテキストを編集したりしても、検証エラーは発生しません。
チェーン検証設計もあります。各思考チェーン ブロックは、前のブロックの情報を記録し、クロスラウンド チェーンを形成します。ブロックはチェーンの先頭から削除できますが、途中から削除すると、それ以降のすべてのブロックが無効になり、チェーン全体が切断点から無効になります。
開発者が行き詰ることを防ぐために、Anthropic は、履歴に触れることなく同じ効果を達成できる一連の代替手段も提供します。
途中で指示を変更する必要がありますか?最上位のプロンプト単語を直接変更するのではなく、会話の途中でシステム メッセージを使用します。
ラウンドごとに一時的なリマインダーを追加する必要がありますか? 「最初に挿入してから削除」という古い方法を置き換えるには、clear_at パラメーターを指定したラウンド レベルのシステム メッセージを使用します。
途中でツールを追加または削除する必要がありますか?ツール リストを直接編集する代わりに、tool_addition ブロックとtool_removal ブロックを使用します。
コンテキストをクリップする必要がありますか?クライアント側の大まかな切り詰めをサーバー側の圧縮とコンテキスト編集に置き換えます。
Claude Code、claude.ai、Claude Managed Agents、Claude Agent SDK などの公式製品を使用している場合は、何も変更する必要はありません。会話プレフィックスが改ざんされないことが自動的に保証されます。
しかし、メッセージ API を直接呼び出す開発者の場合、Anthropic の提案は、メッセージ配列を厳密に追加専用として使用し、prefix_mismatch_behavior を「drop_block」モードに設定して完全なマルチラウンド セッション テストを実行して、ログに prefix_binding_mismatch エントリがあるかどうかを確認することです。
最後のドキュメントでは、トラブルに巻き込まれやすいシナリオについても具体的に言及しています。
ツールまたはフレームワークを管理しており、ユーザーが独自の API キーを使用してそれを呼び出す場合、新規登録ユーザーは早期にこの検証に遭遇します。開発者自身のキーは 8 月 31 日より前に登録されている可能性が高いため、まだ適用されていません。
この場合、prefix_mismatch_behavior を積極的に設定し、事前にテストすることをお勧めします。ユーザーがクラッシュするまで待ってはいけません。
もう 1 つ
A 社がこれほど大騒ぎすると、隣の OpenAI も黙ってはいられないでしょう。
しかし、彼らの新しいモデル Astra は実際にはまだ準備ができていないため、最初に象徴的なプレビューを提供する必要があります。

Fable 5.1 と OpenAI Astra のリリースの際、Ilya はめったに外に出て声を上げず、ネットワーク セキュリティの強化を求めました。

コメント