要約:
Opus 5.5 がリリースされると、ネチズンは急いでそれを試してみました。ワンスワイプでWebページ、アニメーション、ゲームなどさまざまな作品が表示されます。これらはベンチマーク値よりも直感的で、実際に試してみることができるものもあります。 MiaAI Lab というクリエイターが、Opus 5.5 に直接、見栄えが良いこと、繰り返しのデザインがないこと、創造性を最大限に活用することの 3 つの要件を備えた「HTML ファイルを 100 個作成してください」と依頼しました。完成品は素晴らしいです。

https://x.com/MiaAI_lab/status/2102490829306634560
言うまでもなく、すべてのクリックは適切に見えます。同じモデルは、さまざまなインタラクション形式と視覚スタイルの非常に多様な処理を備えています。

ビデオリンク: https://mp.weixin.qq.com/s/dVLbNHkM32K5g1cJWJs1hw
この場合、Opus 5.5 はオープンな要件から始まり、どの作品を作成するかを決定し、ページ構造、CSS、およびインタラクティブ コードを作成しました。 Opus 5.5 は、創造的な構想からタスクの分解、完成品の生産に至るまで、強力な自主性を示しています。
モデルにオープンな全体目標を与え、モデルに独自のステップを計画させ、タスクを完全に引き渡します。
これはまさに、今回 Anthropic が強く推奨しているものです。
本当に一度ですべてを完了できますか?
Anthropic は、Opus 5.5 ユーザー ガイドの冒頭でアドバイスを提供しています。タスク全体を一度に説明し、何が「完了」と見なされるのかを明確にし、立ち止まってユーザーに尋ねる必要がある状況に遭遇した場合には、モデルを自動的に動作させてください。

ガイドリンク: https://claude.dev/blog/getting-the-most-out-of-opus-5-5/
ガイドに示されている例は、支払いインターフェースの移行です。
タスクの説明に加えて、最も重要なことは、完了基準を示すことです。つまり、すべてのインターフェイスで新しいクライアントが使用され、古いクライアントが削除され、テストに合格します。説明できないテストの失敗が発生した場合にのみ、モデルは停止して自問する必要があります。このような要件により、モデルは独自に前進し、最終的な納品に向けて検証可能な基準を残すことができます。
実際、この提案は Opus5 がリリースされたときに言及されました。今回、Anthropic は、Opus 5.5 が長期にわたる複数ステップのタスクにおいて継続的に進歩する能力をより高めていることを特に強調しました。
公式リリース資料には、初期のテスターが約 200,000 行のコードのレビューと修正を依頼し、3 時間未満で完了したと記載されています。 Opus 5 では、同じ作業に 20 時間以上かかりました。別の内部テストでは、モデルで HAProxy を C から Rust に書き直す必要がありました。 Opus 5.5 には 9.5 時間かかり、書き換えの結果は元のプロジェクトのほぼすべての回帰テストに合格しました。
しかし、作業には長い時間がかかりましたが、それはユーザーが達成を最も望んでいることではないかもしれません。
実際のテストでは、テクノロジー メディア Every は、Opus 5.5 に、顧客トレーニングの分単位のスケジュールを作成するのに 10 分間を与えました。要件を読んだ後、5 分近く考えて、トレーニング データを作成し、テーブルをチェックし、学生向けの資料を編集しました。しかし、いざその時になっても、最も必要なスケジュールは渡されなかった。
実際のテスト レポート: https://every.to/vibe-check/vibe-check-opus-5-5-is-pulling-our-codex-converts-back-to-claude/
Every による別のアプリ開発テストもまた、それを物語っています。タスクページは見た目は美しく、自動チェックでもパスしていることが示されますが、テスターが実際に操作すると、依然としてコアページでエラーが報告されます。
それを一気に考えるのはまだ現実的ではないようです。
ダッシュを終了し、音楽とアニメーションを再生します
テキスト表現の点で、Opus 5.5 は大きな進歩を遂げ、以前の典型的な「クロードアクセント」を変更しました。
一部のネチズンは、Opus 5.5 をテストした後の最大の感想は、文体がついに「修正された」ということだとコメントしました。

https://x.com/theojaffee/status/2102454423041818786
「より直接的で、より普通で、AI らしさ (緩慢さ) が少なくなりました。クロードがこれほどきれいに自然に書いているのを最後に見たのは、約 8 か月前の Opus 4.6 でした。」

左側の図は Opus 5 の出力です。これはやや冗長であり、明らかな AI 記述の痕跡があります。右側の図は、Opus 5.5 による同じコンテンツの出力であり、より簡潔で自然です。
クロードの公式アカウントがリリースした Opus 5.5 の更新手順によると、新しいバージョンではより自然にコミュニケーションが図られ、重要な情報が最初に配置され、ユーザーが指定した記述ルールに準拠するようになりました。
一部のネチズンは、Opus 5.5 でダッシュが削除されていることを発見しました。上記の公式比較表では、左側の Opus 5 の出力では多くの場所でダッシュが使用されていますが、右側の Opus 5.5 では同じ内容がまったくダッシュなしで書かれています。

https://x.com/theo/status/2102474289949868254?s=20
PDF テーブルの解析に関しては、LlamaIndex CEO の Jerry Liu がテストに独自の ParseBench を使用しました。 Opus 5.5 のスコアは 93.9% で、Opus 5 よりも 7 パーセント以上高く、Fable、Gemini、Astra などのモデルを上回りました。ただし、グラフ、形式、レイアウトを理解するにはまだ不十分な点があります。

https://x.com/jerryjliu0/status/2102529024841154977
Claude Opus 5.5 は「コードを書く」だけでなく、コードを使用して芸術的で滑らかなアニメーションを直接作成することもできます。
X ブロガーの Kevin Ngo は、Opus 5.5 で JavaScript を使用して次のアニメーションをフレームごとに描画できるようにしました。

ビデオリンク: https://mp.weixin.qq.com/s/dVLbNHkM32K5g1cJWJs1hw
一部のネットユーザーは、Opus 5.5 を使用して同様のアニメーションを作成しました。

ビデオリンク: https://mp.weixin.qq.com/s/dVLbNHkM32K5g1cJWJs1hw
https://x.com/devteamdrew/status/2102436464323661880
クロードは、純粋な JavaScript を使用して、真に聴きやすい電子音楽を作成できるようになりました。
一部のネチズンは、Opus 5.5 に対して「javascript でベース ミュージックを作成」(JavaScript を使用してベース ミュージックを作成) というプロンプト ワードのみを与えました。その結果、クロードは完全な JS コードを一度に書き、非常に良いサウンドのベース ミュージックを生成しました。

ビデオリンク: https://mp.weixin.qq.com/s/dVLbNHkM32K5g1cJWJs1hw
https://x.com/aj_dev_smith/status/2102504509637587339?s=20
コメント