Anthropicは、Claude Opus 5を発表した。Opus 4.8と同じ価格帯のまま性能を引き上げ、Claude Fable 5に近い知能を半分程度のコストで提供するモデルとして位置づけている。特にソフトウェア開発、知識作業、科学研究での「自分で検証しながら進める力」が強調された。
AIエージェントの価値は、途中で止まらないことにある
Anthropicによると、Opus 5はFrontier-Bench v0.1でOpus 4.8を大きく上回り、CursorBench 3.2ではFable 5のピークに0.5%以内まで近づいた。ARC-AGI 3では次点モデルの3倍のスコアを出したとも説明している。
発表で興味深いのは、単なる正答率だけではなく、根本原因を調べ、テストを作り、修正し、再検証するような長い作業の例が多い点だ。AIがコード片を返すだけなら既存ツールでもできる。実務で差が出るのは、曖昧な依頼を分解し、必要な検証を自分で挟み、完了まで粘れるかだ。
価格 | Opus 4.8と同等の価格と説明 |
|---|---|
強み | 開発、知識作業、科学研究、コンピュータ利用 |
評価例 | Frontier-Bench、CursorBench、ARC-AGI 3、Zapier AutomationBench |
導入先 | Claude Maxのデフォルト、Claude Proの最上位モデル |
開発組織ではレビューの役割が変わる
Opus 5のようなモデルが使えると、エンジニアは実装の下書きだけでなく、バグ調査、テスト追加、リファクタリング、ドキュメント更新まで一連の流れをAIに任せやすくなる。すると人間の役割は、手を動かすことから、仕様判断、リスク評価、最終レビューへ移る。
ただし、AIが自律的に作業できるほど、権限の設計が重要になる。リポジトリ、CI、顧客データ、本番環境へのアクセスは段階的に与え、ログと差分レビューを必須にするべきだ。
注意点
Anthropic自身も、サイバーセキュリティ領域ではMythos 5に及ばないと説明している。得意領域を見極めずに万能視するのは危険だ。社内導入では、代表タスクで費用、成功率、レビュー工数を測る小さな評価セットを作りたい。
参考:Anthropic発表

.png&w=384&q=75)

