Anthropicは、Claude Opus 5を提供開始した。Opus 4.8と同等コストで性能を高め、コーディング、業務自動化、知識作業、科学研究で長時間タスクへの強さを打ち出している。
評価は「賢さ」から「やり切る力」へ
Anthropicは、Frontier-Bench、GDPval-AA、Zapier AutomationBench、OSWorld 2.0などでOpus 5の性能を説明している。特に、アカウント健全性のワークブックから解約防止の一連の業務を実行するような、複数ステップのタスク完遂を強調した点が重要だ。
モデルの努力量設定で、知能重視とトークン節約を切り替えられることも示された。企業利用では、最高性能を常に使うのではなく、タスクの重要度に応じてコストと品質を調整する運用が現実的になる。
提供 | Claude Maxの既定、Claude Proの最上位モデル |
|---|---|
強み | コーディング、業務自動化、知識作業、科学研究 |
比較 | Opus 4.8と同等コストで性能改善 |
開発現場への影響
バグ原因の特定、テストハーネス作成、仕様の読み替え、長い調査作業など、途中で失速しやすい仕事をAIに任せやすくなる。AIエージェント導入では、単発回答の正確さだけでなく、失敗時に検証し直す力が評価軸になる。
注意点
高性能モデルでも、権限を持つ業務実行にはレビュー、ログ、ロールバックが必要だ。ベンチマークの数値は自社業務での再現性を保証しないため、業務別の評価セットと人間の承認点を先に設計したい。

.png&w=384&q=75)

