Anthropic「Claude Opus 5」提供開始──業務を最後までやり切るAIエージェント性能を強化

Anthropic「Claude Opus 5」提供開始──業務を最後までやり切るAIエージェント性能を強化

Anthropicは、Claude Opus 5を提供開始した。Opus 4.8と同等コストで性能を高め、コーディング、業務自動化、知識作業、科学研究で長時間タスクへの強さを打ち出している。

評価は「賢さ」から「やり切る力」へ

Anthropicは、Frontier-Bench、GDPval-AA、Zapier AutomationBench、OSWorld 2.0などでOpus 5の性能を説明している。特に、アカウント健全性のワークブックから解約防止の一連の業務を実行するような、複数ステップのタスク完遂を強調した点が重要だ。

モデルの努力量設定で、知能重視とトークン節約を切り替えられることも示された。企業利用では、最高性能を常に使うのではなく、タスクの重要度に応じてコストと品質を調整する運用が現実的になる。

提供

Claude Maxの既定、Claude Proの最上位モデル

強み

コーディング、業務自動化、知識作業、科学研究

比較

Opus 4.8と同等コストで性能改善

開発現場への影響

バグ原因の特定、テストハーネス作成、仕様の読み替え、長い調査作業など、途中で失速しやすい仕事をAIに任せやすくなる。AIエージェント導入では、単発回答の正確さだけでなく、失敗時に検証し直す力が評価軸になる。

注意点

高性能モデルでも、権限を持つ業務実行にはレビュー、ログ、ロールバックが必要だ。ベンチマークの数値は自社業務での再現性を保証しないため、業務別の評価セットと人間の承認点を先に設計したい。

参考:Anthropic公式発表

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
関連記事
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。