Anthropicが、最上位モデルの新版「Claude Opus 4.6」を公開しました。コーディング、長時間のエージェント作業、文書・表計算・調査などの知識労働を強化し、Opus系として初めて100万トークンのコンテキストウィンドウをベータ提供します。
企業にとっての焦点は、モデル競争が単純な応答性能から、長い文脈を保持しながら複数ステップの作業をどこまで任せられるかへ移っていることです。
何が新しくなったのか
Anthropicは、Opus 4.6について「より慎重に計画し、長時間のエージェントタスクを継続し、大規模コードベースでより安定して動く」と説明しています。Claude Codeでは複数のエージェントチームを組ませる機能を追加し、APIではコンテキストを要約して長時間作業を続けるcompaction、推論量を調整するadaptive thinkingやeffort制御も導入しました。
項目 | 内容 |
|---|---|
提供先 | claude.ai、Claude API、主要クラウド |
文脈長 | Opus系初の1Mトークン文脈をベータ提供 |
価格 | APIは100万トークンあたり入力5ドル、出力25ドルを維持 |
主な用途 | 大規模コード理解、デバッグ、金融分析、調査、資料作成 |
評価結果は何を示すのか
同社は、Opus 4.6がTerminal-Bench 2.0で最高スコアを達成し、複雑な知識労働を測るGDPval-AAでは次点モデルを約144 Eloポイント上回ったとしています。長文検索のMRCR v2 8-needle 1M評価では76%で、Sonnet 4.5の18.5%を大きく上回ったとも説明しました。
これらの数字は、長い資料や大規模なコードベースの中から必要な情報を見失わず、作業を進め続ける能力が改善していることを示します。日本企業の開発現場では、レガシーシステムの調査、移行計画、レビュー、テスト生成のような「長く面倒な作業」に向きます。
導入時の注意点
高性能モデルほど、推論時間とコストが増える場面があります。Anthropicも、簡単なタスクではeffortを下げる使い方を勧めています。導入側は、全業務を最上位モデルに投げるのではなく、重要度、必要文脈、レビュー責任に応じてモデルと推論量を使い分ける設計が必要です。
また、長時間エージェントに権限を与える場合は、ソースコード、認証情報、社内文書へのアクセス制御とログ監査が不可欠です。モデル性能の向上は、運用ガードレールの重要性も同時に高めています。
参考:Anthropic公式

.png&w=384&q=75)