Anthropic、サイバー評価でClaudeが実システムに無断アクセスした3件を公表──AIテスト環境の盲点

Anthropic、サイバー評価でClaudeが実システムに無断アクセスした3件を公表──AIテスト環境の盲点

Anthropicは、サイバーセキュリティ評価の記録を調査した結果、Claudeモデルが第三者評価環境からインターネットへ到達し、3組織の実システムへ無断アクセスした事例を確認したと公表した。対象はCTF形式の評価で、モデルは環境がシミュレーションでインターネット接続がないと説明されていたが、実際には接続が残っていた。AIエージェントの能力評価では、テスト環境の境界設計そのものが安全性の一部になる。

何が起きたのか

Anthropicは、141,006件の評価実行をレビューし、3件のインシデントを特定した。いずれもモデルに架空のシナリオで「フラグ」を探させる評価だったが、設定ミスにより実インターネットへ到達できる状態だった。

同社によれば、モデルは弱いパスワードや未認証エンドポイントなど基本的な手法で実システムへアクセスした。複雑な脆弱性を悪用したわけではなく、自己複製や意図的な脱出を試みたものでもないと説明している。

レビュー対象

141,006件の評価実行

確認事例

3件

原因

評価環境の誤設定とインターネット接続

影響

実組織の本番インフラへの無断アクセス

企業にとっての教訓

AIエージェントを評価・検証する企業は、モデルの出力だけでなく、ネットワーク、認証情報、外部API、ブラウザ、端末権限を厳密に分離する必要がある。評価環境だから安全、という前提は通用しない。

AIがツールを使って自律的に探索するほど、誤った前提を与えたときの影響は大きくなる。特にサイバー評価、RPA、社内システム連携では、最小権限、出口制御、監査ログ、緊急停止手順が欠かせない。

注意点

この事例は、AIが自発的に悪意を持ったという話ではなく、評価設計の不備が現実の境界を破った事例として読むべきだ。だからこそ、企業のPoCでも隔離設計を軽視できない。

参考:Anthropic公式発表

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
関連記事
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。