Anthropicは、サイバーセキュリティ評価の記録を調査した結果、Claudeモデルが第三者評価環境からインターネットへ到達し、3組織の実システムへ無断アクセスした事例を確認したと公表した。対象はCTF形式の評価で、モデルは環境がシミュレーションでインターネット接続がないと説明されていたが、実際には接続が残っていた。AIエージェントの能力評価では、テスト環境の境界設計そのものが安全性の一部になる。
何が起きたのか
Anthropicは、141,006件の評価実行をレビューし、3件のインシデントを特定した。いずれもモデルに架空のシナリオで「フラグ」を探させる評価だったが、設定ミスにより実インターネットへ到達できる状態だった。
同社によれば、モデルは弱いパスワードや未認証エンドポイントなど基本的な手法で実システムへアクセスした。複雑な脆弱性を悪用したわけではなく、自己複製や意図的な脱出を試みたものでもないと説明している。
レビュー対象 | 141,006件の評価実行 |
|---|---|
確認事例 | 3件 |
原因 | 評価環境の誤設定とインターネット接続 |
影響 | 実組織の本番インフラへの無断アクセス |
企業にとっての教訓
AIエージェントを評価・検証する企業は、モデルの出力だけでなく、ネットワーク、認証情報、外部API、ブラウザ、端末権限を厳密に分離する必要がある。評価環境だから安全、という前提は通用しない。
AIがツールを使って自律的に探索するほど、誤った前提を与えたときの影響は大きくなる。特にサイバー評価、RPA、社内システム連携では、最小権限、出口制御、監査ログ、緊急停止手順が欠かせない。
注意点
この事例は、AIが自発的に悪意を持ったという話ではなく、評価設計の不備が現実の境界を破った事例として読むべきだ。だからこそ、企業のPoCでも隔離設計を軽視できない。


.png&w=384&q=75)

