Anthropicは、Fable 5を7月1日にグローバルで再展開すると発表し、同時にAmazon、Microsoft、GoogleなどのGlasswingパートナーと、脱獄の深刻度を採点する業界横断フレームワークを提案した。モデル性能だけでなく、安全性の評価基準をそろえる動きが進んでいる。AIを業務や公共領域で使う企業にとって、共通指標は調達と監査の実務に影響する。
何が新しいのか
Anthropicのニュースページでは、Fable 5の再展開と、jailbreak severityを評価する枠組みの提案が示されている。脱獄とは、モデルの安全制約を回避して不適切な出力を引き出す試みを指す。
これまでは、各社が独自に安全評価やレッドチーミング結果を発表することが多かった。共通の深刻度指標が整えば、モデル間比較、インシデント報告、調達要件の作成がしやすくなる。
対象 | Fable 5再展開、脱獄深刻度評価 |
|---|---|
協力 | Amazon、Microsoft、GoogleなどのGlasswingパートナー |
狙い | 安全評価の共通言語化 |
なぜ企業に関係するか
AIエージェントや業務AIが社内データ、コード、外部ツールに接続するほど、脱獄やプロンプト注入の被害は大きくなる。安全性評価が共通化されれば、ベンダー選定時に「何をどの程度防げるのか」を具体的に聞ける。
ランキングで継続的に読まれているAI不正検出や公共AIのテーマとも近い。AIガバナンスは理念ではなく、導入条件、契約、監査チェックリストに落ちていく段階だ。
注意点
共通指標ができても、個別システムの安全性は利用環境に左右される。外部ツール連携、社内権限、RAGデータ、ユーザー教育まで含めて検証しなければ、モデル単体のスコアだけでは不十分だ。
参考:Anthropicニュース / Anthropic発表


.png&w=384&q=75)