OpenAIとAnthropicは、互いの公開モデルに自社の安全性・ミスアラインメント評価を適用した共同評価の結果を公開しました。競合するAIラボ同士が評価手法と結果を示した点で、AI安全性の透明性を高める試みです。
今回の取り組みは、単純なモデル性能ランキングではありません。両社は、命令階層、脱獄耐性、幻覚、悪用耐性など、実運用で問題になりやすい失敗モードを重点的に調べています。
評価の目的は「勝敗」ではなく、盲点の発見
OpenAIは、AnthropicのClaude Opus 4とClaude Sonnet 4に対して内部評価を実施し、GPT-4o、GPT-4.1、OpenAI o3、o4-miniなど当時の自社モデルと並べて結果を説明しました。一方、Anthropic側もOpenAIモデルに対する評価を別途公開しています。
重要なのは、両社が比較の限界も明記していることです。アクセス条件や評価環境が完全に同一ではなく、結果をそのまま「どちらが安全か」という結論にしてはいけないとしています。
評価観点 | 主な狙い | 企業導入での意味 |
|---|---|---|
命令階層 | システム指示を守れるか | 社内ルール逸脱の抑制 |
脱獄耐性 | 悪意ある誘導に耐えるか | 顧客接点でのリスク低減 |
幻覚 | 誤情報を出しにくいか | 業務判断の品質管理 |
悪用耐性 | 危険用途を助長しないか | コンプライアンス対応 |
日本企業への示唆
生成AIを業務基盤として使う企業にとって、モデル選定は速度や価格だけでは不十分です。業務別に失敗したときの影響を整理し、自社の利用シナリオで評価する必要があります。
今回のような相互評価が広がれば、AIベンダーが自社の安全性を一方的に主張するだけでなく、第三者や競合を含む検証結果を参考にできる可能性があります。ただし、評価は時点依存で、モデル更新に伴って結果も変わります。導入後も継続的な再評価が必要です。
参考:OpenAI公式発表 / Anthropic側レポート / OpenAI GPT-5


.png&w=384&q=75)



