OpenAIが発表した「GPT-Red」とは?
2026年7月15日、OpenAIは自動安全レッドチーミングモデル「GPT-Red」を公表しました。この新しいモデルは、AIシステムの安全性を高めるために設計されており、特にプロンプトインジェクションなどの脆弱性を発見する役割を担っています。
GPT-Redの機能と訓練方法
GPT-Redは「攻撃側のAI」として機能し、他のOpenAIモデルに対して攻撃を行うことで、その脆弱性を探ります。このモデルはセルフプレイ強化学習(自己対戦)を用いて訓練されており、攻撃AIと防御AIが競い合うことで、次世代モデルの耐性を高める社内向けシステムです。
このアプローチにより、GPT-Redは悪意ある能力を意図的に訓練されたモデルであり、一般公開される製品ではなく、内部専用の研究モデルとして管理されています。
成果と効果
GPT-Redの導入により、OpenAIの最新モデルであるGPT-5.6 Solにおいて、直接的なプロンプトインジェクションへの失敗率がわずか0.05%まで低下しました。この数値は、AIの安全性を大きく向上させるものであり、ユーザーにとっても安心感をもたらすでしょう。
さらに、未知のシナリオでのテストにおいて、GPT-Redの攻撃成功率は84%に達し、人間の研究者の成功率である13%を大幅に上回りました。この結果は、GPT-Redが非常に効果的な脆弱性発見ツールであることを示しています。
先進的なレッドチーミングの実証
OpenAIは、GPT-Redの前身となる自動レッドチーマーを2026年2月以降のすべての本番モデルの訓練に使用しており、GPT-Redはその成果をさらに進化させたものです。特に、あるモデルが別のモデルに対して敵対者として機能し、測定可能な痕跡を残せることを示した初めての大規模な実証となりました。
まとめ
OpenAIの「GPT-Red」は、AIの安全性を高めるための重要なステップであり、今後のAI技術の発展に寄与することが期待されます。AIの脆弱性を発見し、改善するための新たな手段として、業界全体に影響を与える可能性があります。