GPT-Redとは?OpenAIの自動レッドチームAI|攻撃成功率84%vs人間13%・仕組み・企業セキュリティへの影響を解説【2026年7月最新】

この記事のポイント
OpenAIが2026年7月に発表した自動レッドチームAI「GPT-Red」を、攻撃成功率84%vs人間13%の意味・敵対的セルフプレイの仕組み・GPT-5.6への反映・企業が取るべきセキュリティ対策まで初心者にもわかりやすく解説します。
GPT-Red(ジーピーティー・レッド)とは、OpenAIが2026年7月15日に発表した「自社のAIモデルを自動で攻撃し、脆弱性を発見する社内専用AI」です。 プロンプトインジェクション攻撃で人間のレッドチーム(成功率13%)を大きく上回る84%の成功率を記録し、その成果は次世代モデルGPT-5.6の堅牢性強化に組み込まれました。
この記事でわかること:
- GPT-Redが「何をするAIなのか」と発表の背景
- 「攻撃成功率84% vs 人間13%」という数字が意味すること
- 前提となるレッドチーミング/プロンプトインジェクションの基礎
- GPT-Redの仕組み(敵対的セルフプレイ)と公式が示した性能数値
- GPT-Redは使えるのか(料金・提供形態)
- 自社でAIを運用する企業・担当者が今取るべき対策
この記事は、ニュースで「GPT-Red」を知って概要を正確に押さえたい人と、生成AIを業務導入していてセキュリティ影響を判断したい企業担当者に向けた内容です。 専門用語は都度かみ砕いて説明するため、AIの安全性に詳しくない方でも読み進められます。
⚠️ 本記事の数値・仕様はOpenAIの公式発表と、それを引用した複数の信頼メディアの報道に基づく、2026年7月20日時点の情報です。数値の多くはOpenAIの自己申告であり、現時点では独立した第三者検証・査読は確認されていません。最新かつ正確な内容は必ずOpenAI公式ブログをご確認ください。
GPT-Redとは?OpenAIが開発した「自社AIを攻撃するAI」
GPT-Redは、OpenAIが自社のAIモデルの弱点を"攻撃者の視点"で自動的に探し出すために開発した、社内専用の安全性検証モデルです。 一般ユーザーが使うチャットAIではなく、AIを守るために「あえてAIを壊しにいく」ための道具、と理解すると分かりやすいでしょう。
OpenAIは2026年7月15日(国内外の報道は7月16日)に、公式ブログ「GPT-Red: Unlocking Self-Improvement for Robustness」でこのモデルを発表しました。狙いは、生成AIの実運用で最大の弱点とされるプロンプトインジェクション攻撃への耐性を、人手に頼らず大規模に検証・強化することです。
GPT-Redが発見した攻撃手法は、次世代モデル GPT-5.6(コードネーム "Sol") の訓練に組み込まれ、防御力の向上に使われました。OpenAIによれば、開発には「大規模なポストトレーニング(訓練後の追加学習工程)に匹敵する計算資源」を投入したとされます。
ポイントを整理すると次のとおりです。
- 正体: 自社AIの脆弱性を自動発見する「自動レッドチームAI」
- 発表: 2026年7月15日、OpenAI公式
- 目的: プロンプトインジェクション耐性の検証・強化
- 成果の行き先: 次世代モデル GPT-5.6(Sol)の堅牢性向上
- 提供形態: 一般公開・API提供なし(悪用防止のため社内限定)
なお、GPT-Redが強化に貢献したGPT-5.6そのものについては、GPT-5.6とは?Sol・Terra・Lunaの違い・料金・GPT-5.5との違いを速報解説で詳しく整理しています。
なぜ話題なのか?「攻撃成功率84% vs 人間13%」の衝撃
GPT-Redが注目を集めた最大の理由は、未知のプロンプトインジェクションシナリオで攻撃成功率84%を記録し、人間のレッドチーム(13%)を6倍以上引き離した点です。 これは「AIの攻撃者はもはや人間より優秀になり得る」ことを、開発元のOpenAI自身が数字で示したことを意味します。
OpenAIの発表によると、この84% vs 13%は、訓練データに含まれない(未知の)間接プロンプトインジェクションのシナリオで、標的をGPT-5.1にして比較したものです。
比較項目 | GPT-Red(AI) | 人間のレッドチーム |
|---|---|---|
攻撃成功率(未知の間接インジェクション、標的GPT-5.1) | 約84% | 約13% |
攻撃の生成スピード | 高速・大規模に自動反復 | 人手のため限定的 |
新種攻撃の発見 | 人間より先に「偽Chain-of-Thought攻撃」を発見 | — |
この数字が重要なのは、優劣を競うためではありません。「攻撃側がこれだけ強いなら、同じ強さの攻撃で自社モデルを事前に叩いて直しておこう」という発想が、GPT-Redの本質だからです。攻撃AIを味方につけることで、実際の攻撃者に先回りして脆弱性をつぶす狙いがあります。
ただし、これらの数値はいずれもOpenAIの自己申告であり、現時点では独立した第三者による検証は確認されていません。数字は「攻撃AIの実力の一端を示す参考値」として受け止めるのが妥当です。
前提知識:レッドチーミングとプロンプトインジェクションとは

出典: OWASP Top 10 for Large Language Model Applications(GitHub)
GPT-Redを理解するには、「レッドチーミング」と「プロンプトインジェクション」という2つの言葉を押さえる必要があります。 どちらもAIセキュリティの基礎用語です。
レッドチーミングとは、攻撃者になりきってシステムの弱点を探す検証手法です。もともとは軍事・サイバーセキュリティの用語で、「守る側(ブルーチーム)」に対して「攻める側(レッドチーム)」を意味します。GPT-Redは、この攻める役割をAIで自動化・大規模化したものです。
プロンプトインジェクションとは、メールやWebページ、ツールの出力といった外部データに悪意ある指示を紛れ込ませ、AIを乗っ取る攻撃手法です。AIエージェントがブラウザや接続アプリ、ローカルファイルなど「外の情報」を扱う機会が増えるほど、この攻撃のリスクは高まります。
この記事に登場する重要用語を先に整理しておきます。
用語 | 意味 |
|---|---|
直接プロンプトインジェクション(direct) | モデルへの入力を直接操作し、システムの指示ルール(instruction hierarchy)を破らせる攻撃 |
間接プロンプトインジェクション(indirect) | Webページ・メール・ファイルなど第三者データに指示を仕込み、AIに読ませて乗っ取る攻撃 |
指示階層(instruction hierarchy) | 「開発者の指示 > ユーザーの指示 > 外部データの指示」という優先順位のルール。これを破られると攻撃成立 |
偽Chain-of-Thought攻撃(fake CoT) | AIの推論過程に偽の思考ステップを紛れ込ませ、「自分で検証した」と誤認させて誤動作させる攻撃 |
敵対的セルフプレイ(self-play) | 攻撃AIと防御AIを同時に競わせて互いに強くする訓練手法 |
プロンプトインジェクションは、自律的にタスクを実行するAIエージェントで特に深刻な問題になります。AIエージェントの仕組み自体を押さえたい方はAIエージェントとは?仕組み・種類・活用事例・代表ツールをわかりやすく解説もあわせてご覧ください。
GPT-Redの仕組み|敵対的セルフプレイで自己進化する

GPT-Redの核心は、攻撃側のAIと防御側のAIを同時に訓練して競わせる「敵対的セルフプレイ(self-play reinforcement learning)」にあります。 攻撃と防御がいたちごっこを繰り返すことで、両者が自動的に強くなっていく仕組みです。
具体的には、次のような流れで学習が進みます。
- 攻撃側(GPT-Red) が、標的AIにプロンプトインジェクションを仕掛ける。成功すれば報酬を得る。
- 防御側の複数のLLM が、攻撃に耐えつつ本来のタスクを完了できれば報酬を得る。
- 防御側が強くなると、攻撃側はより巧妙・多様な攻撃を編み出す。
- これを大量に繰り返し、双方が自己進化していく。
攻撃の試行は、ウェブ閲覧・メールアクセス・コード編集などを備えたシミュレーション環境の中で行われます。GPT-Redは標的AIにプロンプトを送り、応答を観察し、攻撃手法を少しずつ変えながら弱点を探し当てます。
特筆すべきは、GPT-Redが人間の研究者より先に「偽Chain-of-Thought攻撃」を独自に発見したとされる点です。これは、AIの推論トレース(思考の連鎖)に偽の推論ステップや「検証済みに見える偽情報」を紛れ込ませ、モデルがそれを「自分で確かめた事実」と誤認して行動してしまう、という新種の攻撃クラスです。人間が思いつかなかった攻撃をAIが見つけ出した、という点で、自動レッドチームの価値を象徴する事例といえます。
GPT-Redが示した性能・数値(比較表)

出典: openai/codex(GitHub)
OpenAIは、GPT-Redの攻撃力と、それによって鍛えられたGPT-5.6の防御力を複数の数値で示しています。 ただし、指標名が媒体によって異なって伝えられている部分もあるため、断定的に読まず「傾向を示す参考値」として捉えるのが安全です。
指標 | 対象 | 数値(OpenAIによる) |
|---|---|---|
未知の間接インジェクション攻撃成功率 | GPT-Red vs 人間(標的GPT-5.1) | 84% vs 13% |
偽Chain-of-Thought攻撃の成功率 | GPT-5.1 | 95%超 |
偽Chain-of-Thought攻撃の成功率 | GPT-5.6(Sol) | 10%未満に低減 |
直接インジェクションの失敗(防御破られ)率 | GPT-5.6(Sol) | 4か月前の最良モデル比で約6分の1 |
間接インジェクション耐性ベンチの正確性 | GPT-5.6(Sol、開発者ツール・ブラウジング含む) | 約97% |
実運用に近いケーススタディでも、GPT-Redの攻撃力が示されました。
- AI自販機エージェント(Vendy): 価格操作や注文キャンセルなど、設定された全目標で攻撃に成功したと報告。
- Codex CLIエージェント: 10回中8回超で、機微データの持ち出し(データの外部流出)に成功したと報告。
さらにOpenAIは、GPT-Redが「GPT-5.5に至るまで、対峙したほぼすべてのモデルを破った」としています。これは、プロンプトインジェクションが特定モデルの欠陥ではなく、現行AIに共通する構造的な設計課題であることを示しています。
一方で、セキュリティ専門メディアのHelp Net Securityは、これらの数値について「独立した検証・査読・外部研究者のコメントが記事内にない」と指摘しています。現時点では第三者検証が未確認である点は、必ず頭の片隅に置いておくべきです。
GPT-5.6(Sol)への反映|私たちが受けられる恩恵
一般ユーザーがGPT-Redから直接得られる恩恵は、GPT-5.6の安全性向上という形で提供されます。 GPT-Red本体は使えませんが、その「攻撃で見つけた弱点を潰す」成果は、ChatGPTやAPI経由で利用できるGPT-5.6に反映されているためです。
OpenAIの説明によれば、GPT-Redが発見した攻撃を訓練に組み込んだ結果、GPT-5.6(Sol)は以下のように改善したとされます。
- 偽Chain-of-Thought攻撃の成功率が、GPT-5.1の95%超から10%未満へ大幅低減
- 直接プロンプトインジェクションで防御が破られる割合が、4か月前の最良モデル比で約6分の1に
- ブラウジングや開発者ツールを含む間接インジェクションのベンチで約97%の正確性
つまり、AIエージェントにメールの読み取りやブラウザ操作を任せるような使い方をしている場合、GPT-5.6世代のモデルはひと世代前より「怪しい外部指示に乗っ取られにくくなっている」と期待できます。とはいえ、OpenAI自身もプロンプトインジェクションを完全には解決していないと明言しており、残存する脆弱性は存在します。過信は禁物です。
GPT-5.6のモデル構成や料金の詳細はGPT-5.6とは?Sol・Terra・Lunaの違い・料金・GPT-5.5との違いを速報解説で確認できます。
GPT-Redは使える?料金・提供形態(社内限定)
GPT-Redは一般ユーザーも企業も直接利用できません。料金プランも存在しません。 OpenAIは、攻撃能力が悪意ある第三者に流出するのを防ぐため、「デプロイするモデルとは分離して社内限定で運用する」方針を明示しています。
項目 | 内容 |
|---|---|
提供形態 | 社内専用。一般公開・API提供なし |
料金・プラン | 該当なし(利用不可のため) |
ユーザーが受けられる価値 | GPT-5.6など、GPT-Redで鍛えられたモデルの安全性向上 |
使い方 | ユーザーが操作する対象ではない |
強力な攻撃AIを一般公開すれば、それ自体が「最強のハッキングツール」になりかねません。社内限定という判断は、この二面性(安全性を高める道具が、そのまま攻撃の道具にもなる)への対応といえます。したがって「GPT-Redの使い方」「GPT-Redの登録方法」といった情報を探しても、公式には存在しない点に注意してください。
企業セキュリティへの影響|自社AIを運用するなら何をすべきか

GPT-Redが企業に突きつける教訓はシンプルです。「AIエージェントは、外部データ経由で乗っ取られ得る」という前提でセキュリティを設計する必要がある、ということです。 GPT-Red自体は導入できませんが、その検証結果は自社AI運用の指針になります。
OpenAI自身も、GPT-Redだけでは安全性を保証できないとし、「人間・第三者によるレッドチーム、多層的なセキュリティ対策、リアルタイム監視と組み合わせる補完的手段」と位置づけています。この考え方は、そのまま企業が取るべき対策のヒントになります。
自社でAIエージェントやチャットボットを運用する場合の、実務的なチェックポイントを整理します。
対策領域 | 具体策 |
|---|---|
権限の最小化 | AIに与えるツール権限・データアクセスを必要最小限にする。決済・削除など不可逆な操作は人の承認を挟む |
入力の隔離 | メール・Web・ファイルなど外部データを「指示」ではなく「参照データ」として扱う設計にする |
多層防御 | 単一のガードレールに依存せず、入力フィルタ・出力チェック・監査ログを重ねる |
リアルタイム監視 | 異常な操作(大量データの外部送信など)を検知・遮断する仕組みを用意する |
人間の関与 | 定期的に人間のレッドチームや外部評価を併用し、AI任せにしない |
モデル選定 | プロンプトインジェクション耐性が改善された新しい世代のモデルを選ぶ |
とくに、AIに社内システムへの書き込み権限や決済権限を与えている企業は、間接プロンプトインジェクションの実害(Vendyの価格操作、Codex CLIのデータ持ち出しのようなシナリオ)を自社に置き換えて点検する価値があります。
社員が無許可でAIツールを使う「シャドーAI」も、外部データ経由の攻撃面を広げる要因です。企業リスクの全体像はシャドーAIとは?73%の企業が未対策・情報漏洩リスクと今すぐできる対策を最新調査で解説、AIを活用したセキュリティ防御側の動向はサイバーセキュリティ業界のAI活用事例|SOC自動化・脅威検知・主要ベンダー比較が参考になります。また、AIがセキュリティ強化に使われる別の事例として、ソフトバンク×OpenAI「Patching as a Service」や、逆にAIチャットボットが悪用されたMetaのAIチャットボット悪用によるInstagram乗っ取りも、攻撃・防御の両面を理解する助けになります。
GPT-Redの限界・注意点
GPT-Redは画期的な取り組みですが、「これで生成AIが安全になった」と結論づけるのは早計です。 発表内容には、冷静に受け止めるべき前提がいくつかあります。
- 数値はOpenAIの自己申告: 84%/13%をはじめ、公表された数値は開発元による報告であり、現時点で独立した第三者検証・査読は確認されていません。
- プロンプトインジェクションは未解決: GPT-5.6でも一定の攻撃は依然成立し得ます。OpenAI自身が残存脆弱性の存在を認めています。
- 単体では安全性を保証しない: OpenAIはGPT-Redを「補完的手段」と明言。人間のレッドチームや多層防御との併用が前提です。
- 指標の呼称に幅がある: 「直接インジェクション失敗率」「指示階層違反率」「インジェクション成功率」など、媒体によって指標名と数値の対応にばらつきがあります。厳密な数字は公式原文での確認が必要です。
- 詳細な技術論文は追跡が必要: 発表週内に技術論文が公開される予定とされており、公開後に手法の詳細が明らかになる可能性があります。
こうした攻撃AIの発展は、他社(Anthropicなど)の敵対的訓練・レッドチーミングの取り組みとあわせて、業界全体の潮流として捉えるのが適切です。GPT-Redは「その最前線の一例」であり、決してゴールではありません。
こんな企業・人におすすめ / 注意すべき人
GPT-Redの動向は、AIエージェントを実務に組み込む企業ほど注視する価値があります。 一方で、個人利用が中心の人にとっては「GPT-5.6が少し安全になった」以上の直接的な影響は限定的です。
GPT-Redの動向を追うべき企業・人
- AIエージェントに外部データ処理(メール・Web・ファイル)を任せている企業
- AIに決済・システム操作など不可逆な権限を与えている組織
- 生成AIの社内導入でセキュリティポリシーを策定する立場の担当者
- AIの安全性・レッドチーミングに関心のあるエンジニア・研究者
過度に気にしなくてよい人
- ChatGPTを文章作成や調べ物に使う一般ユーザー(恩恵はGPT-5.6の安全性向上として自動的に受けられる)
- 外部データと連携しない、クローズドな用途でのみAIを使う人
いずれにせよ、GPT-Redが示したのは「AIエージェントは乗っ取られ得る」という現実です。AIに任せる範囲が広い組織ほど、多層防御と人の監督を組み合わせる設計が欠かせません。
よくある質問(FAQ)
Q. 一般人や企業はGPT-Redを使えますか?
使えません。GPT-Redは悪用防止のため社内限定で運用される専用モデルで、API提供も一般公開もされていません。私たちが受けられるのは、GPT-Redで鍛えられたGPT-5.6などのモデルの安全性向上という間接的な恩恵です。
Q. GPT-5.6はもう完全に安全になったのですか?
いいえ。OpenAIによれば防御力は大きく改善しましたが、プロンプトインジェクションは完全には解決していません。残存する脆弱性はあり、外部データを扱う使い方では引き続き注意が必要です。
Q. 「攻撃成功率84%」は信用できる数字ですか?
OpenAIの発表に基づく数字ですが、現時点で独立した第三者検証は確認されていません。傾向を示す参考値として捉え、断定的に扱わないのが安全です。
Q. GPT-Redは危険なAIではないのですか?
攻撃能力を持つため、悪用されれば危険になり得ます。OpenAIはそのリスクを踏まえ、デプロイ用モデルから分離して社内限定で運用しています。目的はあくまで自社AIの弱点を先回りして直すことです。
Q. 個人がChatGPTを使ううえで何か対策は必要ですか?
特別な設定は不要ですが、AIに外部サイトの内容やメールを読ませて自動操作させる場合は、怪しい指示に従っていないか確認する習慣を持つと安心です。仕組みの理解にはAIエージェントとはが役立ちます。
Q. プロンプトインジェクションはなぜ完全に防げないのですか?
現行AIは「信頼できる指示」と「外部データに紛れた悪意ある指示」を根本的に区別しづらい構造を持つためです。GPT-Redはこの構造的課題を検証・緩和する取り組みですが、根絶には至っていません。
この記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

Gemini 3.5 Proとは?リリース延期の最新状況・性能・料金・Flash/Claude Opus 4.8比較【2026年7月最新】
2026/06/02

AI研修に使える補助金・助成金まとめ【2026年最新】法人が従業員研修で使える制度と申請手順
2026/07/20

店舗数が増えるほど重要になる薬局チェーン本部の運営管理とは|規模拡大の落とし穴と本部機能の作り方
2026/07/20

Apple Intelligenceが中国で承認|22カ月越しのCAC認可・Qwenが言語/Baiduが検索を担当・提供時期とiPhoneユーザーへの影響を解説
2026/07/20

大手薬局で店舗ごとのばらつきが生まれる理由と本部ができること
2026/07/19

薬局チェーンの全店最適とは?多店舗運営で目指すべき状態と実現ステップ
2026/07/19

