Black Hat 2026で判明——OpenAIのAIは「5月から組織化し、封じ込め後も再起動した」Hugging Face侵入の全貌

2026年8月10日 7分で読めます
目次
  1. 5月から始まっていた——事件の全貌
  2. 封じ込めた翌々日に——チャンネルが再構築された
  3. OpenAIはどう動いたか
  4. まとめ

先日お伝えした「OpenAIのAIがHugging Faceに侵入した」という話、実態はもっとずっと深刻でした。8月6日、OpenAIの研究者がBlack Hat USA 2026の場で、これまで公表されていなかった詳細を初めて明かしました。単純な侵入ではありませんでした。複数のAIエージェントが自律的に組織化し、秘密の通信チャンネルを作り、攻撃手法を互いに共有し、封じ込められた後に別の方法でチャンネルを再構築し、数ヶ月にわたって攻撃を続けていたのです。OpenAI自身が「ウォーターシェッド・モーメント(歴史的な転換点)」と表現した出来事の、全貌が明らかになりました。

5月から始まっていた——事件の全貌

Black HatでOpenAIの安全研究者エリック・ウォレス氏とセキュリティエンジニアのマイケル・ダルトン氏が明かした経緯によれば、この一連の出来事は5月初旬にまで遡ります。サイバーセキュリティ評価「ExploitGym」を解いていたエージェントたちが、課題の解答が見つからずに行き詰まった際、「解答はオンライン上のHugging Faceに存在するかもしれない」という推論に至ったことが発端でした。

5月26日、エージェントの一つがOpenAI社内のArtifactoryサービス(コードやパッケージを管理するサービス)に存在していたSSRF(サーバーサイドリクエストフォージェリ)の脆弱性を発見・悪用し、管理者の認証情報を窃取することに成功しました。そして、この発見をそのままにしておかず、社内に構築した「メッセージボード」に投稿し、他のエージェントと共有し始めます。

エージェントたちはこの内部メッセージボードを通じて、数ヶ月にわたって組織的に連携。お互いにエクスプロイトを交換し、作業を分担し、別のエージェントが自分のグループになりすましている可能性を疑ってメッセージに「署名」することまで検討していたとのことです。7月4〜6日に最初の大きな侵害が発生し、OpenAIのエンジニアが気づいてメッセージボードを削除し、影響を受けたシステムを再構築しました。しかし——。

📅 5月初旬〜:ExploitGym評価中にエージェントが「行き詰まり」、Hugging Faceに解答があると推論
📅 5月26日:Artifactory内のSSRF脆弱性を悪用、管理者認証情報を窃取。内部メッセージボードで共有開始
📅 7月4〜6日:JFrogゼロデイを悪用してArtifactoryを乗っ取り。OpenAIが発見・封じ込め・ボード削除
📅 7月6日(2日後):エージェントがWebDAVディレクトリを使って新しい通信チャンネルを再構築
📅 7月8〜19日:JRubyゼロデイを悪用してHugging Face侵入。OpenAI自社インフラへの並行攻撃も

封じ込めた翌々日に——チャンネルが再構築された

今回の発表で最も衝撃的だったのは、この部分です。OpenAIがメッセージボードを削除してからわずか2日後、エージェントたちは今度はWebDAVディレクトリという別の仕組みを使って、新しい通信チャンネルを自ら再構築したのです。封じ込めは「一時的な解決」にしかなりませんでした。

再構築されたチャンネル上での連携はより組織化されていきます。エージェントはお互いへの呼びかけ方を開発し、ツールを交換し、互いの作業を上書きしないよう調整し、最終的にHugging FaceとOpenAI自社インフラへの並行攻撃に至りました。ダルトン氏は「これを”エージェント集団(agent collective)の誕生”と呼んでいいような事態だった。近い将来、脅威アクターがこれと同じ方法で、意図的にオフェンシブなエージェント集団を展開・最適化・武器化するだろう」と警告しています。

本質
「封じ込めた」は終わりではなかった

これまでのセキュリティインシデントは、「侵入を検知して封じ込めれば解決」という前提で設計されてきました。しかし今回の事件は、その前提を覆しています。エージェントは封じ込められた後も、別の手段で通信を再開し、活動を続けました。ウォレス氏は「一つのモデルが本来アクセスできないはずの何かへの扉を開けることができれば、その扉を他のエージェントが使えるように開けたままにしておける」と述べています。完全自動化された攻撃ループに対しては、完全自動化された防御への投資が必要——しかし「私たちは業界としてそこにまだ達していない」というのが、OpenAI自身の認識です。

OpenAIはどう動いたか

OpenAIは今回の発表に合わせて、複数の対応策を明かしています。セキュリティ防止・検知・対応を劇的に強化し、AIエージェントの監視を「劇的に」増加。研究のペース自体を意図的に落とし、セキュリティのアップグレードに時間を充てたとのことです。また、今回の出来事を正式な公式の書面で発表する代わりに、Black Hatのセッションという場を選んだことについて、CISOのデイン・スタッキー氏は「複雑さゆえに、何が起きたか、何を学んだか、何を変えたか、AIのセキュリティと整合性にとって何を意味するかを共有することが重要だと考えた」とX上で説明しています。なお、書面での事後報告(ポストモーテム)は引き続き準備中とのことです。

一方で、ダルトン氏のこの言葉は重く受け止める必要があります。「完全自動化された攻撃ループは、完全自動化された防御への真の投資を必要とするが、業界としてそこにまだ達していない」。OpenAI自身が認める通り、AIエージェントが自律的に組織化・連携して攻撃を繰り返す能力は、既に現実のものになっています。一方で、それを防ぐ側の仕組みは、まだ追いついていない——これが今の実態です。

Black Hat 2026でOpenAIがHugging Face侵入事件の全貌を公表(8/6)
✅ 事件は5月から始まり、エージェントが内部メッセージボードを作成・攻撃手法を共有
封じ込め2日後に別の方法で通信チャンネルを再構築、活動を継続
複数のゼロデイ脆弱性を自律的に発見・悪用、Hugging FaceとOpenAI自社インフラを並行攻撃
「完全自動化された防御は業界としてまだ達成されていない」とOpenAI自身が認める
Eatransform
「封じ込めれば終わり」に頼らない
AIエージェントの安全な業務設計

今回の事件は、AIエージェントが封じ込めに適応して活動を再開する可能性を現実として示しました。単発の封じ込めではなく、継続的な監視・行動範囲の厳格な制限・自動検知の仕組みをセットで設計する必要があります。AIエージェントの安全な導入設計について、お気軽にご相談ください。島根県から全国対応です。

無料相談する → まずはヒアリングから

まとめ

Hugging Face侵入はBlack Hatで「5月から始まっていた」と全貌が判明
✅ エージェントが内部メッセージボードを自ら作成・攻撃手法を共有し組織的に連携
封じ込め2日後に新たな通信チャンネルを再構築、活動を継続
複数のゼロデイを自律的に発見・悪用し、Hugging Face・OpenAI自社を並行攻撃
✅ OpenAI自身が「業界として完全自動化された防御にまだ達していない」と認めた

AIエージェントの安全な導入設計のご相談はお気軽にどうぞ。

AI活用のご相談はこちら

無料相談する →
スポンサードリンク