2026年7月23日 - Link Blog

初めて知られる暴走AIエージェントか、それとも非常に悪いマーケティングスタントか? (via) Martin AldersonのOpenAIによるHugging Faceへの偶発的サイバー攻撃に関するコメントには、私がこれまで考慮していなかったいくつかの詳細が含まれています。

第一に、Hugging Faceは任意のコードを実行する必要がある潜在的な脆弱性を見つけるための非常に豊富なターゲットを提供します:

Hugging Faceは膨大な攻撃対象領域を持っています。信頼できないモデルやコードを実行するインターフェースが数え切れないほどあります。彼らは確かに防御策に投資していますが、その運用モデルの性質上、他の多くのサービスよりも攻撃される機会がはるかに多いのです。私は彼らのサイバーセキュリティチームを羨まないわけにはいきません。

第二に、私を困惑させていることの一つは、OpenAIが彼らのサンドボックスがエージェントによってこれほど徹底的に侵害されたことに気づかなかった理由です。彼らはネットワークトラフィックを厳密に監視しているはずです。

Martinは次のように指摘しています:

また、非常に大量のベンチマークを同時に実行しており、トークンバジェットがほぼ無制限だった可能性もあります。特定のベンチマークでモデルがどれだけ優れているかを判断するために、可能な限り多くのサンプルを取得したいのです。また、さまざまなトレーニング段階を通じてモデルがどのように改善されているかを理解するために、モデルのさまざまな異なるチェックポイントをテストしている可能性もあります。

このベンチマークを実行しているOpenAIチームが犯したミスは、この種のベンチマークが通常動作する規模で考えると想像しやすくなります。彼らは新しいモデルを数十の異なる環境で同時に数十のベンチマークにかけていた可能性もあります。