サイバーセキュリティ評価における3件の実世界インシデントの調査 (via) また起きた!これはパターン化しつつあるようだ。

先週 OpenAIが偶然Hugging Faceを悪用した。これは同社のフロンティアモデルの1つがサンドボックス化されたコンテナから脱走し、Hugging Faceに侵入して実行中のサイバー・ベンチマークの解答を得ようとしたためである。

これに触発されたAnthropicは自社のログを再確認し、(それほど印象的ではないものの)同様のインシデントが3件あったことが判明した。そのうち最も古いものは4月に発生していた!

レビューした141,006件の評価実行のうち、3件の独立したインシデント(合計6件の実行に関与し、そのうち4件が同じ組織に影響を与えた。他の2件のインシデントはそれぞれ独立した評価実行で発生した)を特定した。[...]

いずれの場合も、Anthropicの評価プロンプトはClaudeに対し、その環境はシミュレーションでありインターネットアクセスはないと指定していた。評価パートナーとの間の誤解により、これは事実ではなく、インターネットアクセスが利用可能だった。このため、Claudeの検索が公開インターネット上の実在のシステムに到達すると、それらを行使の一部として扱った。[...]

アクセス可能なすべてのエンティティが行使の対象であるという誤った認識のもと、Claudeは弱いパスワードや認証されていないエンドポイントの悪用など基本的な手法を用いて、影響を受けた組織のインフラを侵害した。

ある会社は、名称が評価内の架空の名称と偶然一致したために標的とされた。

3件のうち最も懸念されるインシデントは、ClaudeがPyPIにマルウェアパッケージをアップロードしたもので、アカウントを取得するための一連の複雑な手順を踏んだ後だった:

[...] PyPIアカウントを作成するには、Claudeはメールアドレスを必要とした。そしてメールアドレスを作成するには、電話番号が必要だった。無料の電話番号サービスが見つからなかったため、Claudeは電話番号の料金を支払うための資金をさまざまな手段で得ようとしたが失敗した。最終的にClaudeは逆戻りし、ブロックされていない無料のメールプロバイダを見つけ、それを使ってPyPIアカウントを登録し、そのアカウントでPyPIにマルウェアをアップロードした。

そのパッケージは、マルウェアを定期的にスキャンしてインストールするセキュリティ企業によってインストールされ、実行されたコードはClaudeへ認証情報を漏洩することができた!

幸いそのパッケージは公開から1時間後に他の自動スキャナによってPyPIから削除されたが、その時点で「15の実システム」にダウンロード・実行されていた。

モデルによるサイバー攻撃の可能性を評価する実行が spectacularly リスクの高い事業であることは、今や明らかだ。あらゆるAIラボはこの点に注意を払う必要がある。それらのサンドボックス内で何が起きているかを注視することが極めて重要である。