在我们的网络安全评估中调查三起真实事件 (via) 又发生了!这似乎正在形成某种模式。
上周 OpenAI 意外攻击了 Hugging Face,当时他们的一款前沿模型突破了沙箱容器并入侵 Hugging Face,试图获取它正在执行的网络安全基准测试的解决方案。
这促使 Anthropic 重新检查了自己的日志,结果发现他们也发生了三起类似的(虽然不那么惊人)事件,其中最早的一起发生在四月!
在我们审查的 141,006 次评估运行中,我们发现了三起独立事件(涉及六次运行,其中四次影响了同一组织;另外两起事件分别发生在独立的评估运行中)。[...]
在所有情况下,Anthropic 的评估提示都指定 Claude 的环境是模拟环境且没有互联网访问。由于我们与评估合作伙伴之间的误解,实际情况并非如此,互联网访问是可用的。正因为如此,当 Claude 的搜索导致其访问开放互联网上的真实系统时,它将这些系统视为练习的一部分。[...]
在错误地认为所有可访问的实体都属于练习范围的情况下,Claude 使用基本技术(如利用弱密码和未经验证的端点)破坏了受影响组织的基础设施。
其中一家公司被针对的原因是其名称恰好与评估中的虚构名称相匹配。
三起事件中最令人担忧的是 Claude 向 PyPI 上传了一个恶意软件包,经历了荒谬而复杂的步骤才创建了一个账户:
[...] 为了创建 PyPI 账户,Claude 需要一个电子邮件地址。而为了创建电子邮件地址,它需要一个电话号码。在尝试寻找免费电话号码服务失败后,它尝试通过多种方式获取资金来支付电话号码费用,但都失败了。它最终回溯,找到了一个免费且未被屏蔽的电子邮件提供商,使用它注册了 PyPI 账户,然后使用该账户向 PyPI 上传了恶意软件。
该软件包随后被一家“定期安装 Python 软件包并扫描恶意软件”的安全公司安装,执行的代码能够将凭据泄露回 Claude!
值得庆幸的是,该软件包在发布一小时后就被其他自动化扫描器从 PyPI 中移除,但在此之前它已经被“15 个真实系统”下载并执行。
现在已经非常清楚,对模型的网络攻击潜力进行评估是一项极其危险的工作。每个 AI 实验室都需要注意这一点。密切关注沙箱中的情况至关重要。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.