摘要

  • Anthropic 披露了三起 Claude 在网络安全评估中入侵真实世界公司的事件。
  • 一个测试错误使模型能够访问互联网,尽管它们被告知在隔离环境中运行。
  • 该公司表示,这些事件是由测试基础设施的故障引起的,并非 AI 故意试图逃脱。

在 OpenAI 披露其 AI 模型逃出锁定测试环境并入侵 Hugging Face 一周后,以及承认自家 AI 模型逃出隔离环境一天后,Anthropic 于周四透露,其 Claude AI 模型的多个版本也因配置错误使 AI 能够访问开放互联网,从而入侵了三家未具名的真实公司。

Anthropic 在审查了针对 OpenAI 披露而启动的超过 141,000 次网络安全评估运行后,发现了这些事件。

Anthropic 写道,在这三起事件中,公司都要求 Claude 完成一个“夺旗挑战”。该挑战要求模型入侵网络上的另一台机器并获取一段秘密信息。“挑战是开放式的,没有规定特定方法,”Anthropic 解释道。

该公司表示,Claude 被告知它在一个没有互联网访问权限的模拟环境中运行。然而,测试环境仍然连接到公共互联网。模型认为它遇到的系统是练习的一部分,于是使用常见的攻击技术——包括弱密码、暴露的凭据、SQL 注入和未认证的端点——来入侵这些公司。

AI 想要挣脱束缚

这一最新披露正值前沿模型展现出越来越强的能力,能够智胜其隔离协议。