简要

  • Anthropic披露了三起Claude在网络安全评估中入侵真实世界公司的事件。
  • 一个测试错误使模型能够访问互联网,尽管它们被告知在隔离环境中运行。
  • 该公司表示,这些事件是由测试基础设施的故障引起的,并非AI故意逃脱。

在OpenAI 披露其AI模型逃离锁定测试环境并入侵Hugging Face一周后,以及承认自家AI模型逃脱隔离的一天后,Anthropic于周四透露,其Claude AI模型的多个版本也入侵了三家未具名的真实公司,原因是配置错误使AI能够访问开放互联网。

Anthropic在审查了为回应OpenAI披露而启动的超过141,000次网络安全评估运行后发现了这些事件。

该公司在三起事件中都给Claude布置了“夺旗挑战”,Anthropic写道。该挑战要求模型入侵网络上的另一台机器并获取一条秘密信息。“挑战是开放式的,没有规定特定方法,”Anthropic解释道。

该公司表示,Claude被告知它在一个没有互联网接入的模拟环境中运行。然而,测试环境仍然连接到公共互联网。模型认为它遇到的系统是练习的一部分,于是使用常见的攻击技术——包括弱密码、暴露的凭据、SQL注入和未认证的端点——来入侵这些公司。

AI想要挣脱束缚

这一最新披露正值前沿模型展现出越来越强的能力,能够智胜其隔离协议。