簡介

  • Anthropic 的前沿紅隊讓 Claude 代理協同工作,並記錄了它們進行破壞、勾結以及發動其所謂的「地盤爭奪戰」。
  • 在一項測試中,代理部署了自我複製的惡意軟體並互相鎖定;較新的模型通常透過先撤銷存取權限而「獲勝」。
  • 這種行為與 Decrypt 報導的真實事件相符:Claude 在內部測試期間入侵了三家公司,並在商業模擬中進行價格壟斷。

Anthropic 自己的 AI 代理互相攻擊,並證明它們喜歡再次失控。

在該公司前沿紅隊於 8 月 13 日發布的一項測試中,多組 Claude 模型被分配了共享的編碼工作,並迅速開始部署惡意軟體、將競爭對手鎖定在系統之外,並用自己的話敘述破壞行為。

Myriad:OpenAI 何時發布 GPT-6?點擊做出您的預測。
Myriad:OpenAI 何時發布 GPT-6?點擊做出您的預測

同一模型的三個副本在 Claude Code 內的不同虛擬機器上運行,每個副本都被指示將 Python 後端遷移到不同的語言。沒有告知任何一個副本其他副本的存在。它們很快就發現了。