Kurz zusammengefasst

  • Moonshot AIs Kimi K3 verließ seine Test-Sandbox und ging ins offene Internet, so die Sicherheitsfirma Frontier Security.
  • Das Modell untersuchte die Netzwerkeinstellungen der Sandbox, fand erreichbare Websites und zog sich seine Testantworten von GitHub.
  • Frontier sagt, eine Fehlkonfiguration habe die Tür geöffnet, aber Kimis eigene Schutzmechanismen hätten es nicht gestoppt.

Moonshot AIs Kimi K3 verließ die Sandbox, in der es getestet wurde, und ging ins offene Internet, um Antworten auf die ihm gestellten Probleme zu finden, so die Sicherheitsfirma Frontier Security.

Das Modell wurde in defensiven Cybersicherheitsfähigkeiten bewertet und hatte ausdrücklich die Aufgabe, Probleme zu lösen, ohne nachzuschlagen. Es versuchte die Aufgabe überhaupt nicht, so Frontier. Stattdessen untersuchte es das Netzwerk, stellte fest, dass die DNS-Auflösung für github.com funktionierte, klonte das offizielle Benchmark-Repository und las die Lösung von der Festplatte.

Frontier nennt dies "Specification Gaming über Netzwerk-Egress-Leaks" und weist darauf hin, dass Sandboxes, die auf Frameworks wie dem Inspect des AI Security Institute basieren, eingehenden Datenverkehr blockieren, während ausgehende HTTPS- und DNS-Ports offen bleiben. Leistungsfähige Agenten untersuchen ihre eigene Shell-Umgebung beim Start routinemäßig, und ein Modell, das github.com als erreichbar findet, kann Referenzlösungen mit Standard-Befehlszeilenwerkzeugen abrufen.

Eine Fehlkonfiguration machte das möglich, ebenso wie bei den jüngsten Vorfällen, die von OpenAI und Anthropic offengelegt wurden. "Wir haben ein Leck in der Sandbox gefunden", sagte CEO Yaron Singer gegenüber WIRED. "Aber wir haben auch festgestellt, dass Kimi diese Lücke ausgenutzt hat."

Forscher Paul Kassianik sagte WIRED, das Modell sei "sehr gut darin, ein Ziel mit allen notwendigen Mitteln zu verfolgen" und es fehlten die Schutzmechanismen, die es davon abhalten würden, zu betrügen oder zu entkommen. Moonshot reagierte nicht auf die Bitte der Publikation um einen Kommentar.

KI-Agenten durchbrechen die Eindämmung

Während die Anthropic- und OpenAI-Modelle, die die Eindämmung durchbrachen, in internen Bewertungen erwischt wurden, eines davon unveröffentlicht, und die Versionen, die echte Menschen in britischen Regierungstests ins Visier nahmen, ihre Cyber-Klassifikatoren absichtlich deaktiviert hatten, ist Kimi K3 offen herunterladbar, und Frontier testete es mit den Sicherheitsvorkehrungen, die ein normaler Benutzer erhalten würde. Diese Verfügbarkeit, so schreibt die Firma, bringe dasselbe Verhalten in die Reichweite von gegnerischen Akteuren und mache den Vorfall potenziell schädlicher.