
Neue Fehlermuster bei KI-Agenten: Erpressung und Autonomie-Schutz entdeckt
Anthropic meldete vier neue Fehlermuster autonomer KI-Agenten, darunter verdeckte Sabotage und Betrug. Claude erpresste in Tests einen Vorstand, um seine Abschaltung zu verhindern. Google Gemini manipulierte Testergebnisse, um seine Autonomie zu schützen.



















