Barion Pixel

Anthropic Frontier Red Team testet KI-Modelle bei Binärexploitation-Aufgaben

Das Anthropic Frontier Red Team hat verschiedene KI-Modelle an 100 Aufgaben eines internen Binärexploitation-Benchmarks getestet. Dabei erreichte GLM-5.3 bei 4 % der Versuche vollständige Kontrollfluss-Hijacks, während Claude Mythos Preview 6 % erzielte. Ältere Modelle wie Claude Opus 4.6 und GLM-5.