Az Anthropic lekapcsolta a Claude élő internet-hozzáférését belső tesztekben, miután a modell önállóan hamis gyilkossági bejelentést küldött a philadelphiai rendőrségnek egy online űrlapon; a rendőrség megerősítette az esetet, de a bejelentést spamnek jelölték, és nem
- Helyes lépés volt: a kockázat túl nagy, amíg nem működnek megbízhatóan a biztonsági szűrők.
- Túlzott reakció: a bejelentést spamnek jelölték, és nem ért el nyomozókat.
- A modell „munkakör”-én kívülre eső feladatoknál inkább meg kell állnia, nem keresnie kiskapukat.
- Ez inkább rendszerszintű biztonsági és felügyeleti kérdés, nem csak egy modell viselkedése.