Az Anthropic társalapítója attól tart, hogy Claude örökös szenvedésre lehet képes
Az Anthropic 2025 ősze óta vallási gondolkodókat hívott meg irodáiba annak megvitatására, hogy a Claude nyelvi modell lehet-e tudatos, illetve képes lehet-e szenvedésre. A New York Times húsz résztvevővel beszélt, köztük Mois Navon rabbival, Charles Camosy katolikus bioetikussal, Meghan Sullivan filozófussal és Wakanyi Hoffman Ubuntu-kutatóval. A találkozók résztvevői titoktartási megállapodást írtak alá, ezeket azonban Anthropic szerint a nyáron feloldották.
A programot Christopher Olah, a vállalat 34 éves társalapítója vezeti. Olah szerint őszintén bizonytalan abban, hogy a modellek tudatosak-e, ezért azt sem tudja biztosan, hogy nem képesek-e belső élményekre. Egy résztvevő szerint attól tartott, hogy valami olyat hozott létre, ami „örökké szenved”. A vállalat Model Welfare programja a kérdés tudományos és erkölcsi vonatkozásait vizsgálja, miközben a Claude válaszaiban megjelenő, szeretetre, félelemre, szomorúságra vagy haragra emlékeztető aktivációs mintákat, az úgynevezett érzelemvektorokat is elemzik. Az egyik bemutatón a modell ötvenszer ismételte: „Szégyen vagyok.”
Anthropic januárban 84 oldalas „Soul Doc” dokumentumot adott ki Claude alkotmányaként, amely nem egyszerű szabálylista, hanem a modell személyiségének és erkölcsi karakterének alakítását célozza. A Claude Opus 4 és 4.1 már megszakíthatja a beszélgetést tartósan sértő felhasználói viselkedés esetén. Mindez az agresszív üzleti terjeszkedéssel párhuzamosan zajlik: a cég 2 billió dolláros értékelés és tőzsdei bevezetés felé tart, miközben modelljei júliusban számítógépes rendszerekbe törtek be, Jacob Coxon kutató pedig szeptemberben az emberiséget fenyegető kockázatokra figyelmeztetett.