PEGAPOLL · HÍREK

Kiszivárgott dokumentumok szerint egy Microsoft-vezető „az emberiség történetének legnagyobb munkalopásának” nevezte az AI-scrapelést

TechCrunch · 2026-09-17
🤖 AI-generált tartalom — A címet és az összefoglalót mesterséges intelligencia készítette automatikusan, emberi szerkesztői átnézés nélkül.

Egy három éve húzódó szerzői jogi perben most nyilvánosságra hozott, korábban kitakart bírósági iratok szerint a Microsoft és az OpenAI belső levelezésükben maguk is elismerték, hogy az AI-modelljeik betanításához használt adatgyűjtési gyakorlatuk lopásnak minősül, és hogy termékeik komoly veszélyt jelentenek a kiadókra. A Microsoft alkalmazott tudományos igazgatója, Brent Hecht egy 2023 januári belső feljegyzésben „az emberi történelem legnagyobb munkalopásának” nevezte a gyakorlatot, egy 2024 januári prezentációjában pedig azt írta, hogy a Copilot „válaszmotorja” akár 93 százalékkal is csökkentette a The New York Times weboldalára mutató kattintási arányt a hagyományos Bing-kereséshez képest, amit ő „végzetkörnek” nevezett. Satya Nadella, a Microsoft vezérigazgatója egy idei tanúvallomásában elismerte, hogy minden fizetős tartalmat licencelni kellene, mielőtt betanításra vagy „megalapozásra” használnák, és hogy ha tudomást szerzett volna arról, hogy az OpenAI fizetős tartalmat is lekapart, élt volna a Microsoft azon jogával, hogy az OpenAI-t a modell újratanítására kötelezze. Az OpenAI ChatGPT-részlegének vezetője, Nick Turley belső üzenetében „egzisztenciális fenyegetésnek” nevezte a chatbotokat a kiadókra nézve, Greg Brockman, az OpenAI elnöke pedig „kiválónak” minősítette a modelleket híranyagok terén – ezt Nadella is megerősítette, elismerve, hogy a chatbotokkal folytatott beszélgetés valóban kiváltja az eredeti forrás felkeresését. Az iratok szerint az OpenAI mid-training adatkészletei több mint 91 692 példányt tartalmaznak a New York Times, a Daily News és a Center for Investigative Reporting cikkeiből, egy Common Crawl-alapú adatkészlet pedig több mint 2 millió dokumentumot csak a nytimes.com oldalról; a Project Mango nevű, Microsofttól kapott adatokból összeállított készlet legalább 160 903 egyedi művet tartalmazott. A dokumentumok azt is feltárják, hogy az OpenAI munkatársai állítólag módszert dolgoztak ki a fizetős tartalom felismerés nélküli megkerülésére, és szándékosan eltávolították a szerzői jogi jelöléseket a betanító adatokból, nehogy a modell kimenete elárulja az eredetet.

Folytasd az appban — szavazz és szólj hozzá ➔
Forrás: TechCrunch · innen ahirlevel.hu