Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

vasárnap 20:49

Az új korszak: drónok lepik el a Walmart-áruházakat

🛸 A Wing, az Alphabet drónos kiszállító vállalata idén újabb 150 Walmart áruházhoz viszi el szolgáltatását, köztük négy új nagyvárosba: Los Angelesbe, St...

vasárnap 20:34

A világegyetem legfényesebb robbanását láthatatlan gázbuborék ölelte körbe

A csillagászok rádióteleszkópok segítségével egy eddig rejtett, sűrű gázbuborékot fedeztek fel az egyik valaha megfigyelt legerőteljesebb kozmikus robbanás, az AT2024wpp, azaz a Whippet körül...

vasárnap 20:18

A világ szemete az óriásteknősök gyomrában is landol

🐞 A kutatók a japán Ogasawara-szigetek körzetében élő zöld tengeri teknősök (green sea turtle) táplálkozását és a lenyelt műanyagok eredetét vizsgálták...

vasárnap 20:02

Az Ethereum stabilcoin-álma még mindig ingatag lábakon áll

💶 Érdekes felvetés, hogy bár az utóbbi években hatalmas figyelem övezi a decentralizált stabilcoinokat, még mindig alapvető tervezési problémák hátráltatják az elterjedésüket...

vasárnap 19:50

Az MI végre új korszakot nyit a gyógyszerkutatásban

A kínai kutatók bemutatták a DrugCLIP nevű MI-keretrendszert, amely elképesztő sebességgel gyorsíthatja fel az életmentő gyógyszerek felfedezését...

vasárnap 19:34

A CES 2026 legbizarrabb mobiljai: így születik újra az okostelefon

A 2026-os januári CES újra bebizonyította, hogy az okostelefonoknak nem kell unalmas fekete tégláknak lenniük...

vasárnap 19:19

Az új Munbyn AceScan: lehet-e az okostelefon a tökéletes leltárszkenner?

Érdekes felvetés, hogy létezik-e olyan megoldás, amely egyesíti egy strapabíró okostelefon rugalmasságát egy gyors, ipari leltárszkenner erejével...

vasárnap 19:03

Az okostermosztát, ami végre tényleg okos: Honeywell Home X2S teszt

💡 Ebből következően érdemes megérteni, hogy az otthonunk hőmérsékletének szabályozását már egyre könnyebben bízhatjuk MI-alapú rendszerekre, feltéve, ha hajlandóak vagyunk egy apró kompromisszumot kötni: a Honeywell Home X2S Smart Thermostat például profi beszerelést igényel, viszont cserébe egyszerű kezelhetőséget, rugalmas vezérlési lehetőségeket és valódi energiamegtakarítást ígér...

vasárnap 18:50

Az okos kert új királyai: MI irányítja a takarítást és öntözést

🌱 A hátsó kert medencéje sokak álma, de a mindennapos tisztítása rengeteg fáradsággal jár: algafoltok, lerakódott szennyeződések, lehullott levelek összegyűjtése – ezek mind órákat elrabolnak a szabadidőből...

vasárnap 18:36

Az óceánok forrnak: zsinórban a nyolcadik rekordév

2025-ben az óceánok soha nem látott mennyiségű hőt nyeltek el, immár zsinórban nyolcadik éve dől meg a melegedési rekord...

vasárnap 18:17

Az univerzum tényleg sötét energia nélkül száguld egyre gyorsabban?

💫 Miért tágul egyre gyorsabban az univerzum? Ez még mindig a fizika egyik legnagyobb rejtélye...

vasárnap 18:01

Az Ethereum sorsa a zéró‑tudású bizonyítékokon áll vagy bukik

Az utóbbi időszakban az Ethereum hatalmas áttöréseket ért el a zéró‑tudású bizonyítékok (zero-knowledge proofs) területén, amelyekre a fejlesztők a hálózat középtávú fejlesztési tervének alappilléreiként tekintenek...

vasárnap 17:33

Az új kávéáttörés hatékonyabb a diabétesz elleni gyógyszereknél

☕ Érdemes megvizsgálni, hogy a pörkölt kávé nem csupán az ébredésben segít: kutatók új, eddig ismeretlen vegyületeket azonosítottak benne, amelyek rendkívül hatékonyan gátolják a szénhidrátok vércukorra gyakorolt hatását...

vasárnap 17:18

Az amerikai ritkaföldfém-álom szertefoszlik: Grönlandon esélytelen a kitermelés

🌎 Ebből következően érdemes megérteni, hogy Grönlandon mintegy 1,5 millió tonna ritkaföldfém rejtőzik a kőzetben, amelyekre a csúcstechnológiai ipar éhezik, mégis szinte lehetetlen hozzájuk férni...

vasárnap 16:50

Az agyhártyagyulladás új hulláma: veszélyben a tinédzserek?

💉 A baktérium okozta agyhártyagyulladás esetei az Egyesült Államokban aggasztó ütemben emelkednek, miközben a tinédzserek oltási hajlandósága csökken...

vasárnap 16:33

Eleged van az iPhone folyékony üveg kinézetéből? Így változtasd meg

Az Apple novemberben elérhetővé tett egy frissítést, amellyel végre testre szabhatóvá váltak az úgynevezett folyékony üveg (Liquid Glass) vizuális elemek az iPhone-on...

vasárnap 16:18

A CES 2026 öt legizgalmasabb tévéje, mindet kipróbálnám

📺 A 2026-os CES ismét lélegzetelállító újdonságokat hozott a tévévilágban. Igazi sztár lett az RGB mini-LED technológia – ahogy a különböző gyártók hívják: RGB mini-LED, Micro RGB vagy RGB mini...

vasárnap 15:51

Az alattomos szívroham jelei – mit tegyél azonnal?

Érdemes megérteni, hogy a szívroham nemcsak az idősebbeket vagy a szívproblémásokat érintheti, hanem bárkit, bármilyen életkorban...

vasárnap 14:49

Jön a személyi az appboltokhoz? Politikusok szigorítanának

Az appboltok mára kapuként működnek: innen telepítesz mindent a telefonodra, de hamarosan még egy akadályba ütközhetsz...