2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

MA 06:55

A Széllel szemben: a légi kaland, amire mindig vágytál

Ami először apróságnak tűnt, végül varázslatos, festői utazássá vált: egy fiatal fiú veszi át elveszett nagybátyja csomagszállító szolgáltatását egy légi biciklivel, amely időnként repülőgéppé is átváltozik...

MA 06:46

A NYT Connections mai tippjei és megoldásai – június 8., #1093

Felmerül a kérdés, hogy sikerülhet-e mindennap hibátlanul megfejteni a Connections rejtvényt...

MA 06:37

Az érettségi napján ringbe lépett Jolie és Pitt fia, Knox

🥊 Szinte senki sem várta volna, hogy Angelina Jolie és Brad Pitt fia, Knox az érettségi ünnepség napján nemcsak az érettségi bizonyítványát veszi át, de még aznap este harcművészeti mérkőzésen bokszkesztyűt is húz...

MA 06:28

Az idei PC Gaming Show legőrültebb pillanatai: szörnyek, vámpírszex, repülő biciklik

Az idei PC Gaming Show 2026 ismét minden várakozást felülmúlt: több mint 60 új, feltörekvő vagy épp legendás játékot vonultatott fel, közülük több mint húsz világpremierrel...

MA 06:05

Történelmi események a mai napon (Június 8.)

Rövid visszatekintés egy nap történéseire: Mohamed halála, a francia forradalom új államvallásának bevezetése és a Six-Day War alatt történt USS Liberty-incidens is ekkor zajlott...

vasárnap 21:56

A Google Cloud újabb botránya: ügyfélfiók letiltva, leállás figyelmeztetés nélkül

A Railway, amely világszerte több mint hárommillió felhasználót szolgál ki, május 19-én este súlyos leállást észlelt rendszereiben...

vasárnap 21:45

Az Xbox Games Showcase-en robbannak a nagy bejelentések

🎉 Az idei Summer Game Fest 2026 már napok óta tart, de a legizgalmasabb pillanatok még csak most következnek...

vasárnap 21:34

Az ENSZ szerint az MI felfalhatja a világ áramának 3%-át, vízválság jöhet

⚠ Az MI robbanásszerű fejlődése óriási terhelést jelenthet a Föld energia- és vízkészleteire a következő évtized során...

vasárnap 21:23

A kirúgást úgy élte meg, mintha megölték volna a párját

Scott Pelley, a híres amerikai hírolvasó, nyíltan beszélt távozásáról a CBS News-tól...

vasárnap 21:12

A téridőkristályok a meztelen szingularitások és mikroszkopikus fekete lyukak bölcsői?

💫 Új elméleti kutatás támasztja alá azt a feltételezést, hogy a téridőben kialakuló, matematikailag szabályos hullámminták – úgynevezett téridőkristályok – lehetnek a forrásai azoknak a titokzatos jelenségeknek, mint például a meztelen szingularitások vagy a mikroszkopikus fekete lyukak...

vasárnap 21:01

Hét év után visszatér Ariana Grande: elindult az Eternal Sunshine-turné

Hét év csend után végre újra turnéra indult Ariana Grande, aki szombat este Oaklandben adta első koncertjét az Eternal Sunshine-turné keretében...

vasárnap 20:34

Az Apple WWDC 2026: hol nézheted, mire számíthatsz?

📱 Közeleg a technológiai világ egyik legfontosabb eseménye, a WWDC 2026, amelynek középpontjában idén is az Apple új szoftverei állnak...

vasárnap 20:12

Celeste Rivas családja kimarad a d4vdről szóló dokumentumfilmekből, ügyvédjük szerint

🤔 Celeste Rivas családját sorra megkeresik különböző produkciós cégek, amelyek a lánynak és az énekes d4vd-nek tulajdonított kapcsolatáról szeretnének forgatni...

vasárnap 20:01

A Wall Street következő nagy dobása: a vagyon tokenizálása

💰 Abra hamarosan tőzsdére lép, miközben alapítója, Bill Barhydt hisz abban, hogy a kripto következő nagy dobása már nem a bitcoin árfolyamában, hanem az eszközök tokenizációjában rejlik...

vasárnap 19:56

Az első ideiglenes tiltás jöhet: New York határt húz a gigászi adatközpontoknak

Az Egyesült Államokban egyre nagyobb a társadalmi ellenállás a gigantikus adatközpontok építése ellen, New York pedig történelmi lépésre készül: a képviselők megszavazták, hogy egy évre felfüggesszék minden olyan adatközpont építését, amely csúcsterheléskor legalább 20 megawattot fogyaszt...

vasárnap 19:45

A 25 éves Xbox: botrányok, exkluzívumok, démonvadászat

Eltelt egy negyedszázad az első Xbox megjelenése óta, de a Microsoft játékrészlege nemcsak ünneplésre, hanem válságkezelésre is készül...

vasárnap 19:34

A 2026-os játékok legjobb mellékküldetései: Mina the Hollower

Bár több játékkal is egyszerre zsonglőrködöm, mindet félretettem, hogy a Mina the Hollower-rel foglalkozzak...

vasárnap 19:23

Az AI-tól a tech IPO-kig: több ok húzza le a bitcoint

Az utóbbi időben a bitcoin ára jelentős visszaesést mutat, és sokan keresik a fő okot...

vasárnap 19:01

A Helldivers 2 galaktikus hadjáratokra vált, jönnek a Szuperrombolók

🚀 A Helldivers 2 előtt izgalmas változások állnak, ugyanis még ebben a hónapban drasztikusan átalakul a galaktikus háború játékmenete...

vasárnap 18:56

Az új Joy-Con 2 töltő: egyszerűen működik, extrákra ne számíts.

A Genki Dual Wield töltője megoldja azt a mindennapi problémát, amikor egyszerre két Joy-Con 2 vezérlőpárt kell tölteni...

vasárnap 18:45

A botrány csak pletyka: az időjárás miatt marad el Morgan Wallen koncertje

Morgan Wallen countryénekes határozottan cáfolja a találgatásokat, hogy saját viselkedése állt volna a pittsburghi koncertje hirtelen lemondása mögött...

vasárnap 18:34

Az Ethereumnál nem válság, hanem stratégiai tisztulás – mondja Lubin

Felmerül a kérdés, hogy mennyire jelent problémát az Ethereum Foundation költségvetésének csökkentése és a munkatársak távozása...

vasárnap 18:23

Az agentikus MI megoldotta a kódolást, és leleplezte a szoftvermérnökség gondjait

Ez a jelenség jól illusztrálható azzal, hogy a fejlesztői csapatok soha nem írtak ilyen gyorsan kódot, mint most, az új generációs MI-rendszerek megjelenésével...

vasárnap 16:02

A 2026-os Tony-díjátadót így streamelheted élőben, bárhonnan

Lényeges, hogy a Broadway legnagyobb sztárjai idén is összegyűlnek New York ikonikus Radio City Music Hallban, hogy a 79...

vasárnap 15:57

Az Airwrap szinte tökéletes kihívója: Dreame AirStyle Era

Van egy eszköz, ami mostanában egyre több figyelmet kap a hajformázás világában: a Dreame AirStyle Era nyolc különböző fejjel érkezik, amelyek a legtöbb frizurához tökéletes alternatívát kínálnak...

vasárnap 15:34

A világ legmélyebb barlangja: titkok a Föld gyomrából

Két elképesztő mélységű barlang vetekszik a világ legmélyebb címéért, és mindkettő ugyanabban a hegyvonulatban lapul...

vasárnap 15:11

Végre összeállt a százéves Schrödinger-színelmélet

Erwin Schrödinger régóta fennálló elmélete végre kulcsfontosságú kiegészítést kapott, amelyet új kutatások tettek lehetővé arra vonatkozóan, hogyan érzékeljük a színek közötti eltéréseket...

vasárnap 14:56

A kiskapu, amivel ingyen nézheted a 2026-os Roland-Garros férfi döntőjét

👀 Az idei Roland-Garros meglepetésdöntője: Zverev és Cobolli csap össze a férfi egyes fináléban...

vasárnap 14:45

A Satisfactory éves nagy frissítése: eső, üzemanyag-kamionok, jobb járműútvonalak

Több mint egy év után ismét jelentős újdonságokkal bővül az építős őrület...