2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

MA 08:19

Az Apple új Sirije: nem csak asszisztens, hanem vállalati alkalmazásréteg

Idén a WWDC 2026 kiemelt szenzációja, hogy az Apple teljesen új alapokra helyezi a Sirit, így most már jóval többről van szó, mint egy digitális asszisztensről...

MA 08:02

A PCOS valódi arca: hormonvihar a női szervezetben

💪 A PCOS (policisztás ovárium szindróma) a nők egyik leggyakoribb hormonális zavara, amely az anyagcserére, a bőrre, a hajra és a mentális egészségre is jelentős hatást gyakorol...

MA 07:55

A Madison Square Gardenért szórják a milliókat: Taylor Swifték esküvője

💍 Taylor Swift és Travis Kelce igazi nagyágyús eseményre készülnek: az esküvőjük helyszíne nem más, mint a legendás Madison Square Garden, amelyet legalább három napra béreltek ki...

MA 07:46

A remake-trilógia fináléja: mindent a Final Fantasy VII Revelationről

🎉 A játékvilág lélegzet-visszafojtva várja, hogyan zárul a legendás történet, amely egy egész generációt inspirált...

MA 07:36

A tea meghosszabbíthatja az életed – ha jól iszod

☕ A tea évszázadok óta közkedvelt ital világszerte, ám nemcsak a hangulatra, hanem a testre is hat...

MA 07:28

A csalás-mítosz ledől: a diákok jóra használják az MI-t

Az oktatás digitális forradalma alapjaiban formálja át a fiatalok tanulási szokásait...

MA 07:18

Az ultrafeldolgozott ételek lopják a figyelmedet – akkor is, ha egészségesen eszel

🤔 Új kutatás szerint a mindennapokban gyakran fogyasztott, ultrafeldolgozott ételek jelentősen rontják a figyelmet és a szellemi teljesítményt, még akkor is, ha valaki egyébként kifejezetten egészségesen táplálkozik...

MA 07:10

Az első kétmagos kvantumgép: kínai áttörés, tényleg stabilabb és hatékonyabb?

⚙ Egy kínai vállalat bemutatta a Hanyuan-2 nevű forradalmi kvantumszámítógépet, amelyet a világ első kétmagos kvantumszámítógépeként emlegetnek...

MA 07:01

Az 5 ezermilliárd dolláros kriptopiac kulcsa: a tokenizált részvények

A tokenizált részvények és ETF-ek új korszakot hozhatnak a kriptopénzek és a hagyományos pénzügyi piacok találkozásában...

MA 06:37

Az Apple is gyárt hamis képeket – ennek tényleg örülünk?

Eddig az Apple szinte szégyenlősen nyúlt a képszerkesztő szoftverek mesterséges intelligenciájához, miközben a konkurencia évek óta villogott a generatív MI-képességekkel...

MA 06:28

Az Ebola-járványban három új vakcina kap zöld utat – mikor érkeznek?

Közép-Afrika újabb Ebola-járvánnyal küzd, amely ezúttal a Bundibugyo-vírustörzs miatt robbant ki...

MA 06:19

Az ötujjú Donald kacsa botrányt kavar a Kingdom Heartsban

A frissen bejelentett Szívek királysága-gyűjtemény (Kingdom Hearts Collection) (1–3) hivatalos plakátján kisebb botrány kerekedett: Donald kacsának feltűnően öt ujja van az egyik kezén...

MA 06:07

Történelmi események a mai napon (Június 10.)

Ma évszázadokon átívelő fordulópontok és megrázó tragédiák sorakoznak: a keresztes háborúktól és a harmincéves háború csatáitól kezdve a II...

kedd 21:34

Az ingyenes Norton Neo a vb-szurkolók belépője a lelátóra

Az idei nyár 39 napján világszerte emberek milliárdjai ülnek le ugyanabban a pillanatban, hogy együtt kövessék a 2026-os labdarúgó-világbajnokság izgalmait...

kedd 21:23

A vb-láz elkerüli New Yorkot, napokkal a kezdés előtt?

🏆 Fontos kérdés, hogy fel tudja-e rázni a fociláz New Yorkot az utolsó pillanatban, hiszen a világ legnagyobb futballeseménye, a világbajnokság hamarosan itt, az Egyesült Államokban veszi kezdetét...

kedd 21:13

Az olcsó mini-LED trónkövetelő: KTC M27T6S teszt

💡 A 27 hüvelykes KTC M27T6S nem csupán egy újabb monitor a piacon – igazi mérföldkő azoknak, akik nem akarnak több százezret költeni egy igazán jó HDR kijelzőre...

kedd 21:03

Az Artemis III legénysége megvan – jön a történelem egyik legösszetettebb küldetése

🚀 A NASA a következő években minden eddiginél bonyolultabb űrmisszióra készül, amely egyesíti az emberes űrrepülés hagyományát az új technológiákkal...

kedd 20:55

A blokklánc forradalmasítja az amerikai gyáripar hitelezését

📦 Ennek megfelelően egy jelentős, 650 millió dolláros (kb. 235 milliárd forintos) hitelprogram indul az amerikai gyártó- és energetikai szektorban, innovatív digitális pénzügyi megoldásokkal...

kedd 20:44

Az FCA engedne: jöhet 10% kripto-ETN a befektetési alapokba?

A brit pénzügyi felügyelet most először engedélyezné, hogy az ország néhány befektetési alapja a vagyonának akár 10%-át kriptoeszközökhöz kapcsolódó tőzsdén kereskedett kötvényekben (crypto ETN) tartsa...

kedd 20:34

Vége a bikapiacnak: külön útra lép a Bitcoin és a techrészvények

A kriptovaluták piacán a nyár előtt komoly bizonytalanság uralkodik, miközben a Bitcoin és a technológiai részvények között ritkán látott különbség alakult ki...

kedd 20:24

Az ultrawide meglepetés: a Koorui, amire senki sem számított

😍 Érdemes megvizsgálni, hogy a PC-alkatrészek egyre dráguló világában mennyire számít üdítő kivételnek a Koorui 34E6UC, egy pénztárcabarát, 34 hüvelykes, ultrawide monitor...

kedd 20:12

Az Artemis III legénysége megvan, jön a tétre menő holdkomp-próba

A NASA hivatalosan is bemutatta az Artemis III négyfős legénységét június 9-én Houstonban, amelynek tagjai 2027 végén egy különleges küldetésre indulnak majd...

kedd 20:01

Az Ocarina of Time újjászületik – már idén a Nintendo Switch 2-n

Valóra váltak a pletykák: a legendás A Zelda legendája: Az idő ocarinája (The Legend of Zelda: Ocarina of Time) megújul, és kizárólag Nintendo Switch 2-re, 2026-ban jelenik meg...

kedd 19:56

Az RTX 50 Super jön, vele a 12 GB-os RTX 5060?

Nagyjából fél éve hallani pletykákat arról, hogy az Nvidia újabb Super modellekkel bővítené a legújabb RTX-szériát, ám a memóriapiac nyűgjei miatt eddig semmi konkrétum nem derült ki...

kedd 19:45

A szlovákiai árok hétezer éves, fej nélküli emberi csontvázakkal sokkolja a régészeket

😮 Egy szlovákiai kőkorszaki település határában régészek egy különös árkot tártak fel, amelyet fej nélküli emberi csontvázak töltöttek meg...

kedd 19:34

A Halo-kampány új korszaka: mindent a tündöklő Master Chiefről

👑 A Halo: Combat Evolved ismét visszatér, de most tényleg nagyot újítanak: nemcsak egy sima felújításról van szó, hanem teljes értékű remake készül Halo: Campaign Evolved címmel...

kedd 19:23

A toxikus rajongás rombolja Clarkson farmját

😤 Jeremy Clarkson szokásához híven ismét bizonyítja, hogy lelkesedése mellett elképesztően ügyetlen, ha gyakorlati teendőkről van szó – és ez a Clarkson farmja (Clarkson’s Farm) ötödik évadában csak még látványosabbá válik...

kedd 19:12

A Blue Origin rakétarobbanása megnehezíti a Holdra visszatérést

Jeff Bezos űripari álmai május 28-án Floridában lángba borultak, amikor a Blue Origin egyik New Glenn rakétája a kilövőálláson hirtelen felrobbant...

kedd 19:01

A Montech Ten Wood: illóolajos gépház, amiért megőrül a gamer?

🌲 A Computex 2024 kiállításon az egyik legszokatlanabb hardverújdonság a Montech Ten Wood PC-ház volt, ami nemcsak a szemnek, de az orrnak is újat kínál...