2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

MA 15:12

Az európai Microsoft-csoda nyomában: szuverenitás, adatközpontok, dicsekvés

🌍 A Microsoft Európában komolyan ráfeküdt az adatkezelésre, és nem aprózza el: az elmúlt évben például Portugáliában több mint 3 500 milliárd forintot, Norvégiában 2 170 milliárdot, az Egyesült Királyságban pedig 10 500 milliárd forintot fordított új adatközpontokra...

MA 15:01

Az MI-háború nagy fordulata: Nem ChatGPT vagy Claude a legokosabb?

Az MI-chatbotok között élesedő verseny újabb meglepetést tartogat: habár egyre többen pártolnak át a ChatGPT-től a Claude-hoz, a friss elemzések szerint egyikük sem mondhatja magát a legokosabb ingyenes MI-nek...

MA 14:56

A villámgyors kontroller – GameSir G7 Pro 8K teszt, humorral

⚡ Kezdődhet a kontrollerfesztivál: a GameSir G7 Pro 8K Aimlabs Edition messze nem csak egy szokványos játékszer...

MA 14:46

Az OLED végre tömegeknek szól: berobban az Alienware AW2726DM

💡 Az utóbbi időben az OLED monitorok ára igencsak elrugaszkodott a valóságtól, de most ugrásszerűen megváltozott a helyzet...

MA 14:33

Az SBI Holdings új kriptotőzsdére csapna le Japánban

💰 A Tokióban működő pénzügyi óriás, az SBI Holdings újabb nagy lépésre készül a digitális eszközök világában...

MA 14:23

Az EA új pénzcsapdája: már előrendelhető a Battlefield 6 battle pass

A Battlefield 6 népszerűsége gyorsan felszökött a rajt után, ám a lendület csak rövid ideig tartott...

MA 13:56

Az MI árnyékában: Mit osztanak meg a dolgozók valójában?

A brit cégek kétharmada bevallja, fogalma sincs arról, hogy alkalmazottaik milyen adatokat osztanak meg azokon az MI-platformokon, amelyeket hivatalosan engedélyeztek...

MA 13:45

Az új gyógyszer, ami felére vágja a rossz koleszterint

A magas koleszterinszint hosszú távon komolyan károsítja az artériákat, növeli a szívbetegségek kockázatát, és világszerte rengeteg embert érint...

MA 13:02

Az új Cyber Essentials-szabályok veszélybe sodorhatják a közbeszerzéseket

⚠ Érdemes megvizsgálni, hogy mennyire komoly következmények várhatnak azokra a szervezetekre, amelyek nem tartanak lépést a legújabb kiberbiztonsági előírásokkal...

MA 12:56

A legkisebb idei telihold jön – és vele a kék Hold

Egy lényeges szempont, hogy május első teliholdja, a Virághold pénteken, 13:24-kor válik pontosan teljessé, bár ez Észak-Amerikában nappalra esik...

MA 12:45

Az etikátlan hackerképzés ára: így veszítjük el a jövő védőit

🔒 Néhány éve még elképzelhetetlen lett volna, hogy tinédzserek önéletrajzaival telnek meg a dark web fórumai...

MA 12:34

Az idei május legütősebb kütyüi: megszólalnak, villannak, rabul ejtenek

💡 Okostévétől könyvespolci hangfalig, elképesztő, mennyi mindent lehet mostanában a kezedbe venni – vagy inkább bekapcsolni...

MA 12:22

Az intézmények óvatosak: 28 millió forint felett a Bitcoin, valami furcsa készül

Még mindig kitart a lendület: a Bitcoin 1,2 százalékot ugrott ma reggel, így már 77 000 dollárnál (kb...

MA 11:01

Az elhízás nagy fordulata: kiderültek a zsírszövet titkai

🧀 A zsírsejteket régóta egyszerű tartályoknak tartották, amelyekben a szervezet elraktározza a felesleges energiát...

MA 10:57

A kidobott kannabiszlevelek igazi aranybányát rejtenek

A Stellenboschi Egyetem kutatói eddig ismeretlen, igen ritka vegyületeket fedeztek fel kannabiszlevelekben, ami teljesen új megvilágításba helyezi ezt a sokat vitatott növényt...

MA 10:49

A dél-koreai kriptotőzsde-óriás végre fellélegezhet

😅 Dél-Korea egyik legnagyobb kriptotőzsdéje, a Bithumb fontos jogi sikert ért el, miután egy helyi bíróság feloldotta féléves, részleges felfüggesztését...

MA 10:43

A filléres kvantumtörés: Vége a titkosításnak?

⚠ Lezajlott egy forradalmi változás: a titkosítás feltöréséhez szükséges technológia mára húszszor olcsóbb lett, mint korábban gondoltuk...

MA 10:36

A Birodalom legőrültebb hadvezére végre betör a Total War: Warhammer 3-ba

A Total War legfrissebb bemutatóján a Total War: Warhammer 3 egészen új lendületet kapott, izgalmas újításokat jelentettek be – köztük egy várva várt patchet is, amely hamarosan orvosolja a tétlenkedő MI-t és a települések ostromát ellehetetlenítő hibákat...

MA 10:29

A Tizenkét Apostol felemelkedésének igaz története

🚢 Ausztrália híres Tizenkét Apostolának eredete hosszú ideig rejtély maradt, ám most a Melbourne-i Egyetem kutatói végre pontos magyarázattal álltak elő...

MA 10:21

Az ivóvíz tényleg nem véd meg a vesekőtől?

💧 Megvizsgálták, hogy a rendszeres, bőséges folyadékfogyasztás valóban megelőzi-e a vesekövek kiújulását...

MA 10:15

A stressz és az éjszakai nassolás tönkreteszi az emésztésed

🤢 A modern élet hajszája könnyen tönkreteheti a gyomor egészségét – különösen, ha a stresszes nap után még éjjel is eszünk...

MA 09:43

Az iskolai verekedés késelésig fajult Tacomában

🛡 Négy diák életveszélyes sérülésekkel, egy biztonsági őr és maga a támadó pedig könnyebb sebekkel került kórházba a washingtoni Tacoma Foss High Schooljában csütörtök délután történt késelés után...

MA 09:36

Az új Total War: Warhammer 40 000-ben mindent elpusztíthatsz

A Totális háború: Warhammer 40 000 fejlesztői végre megerősítették, hogy a játékban nemcsak az épületek, hanem számos tereptárgy is rombolhatóvá válik...

MA 09:22

A nagyok szerint a Robinhood csak átmenetileg botlik meg

💰 A népszerű tőzsdei alkalmazás, a Robinhood a közelmúltban hullámvölgybe került, miután a vártnál gyengébb első negyedéves eredményeket közölt – elsősorban a kriptokereskedelem visszaesése miatt...

MA 09:15

Az április legvadabb robotjai: öt meghökkentő kedvenc

A robotok egyre inkább a hétköznapjaink részei, minden elképzelhető és elképzelhetetlen helyen felbukkannak...

APP
MA 09:12

APPok, Amik Ingyenesek MA, 5/1

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Monthly Dystopia (iPhone/iPad)A Monthly Dystopia egy disztópikus túlélőjáték, amelyet George Orwell 1984 című műve inspirált...

MA 09:08

Az OpenAI goblin-tilalma: amikor az MI már túltolja

A mesterséges intelligencia világában néha egészen szürreális problémák bukkannak fel – pontosan ilyen volt az OpenAI híres „goblin-gate” esete is 2026 tavaszán...

MA 08:57

A fejlesztői MI-asszisztensek gyenge pontjai: mindenki a kulcsokra hajt

🔑 Valódi kódoló MI-k sorozatos hibái borzolják a kedélyeket – az elmúlt kilenc hónapban olyan fejlesztői eszközök, mint a Codex, Claude Code, Copilot vagy a Vertex AI, súlyos sebezhetőségeken keresztül váltak támadások célpontjaivá...

MA 08:43

A brit hálózatokat még mindig az elavult technológia kísérti

Érdemes megérteni, hogy az Egyesült Királyságban ezrek működtetnek olyan informatikai rendszereket, amelyek kritikus sebezhetőségeit már több mint tíz éve feltárták...