2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

szombat 21:22

A looksmaxxing sötét oldala: férfiasságromboló mellékhatások

💀 Lényeges szempont, hogy az utóbbi időben egyre több fiatal férfi próbálja különböző extrém módszerekkel, például plasztikai beavatkozásokkal, hormoninjekciókkal vagy szélsőséges fogyókúrával javítani a külsejét...

szombat 21:12

A kriptópionír, aki 20 millió dollárból milliárdos alapot épített, duplázik bitcoinra

💰 Annak vizsgálata, hogy egy 20 millió dolláros családi befektetésből miként lehet felépíteni egy több mint 1 milliárd dolláros birodalmat a kriptovaluták világában...

szombat 20:56

A nagy pénz megérkezett: a Polymarket már nem csak hóbort

💰 Egy lényeges szempont, hogy a Polymarket és a Kalshi váratlanul hatalmas forgalmat produkálnak, és ezzel magukhoz vonzzák a legnagyobb kvantitatív kereskedési cégeket...

szombat 20:45

Az eltűnt Google-okosóra nyomában: karibi búvárkaland és botrány

Lényeges, hogy a technológiai szivárgások sokféleképpen történhetnek, de néha egészen furcsa fordulatot vesznek...

szombat 20:34

A MI-n túl: konténerek, kvantumcsip – amit kihagytál a Microsoft Builden

⚡ A Microsoft Build 2026 eseményén minden a látványos platformbejelentésekről és MI-bemutatókról szólt, de több rejtettebb újdonság is született, amelyek a következő években még előtérbe kerülhetnek...

szombat 20:22

A tudósok riadót fújnak: veszélyes amőbák terjednek világszerte

😷 Vízhez és talajhoz kötődő mikrobák kerültek a kutatók figyelmének középpontjába mint rejtett veszélyforrások: bizonyos szabadon élő amőbák különösen veszélyessé válhatnak, ahogy a klíma melegszik, és a világszerte elöregedő vízhálózatok karbantartása elmarad...

szombat 20:11

Az erős kvantumállapotok meglepően egyszerű receptje

⚙ Többek között a jövő kvantumtechnológiái, például a szuperérzékeny szenzorok és a kvantumszámítógépek rendkívüli képességei az összefonódás nevű jelenségen alapulnak, amikor részecskék mélyen összekapcsolódnak, és egymásra olyan módon hatnak, amit a klasszikus fizika nem tud megmagyarázni...

szombat 20:01

Az új DMZ egy teljes értékű játék a Modern Warfare 4-ben

🎮 Egy lényeges szempont, hogy a Modern hadviselés 4. (Modern Warfare 4) fejlesztői most egy igazi DMZ-élményt ígérnek a játékosoknak: nem béta, nem mellékes extrakciós próbálkozás, hanem egy kiforrott, önálló játékmód a Call of Duty-univerzumban...

szombat 19:57

Az új őrület, a mogging, mindent eláraszt – gond ez?

A mogging egy pillanat alatt elárasztotta az internetet és a fiatalok szóhasználatát...

szombat 19:45

Az új Star Citizen-patch 385 küldetést hoz, de pilóták robbannak

🚀 A Star Citizen legújabb, Alpha 4.8.1-es frissítése elképesztő mennyiségű, összesen 385 aszteroida-védelmi küldetéssel bővült...

szombat 19:34

A Bitcoin diadalához négy erő kell – Saylor csatakiáltása

💰 Michael Saylor szerint a Bitcoin hosszú távú sikerének titka a különböző felhasználói csoportok együttműködésében rejlik...

szombat 19:22

A miniatűr röntgentávcső lehet a kulcs a Hold rejtett kémiájához

A tokiói kutatók úttörő elképzeléssel álltak elő: egy parányi röntgentávcső segítségével néhány éven belül részletes kémiai térkép készülhet a Hold egész felszínéről...

szombat 19:12

Az Ozempic és hasonló fogyókúrás gyógyszerek 30%-kal csökkenthetik a mellrák kockázatát

💪 Ebből következően érdemes megérteni, hogy egyre több, a fogyást segítő gyógyszer nemcsak a testsúlycsökkentésben, hanem a daganatos betegségek megelőzésében is szerepet játszhat...

szombat 18:56

Az idősek étrend-kiegészítői: mi kell, mi csak pénzkidobás?

Az étrend-kiegészítők iránti kereslet óriásit nőtt az elmúlt években: sokan gondolják, hogy néhány kapszula elég ahhoz, hogy energikusabbak legyenek, erősebb legyen az immunrendszerük, sőt akár tovább is éljenek...

szombat 18:45

A legnagyobb amerikai bankok új digitális pénzhálózattal fékeznék a tömeges betétkivonást

Érdemes megvizsgálni, hogy az Egyesült Államok legnagyobb bankjai hogyan reagálnak a kriptopiac viharos növekedésére: a digitális pénzforgalom felé indulnak, hogy megállítsák a betétek elvándorlását...

szombat 18:34

A Satoshi-korszak bitcoinjai 14 év után megmozdultak a 285 milliárd dolláros perben

💰 2011 óta mozdulatlanul pihenő, 35,55 BTC-t tartalmazó pénztárca mozdult meg a napokban, ébresztve a kriptovilág figyelmét egy több mint 104 ezer milliárd forint (285 milliárd dollár) értékű bírósági ügy közepette...

szombat 18:23

Az éjszakai áramszünet térdre kényszerítette egész Jamaicát

Jamaicában péntek este teljesen elsötétült az ország, miután egy váratlan áramszünet mindenkit érintett...

szombat 16:34

A csillogás és égés: te döntesz!

💫 Bámulatos részletek derültek ki a közelgő sztáresküvőről, amely már most mindenkit lázba hoz...

szombat 16:23

A meggyilkolt James Handy utolsó filmje határozatlan időre dobozban

🕑 A veterán színész, James Handy számos filmben és sorozatban szerepelt pályafutása során, és egészen idén nyárig még egy utolsó projekten dolgozott volna, mielőtt barátnője otthonában meggyilkolták...

szombat 16:12

Az olasz tinik római villát találnak, a Google szúnyoginváziót indít

🏠 Megemlíthető továbbá, hogy a tudományos világ a héten igazán meglepő, évezredek óta rejtőző titkokra bukkant...

szombat 15:12

A világ legbájosabb hűtőmágnese: ez a mini E Ink képkeret

📷 Nem mindennapi látvány, amikor a jól megszokott hűtőmágnesek mellé valami igazán újszerű csatlakozik...

szombat 15:01

A 60 Minutes újabb botránya: bizonytalan a legendás műsor jövője

📺 Az amerikai televíziózás egyik legtöbbet díjazott műsora, a 60 Minutes az elmúlt napokban példátlan felforduláson ment keresztül...

szombat 14:57

A Bloodlines 2 záró DLC-je hozza, ami alapból hiányzott: kardpárbaj, kétpisztolyos harc

🗡 Vámpír: A Maszkabál – Vérvonalak 2 (Vampire: The Masquerade – Bloodlines 2) hosszú és zűrzavaros fejlesztési ciklusának végére ért...

szombat 14:45

A stabil VPN-t találni egyre nehezebb: Kína fokozza a szigort

Habár korábban a VPN-használat egyfajta bűvészmutatványnak számított Kínában, mára a helyzet még szigorúbbá vált...

szombat 14:35

Az Nvidia új chipje és a hét legnagyobb techhírei

Közeledik az év egyik legjobban várt eseménye, az Apple fejlesztői konferenciája, ahol komoly szoftverfrissítéseket és a teljesen megújult Sirit várhatjuk...

szombat 14:23

A kisbefektetők eladják a bitcoint a SpaceX részvénykibocsátásáért?

💰 Erre utal többek között az, hogy a SpaceX rekordösszegű, 27 500 milliárd forintos (75 milliárd USD) tőzsdére lépésekor a szokásosnál jóval nagyobb szeletet, akár a részvények 30 százalékát kínálják fel kisbefektetőknek – például a Robinhood, a Fidelity vagy a Charles Schwab platformján keresztül...

szombat 13:55

A Zcash-hibát MI-vel leleplező kutató auditlistájára tette a Monerót

Fontos kérdés, hogy mennyire bízhatunk a magánéletet védő kriptovaluták biztonságában. Egy népszerű anonim coin, a Zcash nemrég komoly sebezhetőségen esett át, amit egy tapasztalt biztonsági mérnök MI-modellel fedezett fel...

szombat 13:45

A gravitáció erejének rejtélye: miért nem tudjuk pontosan megmérni?

A gravitáció mindennapi tapasztalatunk szerves része – nélküle nem tudnánk a Földön járni, és a Nap sem tartaná pályán a bolygókat...

szombat 13:23

A Roland Garros szenzációja: Andreeva–Chwalińska döntő Párizsban

🎾 Párizsban a Roland-Garros vörös salakján két igazi meglepetésember játszik egymás ellen a 2026-os női döntőben: a 19 éves orosz Mirra Andreeva és a lengyel selejtezős, a 24 éves Maja Chwaliska...