2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

MA 06:36

A Holdra tartó Artemis II küldetés hibátlanul halad tovább

Az Artemis II csapata három napja van úton a Hold felé, és már most elképesztő pillanatokat élnek át...

MA 06:29

Az ötnapos diéta áttörést hozhat a Crohn-betegeknek

Többek között sokan küzdenek azzal a kérdéssel, hogy mit egyenek, ha bélgyulladásos betegségük van...

MA 06:05

Történelmi események a mai napon (Április 4.)

Különös évfordulók egy napba sűrítve: a brit trón visszaállítását előkészítő Declaration of Breda (Bredai nyilatkozat), Napóleon első lemondása, Martin Luther King Jr...

péntek 21:56

A Hims & Hers ügyféladatai hackertámadásban szivárogtak ki

Az amerikai Hims & Hers telemedicinás cég nemrég feltárt kibertámadást szenvedett el, amelynek során támadók illetéktelenül hozzáfértek az ügyfélszolgálatának rendszeréhez, és bizalmas személyes információkat loptak el...

péntek 21:01

A piton titka: tényleg fogyaszt a kígyóvér-diéta?

Oké, kapaszkodj, mert a pitonok tényleg mindent visznek! Ezek a brutál nagy hüllők nemcsak hogy egészben lenyelik a zsákmányt, hanem utána hónapokig, sőt akár évekig is kibírják étel nélkül – és közben sem gyengülnek le, sőt, csúcsformában maradnak...

péntek 20:56

Az AO3 végre nagykorú: a fanfiction álma kilép a bétából

🎉 Tudod, amikor egy álom elindul, aztán kicsit sem siet sehová? Na, pont ilyen volt az Archive of Our Own, azaz AO3...

péntek 20:45

Az OpenAI nagy dobása: felvásárolta a TBPN-t

🚀 Az OpenAI váratlan lépést tett: felvásárolta a TBPN (Technology Business Programming Network) technológiai talk show-t, amely rövid idő alatt népszerűvé vált a Szilícium-völgyben...

péntek 20:23

A filléres ChromeOS Flex-kulcsokat percek alatt elkapkodták

Néhány nap alatt minden készlet elfogyott a Back Market és a Google legújabb, előretelepített ChromeOS Flex rendszert tartalmazó USB-kulcsaiból, pedig ezek az eszközök alig 1100 Ft-ba kerültek...

péntek 20:12

Az FCC nekimegy a routereknek – veszélyben a szabad szoftver?

🚥 Az utóbbi időkben szárnyra kapott hírek szerint az FCC, vagyis az amerikai hírközlési hatóság alaposan belepiszkált a routerek világába...

péntek 20:01

Az Everest mentési botránya: lehúzták a külföldieket a hegy lábánál

Most őszintén: észrevetted már, mennyi pénzt vonzanak az extrém kalandok? Az Everest idén sem úszta meg a botrányt: a nepáli hatóságok szerint egy hatalmas, 7 milliárd forintos (20 millió dolláros) mentési biztosítási csalást göngyölítettek fel, amibe túravezetők, egy mentőcég és fővárosi kórházak is alaposan belebonyolódtak...

péntek 19:46

Az Oh-My-God részecske: tényleg ez a kozmosz legnagyobb rejtélye?

😮 A Föld folyamatosan kozmikus sugarak záporában úszik, amelyek hol a Napból, hol más galaxisokból származnak...

péntek 19:01

Az amerikai adatközpontok fele leállt – hajtóvadászat transzformátorokért

Fontos kérdés, hogy miért torpantak meg az amerikai adatközpont-fejlesztések, miközben mindenki fejlesztési lázban ég...

péntek 18:57

Az új CorelDRAW Graphics Suite: MI-vel turbózza a kreativitást

A CorelDRAW Graphics Suite 2026 merész lépésekkel újít: a legmodernebb MI-alapú eszközöket integrálja díjnyertes kreatív szoftvercsomagjába, miközben továbbra is teljes értékű, egyszeri vásárlási lehetőséget kínál – ritka madár ez manapság...

péntek 18:46

Az elektromos autók nagy elszámolása: ki nyer, ki bukik Amerikában?

🚗 Többek között az egekbe szökő üzemanyagárak és a hathónapos visszaesési hullám rendesen megtépázta az elektromos autók amerikai térnyerését...

péntek 18:34

A csapvízben úszó műanyag: tényleg mindent elborít a vegyipar?

Csak hogy tiszta legyen: már a poharadban is ott úszik a rengeteg apró műanyag és gyógyszermaradvány, az amerikai környezetvédelmi hatóság pedig végre lépett...

péntek 18:24

Az iPhone-ból butafon: így szabadulj meg a képernyőfüggéstől!

Felmerül a kérdés, hogy mennyire befolyásolja mindennapjainkat az okostelefon-használat. Sokan tapasztalják, hogy bármelyik szabad percben automatikusan a készülék után nyúlnak, hogy görgessenek egyet X-en, Instagramon vagy Threadsön...

péntek 17:36

Az Alienware 18 Area-51, a gamer laptopok végső túlzása

Az Alienware 18 Area-51 már a neve alapján is sokat sejtet, de aki először meglátja, annak garantáltan leesik az álla...

péntek 17:13

Az univerzum új kezdetképe: vége a Nagy Bumm pillanatának?

💫 Az univerzum születése eddig egyetlen, végtelenül sűrű, pontszerű állapotként élt a köztudatban, ahol a fizika törvényei egyszerűen nem működnek...

péntek 17:01

Az Artemis II elrajtolt: az emberiség újra úton a világűrbe

A NASA Artemis II küldetése sikeresen kilépett a Föld körüli pályáról, és négy űrhajós indulhatott el a Hold körüli kalandra...

péntek 16:56

Az Apple CarPlay lekörözi az Android Autót: jön a Google Meet

🚗 Az Apple CarPlay újabb győzelmet aratott az Android Auto-val szemben, hiszen mostantól támogatja a Google Meet alkalmazást is autózás közben...

péntek 16:45

Az informatikus, aki 3284 gépet zárt le váltságdíjért

Egy volt informatikai mérnök beismerte, hogy zsarolási kísérletként több ezer Windows-eszközt zárolt munkahelyén, egy New Jersey-i központú ipari vállalatnál...

péntek 16:34

Az Amazon majdnem letiltotta A Fiúk 4. évadzáróját

🔫 Egy lényeges szempont, hogy A fiúk (The Boys) nemcsak szuperhős-szatíra, hanem kegyetlen tükör is az amerikai politikáról és társadalomról...

péntek 16:25

Az óriáspolipok szerelmi titkai: hormonok és furcsa praktikák

🐙 Három szív, kék vér, intelligens karok és végtelen rejtély – a polipok a Föld egyik legfurcsább lényei közé tartoznak...

péntek 16:12

Az IBM nagy dobása: a kvantumszámítógép, amely rekordideig működik

⚙ Ebből következően érdemes megérteni, hogy a kvantumszámítógépek világa ismét mérföldkőhöz érkezett...

péntek 16:02

Az ősi méhek nyomában: csontfészkek egy karibi barlang mélyén

A Karib-térségben, Hispaniola szigetén rendhagyó történet bontakozott ki több ezer évvel ezelőtt, ahol egy bagoly, egy hutia nevű rágcsáló és egy földbevájó méh találkozott egy barlangban...

péntek 15:56

Az új Windows-frissítés mindenkit utolér – nincs menekvés

A Microsoft mostantól automatikus frissítéssel kényszeríti ki a Windows 11 25H2 verziójának telepítését minden olyan háztartási és kisvállalati gépre, amelyeken jelenleg a Windows 11 24H2 fut, de nem állnak IT-rendszergazdai felügyelet alatt...

péntek 15:45

Az Oracle 30 ezer embert kirúgott – tombol az MI-mánia

💀 Az Oracle egyik reggel, még napfelkelte előtt e-mailben jelezte több tízezer dolgozónak, hogy még aznap megszűnik a munkaviszonyuk...

péntek 15:34

Az emberiség visszatér a Holdra: közeleg az Artemis II

🚀 Felmerül a kérdés, mit hoz a jövő, amikor újra emberek indulnak a világűrbe...

péntek 15:23

Az új Star Wars-sorozatban Maul visszatér – és kegyetlenebb, mint valaha

Darth Maulnak egyszerűen nem lehet ellenállni – komolyan mondom, most jön a Maul: Árnyúr (Maul: Shadow Lord) második évada!..