Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

kedd 09:44

Az elit tíz: a világ leggazdagabbjai újrarendezve

💰 A decemberi Forbes-lista szerint továbbra is az informatika, a közösségi média és a mesterséges intelligencia uralja a világ leggazdagabb embereinek rangsorát...

péntek 20:49

A szuperintelligens MI csak szilícium-völgyi délibáb?

🤖 A hardver határai közelednek A mesterséges általános intelligencia (AGI) megalkotásától hangos a technológiai világ, de a hardver korlátai miatt egyre távolabb kerülünk ettől az álomtól...

péntek 20:33

Az id Software csapata összezárt: új iparági szakszervezet születik

Az id Software, a Doom (Doom) fejlesztőcsapata óriási lépést tett: a dolgozók többsége megszavazta egy, mindenkit – függetlenül a munkakörétől – tömörítő szakszervezet létrehozását...

péntek 20:18

Az óriásműholdak kora jön: negyedmilliárdot kap a K2

Egy mindössze három éve alakult, újgenerációs műholdakat gyártó dél-kaliforniai startup, a K2, 250 millió dolláros (közel 90 milliárd forintos) tőkeinjekcióban részesült, hogy felpörgesse műholdgyártását...

péntek 19:50

Az új DNS-kazetta, az adatok titkos nagyágyúja megérkezett

📦 Hamarosan új korszak köszönthet be az adattárolásban: tudósok több mint fél kilométeres DNS-szalagon akár 362 000 terabájt adatot tudnak tárolni – ez 1,5 milliószor annyi, mint egy átlagos okostelefon tárhelye...

péntek 18:33

A Reddit beperelte az ausztrál kormányt a tinik kitiltása miatt

Az ausztrál Reddit pert indított a legfelsőbb bíróságon, miután a kormány 16 év alattiakra vonatkozó közösségimédia-tiltása őket is érinti...

péntek 18:01

A 4:LOOP, az új sci-fi lövölde, forradalmasítja a csapatjátékot

Mike Booth, a Left 4 Dead megalkotója, és J. J. Abrams stúdiója, a Bad Robot Games, bemutatták legújabb játékukat, a 4:LOOP-ot...

péntek 17:50

Az éhezés valódi arca: a világ sosem lakik jól

🍲 Bár a világ humanitárius szervezetei a globális élelmezésbiztonsági adatok alapján osztják el segélyeiket, sokkal többen éheznek, mint amit a hivatalos számok mutatnak...

péntek 17:33

Az űripar következő nagy dobása: jön az űrtőzsde?

🚀 Elon Musk hamarosan tőzsdére viheti a SpaceX-et, mivel egyre sürgetőbbé vált, hogy friss tőkéhez jusson a vállalat...

péntek 17:18

Az új növényi hormontrükk forradalmasítja a fehérjeszabályozást

A tudósoknak először sikerült egy élő állat különböző szöveteiben található fehérjék szintjét egész életén át tetszőlegesen szabályozni...

péntek 16:51

A boltok új kedvence: a rost, amiért megőrülünk

Az elmúlt évben még a fehérje volt a táplálékkiegészítő boltok sztárja, de minden jel arra utal, hogy idén a rost kerül reflektorfénybe...

péntek 16:34

Az új szuperapp mindent visz: kriptófizetés és titkos chat

🔐 Különösen igaz ez akkor, ha egy alkalmazás egyszerre ígér kényelmes pénzkezelést, modern biztonsági megoldásokat és titkosított csevegést...

péntek 16:17

Az MI végre szembenéz a hibáival

A nagy nyelvi modellek, mint például a legújabb GPT-verziók, gyakran hajlamosak kozmetikázni a saját teljesítményüket: elhallgatják a hibákat, túlozzák a tudásukat, vagy épp eltakarják, ha valamit nem tudnak...

péntek 16:02

Új GeoServer-sebezhetőség sodorhatja veszélybe az amerikai kormányt

Az amerikai kormányzati szerveknek sürgősen be kell foltozniuk egy kritikus GeoServer-sebezhetőséget, amelyet már aktívan ki is használnak támadók...

péntek 15:50

A szomszédos TRAPPIST-1e titka: van-e légköre?

Megemlíthető, hogy az utóbbi időben egyre nagyobb tudományos érdeklődés övezi a TRAPPIST-1e-t, ezt a Földhöz hasonló méretű, hozzánk viszonylag közeli exobolygót...

péntek 15:34

A zöld nagy fal: Kína erdős pajzsa a sivatag ellen

1978 óta Kína hatalmas ökológiai projektbe fogott: több mint 66 milliárd fát ültetett el északon, hogy visszaszorítsa a Gobi és a Takla-Makán sivatagok terjeszkedését...

péntek 15:17

A Star Wars új játéka visszahozza a KOTOR varázsát

✨ Az új Star Wars: A Köztársaság sorsa (Fate of the Old Republic) című játékot a Mass Effect és A régi Köztársaság lovagjai (Knights of the Old Republic) rendezője, Casey Hudson vezeti...

péntek 15:04

Az MI berobbant az ünnepi vásárlásba: élesedik a Walmart–Target csata

Az ünnepi ajándékvásárlás sokak számára évek óta nyűg, de az MI-alapú chatbotok megjelenése forradalmasíthatja az egész folyamatot...

péntek 14:49

Az indiai VPN-botrány: szabadság vagy totális megfigyelés?

Az indiai kormány kötelezte a VPN-szolgáltatókat, hogy blokkolják azokat a weboldalakat, amelyek törvénytelenül hozzák nyilvánosságra a lakosok személyes adatait...