Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

vasárnap 20:49

A FaZe Clan tényleg a szétesés küszöbén áll?

A FaZe Clan jövője komoly kérdéseket vet fel, miután hat népszerű influencer – Adapt, Jason, Ronaldo, Lacy, Rage és Silky – bejelentette távozását a csapatból...

vasárnap 20:33

A 10 kihagyhatatlan üzleti könyv, amit idén el kell olvasnod

A sikeres vezetők nemcsak a felszínt kapargatják, hanem szívesen merülnek el mélyebb gondolatokban is: ezek a könyvek nemcsak elméletekről, hanem a mindennapi üzleti élet valós kihívásairól szólnak...

vasárnap 20:17

A kedvező árú Tecmojo 12U hálózati rack falra is szerelhető

A szerverek számára nélkülözhetetlen az állványos elhelyezés, hiszen míg egy asztali PC vagy NAS önmagában is megállja a helyét, igazi adatközponti érzést csak egy jó rack adhat...

vasárnap 20:01

Az agyi miniorganoidok forradalmasítják a pszichiátriát

Egyre több kutatás mutatja, hogy a laborban növesztett miniatűr agyak most először engednek igazán részletes bepillantást abba, hogyan torzul az idegrendszer aktivitása skizofrénia és bipoláris zavar esetén...

vasárnap 19:33

Az olvadó gleccserek végórái: drámai veszteség évtizedeken belül

Az elkövetkező évtizedekben évente akár 4 000 gleccser is eltűnhet világszerte, és a század végére már alig maradhat belőlük...

vasárnap 19:19

Az idei filmek üzenete: egyék meg a gazdagokat!

2025-ben a mozik folytatták régi hagyományukat: a leggazdagabbak újra az év nagy ellenségeivé váltak...

vasárnap 19:02

A 2026-os év három legizgalmasabb kriptója: ezekre figyelj

💸 A kriptopénzpiac erőteljes hullámzásait láttuk 2025-ben, hiszen a vezető kriptovaluták értéke 10–50 százalékkal esett vissza...

vasárnap 18:49

Az új Retroid Pocket 6 már a PS2-t is viszi

A Retroid Pocket 6 végre valóság lett, és hamarosan megérkezik az első előrendelők kezébe...

vasárnap 18:34

Az év sokkoló egészségügyi sztorijai: kanyaró, MI-vezérelt vírusok, botrányok

Érdemes megvizsgálni, milyen jelentős fordulatokat hozott 2025 az egészségügy terén: áttörő orvosi kezelések, alapvető biológiai rejtélyek és egészségpolitikai viharok formálták a világot, miközben az MI és a tudomány új korszakot nyitott...

vasárnap 18:18

A Realme GT8 Pro cserélhető kamerával borzolja a kedélyeket

Megemlíthető továbbá, hogy az okostelefonpiacon évtizedek óta ritkán találni igazán meglepő újdonságot, ám a Realme GT8 Pro váratlanul új színt vitt a megszokott kínálatba...

vasárnap 18:01

Az univerzum sorsa veszélyben: gyengül a sötét energia?

Az utóbbi időben egyre nagyobb vitát váltott ki, hogy a sötét energia, az Univerzum gyorsuló tágulásáért felelős titokzatos erő talán mégsem viselkedik úgy, ahogy korábban gondoltuk...

vasárnap 17:50

Az ötven felettiek költekezése turbózza a gazdaságot

A befektetési világ egyre inkább az 50 év felettiekre, az úgynevezett Silver Spenders-re figyel, akik erősödő anyagi helyzetükkel és növekvő befolyásukkal komoly gazdasági lendületet adnak a brit piacnak...

vasárnap 17:35

Az indiai startuplufi kipukkan? A befektetők már válogatnak

📈 India startup-ökoszisztémája 2025-ben közel 4 000 milliárd forintnyi (11 milliárd dollárnyi) tőkét vonzott, de a befektetők jóval kevesebb csekket írtak alá, mint korábban, és mind válogatósabbá váltak...

vasárnap 17:17

Az érzelmileg intelligens párok valódi titkai

Érdemes megvizsgálni, hogy mit csinálnak másként azok a párok, akik magas érzelmi intelligenciával kezelik a konfliktusokat...

vasárnap 17:03

Az Apple Watch: a hatékonyság titkos aduásza

⏱ Felmerül a kérdés: tényleg csak az egészséged figyelésére jó az Apple Watch, vagy a munkahelyi termelékenységben is segíthet?..

vasárnap 16:50

Az MI mindent elárasztott 2025-ben – de hol a forradalom?

Érdemes megérteni, hogy 2025-re az MI már a mindennapok része lett, de az igazi világrengető áttörés elmaradt...

vasárnap 16:33

Az iraki agyagpajzs a porviharok ellen

🌀 Irak déli sivatagaiban egyre gyakrabban támadnak heves por- és homokviharok, amelyeket az éghajlatváltozás okozta aszály, a magasabb hőmérséklet és az erdőirtás felerősítenek...

vasárnap 16:18

A PlayStation idei éve: meglepetések helyett tökéletes folytatás?

🎮 A PlayStation semmit sem bíz a véletlenre a mostani konzolgenerációban. A 2020 óta piacon lévő PlayStation 5 folyamatosan bővült exkluzív játékokkal – a Returnaltől a God of War Ragnarökig, vagy éppen a The Last of Us folytatásaiig...

vasárnap 16:02

A világegyetem csodája: 400 gyűrű fedi fel a csillagszületés titkát

A téli égbolton, ha délkelet felé nézel, és a ragyogó csillagokat keresed, érdemes kicsit feljebb tekinteni a visszafogottabb fényű Perseus csillagkép felé...