2025. 04. 03., 14:01

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához

Az OpenAI jogszabályokon felülemelkedve használja az O’Reilly könyveket az MI tanításához
Tim O’Reilly, a neves tech könyvkiadó vezetője azt állítja, hogy az OpenAI engedély nélkül használta fel a kiadó szerzői jogvédelem alatt álló könyveit a legújabb GPT-4o modell betanításához. Mindez annak ellenére történt, hogy a cég már több szerzői jogi per alanya hasonló tevékenységek miatt, bár az OpenAI tagadja a jogsértést.

Rejtett módszerekkel a nyomok után

O’Reilly a “Nem nyilvános adatok szerepe az LLM-ek előképzésében” (Beyond Public Access in LLM Pre-Training Data) című tanulmány társszerzőjeként vizsgálta meg, hogy a GPT-4o felhasznált-e 34 szerzői jogvédelem alatt álló O’Reilly Media könyvet. A kutatók úgynevezett DE-COP teszteket végeztek: feleletválasztós kérdéseket tettek fel, amelyek során a modellnek négy opció közül kellett kiválasztania, melyik szövegrészlet származik eredeti O’Reilly könyvből. Ha a modell helyesen azonosította az eredeti szövegeket, az erősen arra utalt, hogy ezeken a szövegeken tanult.

A tesztek alapján a GPT-4o 82%-os pontossággal ismerte fel az eredeti szövegrészleteket, ami egyértelműen arra utal, hogy valószínűleg a kiadó anyagain képezték ki. A kutatók szerint az OpenAI a hírhedt LibGen adatbázist használhatta, amely mind a 34 tesztelt könyvet tartalmazza – ugyanazt az adatbázist, amelyet korábban a Meta is alkalmazott a Llama modellek betanításához.

 

Érdekes módon a 2022-es GPT-3.5 modell csak alig 50% feletti eredményt ért el, ami arra enged következtetni, hogy “a nem nyilvános adatok szerepe az OpenAI modelljeinek előképzésében jelentősen megnőtt az idők során”. Ugyanakkor a kisebb GPT-4o Mini modell, amely 2024-ben jelent meg, nem tűnik úgy, mintha O’Reilly könyvek alapján tanult volna, vélhetően kisebb paraméterkészlete miatt.

A jogsértő gyakorlat veszélyei

A kutatók figyelmeztetnek: a szerzők megfelelő kompenzálásának hiánya “az egész internet lezülléséhez” vezethet. “Ha az MI-cégek értéket vonnak ki a tartalomkészítők által előállított anyagokból anélkül, hogy méltányosan kompenzálnák az alkotókat, azzal éppen azokat az erőforrásokat merítik ki, amelyektől MI-rendszereik függenek,” érvelnek.

 

Az MI-óriások láthatóan tisztában vannak azzal, hogy nem támaszkodhatnak csak az internetes adatgyűjtésre, ezért licencszerződéseket kötnek kiadókkal és közösségi hálózatokkal. Az OpenAI tavaly szerződést kötött a Reddittel és a Time magazinnal is archívumaik felhasználására. Ugyanakkor a cég nemrég arra kérte az amerikai kormányt, hogy lazítson a szerzői jogi korlátozásokon, azzal érvelve, hogy a merev szabályok elnyomják az innovációt és a befektetéseket.

 

Miközben az MI-modellek készítői a korlátlan hozzáférésért harcolnak, mások akadályokat állítanak a szerzői jogok védelmében. A Cloudflare nemrég bemutatta AI Labyrinth nevű bot-ellenes MI-jét, amely a robots.txt utasításokat figyelmen kívül hagyó adatgyűjtőket egy hamis oldalakból álló labirintusba csalja, pazarolva idejüket és számítási erőforrásaikat.

 

Az éppen 40 milliárd dolláros finanszírozást szerző OpenAI egyelőre nem reagált a megkeresésekre.

2025, adminboss, go.theregister.com alapján

Legfrissebb posztok

MA 20:22

A telekomóriás KDDI 14,9%-ot vesz a Coincheck Groupban, 65 millió dollárért

💰 A japán KDDI 14,9%-os részesedést szerez a Coincheck Groupban, miután 65 millió dollárért – közel 23,2 milliárd forintért – 28,5 millió új részvényt vásárol részvényenként 2,28 dolláros (kb...

MA 19:56

Az iPhone Ultra lehet a meglepetéssiker: milliók vennének hajlítható iPhone-t

📱 Az Apple hamarosan piacra dobhatja első hajlítható iPhone modelljét, amit iPhone Ultra néven emlegetnek, és úgy tűnik, ezzel új fejezetet nyithat a mobiltechnológiában...

MA 19:45

A Surfshark Alternative ID felturbózza az Android 17 hívásvédelmét

📱 Az Android 17 hívószám-hamisítás elleni védelme (Spoofing Protection) váratlanul hasznosnak bizonyul: képes felismerni a csalókat és megszakítani a hívásaikat, még mielőtt megszereznék az érzékeny adatokat...

MA 19:34

A jégkorszak után 500 évvel korábban tértek vissza Britanniába, mint hittük

🦾 Több mint 15 000 évvel ezelőtt, az utolsó nagy jégkorszak után az emberek a korábban véltnél jóval előbb tértek vissza a brit szigetekre...

MA 19:23

A bitcoin az aranyhoz képest még mindig 26%-kal alulértékelt

Az elmúlt években a piacok régóta birkóznak azzal, hogyan értelmezzék a bitcoint: részvény helyett inkább kockázatos vagyontárgynak tartják, amely felfelé repül, ha bő a likviditás, és zuhanni kezd, ha eluralkodik a védekező hangulat...

MA 19:12

Német 1,5 millió dollár a Steam Deck asztali környezetére – vége a kémprogramoknak

Tipikus eset, amikor a nyílt forráskódú közösség jelentős elismerésben részesül. Németország Szuverén Technológiai Alapja (Sovereign Tech Fund) 1,3 millió euróval (kb...

MA 19:01

A BioShock legendás nyitányainak titka: Ken Levine hitvallása

A játékvilágban az első benyomás kíméletlenül dönthet sorsokról. A BioShock-sorozat ennek ékes példája: már az első percek beszippantanak, elég csak Rapture városába alászállni, miközben Andrew Ryan szónokol a szabadságról és a kemény munkáról...

MA 18:56

A bitcoinban hívők száma 300%-kal ugrott, a friss vevők nyerőben

2025 vége óta soha nem látott mértékben nőtt a bitcoin hosszú távú tulajdonosainak száma...

MA 18:44

A Halley-üstökös talán rossz emberről kapta a nevét

🚀 A híres üstököst, amelyet ma Halley-üstökös néven ismerünk, évszázadokkal Edmond Halley előtt már ismétlődő égi jelenségként ismerhették fel...

MA 17:01

A Trump–Hszi-csúcs árnyékában is 81 ezer dollár alatt a Bitcoin

💰 Noha az elmúlt időszakban a pénzügyi piacok gyakran kilengtek a geopolitikai események hatására, az utóbbi napokban a legnagyobb kriptovaluta szinte mozdulatlanul őrzi értékét...

MA 16:34

Az eToro kitart: gyengébb első negyedév ellenére is kriptópárti

💰 Az eToro vezérigazgatója, Yoni Assia optimistán tekint a kriptodevizák jövőjére, noha az év első negyedévében a cég jelentős visszaesést tapasztalt a digitális eszközökkel kapcsolatos aktivitásban...

MA 15:56

A valódi külső nézet 15 éve rejtve az MGS2-ben, most végre megkapjuk

A Metal Gear Solid Master Collection utolsó nagy frissítése idén érkezett meg, 61 GB-nyi új textúrával gazdagítva az MGS3-at, valamint végre lehetővé tette a játékosoknak, hogy a vezérlőn megcseréljék a megerősítő és visszalépő gombokat az MGS1-ben...

MA 15:45

Az év bulija helyett összeomlás: a Spotify újdonsága leszerepelt

A Spotify húszéves jubileuma nem alakult zökkenőmentesen: az új Party of the Year(s) funkció bejelentése után a szolgáltatás órákra elérhetetlenné vált...

MA 15:34

A tokenizált állampapírok 15 milliárdnál járnak, a bitcoin megtorpan, miközben Fed-kamatfélelmek erősödnek

Például miközben a Bitcoin 80 000 dollár felett oldalazik, a digitális állampapírok piaca valósággal berobbant...

MA 15:23

A 82 ezres ütközet: a bitcoin kulcsellenállást ostromol

🛡 A bitcoin most kritikus szinten mozog, a 200 napos egyszerű és exponenciális mozgóátlag alatt, amelyek 82 455 dollárnál és 82 027 dollárnál húzódnak...

MA 15:12

Az SSD-k ára szárnyal, a DDR5-é csak toporog

Érdemes megvizsgálni, hogy napjainkban miként változnak a memória- és SSD-árak, hiszen ezek szinte mindenki pénztárcáját érintik, aki új laptop vagy alkatrész vásárlását fontolgatja...

MA 15:02

A kínai drágulás miatt borsos lehet az idei karácsony

🎁 Ez a jelenség jól illusztrálja, hogy az amerikai boltok polcaira kerülő termékek már most drágulnak, miközben a kínai gyártók évek óta először emelnek árakat, éppen a karácsonyi szezon gyártási csúcsidőszakában...

MA 14:45

A Charles Schwab az USA-ban spot kriptokereskedést indít a kisbefektetőknek

💸 A Charles Schwab amerikai brókercég megnyitotta platformját, hogy ügyfelei közvetlenül kereskedhessenek bitcoinnal és etherrel...

MA 14:34

Az OpenAI-perben Altman: Musk totális kontrollt akart, közös vezetést nem

🕵 Sam Altman tanúvallomása Elon Musk és az OpenAI közötti perben igazi szenvedélyeket váltott ki...

MA 14:23

Az Xbox mód miért hiányzik még a Windows 11 legújabb frissítése után?

Sokan észlelték, hogy a legújabb Windows 11-frissítés telepítése után sem jelent meg az Xbox-mód, holott ezt a konzolos kezelőfelületet már az április 30-i, majd a májusi frissítés (KB5089549) is elhozta néhány felhasználónak...

MA 13:57

Az MI önmásolása már nem elmélet – szakértők: korai a pánik

🤔 Noha elsőre sci-fi forgatókönyvnek hangzik, a legfrissebb kutatások bebizonyították, hogy a fejlett nyelvi modellek már képesek önállóan terjedni, sérülékeny rendszereken át replikálni magukat, és saját magukból újabb, működő példányokat létrehozni...

MA 13:45

Az iOS 27 Siri 2.0 részletei kiszivárogtak: új chat és Dynamic Island-integráció

Érdemes megérteni, hogy az Apple végre rászánta magát a Siri teljes megújítására, amely nemcsak a kinézetében, hanem a tudásában is jelentős ugrást ígér...

MA 13:02

Az orvosi rejtély: a kisbaba szeme indigókék lett COVID-ellenes gyógyszertől

Egy hat hónapos bangkoki kisfiú meglepő tünetekkel került kórházba, miután egy napja lázzal és köhögéssel küzdött...

MA 12:56

A Dark Souls 2 path tracing mod már mindenkié – és még nehezebb

A Dark Souls 2 rajongói most végre kipróbálhatják a legújabb path tracing modot, ami teljesen új megvilágításba helyezi a játék sötét világát...

MA 12:46

A RAM-apokalipszis leleplezi, mennyire rosszul gondolkodunk a végpontokról

Az informatikai eszközök cseréje évek óta rutinszerű: amikor a laptopok, PC-k lassulni kezdenek, egyszerűen jönnek az újak...

MA 12:35

Az új TCL SQD mini-LED-ek ár-értékben lenyomják az LG OLED-et

🔥 A TCL legújabb csúcskategóriás mini-LED televíziói végre hivatalos árat kaptak az Egyesült Királyságban – és az árak láttán komolyan elgondolkodik az ember: érdemesebb lehet ezek közül választani, mint egy LG OLED-modellt...

MA 12:24

Az MI-biztonság futásidőben omlik össze – a legtöbb cégnek fogalma sincs

A mesterséges intelligencia néhány év alatt az üzleti világ alapkövévé vált...

MA 10:57

A nevadai felügyelet visszavág az őket hibáztató előrejelzési piackonferenciának

A közelmúltban a Predict 2026 bejelentette, hogy a konferenciáját Las Vegasból New Yorkba helyezi át, mivel állításuk szerint a Nevada Gaming Control Board nyomást gyakorolt rájuk...

MA 10:50

A Lies of P stúdió MI-szakértőt keres, de nem a folytatáshoz

🔮 Erre utal többek között az is, hogy a Lies of P-t fejlesztő Neowiz új MI-szakembert keres, az úgynevezett „MI Creator” pozíció betöltésére...