2025. 03. 04., 18:48

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 14:01

Az új iOS gyorsan meríti az iPhone-t? Nyugi, normális!

Kiugrott az új iOS 26.4 március 24-én, hozott magával egy rakás izgalmat: végre saját videós podcastok pörögnek az Apple Podcastsban, némi hibajavítás is becsúszott, meg persze még pár apróság...

MA 13:56

Az Anthropic szigorít: csúcsidőben drágul az MI-csevegés

⚠ Az Anthropic szerdán váratlan fordulattal módosította a Claude nevű MI-szolgáltatás időalapú felhasználási korlátait...

MA 13:45

Az új Langflow-sebezhetőségre már rárepültek a hackerek

A Langflow-keretrendszer egy súlyos sebezhetőség miatt került veszélybe, amelyet a hackerek már aktívan ki is használnak...

MA 13:34

A kisbefektetők pánikban szórják a bitcoint, a nagyok kivárnak

A bitcoin megint zuhan, most épp 24,5 millió forint alá esett egy darabja, és ahogy ez lenni szokott, előkerül a pánikgomb: akik 10 bitcoint (vagyis nagyjából 245 millió forintnyit) tartanak vagy annál kevesebbet, szó szerint menekítik a vagyonukat...

MA 13:23

A legjobb gamepadok egyike most fillérekért elvihető

🎮 Egy lényeges szempont, hogy a hardverhiány miatti áremelkedés főként a belső alkatrészekre volt jellemző, de a perifériák ára nagyrészt stabil maradt...

MA 12:01

A pumpamentes átfolyós akkumulátor: tényleg ez a jövő?

Most őszintén, észrevetted már, hogy a legtöbb flow battery (átfolyós akkumulátor) bonyolult pumpákkal van telepakolva?..

MA 11:44

A nagy blama: milliárdok menekülnek a bitcoin ETF-ekből

💸 Csütörtökön nagyot rándult a piac: a befektetők egyetlen nap alatt 62 milliárd forint értékű – azaz 171 millió dollárnyi – tőkét vontak ki az amerikai bitcoin ETF-ekből...

MA 11:11

Lezárul egy korszak: az Apple kivezeti a Mac Pro-t

Szevasz, Mac Pro, hello, régi idők! Az Apple minden megmaradt Mac Pro-rajongónak most azt üzeni: köszi, ennyi volt...

MA 11:01

Az Apple lebuktatja az iCloud+ álcímeket – így buksz le

Azt hinnéd, elég, ha iCloud+-on elrejted az igazi e‑mail-címedet a Hide My Email funkcióval, de nem...

MA 10:50

A valódi holland hackerjátszma: mélymerülés a rendőrség rendszereibe

🕵 Na hát ennyit erről, de aztán jön a váratlan fordulat: a holland rendőrség kénytelen volt elismerni, hogy őket is célba vették egy ügyes adathalász-támadással...

MA 10:43

A Samsung böngészője mostantól pénzt spórol a kasszánál

💸 A Samsung hamarosan új, Smart Shopping nevű funkcióval bővítheti népszerű böngészőjét, amely automatikusan kuponokat keres és alkalmaz különböző webáruházakban...

MA 10:37

Az űrutazás árnyoldala: a súlytalanság tönkreteheti a fogantatást

👽 Az űrutazás újabb hátulütővel szembesített minket: a súlytalanság gyakorlatilag lehetetlenné teszi a sikeres szaporodást...

MA 10:29

Az új Tether-audit: jön a KPMG, milliárdok a tét

A Tether, a világ legnagyobb stabilcoin-kibocsátója, átfogó pénzügyi átvilágítást indított az USDT tartalékairól, a 185 milliárd dollárt (kb...

MA 10:22

Az anonim bűnügyi bejelentések tényleg nem biztonságosak?

Ilyen eset például, amikor az ember teljes biztonságban érzi magát egy anonim rendőrségi bejelentőfelületen, majd pár kattintás után kiderül, mennyire könnyen kijátszható a rendszer...

MA 10:16

Az ősi barlang, ahol kiderült: rokonok voltak a neandervölgyiek

Egy apró, 110 000 éves csontdarab a híres Denisova-barlangból Szibériában újabb részleteket tárt fel a neandervölgyiek életéről...

MA 10:08

Az éhező méhek titkos fegyvere: szuperélelmiszerrel újraindul a beporzás

🦋 A világ méhpopulációja évek óta aggasztó ütemben csökken, és ez hatalmas kockázatot jelent az élelmiszer-ellátásra...

MA 10:01

Az Ajax adatvédelmi botránya: veszélybe kerültek a szurkolók

💀 Kezdetben a holland Ajax Amsterdam futballklub informatikai rendszerében olyan sebezhetőséget találtak, amelyhez egy hacker férhetett hozzá...

MA 09:57

Az új Google Gemini: most tényleg itt az MI-forradalom

Végre itt egy MI-funkció, amire tényleg vártunk! A Gemini mostantól lehetőséget ad arra, hogy gond nélkül áthozd minden csevegésedet és adatodat más mesterségesintelligencia-alkalmazásokból...

MA 09:36

Az Android 17 berobbanthatja a VPN-ek forradalmát

Úgy tűnik, a Google az Android-felhasználók egyik legidegesítőbb problémájára készül megoldást adni...

MA 09:30

Az antarktiszi bálnák diadalmas visszatérése ismét veszélyben

Az elmúlt évtizedekben csendben, de látványosan elkezdődött a bálnapopulációk regenerálódása a Déli-óceán vad vizeiben...

MA 09:22

Az új Google Search Live teljesen átírhatja a netes keresést

🔍 A Google forradalmi Search Live funkciója már 200 országban, 98 nyelven elérhető, és teljesen új szintre emeli az online keresést...

MA 09:15

A Mac Pro sorsa megpecsételődött: az Apple végleg lemond róla

💀 Az Apple hivatalosan is megszünteti a legendás Mac Pro asztali gépét, amelyet csütörtökön el is távolítottak a cég weboldaláról...

MA 09:01

A Wikipédia kitiltja az AI-t: vége a gépi zagyvaságnak

🚫 Búcsút inthetünk az AI-zabált cikkeknek a Wikipédián, mert az óriási, szabad enciklopédia végre kimondta: nincs több robotírás, kivéve néhány nagyon ritka esetben...

MA 08:57

Az ezeréves oltár véres titkai: emberáldozatok Tulában

Egy több ezer éves oltár került elő Mexikóban, amelyet a Tolték Birodalom idején emberáldozatokhoz használtak...

MA 08:51

Az Anthropic súlyos adatbiztonsági bakija: kiszivárgott a titkos MI-fejlesztés

🔒 Fontos kérdés, hogy mennyire biztonságosak a vezető technológiai cégek adatkezelési megoldásai, amikor egy apró figyelmetlenség is komoly belső információk kiszivárgásához vezethet...

MA 08:36

A szerelem két lakcím között: együtt, mégis külön

Mindenki ismeri azt a klasszikus szerelmi menetet: megismerkedés, összejövetel, majd összeköltözés – mintegy a kapcsolat komolyságának bizonyítékaként...

MA 08:22

Az új Gemini-frissítés: zökkenőmentes váltás, könnyebb mindennapok

A Gemini mostantól lehetővé teszi, hogy minden eddiginél egyszerűbben válts más MI-csevegőalkalmazásról úgy, hogy közben nem veszítesz el semmit a korábbi beszélgetéseidből vagy emlékeidből...

MA 08:15

Az új One UI 8.5 felpörgeti a Samsung Linux terminált

💻 A One UI 8.5 verzióval jelentős fejlesztések érkeztek a Linux Terminálhoz az Exynos-alapú Samsung mobilokon...

MA 08:01

A megfizethető 10 GbE switch, ami megváltoztatja a hálózatodat

A SICSOLINK SFP-J06Q-HG2-US igazán szokatlan látvány: ez a nyolcportos, 10 gigabites Ethernet switch már első pillantásra felhívja magára a figyelmet rikító zöld és narancssárga előlappal...