2025. 03. 04., 18:48

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 07:22

Az óceán mélyének titkos fegyverei: szuperdiagnosztikus fehérjék

🐋 Elképesztő ellenállóképességű, eddig rejtett fehérjék kerültek elő izlandi vulkáni tavakból és az Atlanti-óceán fenekén húzódó hidrotermális kürtők mélyéről...

MA 07:15

Az AppsFlyer Web SDK körül kriptolopási botrány robbant

🚨 Az AppsFlyer Web SDK-t egy rövid időre feltörték, és rosszindulatú kódot juttattak a rendszerbe, amellyel kriptovaluták ellopására alkalmas támadást hajtottak végre...

APP
MA 07:11

APPok, Amik Ingyenesek MA, 3/15

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     ForkYa!..

MA 07:08

Az ALS-fehérje lehet a hiányzó láncszem rák és demencia közt

🧠 Egy kulcsfontosságú fehérjéről, amely eddig főként az ALS-hez (amiotrófiás laterálszklerózis) és a demencia egyes formáihoz, például a frontotemporális demenciához kötődött, most kiderült, hogy jóval átfogóbb betegségi folyamatokban játszik szerepet, mint korábban gondolták...

MA 07:02

A kötelező fedélzeti kémkedés 2027-től jön

A következő autód már nemcsak a titkaidat őrzi, hanem mindent figyel majd veled kapcsolatban...

MA 06:58

A Mars ősi pókhálója: titokzatos víznyomok a vörös bolygón

🔬 Érdekes, pókhálószerű mintázatot fedezett fel a Curiosity a Mars felszínén. Ezek az egybefonódó, keskeny, 1-2 méter magas gerincek úgy szelik át a tájat, mint egy óriási pókháló, és a kutatók szerint fontos bizonyítékot hordoznak a bolygó vízmúltjáról...

MA 06:43

Hosszú szünet jön az F1-ben: a közel-keleti háború törölte a futamokat

🏁 Most őszintén, feltűnt már, hogy a Forma-1 vezetősége tényleg nem szeret kockáztatni?..

MA 06:36

Az új Spotify-csoda: mostantól te irányítod a zenét

A Spotify új csodafegyvere, a Taste Profile mostantól rád bízza, hogy finomhangold az algoritmus zenei ajánlásait...

MA 06:30

Az MI-hallucinációk tényleg rávesznek minket a túlköltésre?

Az elmúlt időszakban a San Diegó-i Kaliforniai Egyetemen végzett kutatás meglepő eredményre jutott: ha az emberek MI által készített termékösszefoglalókat olvasnak, nagyobb valószínűséggel döntenek a vásárlás mellett, mint amikor ember által írt értékelést olvasnak el...

MA 06:22

Az ikerrejtély: Elárulja-e a DNS, ki a tettes?

Felmerül a kérdés, hogy az egypetéjű ikrek megkülönböztethetők-e egymástól, ha DNS-nyomot hagynak egy bűncselekmény helyszínén...

MA 06:08

Az Apple ötven éve másképp gondolkodik – ez a titka

Ötven évvel ezelőtt egy apró garázsban indult útjára egy nagy ötlet, amelynek lényege az volt, hogy a technológia legyen minél személyesebb...

MA 06:06

Történelmi események a mai napon (Március 15.)

Erős nap a történelemben: kitör a magyar forradalom, lemond az utolsó orosz cár, és megszületik az első internetes domain...

szombat 21:46

Az ausztrál laborokban tápfolyadékot kapnak az idegsejtek

🧠 A nap kezdetén a melbourne-i Cortical Labs adatközpontjában nem a kávé és a szerverek zaja jelenti a rutint: a technikusok először egy agy-gerincvelői folyadékra emlékeztető oldatot töltenek a számítógépekbe...

szombat 21:35

Az E Ink monitor, amit jobb, ha csak megálmodsz

A Bigme B251 egy szemet gyönyörködtető újdonságként próbál berobbanni a monitorpiacra, hiszen 25,3 colos színes E Ink kijelzővel várja a felhasználókat...

szombat 21:23

Az új MacBook Air M5: király, vagy örök középső?

💻 Oké, mindenki figyeljen: megjelent az új MacBook Air M5, de ha instant forradalmat vársz, csalódni fogsz...

szombat 21:12

Az új MacBook Neóból ezek az appok hozzák ki a maximumot

💻 Az új MacBook Neo az Apple-től váratlanul alacsony áron jelent meg a héten, ami nagy meglepetést keltett a technológiai világban...

szombat 21:01

Valóban elűzi az internet unalmát a BuzzFeed kreatív játszótere?

A BuzzFeed ismét robbant: a cuki kvízeiről elhíresült oldal most egy igazán bevállalós új projektet indított Branch Office néven...

szombat 20:45

A papírnaptár, amelyre a Google Naptár is féltékeny

Oké, valljuk be: a hagyományos papírnaptárat még mindig semmi nem tudja teljesen kinyírni...

szombat 20:34

Az eltűnt skóciai római erőd titkainak nyomában

Skóciában régészek egy eddig ismeretlen római erőd maradványaira bukkantak, a Hadrianus-faltól jóval északabbra...

szombat 20:23

Az önellátás kulcsa: áram és meleg víz fából

Fontos kérdés, hogyan lehet megbízhatóan áramot és meleg vizet előállítani úgy, hogy közben nem függünk a nagy energiaszolgáltatóktól...

szombat 20:12

Végre megszületett a legendás hatszögletű gyémánt?

💎 Egy új kínai kutatás meggyőző bizonyítékokkal támasztja alá, hogy sikerült előállítani a régóta vitatott hatszögletű gyémántot, amely minden eddigi anyagnál keményebb lehet...

szombat 20:02

Az amerikaiak negyede már bedől a deepfake-hívásoknak – megállíthatatlan az MI?

Az elmúlt egy évben az amerikaiak 25 százaléka tapasztalt deepfake hanghívást: ismerősnek tűnő, ám mesterségesen klónozott hanggal próbáltak pénzt vagy adatokat kicsalni tőlük...

szombat 19:56

A virágokat tényleg az evolúció mentette meg a kihalástól?

2012 és 2015 között Kaliforniában az elmúlt 10 ezer év legsúlyosabb aszálya pusztított...

szombat 19:46

Az MI új fegyvere: miként válik a GPS a hajózás rémálmává?

🚢 A modern tengerhajózás ma már elképzelhetetlen GPS-navigáció nélkül. Olajszállító óriások, kutatóhajók és rakományt szállító hajók mind-mind a műholdas helymeghatározásra támaszkodnak...

szombat 19:35

Az olaj végnapjait éli, a Nap vándorol, a QR-kód zsugorodik

🌑 Régészeti felfedezések sora kavarta fel a tudományos világot: egy cseh kerti pajta alapkövéről derült ki, hogy valójában egy 3300 éves bronzkori öntőforma, amellyel sarlókardokat készítettek...

szombat 19:23

Az éghajlatváltozás már a Föld forgását is lassítja

🌎 A Föld forgása jelenleg olyan ütemben lassul, amilyenre legalább 3,6 millió éve nem volt példa...

szombat 17:45

Az óriási örvények titka tárul fel Grönland jégpáncélja alatt

Grönland hatalmas jégtakarójának mélyében óriási, örvénylő struktúrákat fedeztek fel tudósok, amelyek olykor forrongó üsthöz hasonlóan mozognak...

szombat 17:35

A vakbél: felesleges szerv vagy az evolúció rejtett aduásza?

Az emberek többsége akkor szembesül a vakbelével, amikor az fájdalmassá válik, és életveszélyes gyulladás miatt műtétre van szükség...

szombat 17:23

Az új Snapdragon-bakit villámgyorsan javítják – megéri most frissíteni?

⚡ Fontos kérdés, hogy a legújabb Snapdragon 8 Elite Gen 5 csúcstelefonokat egy komoly sebezhetőség érinti, amelyet a Xiaomi ShadowBlade Security Lab kutatói fedeztek fel...