MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk.
A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.
Nem egészen a klasszikus játék
Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.
A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.
Meglepő eredmények
A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.
A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.
A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.
Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.
De legalább nézhetjük, ahogy az MI Mariót játszik.
filózó
Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?
Az idei nyár 39 napján világszerte emberek milliárdjai ülnek le ugyanabban a pillanatban, hogy együtt kövessék a 2026-os labdarúgó-világbajnokság izgalmait...
🏆 Fontos kérdés, hogy fel tudja-e rázni a fociláz New Yorkot az utolsó pillanatban, hiszen a világ legnagyobb futballeseménye, a világbajnokság hamarosan itt, az Egyesült Államokban veszi kezdetét...
💡 A 27 hüvelykes KTC M27T6S nem csupán egy újabb monitor a piacon – igazi mérföldkő azoknak, akik nem akarnak több százezret költeni egy igazán jó HDR kijelzőre...
🚀 A NASA a következő években minden eddiginél bonyolultabb űrmisszióra készül, amely egyesíti az emberes űrrepülés hagyományát az új technológiákkal...
📦 Ennek megfelelően egy jelentős, 650 millió dolláros (kb. 235 milliárd forintos) hitelprogram indul az amerikai gyártó- és energetikai szektorban, innovatív digitális pénzügyi megoldásokkal...
A brit pénzügyi felügyelet most először engedélyezné, hogy az ország néhány befektetési alapja a vagyonának akár 10%-át kriptoeszközökhöz kapcsolódó tőzsdén kereskedett kötvényekben (crypto ETN) tartsa...
A kriptovaluták piacán a nyár előtt komoly bizonytalanság uralkodik, miközben a Bitcoin és a technológiai részvények között ritkán látott különbség alakult ki...
😍 Érdemes megvizsgálni, hogy a PC-alkatrészek egyre dráguló világában mennyire számít üdítő kivételnek a Koorui 34E6UC, egy pénztárcabarát, 34 hüvelykes, ultrawide monitor...
A NASA hivatalosan is bemutatta az Artemis III négyfős legénységét június 9-én Houstonban, amelynek tagjai 2027 végén egy különleges küldetésre indulnak majd...
Valóra váltak a pletykák: a legendás A Zelda legendája: Az idő ocarinája (The Legend of Zelda: Ocarina of Time) megújul, és kizárólag Nintendo Switch 2-re, 2026-ban jelenik meg...
Nagyjából fél éve hallani pletykákat arról, hogy az Nvidia újabb Super modellekkel bővítené a legújabb RTX-szériát, ám a memóriapiac nyűgjei miatt eddig semmi konkrétum nem derült ki...
👑 A Halo: Combat Evolved ismét visszatér, de most tényleg nagyot újítanak: nemcsak egy sima felújításról van szó, hanem teljes értékű remake készül Halo: Campaign Evolved címmel...
😤 Jeremy Clarkson szokásához híven ismét bizonyítja, hogy lelkesedése mellett elképesztően ügyetlen, ha gyakorlati teendőkről van szó – és ez a Clarkson farmja (Clarkson’s Farm) ötödik évadában csak még látványosabbá válik...
🌲 A Computex 2024 kiállításon az egyik legszokatlanabb hardverújdonság a Montech Ten Wood PC-ház volt, ami nemcsak a szemnek, de az orrnak is újat kínál...
A Roskomnadzor, az orosz médiahatóság meghökkentő lépésre készül: egységes, állami VPN-szolgáltatást hozna létre, hogy az ország IT-szakemberei megkerülhessék a rájuk vonatkozó internetes korlátozásokat...
A Nevada–Kalifornia határ mentén lenyűgöző képet mutat a világűrből nézve három egymás mellett elterülő, de teljesen eltérő megjelenésű tó: Tahoe, Walker és Mono...
Az alkohol és az egészség kapcsolatáról szóló legfrissebb amerikai kutatás szerint már napi egy ital is érezhetően megnöveli a korai halálozás kockázatát...
Az iPhone-tulajdonosok számára idén izgalmas újdonságokat tartogat az iOS 27 frissítés, amely többek között néhány változást hoz az Apple Music felületén is...
💸 A kanadai Windscribe VPN-szolgáltató újabb szintre emeli az anonim internetezést, ugyanis mostantól készpénzes fizetést is lehetővé tesz az éves előfizetéshez...
😷 2026 júniusának elejére kevesebb mint egy hónap alatt már több mint 569 megerősített Ebola-fertőzöttet regisztráltak Ugandában és a kelet-kongói Ituri tartományban...