MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 18:17

Az univerzum tényleg sötét energia nélkül száguld egyre gyorsabban?

💫 Miért tágul egyre gyorsabban az univerzum? Ez még mindig a fizika egyik legnagyobb rejtélye...

MA 18:01

Az Ethereum sorsa a zéró‑tudású bizonyítékokon áll vagy bukik

Az utóbbi időszakban az Ethereum hatalmas áttöréseket ért el a zéró‑tudású bizonyítékok (zero-knowledge proofs) területén, amelyekre a fejlesztők a hálózat középtávú fejlesztési tervének alappilléreiként tekintenek...

MA 17:33

Az új kávéáttörés hatékonyabb a diabétesz elleni gyógyszereknél

☕ Érdemes megvizsgálni, hogy a pörkölt kávé nem csupán az ébredésben segít: kutatók új, eddig ismeretlen vegyületeket azonosítottak benne, amelyek rendkívül hatékonyan gátolják a szénhidrátok vércukorra gyakorolt hatását...

MA 17:18

Az amerikai ritkaföldfém-álom szertefoszlik: Grönlandon esélytelen a kitermelés

🌎 Ebből következően érdemes megérteni, hogy Grönlandon mintegy 1,5 millió tonna ritkaföldfém rejtőzik a kőzetben, amelyekre a csúcstechnológiai ipar éhezik, mégis szinte lehetetlen hozzájuk férni...

MA 16:50

Az agyhártyagyulladás új hulláma: veszélyben a tinédzserek?

💉 A baktérium okozta agyhártyagyulladás esetei az Egyesült Államokban aggasztó ütemben emelkednek, miközben a tinédzserek oltási hajlandósága csökken...

MA 16:33

Eleged van az iPhone folyékony üveg kinézetéből? Így változtasd meg

Az Apple novemberben elérhetővé tett egy frissítést, amellyel végre testre szabhatóvá váltak az úgynevezett folyékony üveg (Liquid Glass) vizuális elemek az iPhone-on...

MA 16:18

A CES 2026 öt legizgalmasabb tévéje, mindet kipróbálnám

📺 A 2026-os CES ismét lélegzetelállító újdonságokat hozott a tévévilágban. Igazi sztár lett az RGB mini-LED technológia – ahogy a különböző gyártók hívják: RGB mini-LED, Micro RGB vagy RGB mini...

MA 15:51

Az alattomos szívroham jelei – mit tegyél azonnal?

Érdemes megérteni, hogy a szívroham nemcsak az idősebbeket vagy a szívproblémásokat érintheti, hanem bárkit, bármilyen életkorban...

MA 14:49

Jön a személyi az appboltokhoz? Politikusok szigorítanának

Az appboltok mára kapuként működnek: innen telepítesz mindent a telefonodra, de hamarosan még egy akadályba ütközhetsz...

MA 14:35

A 6 kötelező lépés a telefon gyári visszaállítása előtt

📱 Akár eladás előtt, akár csak szükségből időnként gyári visszaállítást végzel a telefonodon, érdemes pár előzetes lépést megtenni, hogy később ne érjen kellemetlen meglepetés...

MA 13:50

A Google Maps hangos navigációja: tényleg megbízható, vagy csak idegesítő?

Érdemes belátni, hogy manapság mennyire számítunk a navigációs alkalmazásokra, különösen autózás közben...

MA 13:34

Az örök Finke-folyó: 400 millió éve dacol az idővel

💧 Érdemes megérteni, hogy a folyók sem örökéletűek: életciklusuk van, akárcsak a hegyeknek vagy más természeti képződményeknek...

MA 13:03

Az új MI-alapú közösségi app rendet tesz, vagy káoszt szül?

Egyre többen érzik úgy, hogy a mai közösségi oldalak inkább rombolják, mint építik a társas kapcsolatokat: a tartalmat algoritmusok uralják, ismeretlen emberek videói lepik el a hírfolyamot, személyesség és jelentés helyett csak lájkvadász, időrabló zaj marad...

MA 12:49

A Tennessee-i hatóságok keményen fellépnek az illegális sportfogadás ellen

Tennessee állam hatóságai felszólították a Kalshit, a Polymarketet és a Crypto...

MA 12:17

Az óriási kozmikus szendvics: így születnek a bolygók a Hubble szerint

🥪 Egy különös, szendvicsre emlékeztető objektum minden korábbinál izgalmasabb bepillantást nyújt abba, hogyan formálódnak a bolygók...

MA 11:49

Az űr tovább telik: újabb Starlink-műholdak lepik el az eget

🛰 A SpaceX zöld utat kapott az amerikai hírközlési hatóságtól, hogy további 7 500 Starlink Gen 2 műholdat indíthasson, így összesen már 15 000 ilyen eszközt küldhet fel az űrbe...

MA 11:33

Az aranybogyó új korszaka: CRISPR teremti a szupergyümölcsöt

Az aranybogyó, vagy más néven goldenberry, régóta csábítja a fogyasztókat különleges ízével és magas tápértékével, de eddig igazi rémálom volt nagyüzemi méretekben termeszteni...

MA 11:03

A jó szellőzés tényleg megállítja az influenzát?

😷 Érdekes megfigyelés: amikor influenzás betegeket egészségesekkel zártak össze egy szobába, senki sem betegedett meg...

MA 10:57

Az X algoritmusa hamarosan mindenki kezébe kerül

🚀 Elon Musk bejelentette, hogy az X (korábban Twitter) új ajánlórendszerének algoritmusa – beleértve minden kódot, amely meghatározza, hogy mely organikus és hirdetési bejegyzéseket javasolja a platform a felhasználóknak – bárki számára elérhetővé válik a jövő héten...