MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 12:33

Az újévi fogadalmak ideje lejárt – jöhet a szerencsekártya!

A január minden évben tiszta lappal kecsegtet. Elengedheted a múlt hibáit, és úgy érezheted, hogy idén végre új ember leszel, új szokásokkal és jó szándékkal...

MA 12:18

Az új HP ZBook X G1i: a profik hordozható erőműve

Érdemes megvizsgálni, hogy a HP ZBook X G1i mennyire hozza elérhető közelségbe az asztali munkaállomások erejét akár egy hátizsákban is...

MA 12:02

A mesterséges intelligencia már 50 ezret küldött utcára 2025-ben

💀 A 2025-ös évben az elbocsátások mindennapossá váltak az amerikai munkaerőpiacon, és a mesterséges intelligencia (MI) egyre gyakoribb indokként jelent meg az állások megszűnése során...

MA 11:50

Az Elf leckéje: így őröl fel minket a megélhetés

Felmerül a kérdés, hogy mennyibe kerülne ma Buddy, a Mi a manó?..

MA 11:34

Az MI-botrány az Indie Game Awards-on: elvették a díjakat a Clair Obscurtól

A Sandfall Interactive nagy sikerű, kritikusok által elismert RPG-je, a Clair-obscur: 33...

MA 11:02

Az amerikai alap kiszáll a Sportradarból: miért most?

🏆 A kaliforniai székhelyű Global IMC jelentősen csökkentette részesedését a Sportradar Group AG-ben, több mint 7 millió dollár (kb...

MA 10:57

Végleg vége az olcsó Steam Deck korszakának

💸 A Steam Deck-rajongók számára rossz hír, hogy a Valve beszüntette az utolsó megfizethető, LCD-s modellt is...

MA 10:39

Az év rejtett gyöngyszemei: játékok, amikről lemaradtál

💎 2025-ben a videojáték-ipar elképesztő mennyiségű címet ontott magából, de szinte lehetetlen mindenre odafigyelni...

MA 10:32

Az inka kőcsodák titkai: így emelték fel a birodalmat

Az inka civilizáció építőművészetét évszázadok óta rejtély övezi. A mai Peru, Ecuador, Bolívia, Chile és Argentína területén elterülő, több mint tízmillió lakosú inka birodalom hivatalosan az 1500-as években bekövetkezett spanyol hódításig uralta a térséget...

MA 10:17

A 2025-ös társasjátékrobbanás legizgalmasabb újdonságai

🎲 A társasjáték-rajongók számára 2025 a nehézségek ellenére is kiemelkedő év lett – a vámok alaposan felforgatták a piacot, de így is rengeteg kiváló cím jelent meg...

MA 09:43

A Switch 2 olcsóbb kazettáinak titka kiszivárgott?

🔑 A Nintendo következő konzolja, a Switch 2 várhatóan olcsóbb fizikai játékkazettákat kaphat, legalábbis erre utalt egy korai, idő előtt törölt bejegyzés egy retro játékokkal foglalkozó kiadótól, az ININ Games-től...

MA 09:37

Az új Dogpile: Tetris, Balatro és kiskutyák őrült találkája

A Dogpile egy meglepően friss játék, amely ötvözi a pakliépítős stratégiát, a match-3 mechanikát, a roguelike hangulatot és persze rengeteg aranyos kutyát...

MA 09:22

Az okos kosár titka: így lesz egészséges a bevásárlás

Az egészséges táplálkozás egyik kulcsa, hogy tudatosan vásárolj az élelmiszerboltban. Egyre többen esküsznek arra a bevált módszerre, hogy elsősorban a bolt peremén keresd az alapanyagokat...

MA 09:16

Az Apple nyit, de vasmarokkal fogja az iPhone-okat Japánban

Az Apple jelentős módosításokat jelentett be a japán iOS-rendszerben, hogy megfeleljen a Mobil Szoftver Versenytörvénynek (MSCA)...

MA 09:08

A mesterséges intelligenciás autók elárasztották San Franciscót – káosz a sötétben

🚗 San Franciscót december 20-án hatalmas áramszünet bénította meg, aminek következtében a Waymo önvezető autói egyszerűen leálltak az utakon...

MA 09:02

Az Ozempic-láz kincsvadászata: a turkálás új aranykora

💎 Tíz éven át vadásztam arra a kabátra, amilyet Winona Ryder visel a Furcsa dolgok (Stranger Things) első évadában...

MA 08:59

Az igazi távcsőpárbaj: melyik Celestron 10×42 a nyerő?

A hobbifelfedezők és természetjárók szinte mind találkoztak már a 10×42-es távcsövekkel...

MA 08:36

A RansomHouse új titkosító trükkökkel riogatja az áldozatokat

Az ismert RansomHouse zsarolóvírus-csoport nemrég komoly fejlesztéseken esett át: eddigi egyszerű titkosítási eljárása helyett most egy összetettebb, többrétegű titkosítási módszert alkalmaz...

MA 08:29

A műanyagválság elharapózik – ideje lépniük a kormányoknak!

A műanyagszennyezés világszerte egyre csak nő, miközben a globális műanyag-egyezményről szóló tárgyalások évek óta elakadtak...