MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 16:34

Az MI-kütyük pocsékul fogynak – ezt már a Logitech is mondja

Az utóbbi időben minden startup arról álmodik, hogy az MI-t saját hardverrel forradalmasítsa, ám egyelőre sorra buknak el a próbálkozások...

MA 16:20

A mesterséges intelligencia sötét oldala: botrányok, veszélyek, diszkrimináció

Megemlíthető, hogy a mesterséges intelligencia mindennapjaink egyre több területén jelenik meg...

MA 16:02

A kozmikus káosz ura: mit rejt a TXS 0518+211 blazár?

A TXS 0518+211 nevű közeli blazárt indiai csillagászok vizsgálták tizenhat éven keresztül a Swift és a Fermi űrteleszkópokkal, minden hullámhosszon...

MA 15:49

Az Apple-vezetők sorra lépnek le, Siri már a Google-re vár

🚨 Az Apple háza táján tovább gyűrűzik a vezetői átrendeződés: újabb két kulcsember jelentette be távozását...

MA 15:34

Az Ofcom 2026-tól drasztikusan szigorítaná a fájlok ellenőrzését

🔏 Az Egyesült Királyság új csúcsra járatja az internetes fájlmegosztás ellenőrzését: az Ofcom 2026-ban kiterjesztené a gyermekek online biztonságáról szóló törvény miatt bevezetett felügyeletet a felhőalapú tárolókra, fájlmegosztókra és más hasonló szolgáltatásokra...

MA 15:17

Végre gyerekjáték visszaszerezni az ellopott Facebook- és Instagram-fiókokat?

🔑 A Meta bejelentette, hogy új, központosított támogatási központot indít Facebook- és Instagram-felhasználóknak, hogy egyszerűbbé és gyorsabbá tegye az ellopott vagy feltört fiókok visszaszerzését...

MA 15:02

A fizika új húzása: kvantumfeladatok laptopon, nem szuperszámítógépen

Kvantumproblémákat már nemcsak szuperszámítógépek és MI segítségével lehet megoldani: új módszernek köszönhetően hétköznapi laptopok is képesek komplex szimulációkat futtatni, akár pár óra alatt...

MA 14:49

A műholdak gigacunamit jeleznek – újraírják az előrejelzéseket

2025 júliusában a Kuril–Kamcsatka földrengés után a NASA és a CNES SWOT műholdja először részletesen rögzítette egy óriási szökőár középóceáni szerkezetét...

MA 14:18

Az eltűnés küszöbén az ausztrál sivatagi víznyelők rejtett élővilága

Érdekes felvetés, hogy Ausztrália középső, kietlen sivatagjában nem is gondolnánk, milyen gazdag és különleges élet rejtőzik a kőbe vájt víznyelőkben...

MA 14:02

Az MI-őrület az egekbe lövi a Foxconn bevételeit

A Foxconn, amely Hon Hai néven is ismert, látványos, 26%-os éves árbevétel-növekedést jelentett be novemberre, miután soha nem látott kereslet alakult ki az MI-alapú szerverek iránt...

MA 13:50

A tajvani hatóságok lecsaptak a RedNote-ra – újabb kínai app-tilalom

🛡 Tajvan egy évre szóló országos tiltást rendelt el a kínai Xiaohongshu (RedNote) közösségi alkalmazással szemben, miután a hatóságok szerint több ezer csalási ügy kapcsolódik hozzá...

MA 13:33

A Cloudflare újraélesztette az internetet a globális leállás után

Világszerte ismét elérhetővé váltak a népszerű weboldalak, miután a Cloudflare gyors javítást adott ki egy, az irányítópultját és kapcsolódó alkalmazásait érintő hibára...

MA 13:17

A Futtatás ablak végre normális dizájnt kapott Windows 11-en

🚀 Több mint harminc év után a Microsoft végre megújítja a Windows egyik legrégebbi eszközét: a Futtatás (Run) ablakot...

MA 13:04

Az ész ára: miért lettünk tudatosak?

🧠 Az emberi tudat kialakulásának okait vizsgálva hamar szembetűnnek a hiányzó mozaikdarabok...

MA 12:50

A Binance új titánja: Yi He, a háttérből irányító társigazgató

🛡 A Binance, a világ legnagyobb kriptovaluta-tőzsdéje jelentős átalakuláson megy keresztül: Yi He, a társalapító mostantól társigazgatóként áll a cég élén Richard Teng mellett...

MA 12:35

A legújabb Öt éjszaka Freddyéknél-film belegabalyodik a saját rémtörténetébe

A játékadaptációk aranykorát éljük, ahol olyan sorozatok, mint az Az utolsók közülünk (The Last of Us), vagy akciódús filmek, például a Sonic, a sündisznó (Sonic the Hedgehog) nemcsak tiszteletben tartják az eredeti anyagot, hanem új rajongókat is vonzanak...

MA 12:17

Az óceánok kiürülnek: csúfosan elbukott a halászati szabályozás

🐟 Fontos kérdés, miként lehetne megvédeni a világ óceánjainak élővilágát, amikor az ipari halászat továbbra is túlhasználja ezeket a vizeket...

MA 11:49

A rejtélyes vulkán, amely kirobbantotta a Fekete Halált?

A 14. század közepén történt titokzatos vulkánkitörés alaposan felforgatta Európa középkori történelmét...

MA 11:34

A Netflix bekebelezi az HBO-t és a Warner Bróst? Jöhet a gigadeal

💸 A Netflix jelenleg kizárólagos tárgyalásokat folytat a Warner Bros. Discovery filmes és tévés stúdióinak, valamint az HBO Max streamingszolgáltatásának megvásárlásáról...