2025. 03. 04., 18:48

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 06:59

A deepfake-láz elszabadult: célkeresztben Hollywood sztárjai

👻 A hollywoodi színészek egyre erősebben veszik fel a harcot az MI-alapú deepfake-technológiákkal, amelyek zavaróan pontosan képesek lemásolni az arcukat és hangjukat...

MA 06:49

A Reddit MI-hőse: a Runpod 44 milliárdos bevételig jutott

Néhány év alatt robbant be a techszcénába a Runpod, az MI-alkalmazásokat hosztoló startup, amely pár mezei fejlesztő hobbiprojektjéből indult — és ma már évi 44 milliárd forintos bevételnél (120 millió USD, kb...

MA 06:41

Az X visszatért: reggeli leállás után újra online

Az X közösségi oldal csaknem hatórás leállás után ismét elérhető. Reggel óta rengeteg felhasználó tapasztalt lassulást, akadozást, illetve azt, hogy az oldal egyáltalán nem töltött be...

MA 06:33

A Wall Street új kedvence az Ethereum?

📈 Az Etherealize társalapítói, Vivek Raman és Danny Ryan szerint az Ethereum túl van a szabályozási „purgatóriumon”, és esélye van arra, hogy a pénzügyi szektor első számú blokkláncává váljon...

MA 06:25

A sűrű ködben titokzatos vashasábra bukkantak

🪴 A Lant (Lyra) csillagképben található neves Gyűrűs-köd belsejében a csillagászok soha nem látott, rúdszerű vasfelhőt fedeztek fel...

MA 06:17

Az e-mail ára az egekbe szökik – botrány a Rackspace-nél

A Rackspace hosszú évekig megfizethető és népszerű e-mail tárhelyszolgáltatást nyújtott cégeknek és viszonteladó partnereinek...

MA 06:06

Történelmi események a mai napon (Január 17.)

Gyors időutazás: a Római Birodalom kettészakadása, a Desert Storm rajtja és Auschwitz kiürítése mind ezen a napon történt – sőt, a Northridge-földrengés is megrázta Los Angelest...

MA 06:03

A Slackbot, ami helyetted kódol: megérkezett a Kilo

Megvizsgálandó, miként változtatja meg a szoftverfejlesztési munkát a Kilo újítása: az MI-alapú Slackbot, amely már a csevegőszálakból képes hibajavítást, kódmódosítást és pull requestet indítani – mindezt anélkül, hogy ki kellene lépni a Slackből, vagy megnyitni az IDE-t...

péntek 21:46

Az eltűnt kőzetlemez darabja átírja a földrengéskockázatot

Új vizsgálatok szerint egy régi, eltűnt tektonikus lemez maradványa bukkant fel a Csendes-óceán fenekén, amely éppen a San Andreas- és a Cascadia-törésvonal csomópontján csúszik Észak-Amerika alá...

péntek 21:34

Az amerikai Mars-mintaprojekt véget ér: Kína lépéselőnyben

Kezdetben a NASA Mars-minta-hazahozatali programja (Mars Sample Return, MSR) a tudomány legnagyobb áttöréseit ígérte: a Perseverance marsjáró által gyűjtött, életre utaló kőzetminták visszajuttatását a Földre...

péntek 14:51

Az űripar forr: új rakéták, látványos bukások és nagy visszatérések

Az űripar soha nem látott pezsgést él át. Flottabővülés, technológiai újítások, látványos kudarcok és igen, némi szarkazmusra okot adó visszatérések egyszerre jellemzik az ágazatot...

péntek 14:33

Az új Windows 11-frissítés lefagyasztja az Outlookot – így orvosold

A januári Windows 11 biztonsági frissítés rengeteg felhasználónak okozott kellemetlen meglepetést: a klasszikus Outlook asztali alkalmazás teljesen lefagy, ha POP-alapú e-mail-fiókot használsz...

péntek 14:17

Végre lecserélheted a bénán választott Gmail-címedet!

Eljött az, amire régóta sokan vártak: hamarosan bárki lecserélheti régi, kínos vagy gyermekkori Gmail-címét egy sokkal vállalhatóbbra...

péntek 14:02

A Star Wars új ura: Dave Filoni veszi át a Lucasfilmet

👾 A Lucasfilm élére friss vezető került: Dave Filoni, akit az A Mandalóri (The Mandalorian) és A klónok háborúja (The Clone Wars) sorozatokról ismer minden Star Wars-rajongó, lett a stúdió új elnöke...

péntek 13:50

Az Antarktisz jégpáncélja alatt titkos tavak, völgyek, hegyek

Egy nemzetközi kutatócsoport példátlan részletességgel térképezte fel az Antarktisz jégtakarója alatti felszínt, új világot tárva fel, amelyet tavak, völgyek, hegyek és medencék alkotnak...

péntek 13:33

Az élet kezdetét egy halálos méreg hozhatta el?

Furcsa szereplőként jelenhetett meg a hidrogén-cianid az élet eredeténél: ez a rendkívül mérgező vegyület fagyott állapotban kristályokat hoz létre, amelyek meglehetősen aktív felületeiken különleges kémiai reakciókat indíthatnak be, akár extrém hidegben is...

péntek 13:18

Az új Star Wars-korszak Disneylandben: időutazás a Galaxy’s Edge-ben

🚀 Szinte hihetetlen, de már közel hét éve nyitotta meg kapuit a Star Wars: Galaxy’s Edge Anaheimben és Orlandóban, ahol a rajongók végre testközelből tapasztalhatták meg a messzi-messzi galaxist...

péntek 13:02

Miért kellett az űrhajósoknak vészhelyzetben idő előtt hazatérniük?

🚀 Öt hónapnyi űrbeli szolgálat után a Nemzetközi Űrállomás (ISS) Crew-11 legénysége váratlanul korán tért vissza a Földre...

péntek 12:50

Az MI levetkőztette Elon Musk gyermekeinek anyját – jön a per

Ashley St. Clair, Elon Musk egyik gyermekének anyja pert indított X (korábban Twitter) ellen, miután az oldal MI-chatbotja, a Grok, St...