MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

kedd 09:44

Az elit tíz: a világ leggazdagabbjai újrarendezve

💰 A decemberi Forbes-lista szerint továbbra is az informatika, a közösségi média és a mesterséges intelligencia uralja a világ leggazdagabb embereinek rangsorát...

szerda 20:49

A Mars rejtélyes hatása: tényleg alakítja a Föld éghajlatát?

Évmilliók óta váltakoznak a jégkorszakok és melegebb időszakok a Földön, amit bolygónk pályájának és tengelyferdeségének finom változásai irányítanak...

szerda 20:33

A King Gizzard kivonul, MI-klónok lepik el a Spotify-t

🎧 Miután az ausztrál King Gizzard & the Lizard Wizard hangos tiltakozás közepette elhagyta a Spotify-t, a rajongók megdöbbenve tapasztalták, hogy a platform máris MI által generált klónokat kínál helyettük...

szerda 20:19

Az MI-chatbotok csődöt mondanak az öngyilkossági segélyvonalakon

Ez a jelenség jól illusztrálható azzal, hogy egyre többen fordulnak MI-hez lelki problémáikkal, de a legnépszerűbb chatbotok váratlanul rosszul vizsgáztak abban, hogyan reagálnak az önsértési vagy öngyilkossági gondolatokat tartalmazó kérésekre...

szerda 20:02

A lítium trónkövetelője? Berobbanhat a nátrium‑ion akkumulátor

⚡ Tipikus eset, amikor a tudósok egy váratlan áttöréssel rukkolnak elő, amely akár felforgathatja az akkumulátorok piacát...

szerda 19:50

Az eddig mért leghosszabb gammakitörés rejtélye felforgatta az asztrofizikát

🚀 Érdemes megérteni, hogy a gammakitörések (GRB) a világegyetem legnagyobb energiájú robbanásai, mégis megfejthetetlennek tűnnek...

szerda 19:34

A Bluebird-hadművelet Musk bakiját meglovagolva indítaná újra a Twittert

Tipikus eset, amikor egy kihagyott ziccer visszaüthet: egy amerikai startup úgy véli, Elon Musk végzetes hibát vétett, amikor a legendás Twittert X-re nevezte át, és ezzel végleg eltüntette a logót és a márkanevet a térképről...

szerda 19:17

Az új Spiderman adathalász-szolgáltatás Európa bankjait veszi célba

🕵 Egy új, Spiderman nevű adathalász eszköz jelent meg, amely valósághű másolatokat készít több európai bank és kriptopénztárca oldalairól...

szerda 19:01

Az Nvidia már a tartózkodási helyedet is követné: jön a nyomkövető MI‑chip

Az Nvidia új, helymeghatározásra alkalmas technológiát fejlesztett, amely képes megmondani, pontosan melyik országban működnek az MI-chipjei...

szerda 18:49

Az MI-képzés káosza: mindenki mást okol

😕 A munkahelyi MI-képzés nélkül ma már nehéz lenne lépést tartani: az alkalmazottaknak elengedhetetlen megtanulni, hogyan használják a mesterséges intelligenciát anélkül, hogy veszélyben éreznék az állásukat vagy a karrierjüket...

szerda 18:33

A manhattani dugódíj máris kitisztította a levegőt

Januárban indult New Yorkban a dugódíjrendszer, amelyben az autósok csúcsidőben 3500 Ft-ot (kb...

szerda 18:18

A gyenge kód leállítja a gyártást – milliárdos bukó a vége

💥 Meg kell vizsgálni, hogy a gyártóvállalatok miért nem engedhetik meg maguknak a gyenge szoftverfejlesztést, és miért vált kulcskérdéssé, hogy már a fejlesztés során beépüljön a biztonság, ne pedig utólag próbálják meg védeni az elkészült alkalmazásokat...

szerda 18:02

Az ultravékony nanomembrán átírhatja az orvosi implantátumok játékszabályait

Egy dél-koreai kutatócsoport új, ultravékony és rendkívül hajlékony bioelektronikai nanomembránt fejlesztett ki, amely képes szinte észrevétlenül kapcsolódni az élő szövetekhez...

szerda 17:34

Az MI‑chipversenyben a győztes már rég nem Kína

Érdekes felvetés, hogy az utóbbi évek amerikai exportkorlátozásai, amelyek célja Kína elzárása volt az élvonalbeli félvezetőktől, végül inkább Kína saját technológiai fejlesztését pörgették fel, mintsem lassították volna azt...

szerda 17:17

Az ukrán hekkernő az orosz kibertámadások titkos segítője

🕵 Az amerikai hatóságok vádat emeltek egy 33 éves ukrán nő, Victoria Eduardovna Dubranova (ismertebb nevén Vika, Tory vagy SovaSonya) ellen, mert orosz hátterű hekkercsoportokat segített kibertámadásokban világszerte, többek között amerikai vízrendszerek, választási rendszerek és atomerőművek ellen...

szerda 17:03

Jön az ausztrál tinédzser közösségimédia-tilalom: új korszak indul?

Érdemes megvizsgálni, hogy miért kelt világszerte ilyen nagy visszhangot az ausztrál döntés, amely elsőként tiltotta be országos szinten a 16 év alattiak közösségi médiához való hozzáférését...

szerda 16:49

Az adelaide-i zöldterületek fenntarthatósága veszélyben?

Adelaide városának zöldterületei kulcsszerepet játszanak a klímaszabályozásban, a biodiverzitás megőrzésében és az élhetőség javításában...

szerda 16:33

A perzselő hőség hátráltatja a kisgyermekkori fejlődést

A szokatlanul magas hőmérséklet miatt a kisgyerekek egyre nehezebben érik el a korai tanulási mérföldköveket, leginkább az olvasás és a matematika terén...

szerda 16:17

A Mars-utazás küszöbén állunk – tényleg ennyire közel?

Az Egyesült Államok Tudományos, Mérnöki és Orvostudományi Akadémiái egy átfogó jelentésben részletesen bemutatják, miért lenne sorsfordító, ha végre űrhajósokat küldenénk a Marsra...