MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk.
A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.
Nem egészen a klasszikus játék
Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.
A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.
Meglepő eredmények
A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.
A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.
A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.
Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.
De legalább nézhetjük, ahogy az MI Mariót játszik.
filózó
Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?
A techóriások eddig messzire kerülték, hogy felelősséget vállaljanak azért, ha termékeik vagy szolgáltatásaik hibásan működnek, vagy félrevezető információkat adnak...
A legtöbb vállalat manapság egyszerűen csak rá akarja húzni a mesterséges intelligenciát egy olyan működési modellre, amelyet még a múlt század stabil, kiszámítható világára szabtak...
Senki sem várta volna, hogy egy amerikai nő, akit gyerekként untatott az Apollo–11 holdraszállása, egyszer egy több mint 650 milliárd forintot érő vállalat egyik arca lesz – és története még ma is elképesztően inspiráló...
Erre utal többek között az, hogy a Microsoft hat alapvető Windows-alkalmazást fejlesztett tovább egy átfogó frissítéssel: a Photos, Paint, Calculator, Clock, Media Player, valamint a Voice Recorder újdonságokat kapott...
Az Oxfordi Egyetem kutatói egy teljesen újfajta kvantumszuperpozíciót hoztak létre, amely a híres Schrödinger-macska gondolatkísérletnél is érdekesebb eredményeket mutat...
A szén-dioxid újrahasznosítása metanollá hosszú ideje a vegyipar egyik nagy ígérete, mégis makacs akadályokba ütközött a folyamat tökéletesítése során...
Az új tudományos fejlesztéseknek köszönhetően végre olyan fehérjeturmixok kerülhetnek az asztalodra, amelyek nemcsak egészségesek, hanem ízre és állagra is jóval kellemesebbek...
Fizetős iOS appok és játékok, amik ingyenesek a mai napon. Inkflow Plus Visual Notebook (iPhone/iPad)Az Inkflow egy vizuális gondolkodást támogató alkalmazás...
Érdemes megvizsgálni, miért fizet valaki 3 millió dollárt (nagyjából 1,1 milliárd forintot) egyetlen videojátékért: egy ritka, bontatlan Super Mario testvérek (Super Mario Bros.)..
A legújabb kutatás szerint a prediabéteszből – vagyis a cukorbetegséget megelőző állapotból – visszaforduló embereknél jelentősen csökken a szív- és érrendszeri halálozás esélye...
🕵 Egy összehangolt akcióban az FBI, a Google és a Black Lotus Labs közösen számolták fel a hatalmas kínai Outsider Enterprise adathalász-hálózatot, amely több ezer hamis weboldallal próbált hitelkártyaadatokat és jelszavakat megszerezni...
🔐 Képzeld el, hogy úgy nyitod ki a bejárati ajtót, mintha A Jedi visszatérben (Return of the Jedi) használnád az Erőt – elég, ha felemeled a tenyered...
A NASA X-59 kísérleti repülőgépe új mérföldkövet ért el: nemrég sikeresen teljesített egy tesztrepülést, amelyen szuperszonikus sebességgel, nagy magasságban repült...
💀 Érdemes megvizsgálni, hogy a régmúlt földimókusai milyen meglepő szokásokkal rendelkeztek, amelyek fényt derítenek izgalmas ökológiai kapcsolatokra a jégkorszak idejéből...
✏️ Érdekes felvetés, hogy egy modern digitális eszköz képes lehet visszahozni a kézzel írás élményét, ráadásul úgy, hogy lemond a mai tabletek szinte kötelező bonyolultságáról...
Viharos háborúk, birodalmak sorsa és sorsfordító természeti katasztrófák jelölik ezt a napot: a rigómezei ütközet és a Mount Pinatubo pusztító kitörése mellett II...
Sokan vásároltak iPhone 16 vagy iPhone 15 Pro készüléket abban a reményben, hogy az Apple által beharangozott, vadonatúj okosfunkciókat azonnal használhatják...
Egykori rendszergazda miatt bénult le egy iowai iskolai körzet: 21 hónap börtönre ítélték, miután hónapokon keresztül támadta volt munkahelyének rendszereit...