MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

MA 09:30

A Taung-gyermek: hogyan vált Afrika az emberiség bölcsőjévé

🐒 1924 végén Raymond Dart dél-afrikai antropológus egy aprócska koponyát faragott ki a kőzetből, amely alapjaiban írta át az emberi fejlődés történetét...

MA 09:22

Az FCC kitiltja a külföldi drónokat – lehull a lepel

Az amerikai Szövetségi Kommunikációs Bizottság (FCC) frissen meghozott döntése szerint mostantól tilos külföldi gyártású drónokat az Egyesült Államokban új értékesítésre vagy importálásra jóváhagyni, nemzetbiztonsági okokra és kémkedési félelmekre hivatkozva...

MA 09:03

Az OpenAI figyelmeztet: az MI-böngészők örökké sebezhetők

⚠ A mesterséges intelligenciával működő böngészők új színt hoznak az internetes biztonsági játszmába, de lényeges szempont, hogy a prompt injection támadások, vagyis a rejtett, rosszindulatú utasítások bejuttatása szinte örök fenyegetést jelentenek...

MA 08:57

A Super Mario Bros. visszahoz a kiégés sötétjéből

🎮 A friss kutatás szerint a Super Mario Bros. és a Yoshi-játékok nemcsak szórakoztatnak, hanem jelentősen hozzájárulhatnak a fiatal felnőttek érzelmi jóllétéhez is...

MA 08:51

A United Launch Alliance vezérigazgatója lemondott – távozik az űripar nagy öregje

Külön említést érdemel, hogy váratlanul lemondott Tory Bruno, a United Launch Alliance (ULA) vezérigazgatója, aki több mint tíz éven át vezette az amerikai rakétaipar egyik legjelentősebb vállalatát, miközben az egyre növekvő SpaceX-fölénnyel szemben próbált helytállni...

MA 08:43

Az újabb adatbotrány: veszélyben tízezernyi Nissan-ügyfél személyes adatai

🔐 A Nissan megerősítette, hogy a szeptemberi, a Red Hatnál történt adatvédelmi incidens következtében mintegy 21 000 ügyfél adatai szivárogtak ki, főként a japán Fukuoka prefektúrában...

MA 08:38

Az emberi evolúció új fejezete: Lehull Lucy koronája?

🙉 Külön említést érdemel, hogy a „Lucy” néven ismert Australopithecus afarensis fosszíliák évtizedeken át az emberi családfa sarokköveinek számítottak – most azonban új leletek és tudományos viták mindent átírhatnak, amit az ember eredetéről gondoltunk...

MA 08:30

Az ötven éve várt rákgyógyító molekula végre megszületett

Különösen igaz ez akkor, ha az orvostudományt egy makacs, évtizedek óta megoldatlan probléma hajtja előre: egy titokzatos gombamolekula, amely ötven évvel a felfedezése után most végre laboratóriumban is előállt – és esélyt kínál a gyógyíthatatlan gyermekkori agydaganatok elleni harcban...

MA 08:22

Az ünnepi postát térdre kényszerítette egy francia kibertámadás

Három nappal karácsony előtt komoly kibertámadás bénította meg a francia posta (La Poste) csomagküldő és online banki rendszerét, éppen a karácsonyi hajrá csúcsán...

MA 08:15

Az Interpol lecsapott: zsarolóvírus miatt százezreket tartóztattak le

🚨 Egy hónapos, 19 ország együttműködésével zajló Interpol-művelet során 574 embert tartóztattak le, és közel 1 milliárd forintot sikerült visszaszerezni üzleti e-mail-csalásokhoz, zsarolásokhoz és zsarolóvírus-támadásokhoz kapcsolódóan...

MA 08:09

Az internet térdre kényszeríti a Spotifyt: veszélyben a zenei örökség?

Felmerül a kérdés, hogy mi történne a világ zenegyűjteményeivel, ha a streaming szolgáltatások egyik napról a másikra eltűnnének...

MA 08:02

A karácsony idén: fehér csoda vagy szikrázó napsütés?

Érdemes megérteni, hogy a fehér karácsony esélye idén nagyban múlik azon, hol élsz, hiszen a hóesést egyszerre befolyásolja az adott hely klímája és az éppen aktuális időjárás...

MA 07:58

Az MI robbanthatja ki a következő WannaCry-járványt

Sanaz Yashar, aki korábban az izraeli katonai hírszerzés kiberelitalakulatánál dolgozott, ma egy biztonsági startup vezérigazgatója...

MA 07:50

A Hadrianus-falnál férgek tizedelték a légiósokat

🔥 Az ókori Róma katonái, akik Hadrianus falát őrizték, valóságos parazita-invázióban éltek Britanniában...

MA 07:36

A hosszú séta tényleg többet ér, mint a sok rövid?

Az, hogyan és mennyi ideig sétálsz naponta, sokat számít az egészséged szempontjából...

MA 07:29

Az MI-botrány után az Indie Game Awards visszavonta díjait

Az Indie Game Awards megfosztotta a Clair Obscur: Expedition 33 című játékot két fontos díjától, köztük az Év Játéka és a Legjobb Debütáló Játék címétől, mivel a fejlesztő, a Sandfall Interactive generatív MI-t használt a fejlesztés során...

MA 07:23

Az okos kameracsapdák: valóban életet mentenek az állatvilágban?

📷 Ausztrália egyszerre híres lenyűgöző élővilágáról és arról, hogy a fajok veszélyeztetettsége itt az egyik legmagasabb a világon...

MA 07:16

Az ünnepi akciók újra berobbantják a fast fashiont

🎁 Érdemes megérteni, hogy a vásárlók többsége decemberben elhatározza, hogy kevesebbet költ, és fenntarthatóbb ruhadarabokat választ...

APP
MA 07:13

APPok, Amik Ingyenesek MA, 12/23

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     AudioKit Hey Metronome (iPhone/iPad)A Hey Metronome egy modern, digitális metronóm alkalmazás, amely a zenészek és táncosok gyakorlását teszi élvezetesebbé...