MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő

MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk. A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.

Nem egészen a klasszikus játék

Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.

A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.

Meglepő eredmények

A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.

A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.

Játékok mint teljesítménymérők

A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.

 

Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.

De legalább nézhetjük, ahogy az MI Mariót játszik.

  • Te milyen más nem hagyományos módszereket próbálnál ki az MI-k teljesítményének mérésére?
  • Ha te lennél a kutatócsoport vezetője, hogyan változtatnál a jelenlegi megközelítésen a játékok használatát illetően?


Legfrissebb posztok

Top
hétfő 16:50

Egyetemet végzett milliárdosok – ki mit végzett?

A közvéleményben gyakran keringenek olyan történetek, amelyek a felsőoktatásból kimaradó vállalkozókról szólnak...

péntek 20:50

Az MI vészleállítója: megfékezhetők az elszabadult ügynökök?

Fontos kérdés, hogyan akadályozható meg az MI-ügynökök nemkívánatos tevékenysége, például az illegális adatgyűjtés...

péntek 20:33

Az MI-módban sem menekülsz a Google hirdetései elől

👀 A Google mostantól hirdetéseket jelenít meg az MI-módban is, amely a megszokott kereső helyett már egy kérdés-válasz rendszerként működik...

péntek 20:17

Az Avast most ingyen adja a világ legokosabb csalásvédelmét

Az Avast bejelentette a Scam Guardian nevű új szolgáltatását, amely mesterséges intelligencián alapuló átverésvédelmet kínál mindenkinek, teljesen ingyen...

péntek 20:01

Az első gyógyszercég a billiódolláros klubban: tarol az Eli Lilly

Az amerikai Eli Lilly gyógyszergyártó áttörte az 1 billió dolláros (kb...

péntek 19:49

Végre nem küldi fel a felhőbe a szöveget az okos másolás–beillesztés

A Microsoft továbbfejleszti a PowerToys Advanced Paste eszközét a Windows 11-ben, így mostantól az MI nemcsak a felhőben, hanem közvetlenül a számítógépen is futtatható...

péntek 19:33

Az Europa Clipper lencsevégre kapta az Uránuszt – ilyet még nem láttunk

🚀 A NASA Europa Clipper űrszondája november 5-én egy felvételen kapta lencsevégre az Uránuszt, miközben a Jupiter felé tart...

péntek 19:17

A brit hekkerek csapása milliókba fájt a londoni közlekedésnek

💸 Két brit fiatal, a 19 éves Thalha Jubair és a 18 éves Owen Flowers tagadta, hogy közük volt az augusztusban történt Transport for London (TfL) informatikai betöréshez, amely több milliárd forintos kárt okozott, és az utasok adatait is veszélybe sodorta...

péntek 19:03

A Pornhub bekeményít: eszközalapú életkor-ellenőrzést követel mindenkinél

A Pornhub anyavállalata, az Aylo a hét elején levelet küldött a Google-nek, az Apple-nek és a Microsoftnak, amelyben arra kérte a technológiai óriásokat, hogy támogassák a készülékalapú korhatár-ellenőrzést alkalmazásaikban és operációs rendszereikben...

péntek 18:49

Az Apple kézműves iPhone-tartója: műtárgy vagy pénzkidobás?

Az Apple ismét művészeket vont be a kiegészítők tervezésébe: most Bailey Hikawával közösen készítettek egy MagSafe-kompatibilis iPhone-markolatot és állványt...

péntek 18:33

A forradalmi légáramló rendszer megfékezi a kórokozók terjedését

Télen, amikor az emberek a hideg elől zárt terekbe húzódnak, a belélegzett levegő minősége kulcsfontosságúvá válik a légúti fertőzések terjedésének megfékezésében...

péntek 18:18

Az új húspótló gomba fenekestül felforgatja az élelmiszeripart

Kínai kutatók a CRISPR génszerkesztési technológiával sikeresen módosították a Fusarium venenatum nevű gombát, hogy még fenntarthatóbb, gyorsabban termeszthető és könnyebben emészthető fehérjeforrás legyen...

péntek 18:04

Az újrahasznosításra építő rakétacég mindent kockára tesz

Az űripar globális pezsgése közepette néhány rakétacégnél hatalmas pénzek és óriási ígéretek forognak kockán...

péntek 17:50

A nagy dobás: Ken Griffin felpörgette tech-portfólióját

📈 Első pillantásra meglepőnek tűnhetett Ken Griffin legújabb lépése: a legendás befektető eddig egyáltalán nem részesült a Meta Platforms sikeréből, most viszont rövid idő alatt óriási tétet tett a cégre...

péntek 17:18

Az új Starship első nagy pofonja – kezdődhet a válságkezelés

🚨 Péntek hajnalban jelentős károsodást szenvedett a SpaceX legújabb Starship hordozórakétája Dél-Texasban, alig egy nappal azután, hogy kigördült a gyárból...

péntek 17:02

Az amerikai tőzsdefelügyelet visszakozott a SolarWinds-perben

Az amerikai tőzsdefelügyelet (SEC) hivatalosan is elállt a SolarWinds és információbiztonsági vezetője, Timothy G...

péntek 16:50

Az új New Glenn: a Blue Origin legnagyobb dobása jön

Miután a New Glenn rakéta második sikeres indításán is túljutott, a Blue Origin, Jeff Bezos űrvállalata nem lassít: komoly fejlesztések érkeznek már a következő, harmadik küldetésen is...

péntek 16:34

Az új esőerdő-alap 45 ezermilliárdja: ki jár jól valójában?

🌲 Egy 45 ezermilliárd forintos, azaz 125 milliárd dolláros esőerdő-alap keltette fel a világ figyelmét a 2025-ös belémi Klímacsúcson...

péntek 16:20

A chipláz sötét oldala: vízkrízis és mérgek Arizonában

Felmerül a kérdés, hogy az új ipari fellendülés valóban megéri-e a kockázatokat, amelyeket a víz- és vegyszerhasználat okoz Arizona szívében...