MI vs. Super Mario: Az örökkévaló játék lett az új teljesítménymérő
Új ötlet van terjedőben: a Super Mario-t használják a mesterséges intelligencia teljesítményének mérésére. Egy kutatócsoport szerint a Super Mario Bros. mégnagyobb kihívást jelent, mint gondolnánk.
A Kaliforniai Egyetem San Diego campusán működő Hao AI Lab pénteken élő Super Mario Bros. játékokba vetette az MI-ket. Az Anthropic Claude modellje teljesített a legjobban, majd a Claude 3.5 következett. A Google és az OpenAI modelljei gyengébben szerepeltek.
Nem egészen a klasszikus játék
Fontos tisztázni, hogy ez nem pontosan az eredeti 1985-ös kiadás volt. A játék egy emulátorban futott, és egy keretrendszerrel integrálták, hogy az MI-k irányíthassák Mariót.
A Hao által házon belül fejlesztett GamingAgent alapvető utasításokat adott az MI-nek, például: “Ha akadály vagy ellenség van a közelben, mozdulj/ugorj balra, hogy elkerüld”, valamint játékbeli képernyőképeket mutatott. Az MI ezután Python kódban generált bemeneti parancsokat Mario irányításához.
Meglepő eredmények
A Hao szerint a játék arra kényszerítette a modelleket, hogy “megtanuljanak” összetett manővereket tervezni és játékstratégiákat kidolgozni. Érdekes módon a kutatólabor azt találta, hogy az OpenAI-hoz hasonló, következtető modellek, amelyek lépésről lépésre “gondolkodnak” a problémák megoldása során, rosszabbul teljesítettek, mint a “nem következtető” modellek, annak ellenére, hogy általában erősebbek a legtöbb teljesítménymérőn.
A kutatók szerint az egyik fő oka annak, hogy a következtető modelleknek gondot okoz a valós idejű játékok játszása, az, hogy időbe telik – általában másodpercekbe -, mire döntést hoznak. A Super Mario Bros. játékban pedig minden a megfelelő időzítésen múlik. Egy másodperc lehet a különbség egy biztonságosan végrehajtott ugrás és a halálba zuhanás között.
A játékokat már évtizedek óta használják az MI teljesítményének mérésére. Azonban kétséges az MI játékban mutatott képességei és a technológiai fejlődés közötti összefüggések megítélése. A való világgal ellentétben a játékok általában elvontak és viszonylag egyszerűek, valamint elméletileg végtelen mennyiségű adatot biztosítanak az MI betanításához.
Nincsenek igazán jó mérőszámokat az MI-k összehasonlítására.
De legalább nézhetjük, ahogy az MI Mariót játszik.
A január 23-án megjelent Lorwyn Eclipsed minden eddiginél gyorsabban fogy a Magic: The Gathering történetében, így újabb csúcsot állított be a 33 éves kártyajáték életében...
💻 A Microsoft elkezdte terjeszteni az új Secure Boot tanúsítványokat a szokásos havi Windows-frissítésekkel, mivel az eredetileg 2011-ben bevezetett tanúsítványok 2026...
🟢 A Blockchain.com kriptotőzsde sikeresen megszerezte az Egyesült Királyság pénzügyi felügyeletének, az FCA-nak a regisztrációját, ami lehetővé teszi, hogy hivatalosan is kriptoszolgáltatásokat nyújtson az országban...
🚨 A Kraken kriptotőzsde az első félévben esedékes, régóta várt tőzsdei bevezetésére készülve váratlanul megvált pénzügyi igazgatójától, Stephanie Lemmermantól...
🖩 Újabb elképesztő limitált kiadást dob piacra a Razer: 25 évvel az első Boomslang után visszatér a legendás gamer egér, de a pénztárcád nem lesz hálás érte...
🚀 Felmerül a kérdés, meddig tart az ingyenes paradicsom: az OpenAI legújabb MI-alapú Codex alkalmazása már az első héten elérte az egymilliós letöltési küszöböt, miközben csak Mac számítógépeken érhető el...
🔒 A Microsoft automatikusan lecseréli a Secure Boot-tanúsítványokat a Windows-eszközökön, mielőtt a régiek 2026 júniusa és októbere között lejárnának...
Nyár volt 2020-ban, amikor Walter Crist kutató egy hollandiai múzeumban sétált, amely az ókori Római Birodalom hollandiai jelenlétének szentelt kiállításokat mutatott be...
💡 A Philips Hue Lucca nevű kültéri lámpacsaládja hamarosan jelentős frissítést kap, amelynek köszönhetően a lámpák nemcsak világosabbak, hanem színesebbek is lesznek...
Amerikai felhasználóknál már megjelentek a hirdetések a ChatGPT-ben, ami komoly fordulópontot jelent az MI üzleti modellje és a felhasználói élmény szempontjából...
A Yahoo Japan és a LINE 2021-es egyesülése nem csupán a cégméretet növelte meg, de teljesen új alapokra helyezné a régiós digitális szolgáltatásokat is – most bejelentették, hogy három éven belül teljesen egységes, privát felhőinfrastruktúrát szeretnének kialakítani...
Egy új, a Michigani Egyetemen kifejlesztett MI-rendszer képes másodpercek alatt kiértékelni az agyi MRI-felvételeket, 97,5%-os pontossággal azonosítva a neurológiai betegségeket, és segítséget nyújtva a sürgősségi esetek felismerésében is...
A Google hivatalosan is megerősítette, hogy a Pixel 10a február 18-án előrendelhetővé válik, és kiemelte, hogy ez lesz eddig a legstrapabíróbb Pixel A-szériás modell...
💉 Az Ozempic és a Wegovy készítményeiről ismert Novo Nordisk jogi lépéseket tett a rivális Hims & Hers ellen az Egyesült Államokban, mert szerinte veszélyes, hamisított fogyókúrás gyógyszereket árusít...
Erre utal többek között az, hogy egy friss, nagyszabású kutatás szerint azok, akik elhízottak, jelentősen nagyobb arányban kerülnek kórházba, illetve halnak meg különféle fertőzések miatt, legyen szó vírusokról, baktériumokról, gombákról vagy parazitákról...
Egy kínai és Saint Kitts és Nevis-i állampolgárságú férfit távollétében húsz év börtönre ítéltek, amiért részt vett egy nemzetközi, úgynevezett „pig butchering” (szerelmi csalás) típusú kriptovaluta-befektetési átverésben, amellyel több mint 26 milliárd forintot (73 millió USD) csaltak ki áldozatoktól...
💡 Az ADHD világa sokszor zavaros: egymásnak ellentmondó ajánlások, bizonytalan hatású módszerek és éveken át tartó találgatás nehezítette a döntést orvosoknak és érintetteknek egyaránt...