2025. 09. 09., 09:03

Nehézségekbe ütközött a mesterséges intelligencia, ezeken a fejtörőkön elbukott

Nehézségekbe ütközött a mesterséges intelligencia, ezeken a fejtörőkön elbukott
Vajon mennyire okos a mesterséges intelligencia? Bár a beszélgetések gördülékenysége, a szövegértés vagy a sakkbajnokságok sorozatos megnyerése már mind az MI oldalán áll, mégis akadnak olyan feladatok, amelyeket a legtöbb ember játékosan, másodpercek alatt megold – miközben a legfejlettebb algoritmusok is sorra elbuknak rajtuk. Fontos hangsúlyozni, hogy a mesterséges általános intelligencia, vagyis az AGI mércéje nem a bemagolt tudás vagy egyes speciális készségek, hanem az, hogy kevés információból képes-e a gép általánosítani és új helyzetekhez alkalmazkodni. Ez az a pont, ahol az MI jelenleg még messze elmarad embertársaink mögött.

Az absztrakció és logika próbája: a színes rácsok titka

A mesterséges intelligencia általánosító képességének mérésére dolgozta ki François Chollet 2019-ben az Absztrakció és Érvelés Korpuszt (Abstraction and Reasoning Corpus, röviden ARC), amely színes négyzetrácsokból felépülő apró logikai feladatok gyűjteménye. Ezeknél mindig fel kell ismerni egy rejtett szabályt, majd azt egy újszerű rácson alkalmazni. Az ARC rácspéldáit ma már szinte minden jelentős MI-rendszeren futtatják, a feladatcsomag iparági etalonná vált. Ezen kívül létrejött az ARC Prize Foundation is, amely nemcsak gondozza ezeket a teszteket, hanem rendszeresen fejleszt újakat is, például az ARC-AGI-2-t és most az ARC-AGI-3-at. Utóbbi újdonsága, hogy kifejezetten MI-ügynökök mérésére készült – videójátékokkal.

Mit is mér valójában az ARC?

Az ARC tesztje egyetlen minikészség elsajátítását várja el: minden feladat rávezet egy logikára, majd rögtön arra kér, hogy ezt az új tudást alkalmazzuk egy új helyzetben. Az MI tehát egy szűk területen tanul, és ez alapján próbál általánosítani. Mindezek ellenére ez még nem AGI – hiszen ilyen szűk tartományban maga az alkalmazkodás is erősen korlátos. Az ember ezzel szemben folyamatosan olyan feladatokat old meg (biciklizés, autóvezetés, nyelvtanulás), amelyek messze túlmutatnak a születéskori „tanító adathalmazon”.

Hol húzódik az AGI határa?

Akkor beszélhetünk valódi AGI-ról, ha elérkezik az a pillanat, amikor már nem találunk olyan problémát, amelyet az ember meg tud oldani, de az MI nem. Eddig azonban minden ilyen próbán elbukik az algoritmus: egy átlagember az ARC-feladatok jelentős részét sikerrel oldja meg, miközben a legokosabb MI, mint például a Grok, rendszerint csődöt mond. Fontos kiemelni, hogy ezek az MI-k már képesek mesterfokú vizsgákat, teszteket hibátlanul teljesíteni, de minden tudásuk szigetszerű, nincs meg bennük a mindennapi életben elengedhetetlen általánosítási képesség.


Az emberhez igazított nehézség

Az ARC-AGI-tesztcsomag legfőbb különlegessége, hogy minden egyes tesztet először emberek oldanak meg. A fejlesztők 400 önkéntest kértek fel, akik demográfiai szűrés után ugyanazt a feladatsort kapták számítógépen keresztül. Az átlagos eredmény az ARC-AGI-2-n 66 százalék körül volt, és egy kisebb csoport közös megoldásai összesen minden egyes kérdésre helyes választ adtak. Az MI-k jóval ez alatt teljesítenek.

Miért könnyű az embernek, és miért nehéz az MI-nek?

Az ember tanulása elképesztően hatékony: akár egyetlen példából is képesek vagyunk ráérezni a szabályra, majd alkalmazni azt új konfigurációkban. Ezzel szemben az MI algoritmusai (még a legmodernebbek is) nagyságrendekkel nehezebben tanulnak minta alapján; míg a gép száz vagy akár ezer példából sem találja meg azt, amire mi pillanatok alatt ráérzünk.

ARC-AGI-1-től a videojátékokig

Az első, eredeti ARC-AGI-1-et még 2019-ben alkotta meg Chollet; ez mintegy 1000 feladatból állt, amelyek több mint öt éven át leküzdhetetlen akadálynak bizonyultak az MI számára. Csak 2024-ben jelentek meg az OpenAI újabb modelljei, amelyek megközelítették ezt a mércét. Az ARC-AGI-2 komolyabb problémákat, nagyobb rácsokat és összetettebb szabályokat tartalmaz – amit az ember pár perc alatt megold, azt az MI gyakran meg sem közelíti. 2024-től teljesen új irányba is elmozdult a fejlesztés: az ARC-AGI-3 már interaktív, szimulációalapú próbákat tartalmaz.

Új mérce: ügynökteszt videojátékokban

A való élet ritkán „állapotmentes”: ott a döntéseink nem statikusak, hanem összefüggő sorozatot alkotnak. Egy igazi ügynöknek nemcsak egy kérdésre kell válaszolnia, hanem terveznie, tapasztalatból tanulnia, előre gondolkodnia is. Az ARC-AGI-3-hoz ezért 100 teljesen újszerű, kétdimenziós pixeles videojátékot hoztak létre. Minden játékban egy minikészség elsajátítása a cél: csak akkor lehet továbblépni, ha a játékos (legyen ember vagy MI) végigcsinálja a tervezett lépéssort, elsajátítja és helyesen alkalmazza az elvárt logikát. Az MI-k jelenlegi generációja egyelőre egyetlen pályát sem teljesített sikerrel.

MI megmérettetés videojátékban: miért más ez, mint eddig?

Videojátékokkal régóta tesztelik az MI fejlődését – az Atari-klasszikusok (Atari Classics) vagy a sakk, a Go például már lezárt terepnek számítanak. De ezeknél egyaránt gondot jelent, hogy nyilvánosan elérhető az összes szabály, rengeteg példa áll rendelkezésre, és számtalan MI-fejlesztő előzetes tudása is beépül a fejlesztésbe. Az új ARC-AGI-3 játékokkal mindez kizárható: nincs előzetes tudás, az MI-nek egy addig teljesen ismeretlen környezetben kell boldogulnia.

Következésképpen, bár az MI egyre okosabb, az általános alkalmazkodás és logikai problémamegoldás terén az ember még mindig magasan vezet – legalábbis, amíg a leggyorsabb algoritmus is hosszan gondolkodik azon, amin mi csak mosolygunk.

2025, adminboss, www.livescience.com alapján

Legfrissebb posztok

szombat 21:46

Az ausztrál laborokban tápfolyadékot kapnak az idegsejtek

🧠 A nap kezdetén a melbourne-i Cortical Labs adatközpontjában nem a kávé és a szerverek zaja jelenti a rutint: a technikusok először egy agy-gerincvelői folyadékra emlékeztető oldatot töltenek a számítógépekbe...

szombat 21:35

Az E Ink monitor, amit jobb, ha csak megálmodsz

A Bigme B251 egy szemet gyönyörködtető újdonságként próbál berobbanni a monitorpiacra, hiszen 25,3 colos színes E Ink kijelzővel várja a felhasználókat...

szombat 21:23

Az új MacBook Air M5: király, vagy örök középső?

💻 Oké, mindenki figyeljen: megjelent az új MacBook Air M5, de ha instant forradalmat vársz, csalódni fogsz...

szombat 21:12

Az új MacBook Neóból ezek az appok hozzák ki a maximumot

💻 Az új MacBook Neo az Apple-től váratlanul alacsony áron jelent meg a héten, ami nagy meglepetést keltett a technológiai világban...

szombat 21:01

Valóban elűzi az internet unalmát a BuzzFeed kreatív játszótere?

A BuzzFeed ismét robbant: a cuki kvízeiről elhíresült oldal most egy igazán bevállalós új projektet indított Branch Office néven...

szombat 20:45

A papírnaptár, amelyre a Google Naptár is féltékeny

Oké, valljuk be: a hagyományos papírnaptárat még mindig semmi nem tudja teljesen kinyírni...

szombat 20:34

Az eltűnt skóciai római erőd titkainak nyomában

Skóciában régészek egy eddig ismeretlen római erőd maradványaira bukkantak, a Hadrianus-faltól jóval északabbra...

szombat 20:23

Az önellátás kulcsa: áram és meleg víz fából

Fontos kérdés, hogyan lehet megbízhatóan áramot és meleg vizet előállítani úgy, hogy közben nem függünk a nagy energiaszolgáltatóktól...

szombat 20:12

Végre megszületett a legendás hatszögletű gyémánt?

💎 Egy új kínai kutatás meggyőző bizonyítékokkal támasztja alá, hogy sikerült előállítani a régóta vitatott hatszögletű gyémántot, amely minden eddigi anyagnál keményebb lehet...

szombat 20:02

Az amerikaiak negyede már bedől a deepfake-hívásoknak – megállíthatatlan az MI?

Az elmúlt egy évben az amerikaiak 25 százaléka tapasztalt deepfake hanghívást: ismerősnek tűnő, ám mesterségesen klónozott hanggal próbáltak pénzt vagy adatokat kicsalni tőlük...

szombat 19:56

A virágokat tényleg az evolúció mentette meg a kihalástól?

2012 és 2015 között Kaliforniában az elmúlt 10 ezer év legsúlyosabb aszálya pusztított...

szombat 19:46

Az MI új fegyvere: miként válik a GPS a hajózás rémálmává?

🚢 A modern tengerhajózás ma már elképzelhetetlen GPS-navigáció nélkül. Olajszállító óriások, kutatóhajók és rakományt szállító hajók mind-mind a műholdas helymeghatározásra támaszkodnak...

szombat 19:35

Az olaj végnapjait éli, a Nap vándorol, a QR-kód zsugorodik

🌑 Régészeti felfedezések sora kavarta fel a tudományos világot: egy cseh kerti pajta alapkövéről derült ki, hogy valójában egy 3300 éves bronzkori öntőforma, amellyel sarlókardokat készítettek...

szombat 19:23

Az éghajlatváltozás már a Föld forgását is lassítja

🌎 A Föld forgása jelenleg olyan ütemben lassul, amilyenre legalább 3,6 millió éve nem volt példa...

szombat 17:45

Az óriási örvények titka tárul fel Grönland jégpáncélja alatt

Grönland hatalmas jégtakarójának mélyében óriási, örvénylő struktúrákat fedeztek fel tudósok, amelyek olykor forrongó üsthöz hasonlóan mozognak...

szombat 17:35

A vakbél: felesleges szerv vagy az evolúció rejtett aduásza?

Az emberek többsége akkor szembesül a vakbelével, amikor az fájdalmassá válik, és életveszélyes gyulladás miatt műtétre van szükség...

szombat 17:23

Az új Snapdragon-bakit villámgyorsan javítják – megéri most frissíteni?

⚡ Fontos kérdés, hogy a legújabb Snapdragon 8 Elite Gen 5 csúcstelefonokat egy komoly sebezhetőség érinti, amelyet a Xiaomi ShadowBlade Security Lab kutatói fedeztek fel...

szombat 17:13

A mesterséges intelligencia újraírja a rajongói kultúra szabályait

A rajongók évtizedeken át csupán szemlélői voltak kedvenc filmjeiknek, sorozataiknak vagy zenei előadóiknak...

szombat 17:01

A haj növekedéséről mindent rosszul tudtunk – íme az igazság

💪 Évtizedek óta abban a hitben élünk, hogy hajunkat a gyökérben osztódó sejtek tolják kifelé a fejbőrből, a legfrissebb kutatások viszont egészen új, meglepő magyarázatot tártak fel...

szombat 16:57

A nagy Android-asztali párbaj: Samsung DeX vagy Pixel Desktop?

💻 Az okostelefonok asztali üzemmódban immár tényleg kihívók a számítógépek világában, legalábbis ha a Samsung DeX-re vagy a Google vadonatúj Pixel Desktopjára nézünk...

szombat 16:35

Az xAI-nál káosz tombol: Elon Musk a Holdra hajt

🚀 Elon Musk, miután összeolvasztotta a SpaceX-et az xAI-jal egy közel 455 milliárd forintos (1,25 milliárd dolláros) üzletben, újabb elbocsátási hullámot rendelt el az xAI mesterségesintelligencia-céget irányítva...

szombat 16:23

Az új brazil adócsomag padlóra küldheti a kriptoszektort

📈 A brazil pénzügyi és fintech szektor kulcsszereplői élesen tiltakoznak a kormány legújabb adóterve ellen, amely a stabilcoin-tranzakciókra is kiterjesztené az IOF nevű pénzügyi műveleti adót...

szombat 14:03

A cambridge-i áttörés: fény forradalmasítja a gyógyszermódosítást

💡 Egy váratlan laborhiba hozta meg azt a forradalmi áttörést, amelynek köszönhetően fény segítségével lehet jelentősen egyszerűsíteni a gyógyszermolekulák átalakítását a fejlesztés késői szakaszában...

szombat 13:45

A szójáték, amit most mindenkinek ki kell próbálnia – Josh Wardle-től

Szevasztok, szórajongók! Vége a Wordle-monopóliumnak, mert Josh Wardle, aki világszerte megbabonázott minket a kis színes négyzetekkel, most megint szintet lépett...

szombat 13:34

Az elektromos pickup, amiért megőrül a világ

🚗 Régi Ford pickup, új élet: belül már nem zakatol a klasszikus V8-as motor, helyette egy Tesla-alapú akkumulátorcsomag tölti meg energiával a veterán platós járgányt...

szombat 13:23

A Meta újra felkavarja a hírvilágot – indul a nemzetközi hírözön?

📰 A Meta újabb lépéssel próbálja fokozni az aktuális világhírekhez való hozzáférést – ehhez most komoly nemzetközi partnerségeket kötött kiadókkal...

szombat 12:03

Az amerikai jólét átrendeződik: hol fialhat most a pénz?

A vállalatok hosszú távú sikerét ma már nem pusztán az határozza meg, milyen tehetségeket tudnak magukhoz vonzani, vagy mennyi pénzzel rendelkeznek, hanem hogy hol helyezik el működésüket, hogyan választják meg beszállítói láncaikat, illetve mely területeken ruháznak be...

szombat 11:46

A hordozható monitorok olcsó királya? KYY K3 teszt

💻 A hordozható monitorok egyre elterjedtebbek, és manapság bőven válogathat mindenki a különböző modellek közül...

szombat 11:23

Az Outlook megint bakizik: hibák, félmegoldások, bosszús felhasználók

🙁 A klasszikus Outlook asztali kliensben egyre több szinkronizációs és kapcsolódási probléma bosszantja a felhasználókat...