Mesterséges intelligencia, amely már képes meglepődni a világon

Mesterséges intelligencia, amely már képes meglepődni a világon
Az emberek már csecsemőkorukban felismerik, ha valami ellentmond a fizikai törvényeknek: például egy tárgy, amely hirtelen eltűnik, vagy szilárd testeken halad át, meglepetést okoz. Ezt a képességet, az ún. fizikai intuíciót már néhány modern MI-rendszer is kezdi elsajátítani. A Meta kutatói legújabb, Video Joint Embedding Predictive Architecture (V-JEPA) nevű modelljük segítségével azt vizsgálták, hogyan képes egy MI videók tanulmányozásán keresztül tanulni a világról, sőt – úgymond – „meglepődni” azon, ha valami szembe megy az addig tapasztalt világismeretével.

Absztrakciók szintjén gondolkodik a gép

Az önvezető autók fejlesztői jól tudják, mennyire nehéz egy MI-nek megbízhatóan értelmezni a környezetet. A hagyományos megközelítések, amelyek pixelről pixelre vizsgálják a képeket, gyakran elvesznek a részletekben: például túlságosan fókuszálhatnak a lombkorona mozgására, miközben figyelmen kívül hagyják a valóban fontos információkat, mint például a lámpa színét vagy az autók helyzetét.

Lényeges szempont, hogy a V-JEPA architektúra 2024-ben éppen azért készült, hogy ezt a problémát megoldja. Ahelyett, hogy minden egyes pixelt azonos súllyal kezelne, a rendszer magasabb szintű, úgynevezett látens (rejtett) reprezentációkat hoz létre, amelyekben már csak a lényegi információk maradnak meg. Így például egy henger vonalas ábrázolásából a rendszer csak a magasságot, szélességet, tájolást és helyzetet jegyzi fel számok formájában, nem az egész képet másolja le.

Így működik a V-JEPA rendszer

A V-JEPA három fő komponensből áll: két kódolóból (1-es és 2-es) és egy előrejelzőből. A rendszer a videók egyes képkockáin mindig ugyanazt a pixelkészletet maszkolja, és az így „kitakart” képeket először az 1-es kódoló dolgozza fel, létrehozva a látens reprezentációkat. A teljes, maszkolatlan képeket közben a 2-es kódoló értelmezi hasonló módon. Ezután az előrejelző a maszkolt képekből készült látens reprezentációk alapján megpróbálja megjósolni, mit „gondolt” volna a rendszer a teljes képek esetén.

Ezzel a módszerrel a rendszer olyan sémát tanul ki, amely csak a legszükségesebb információkat tartalmazza az adott feladathoz. Ennek köszönhetően, amikor konkrét célhoz, például akciófelismeréshez vagy jelenetazonosításhoz kell igazítani, már jóval kevesebb ember által címkézett adat szükséges, mintha az elejétől végig kellene megtanítani a rendszert az adott célfeladatra. Ráadásul az alap architektúrát különböző feladatokra is adaptálni lehet.

Az MI már meg tud lepődni

2024 februárjában tesztelték, mennyi „intuitív fizikai tudása” van a modellnek. A teszten, amelyen a videókban bemutatott események fizikai valószínűségét kellett felismerni (például egy tárgy eltűnik-e, amikor elhalad mögötte egy másik), a V-JEPA közel 98%-os pontosságot ért el – szemben a hagyományos, pixelen alapuló modellekkel, amelyek alig voltak jobbak, mint a véletlenszerű találgatás.

Külön érdekesség, hogy a V-JEPA a meglepettség mértékét is számszerűsíteni tudja. A kutatók elemezték, mennyire tér el az MI előrejelzése a valóságtól: ha például egy labda eltűnik egy tereptárgy mögött, majd mégsem jelenik meg újra, az előrejelzési hiba hirtelen nő, ami jól tükrözi a csecsemőkhöz hasonló meglepődést.


Mi hiányzik még az MI-ből?

Ennek ellenére, bár a V-JEPA már egészen közel áll ahhoz, ahogyan az agyunk tanul és modellezi a világot, hiányzik még egy-két lényeges komponens. Ilyen például a bizonytalanság megfelelő kezelése: ha a múltbeli információk alapján nem lehet pontosan megjósolni a jövő eredményeit, a modell ezt nem rögzíti kellő rugalmassággal.

V-JEPA 2: nagyobb tudás, még rövidebb emlékezet

2024 júniusától már a második generáció, a V-JEPA 2 is elérhető: a most 1,2 milliárd paraméteres modell több mint 22 millió videón tanult, sőt, robotikai alkalmazásokban is sikeresen tesztelték – mindössze kb. 60 órányi robotadat birtokában képes volt viszonylag bonyolult feladatokat is megoldani, például tárgyakat manipulálni.

Az újabb, nehezebb, úgynevezett Physion++ (Physion++) teszten azonban a V-JEPA 2 és a többi modell is csak alig haladta meg a véletlen eredményt. Ennek oka lényegében az, hogy a rendszer csak néhány másodperces videókat képes értelmezni és előrejelezni; minden, ami ennél hosszabb, gyorsan feledésbe merül. Így jelenleg még inkább egy aranyhal emlékezőképességére hasonlít, semmint egy emberére.

Összességében elmondható, hogy a V-JEPA áttörést hozott az MI-k fizikai intuíciójának fejlesztésében: a gép immár csodálkozva tekinthet a világra, még ha memóriája egyelőre rövid is marad.

2025, adminboss, www.quantamagazine.org alapján

Legfrissebb posztok

MA 18:49

Az Andreessen Horowitz tarol, soha nem látott rekorddal

🥇 Az Andreessen Horowitz 5,4 ezermilliárd forintot (15 milliárd dollárt) vont be, ezzel minden eddiginél nagyobb hangsúlyt fektet az amerikai infrastruktúrára, egészségügyre, védelmi iparra és a saját megfogalmazásuk szerinti American Dynamism-re...

MA 18:34

A gigantikus napfolt rekordot dönt: ezernyi kitörés, titokzatos napvihar

Az áprilisban feltűnt hatalmas napfolt, az AR 13664, extrém geomágneses vihart okozott a Földön 2024 májusában...

MA 18:17

A Tether 50 millió dollárral száll be a Ledn-üzletbe

A Tether, a világ legismertebb dollárhoz kötött stabilcoinját (USDT-t) kibocsátó cég tavaly novemberben titokban 40–50 millió dollárt (kb...

MA 17:51

A fizetős fal sem állítja meg a Grok deepfake-özönt az X-en

📸 Elon Musk közösségi oldala, az X, részlegesen korlátozta a Grok MI-képszerkesztési képességeit, mivel egyre nagyobb felháborodás övezi a platformon készülő szexuális jellegű, beleegyezés nélküli deepfake-ek terjedését felnőttekről és kiskorúakról egyaránt...

MA 16:52

A techforradalom a póráz végén: a legjobb kütyük kedvenceknek

Az ügy súlyát mutatja, hogy az állattartók egyre gyakrabban fordulnak az okoseszközök felé, hogy még jobb ellátást, kényelmet és biztonságot nyújtsanak házi kedvenceiknek...

MA 16:34

Az ezeréves chilei múmia rejtélye: halál a türkizbányában

🏛 Egy 1100 éves, természetesen mumifikálódott férfi maradványai meglepő részleteket tártak fel a chilei El Salvador városka közelében...

MA 16:18

A LEGO, ami okos, mégis láthatatlan: itt a Smart Play

🤓 Felmerül a kérdés, hogy észreveszik-e a gyerekek a technológiát, ha az valóban tökéletesen belesimul az élménybe...

MA 16:03

Az amerikai munkaerőpiac és a vámháború megrengetheti a kriptopiacot

📈 A pénteki nap eseményei könnyen felforgathatják mind a bitcoin, mind a szélesebb kriptopiac árfolyamait...

MA 15:49

Az új-zélandi kakapó végre újra költ

Új-Zéland világszerte egyedülálló, súlyosan veszélyeztetett röpképtelen papagája, a kakapó, négy év után újra költésbe kezdett...

MA 15:35

A humanoid robotok uralták Las Vegast – a sci-fi valóság

Las Vegasban idén a jövő már most láthatóvá vált, amikor az éves CES kiállításon a technológiai cégek bemutatták, hogyan képzelik el az MI-vezérelt fizikai világot...

MA 15:18

Az olcsó akkumulátorok forradalma most robban be?

⚡ Érdemes megvizsgálni, hogy a dél-koreai tudósok újítása révén az eddig drágának tartott szilárdtest-akkumulátorok sorsa gyökeresen megváltozhat...

MA 15:01

Az új Bixby: végre tényleg hasznos?

🧐 A Samsung eddig csak félgőzzel dolgozott a Bixby-n, amit a legtöbben az első percben kikapcsoltak, de a One UI 8...

MA 14:49

Az év legmenőbb kütyüi: a CES 2026 Verge-díjasai

🚀 Az idei CES ismét Las Vegasban hozta össze a technológia rajongóit, ahol tömérdek új kütyü és eszköz debütált – a feltekerhető laptopoktól kezdve a kétszer hajtható telefonokon át egészen a „hosszú élettartamú állomásig”...

MA 14:34

A brutál akkumulátorú OnePlus Turbo 6 letarolja a piacot

A OnePlus bemutatta új Turbo sorozatát, amelyet elsősorban játékosoknak terveztek, hatalmas, 9 000 mAh-s akkumulátorral és prémium képfrissítési rátával...

MA 14:18

Az új Gmail felborítja az e-mailezés játékszabályait

📧 Az MI belép a Gmailbe A Google bejelentette, hogy mától kezdve a Gemini 3-ra épülő MI-t integrálja a Gmailbe, amely gyakorlatilag minden felhasználót érinteni fog, és sokaknál nem lesz választható opció...

MA 14:03

Az MI-botrány miatt hátat fordíthat az X-nek a brit kormány

A brit kormánynál egyre komolyabb viták folynak arról, hogy folytatják-e jelenlétüket az X közösségi oldalon, miután a platform MI-eszköze, a Grok, lehetővé tette szexuális tartalmú képek – köztük meztelen gyerekeket ábrázoló fotók – létrehozását...

MA 13:50

A kínai hekkerek már a balkáni távközlést is célba vették

A Kínához köthető UAT-7290 nevű hekkercsoport mostanra Délkelet-Európa távközlési szolgáltatóit is célba vette, miután korábban Dél-Ázsiára koncentrált...

MA 13:33

A Word új trükkje: villámgyors linkelés két kattintással

A Microsoft mostantól gyerekjátékká teszi a hiperhivatkozások beszúrását a Word-dokumentumokba. Elfelejthetjük a bonyolult menük és a Ctrl+K kombináció használatát: egyszerűen csak be kell illeszteni a linket arra a kijelölt szövegre, amelyet hivatkozássá szeretnénk alakítani...

MA 13:17

A SharpLink nagy dobása: 62 milliárd forintnyi ETH a Lineán

💸 A SharpLink Gaming új szintre emeli az Ethereum kincstárkezelést: 62 milliárd forint (170 millió USD) értékű ethert helyezett el a ConsenSys által fejlesztett Linea hálózaton egy többéves hozamstratégia részeként...