Mesterséges intelligencia, amely már képes meglepődni a világon

Mesterséges intelligencia, amely már képes meglepődni a világon
Az emberek már csecsemőkorukban felismerik, ha valami ellentmond a fizikai törvényeknek: például egy tárgy, amely hirtelen eltűnik, vagy szilárd testeken halad át, meglepetést okoz. Ezt a képességet, az ún. fizikai intuíciót már néhány modern MI-rendszer is kezdi elsajátítani. A Meta kutatói legújabb, Video Joint Embedding Predictive Architecture (V-JEPA) nevű modelljük segítségével azt vizsgálták, hogyan képes egy MI videók tanulmányozásán keresztül tanulni a világról, sőt – úgymond – „meglepődni” azon, ha valami szembe megy az addig tapasztalt világismeretével.

Absztrakciók szintjén gondolkodik a gép

Az önvezető autók fejlesztői jól tudják, mennyire nehéz egy MI-nek megbízhatóan értelmezni a környezetet. A hagyományos megközelítések, amelyek pixelről pixelre vizsgálják a képeket, gyakran elvesznek a részletekben: például túlságosan fókuszálhatnak a lombkorona mozgására, miközben figyelmen kívül hagyják a valóban fontos információkat, mint például a lámpa színét vagy az autók helyzetét.

Lényeges szempont, hogy a V-JEPA architektúra 2024-ben éppen azért készült, hogy ezt a problémát megoldja. Ahelyett, hogy minden egyes pixelt azonos súllyal kezelne, a rendszer magasabb szintű, úgynevezett látens (rejtett) reprezentációkat hoz létre, amelyekben már csak a lényegi információk maradnak meg. Így például egy henger vonalas ábrázolásából a rendszer csak a magasságot, szélességet, tájolást és helyzetet jegyzi fel számok formájában, nem az egész képet másolja le.

Így működik a V-JEPA rendszer

A V-JEPA három fő komponensből áll: két kódolóból (1-es és 2-es) és egy előrejelzőből. A rendszer a videók egyes képkockáin mindig ugyanazt a pixelkészletet maszkolja, és az így „kitakart” képeket először az 1-es kódoló dolgozza fel, létrehozva a látens reprezentációkat. A teljes, maszkolatlan képeket közben a 2-es kódoló értelmezi hasonló módon. Ezután az előrejelző a maszkolt képekből készült látens reprezentációk alapján megpróbálja megjósolni, mit „gondolt” volna a rendszer a teljes képek esetén.

Ezzel a módszerrel a rendszer olyan sémát tanul ki, amely csak a legszükségesebb információkat tartalmazza az adott feladathoz. Ennek köszönhetően, amikor konkrét célhoz, például akciófelismeréshez vagy jelenetazonosításhoz kell igazítani, már jóval kevesebb ember által címkézett adat szükséges, mintha az elejétől végig kellene megtanítani a rendszert az adott célfeladatra. Ráadásul az alap architektúrát különböző feladatokra is adaptálni lehet.

Az MI már meg tud lepődni

2024 februárjában tesztelték, mennyi „intuitív fizikai tudása” van a modellnek. A teszten, amelyen a videókban bemutatott események fizikai valószínűségét kellett felismerni (például egy tárgy eltűnik-e, amikor elhalad mögötte egy másik), a V-JEPA közel 98%-os pontosságot ért el – szemben a hagyományos, pixelen alapuló modellekkel, amelyek alig voltak jobbak, mint a véletlenszerű találgatás.

Külön érdekesség, hogy a V-JEPA a meglepettség mértékét is számszerűsíteni tudja. A kutatók elemezték, mennyire tér el az MI előrejelzése a valóságtól: ha például egy labda eltűnik egy tereptárgy mögött, majd mégsem jelenik meg újra, az előrejelzési hiba hirtelen nő, ami jól tükrözi a csecsemőkhöz hasonló meglepődést.


Mi hiányzik még az MI-ből?

Ennek ellenére, bár a V-JEPA már egészen közel áll ahhoz, ahogyan az agyunk tanul és modellezi a világot, hiányzik még egy-két lényeges komponens. Ilyen például a bizonytalanság megfelelő kezelése: ha a múltbeli információk alapján nem lehet pontosan megjósolni a jövő eredményeit, a modell ezt nem rögzíti kellő rugalmassággal.

V-JEPA 2: nagyobb tudás, még rövidebb emlékezet

2024 júniusától már a második generáció, a V-JEPA 2 is elérhető: a most 1,2 milliárd paraméteres modell több mint 22 millió videón tanult, sőt, robotikai alkalmazásokban is sikeresen tesztelték – mindössze kb. 60 órányi robotadat birtokában képes volt viszonylag bonyolult feladatokat is megoldani, például tárgyakat manipulálni.

Az újabb, nehezebb, úgynevezett Physion++ (Physion++) teszten azonban a V-JEPA 2 és a többi modell is csak alig haladta meg a véletlen eredményt. Ennek oka lényegében az, hogy a rendszer csak néhány másodperces videókat képes értelmezni és előrejelezni; minden, ami ennél hosszabb, gyorsan feledésbe merül. Így jelenleg még inkább egy aranyhal emlékezőképességére hasonlít, semmint egy emberére.

Összességében elmondható, hogy a V-JEPA áttörést hozott az MI-k fizikai intuíciójának fejlesztésében: a gép immár csodálkozva tekinthet a világra, még ha memóriája egyelőre rövid is marad.

2025, adminboss, www.quantamagazine.org alapján

Legfrissebb posztok

Top
hétfő 16:50

Egyetemet végzett milliárdosok – ki mit végzett?

A közvéleményben gyakran keringenek olyan történetek, amelyek a felsőoktatásból kimaradó vállalkozókról szólnak...

szerda 20:49

A Google új MI-je, a Gemini 3 még okosabb lett

🚀 A Google bemutatta legújabb MI-modelljét, a Gemini 3-at, amelyet saját állítása szerint eddigi legintelligensebb modelljének tekint...

szerda 20:33

Egy elavult Samsung mobil miatt végzetes tragédia Ausztráliában

🔥 Egy sydney-i lakos halála rávilágított arra, hogy élet és halál múlhat egy mobiltelefon szoftverfrissítésén...

szerda 20:18

Az okos szenzorok új korszakot nyitnak a mezőgazdaságban

Egy Utah állambeli búzamező rekordot döntött, miután a BYU egyetemi hallgatóiból és professzoraiból álló csapat a világ egyik legfejlettebb mezőgazdasági szenzorrendszerét telepítette a területén...

szerda 20:03

A Black Ops 7: végre olyan CoD-multi, amire vártunk

A Black Ops 7 hasonló stratégiát követ, mint amilyet a Modern Warfare 3 a Modern Warfare 2 után: nem hagytak időt két megjelenés között, hanem rögtön egymás után érkeztek a részek...

szerda 19:51

A kaméleonszem igazi titka végre kiderült

Évezredeken át csodálták a kaméleonokat, főleg azért, mert szemük szinte bármilyen irányba mozoghat – ráadásul akár egymástól függetlenül is...

szerda 19:34

Tényleg 21 millió éve csókolózunk?

Tipikus példa arra, amikor egy ártatlannak tűnő mindennapi mozdulat, mint a csókolózás, egész evolúciós történelmet rejthet...

szerda 19:18

A krónikus gyulladás észrevétlenül átírja a csontvelő működését

Különösen igaz ez akkor, ha a szervezet évek alatt keletkező idült gyulladások hatására kezd megváltozni – a legnagyobb meglepetést pedig az okozza, ahogyan a csontvelő fogékonyabbá válik veszélyes betegségekre...

szerda 19:03

Az univerzum csak ránk vár: mi történik, ha senki sem figyel?

A kvantummechanika és a gravitáció talán legfurcsább összefonódása egy meglepő paradoxont szült: vajon van-e értelme egy olyan világnak, amelyben nincsenek megfigyelők?..

szerda 18:49

Az orosz kiberbűnözők szervereire lecsap az új szankcióhullám

Az Egyesült Államok, az Egyesült Királyság és Ausztrália újabb szankciókat jelentett be azokkal az orosz „golyóálló” tárhelyszolgáltatókkal szemben, amelyek kiberbűnöző bandákat, például zsarolóvírus-hálózatokat támogatnak...

szerda 18:33

Az MI5 lerántja a leplet Kína kémtoborzó trükkjeiről

🕵 Kínai hírszerzők egyre kifinomultabb módszerekkel próbálnak beépülni az Egyesült Királyság kulcsfontosságú intézményeibe...

szerda 18:17

Az AMD és a Cisco szaúdi MI-szövetsége átírja a játékszabályokat

⚡ A chipgyártó AMD, a hálózati óriás Cisco és a szaúdi Humain nevű MI-startup egyesítik erejüket, és közös vállalkozást indítanak adatközpontok építésére a Közel-Keleten...

szerda 18:02

A humanoid robot hátáról rajtol az alakváltó drón

🤖 A Caltech mérnökei olyan robotrendszert alkottak, amelyben egy humanoid robot hátán egy különleges, átalakulni képes drón, az M4 utazik...

szerda 17:49

Az új Microsoft-felhő-PC MI-t kap, de nem Copilot+

💻 A Microsoft új szintre lépett a felhőalapú számítástechnikában, bemutatta a Windows 365 MI-képes Cloud PC-t...

szerda 17:04

Az Nvidia 1800 milliárd dolláros óriástétje az MI-ben: kérdések Jensen Huanghoz

💰 Az Nvidia negyedéves gyorsjelentése a figyelem középpontjában áll, hiszen nemcsak a legnagyobb MI-láz közepén vagyunk, hanem most dől el az is, valóban bírják-e majd pénzzel az iparági szereplők az önmagukat gerjesztő MI-beruházások számláit...

szerda 16:34

Az elektromos Jeep Recon befutott: indulhat a terepforradalom

🚙 A Jeep végre bemutatta az első teljesen elektromos SUV-ját, a Jeep Recont, amely hivatalosan is 2026-tól lesz kapható...

szerda 16:17

Az internet kis híján megállt – mi állt a Cloudflare-kiesés mögött?

Kedden a Cloudflare hat éve nem látott mértékű leállást szenvedett el, ami közel hat órán keresztül tette elérhetetlenné a világ számos weboldalát és online platformját...

szerda 16:03

A Windows búcsút int a kékhalálnak a digitális kijelző móddal

Külön említést érdemel, hogy a Microsoft egy új Windows-üzemmódot vezet be, amely automatikusan eltünteti a hírhedt kékhalált (BSOD) a nyilvános kijelzőkről 15 másodperc után...

szerda 15:50

A fél internet térdre rogyott a Cloudflare leállása miatt

Kedd délelőtt egy rejtélyes globális hiba miatt az internet egyik legnagyobb, szinte láthatatlan közműve, a Cloudflare szolgáltatása leállt...