Az MI-s videómodellek még tanulgatják, hogyan legyenek élethűek

Az MI-s videómodellek még tanulgatják, hogyan legyenek élethűek
Az elmúlt hónapokban hatalmas fejlődést láthattunk a generatív MI-videómodellek terén, ám továbbra is kérdéses: mennyire képesek ezek a modellek valóban megérteni és utánozni a valós világ működését? A Google DeepMind kutatói tudományos precizitással vizsgálták meg a legújabb Veo 3 videómodellt, hogy milyen mértékben képes a világról tanulni pusztán adatok és videók alapján, illetve mennyire tud új, eddig nem látott feladatokat megoldani.

Fényes sikerek, sötét kudarcok

Érdemes kiemelni, hogy a Veo 3 modell számos tesztfeladaton meglepően jól teljesített: képes volt például robotkéz-mozdulatokat, tárgyak dobását és elkapását, homályos vagy zajos képek helyreállítását, bonyolult képek kitöltését, illetve élek felismerését végrehajtani. Ezeken a feladatokon rendre 12 próbálkozásból 12-szer jó eredményt mutatott.

Ennek ellenére bőven akadnak hiányosságok is. Ha például egy adott betűt kellett volna kiemelni egy rácson, az esetek 75%-ában hibázott. Egy Bunsen-égő lángjának és papír elégésének szimulációjánál is kilencszer elbukott a 12 próbából. Labirintusmegoldásban tízszer, buborékszámozásnál tizenegyszer vallott kudarcot.

A kutatók érdekes mércét alkalmaznak: számukra az is siker, ha egy 12 próbából álló teszten legalább egyszer sikerrel jár a modell. Teljes kudarcnak pedig azt tekintették, ahol mind a 12 alkalommal elbukott – ez 62 feladat közül 16-szor fordult elő.

Sikerek háttere és a fejlődési ütem

Gyakorlati szempontból ezek az adatok elgondolkodtatók: egy önvezető autónál vagy robotnál nem nagyon fér bele, ha tízből nyolcszor hibázik. Az MI-iparban azonban gyakori az optimista hozzáállás, így olyan eredményeket is sikerként értékelnek, ahol a modell csak minden tizenkettedik alkalommal teljesít.

Ennek ellenére a mérnökök mégis bizakodók: a Veo 3 számos feladatban látványosan felülmúlta elődjét, a Veo 2-t. Például a horizontális mintázatok felismerésénél a sikerarány 0%-ról 72%-ra nőtt, az élfelismerés, tárgykivágás vagy labirintusmegoldás terén is mérhetően javult.

Külön említendő, hogy a szakemberek szerint a fejlődés gyors, és hamarosan a videómodellek is egyfajta univerzális MI-alapmodellé válhatnak, ahogy azt a nagy nyelvi modelleknél (LLM) már láttuk.

A következő mérföldkő még várat magára

Mindazonáltal a következtetés világos: bár az MI-videómodellek látványosak, a mai eredmények alapján egyáltalán nem mondható, hogy stabilan és megbízhatóan értelmeznék vagy modelleznék a valóság szabályszerűségeit. Az ok-okozati összefüggések felismerése vagy a feladatok egyenletes, hibamentes végrehajtása még várat magára, így továbbra is bőven van teendő, mire ezek a rendszerek valóban megbízhatóan tükrözik majd világunk működését.

2025, adminboss, arstechnica.com alapján

  • Te szerinted mennyi hibát szabad megengedni egy ilyen rendszernek?
  • Te mit éreznél, ha rád is hatással lenne egy MI modell hibája?
  • Szerinted etikus lenne fontos döntéseket kizárólag egy ilyen MI-re bízni?


Legfrissebb posztok

MA 11:50

Az MI-alapú játéktutorialok rémálma: a Sony új szintre lép

🤓 A videojátékok tutorialjai régóta okoznak fejfájást a játékosoknak és fejlesztőknek egyaránt...

MA 11:34

Az Alphabet tarolt a Wall Streeten: MI-őrület és pénzeső

💵 Az Alphabet lehengerlő, 65%-os árfolyam-emelkedéssel zárta a 2025-ös évet, amire 2009 óta nem volt példa...

MA 11:17

Az űr pezsgője: elképesztő galaxisütközésre bukkantak

🌌 A Champagne-halmaz névre keresztelt csillagászati jelenség szilveszter éjszakáján történt felfedezése óta ejti ámulatba a szakértőket: két hatalmas galaxishalmaz ütközése mutatkozik meg benne, a képeken pedig szinte pezsgőbuborékszerű foltok formájában láthatók a felforrósodott gázok...

MA 10:57

A januári PS Plusban autóőrület, Mickey‑újrafestés és barlangi túlélés – azonnal töltsd!

Új év, új játékok: 2026 januárjában három izgalmas címmel bővül a PlayStation Plus Essential kínálata...

MA 10:49

A NASA legnagyobb könyvtára lehúzza a rolót – hová kerül a tudás?

A NASA súlyos költségmegszorítások és telephely-összevonások közepette kénytelen bezárni a legnagyobb könyvtárát, így veszélybe kerül tízezernyi történelmi és tudományos dokumentum, amelyek jelentős része még nem digitalizált...

MA 10:43

Az amerikai dollár jövője: összeomlás vagy fordulat 2026-ban?

Az idei év kifejezetten gyengén alakult a dollár számára, hiszen a valuta több mint 9 százalékot veszített értékéből a főbb devizákkal szemben – ilyen rossz évet legutóbb nyolc éve látott...

MA 10:35

Az ütköző spirálgalaxisok még soha nem voltak ilyen lélegzetelállítóak

Lenyűgöző részletességgel sikerült megörökíteni két ütköző spirálgalaxist a NASA James Webb-űrteleszkópja (James Webb Space Telescope, JWST) és a Chandra röntgenobszervatórium (Chandra X-ray Observatory) adatainak egyesítésével...

MA 10:30

Az MI 2026-ban: Már megkerülhetetlen a digitális inas

🤖 Az elmúlt év végleg átalakította az MI helyét: a kezdeti mutatványokból állandó társunk lett a mindennapokban, és az emberek már nem csupán újdonságként tekintenek rá...

MA 10:23

Az új brit dróntörvények 2026-tól mindent fenekestül felforgatnak

Érdemes megérteni, hogy az Egyesült Királyságban jelentősen átalakultak a drónokra vonatkozó szabályok, amelyek 2026...

MA 10:15

Az MI 2026-ra tényleg elveszi a munkánkat?

🤔 Egyre nagyobb a bizonytalanság a munkaerőpiacon az MI rohamos fejlődése miatt...

MA 10:10

Az év, amikor a játékosok álma valóra válik: 2026

2026 már most bombasikerű gamer évnek ígérkezik: seregnyi folytatás, új franchise, nagy visszatérő és izgalmas sztori vár mindenkire...

MA 09:57

Az ősi perui trófeafej rejtélyének kulcsa: egy ritka rendellenesség

Egy mumifikálódott fej vizsgálata új megvilágításba helyezi az andoki társadalmak hozzáállását a születési rendellenességekkel élőkhöz...

MA 09:50

A hiányzó fehérje, amely felgyorsítja immunrendszered idő előtti öregedését

Ahogyan telnek az évek, az ősz hajszálak és a gyengülő izmok mellett az immunrendszerünk is változik...

MA 09:44

Az univerzum mégis kockajáték: Bohr diadalmaskodott Einstein felett

🎲 Egy lényeges szempont, hogy a kínai tudósoknak most először sikerült megvalósítaniuk azt a híres gondolatkísérletet, amellyel Albert Einstein majdnem száz éve próbálta cáfolni Niels Bohr elméletét a kvantummechanikában...

MA 09:36

Az Nvidia H200-ért kitört a vásárlási őrület Kínában

🔥 Az Nvidia H200-as gyorsítókra sosem látott kereslet alakult ki Kínában, miután enyhítettek az amerikai exportkorlátozásokon...

MA 09:30

Az új New York-i polgármester beiktatásán száműzik a techkütyüket

🚫 A 2026-os New York-i polgármesteri beiktatáson, ahol Zohran Mamdani lép hivatalba, szigorú tiltólistát hirdettek, amelyen meglepő módon külön megnevezték a Flipper Zero-t és a Raspberry Pi-t...

MA 09:22

Az Eaton lemaradt az MI‑őrületről – most jön a nagy visszatérés?

🚀 Érdekes, hogy az MI-berobbanás éveiben szerzett lendület ellenére az Eaton részvényárfolyama 2025-ben nem tudta tartani a lépést a többi ipari óriással...

MA 09:16

A fény hajtja az arany nanorészecskéket: tisztább ammónia a végeredmény

💡 A kutatók azt vizsgálják, miként lehetne fenntarthatóbban előállítani az egyik legfontosabb ipari vegyületet, az ammóniát, amely a műtrágyák, tisztítószerek és robbanóanyagok gyártásának is alapja...

MA 09:09

Az Amazon rejtett filmes gyöngyszemei, amikről nem hallottál

🎥 Az Amazon Prime Video kínálata valóságos kincsesbánya azok számára, akik szeretik a mozifilmeket – különösen a 2011 előtti alkotásokat...