Az MI-s videómodellek még tanulgatják, hogyan legyenek élethűek

Az MI-s videómodellek még tanulgatják, hogyan legyenek élethűek
Az elmúlt hónapokban hatalmas fejlődést láthattunk a generatív MI-videómodellek terén, ám továbbra is kérdéses: mennyire képesek ezek a modellek valóban megérteni és utánozni a valós világ működését? A Google DeepMind kutatói tudományos precizitással vizsgálták meg a legújabb Veo 3 videómodellt, hogy milyen mértékben képes a világról tanulni pusztán adatok és videók alapján, illetve mennyire tud új, eddig nem látott feladatokat megoldani.

Fényes sikerek, sötét kudarcok

Érdemes kiemelni, hogy a Veo 3 modell számos tesztfeladaton meglepően jól teljesített: képes volt például robotkéz-mozdulatokat, tárgyak dobását és elkapását, homályos vagy zajos képek helyreállítását, bonyolult képek kitöltését, illetve élek felismerését végrehajtani. Ezeken a feladatokon rendre 12 próbálkozásból 12-szer jó eredményt mutatott.

Ennek ellenére bőven akadnak hiányosságok is. Ha például egy adott betűt kellett volna kiemelni egy rácson, az esetek 75%-ában hibázott. Egy Bunsen-égő lángjának és papír elégésének szimulációjánál is kilencszer elbukott a 12 próbából. Labirintusmegoldásban tízszer, buborékszámozásnál tizenegyszer vallott kudarcot.

A kutatók érdekes mércét alkalmaznak: számukra az is siker, ha egy 12 próbából álló teszten legalább egyszer sikerrel jár a modell. Teljes kudarcnak pedig azt tekintették, ahol mind a 12 alkalommal elbukott – ez 62 feladat közül 16-szor fordult elő.

Sikerek háttere és a fejlődési ütem

Gyakorlati szempontból ezek az adatok elgondolkodtatók: egy önvezető autónál vagy robotnál nem nagyon fér bele, ha tízből nyolcszor hibázik. Az MI-iparban azonban gyakori az optimista hozzáállás, így olyan eredményeket is sikerként értékelnek, ahol a modell csak minden tizenkettedik alkalommal teljesít.

Ennek ellenére a mérnökök mégis bizakodók: a Veo 3 számos feladatban látványosan felülmúlta elődjét, a Veo 2-t. Például a horizontális mintázatok felismerésénél a sikerarány 0%-ról 72%-ra nőtt, az élfelismerés, tárgykivágás vagy labirintusmegoldás terén is mérhetően javult.

Külön említendő, hogy a szakemberek szerint a fejlődés gyors, és hamarosan a videómodellek is egyfajta univerzális MI-alapmodellé válhatnak, ahogy azt a nagy nyelvi modelleknél (LLM) már láttuk.

A következő mérföldkő még várat magára

Mindazonáltal a következtetés világos: bár az MI-videómodellek látványosak, a mai eredmények alapján egyáltalán nem mondható, hogy stabilan és megbízhatóan értelmeznék vagy modelleznék a valóság szabályszerűségeit. Az ok-okozati összefüggések felismerése vagy a feladatok egyenletes, hibamentes végrehajtása még várat magára, így továbbra is bőven van teendő, mire ezek a rendszerek valóban megbízhatóan tükrözik majd világunk működését.

2025, adminboss, arstechnica.com alapján

  • Te szerinted mennyi hibát szabad megengedni egy ilyen rendszernek?
  • Te mit éreznél, ha rád is hatással lenne egy MI modell hibája?
  • Szerinted etikus lenne fontos döntéseket kizárólag egy ilyen MI-re bízni?


Legfrissebb posztok

MA 14:18

Az adatvédelem csődje: titkok, támadások, az elmaradt jelentés

Érdemes megvizsgálni, hogy az elmúlt hetekben hogyan sodródtak cégek és szervezetek súlyos adatbiztonsági botrányokba, miközben az állami szervek is késlekednek a nyilvánosság tájékoztatásával...

MA 13:33

Az önvezető autók San Franciscóban a macskákat is veszélyeztetik

A San Franciscó-i Mission negyed közösségét megrázta, hogy egy népszerű bolti macska, Kit Kat életét vesztette, amikor egy Waymo önvezető taxi elütötte október 27-én este...

MA 13:17

Az első Rivian-spinoff e-bike drága – de mire képes?

🚲 A Rivian elektromos járműgyártó egyik volt fejlesztőinek új cége, az Also bemutatta első saját e-bike-ját, a TM-B-t, amelynek alapmodellje várhatóan 1,25 millió forinttól (3 500 USD) indul...

MA 13:01

Az utolsó független zeneblog lázadása a mesterséges intelligencia ellen

🎶 Ha valaki indie rock-rajongó, biztosan ismeri a Stereogum nevét, amely már több mint húsz éve számít meghatározó zenei oldalnak...

MA 12:17

Az Amazon műholdas netje nevet váltott, az árak elszálltak

Az Amazon műholdas internethálózata mostantól egyszerűen Leo néven fut, ezzel véget ért a korábbi Project Kuiper időszak...

MA 12:01

Az Apple felborítja az iPhone-menetrendet: jön az iPhone Air?

Az Apple 2027 márciusára időzítheti az új iPhone Air megjelenését, amelyet rögtön az iPhone 18 és az iPhone 18e is követhet...

MA 11:49

Az új kriptokrach: elolvadt a Bitcoin idei nyeresége

Kevesebb mint másfél hónappal azután, hogy új történelmi rekordot döntött, a Bitcoin teljesen lenullázta idei 30%-os nyereségét...

MA 11:34

Az önéletrajz titka, amitől azonnal behívnak interjúra

📌 Különösen igaz ez akkor, ha egy jó önéletrajz egész karriert indíthat el, miközben egy átláthatatlan, rosszul szerkesztett dokumentum azonnal elveszítheti a döntéshozók figyelmét...

MA 11:17

Az űr az adatközpontok következő nagy dobása?

A technológiai nagyágyúk egyre komolyabban foglalkoznak azzal, hogy adatközpontokat építsenek a világűrben...

MA 10:58

Az elektronok vadonatúj állapota átírhatja a kvantumtechnológia szabályait

Az elektromosság mindennapjaink hajtóereje: autók, telefonok, számítógépek és szinte minden modern eszköz működésének alapja...

MA 10:41

Az afrikai pingvineket a halászat a kihalás szélére sodorja

🐧 Az afrikai pingvinek (Spheniscus demersus) drámai mértékben kiszorulnak természetes élőhelyeikről, mivel évről évre egyre erősebben versengenek a kereskedelmi halászhajókkal az élelemért...

MA 10:34

A hawaii gömbölyűfejű delfinek megőrülnek a tintahalért

A hawaii vizekben élő rövidszárnyú gömbölyűfejű delfinek (Globicephala macrorhynchus) hatalmas mennyiségű tintahalat fogyasztanak...

MA 10:26

A Princeton új kvantumchipje felforgatja a piacot

A Princeton Egyetem mérnökei háromszor stabilabb szupravezető qubitet alkottak, mint bármely korábbi típus, ezzel jelentősen közelebb hozva a valóban működőképes, megbízható kvantumszámítógépek korszakát...

MA 09:59

Az Intel elkaszálta a zászlóshajó Xeon szerverprocesszorokat

🛠 Megemlíthető továbbá, hogy az adatközponti piac rohamosan változik: az utóbbi hetekben az Intel új vezetés alatt alaposan átvizsgálta szerverprocesszor-útitervét, amely végül komoly irányváltáshoz vezetett...

MA 09:41

Az elektromos autók akkumulátorai áttörés előtt: itt az új korszak

Az LFP (lítium-vas-foszfát) akkumulátorok terjedése új lendületet kapott, miután 2022-ben lejártak a legfontosabb szabadalmak az alapkémiára...

MA 09:34

Az olasz fonalóriás is bedőlt: napvilágra kerültek a sztárdivat titkai

Fulgar, a H&M, az Adidas, a Wolford és a Calzedonia szintetikus fonalbeszállítója kénytelen elismerni, hogy zsarolóvírus-támadás érte, amelyet a hírhedt RansomHouse-csoporthoz kötnek...

MA 09:17

A mikrobák okos koktéljai átírják a növényvédelem szabályait

A Kínai Tudományos Akadémia kutatói áttörő módszert fejlesztettek ki, amellyel mesterségesen összeállított, jótékony mikrobaközösségekkel jelentősen javítható a növények egészsége, és elnyomhatók a talajeredetű betegségek...

MA 09:02

Az Android-appok zabálják az akkut? Érkezik a Google-riasztás!

Az okostelefon-felhasználók örülhetnek: a Google bejelentette, hogy a Play Áruházban hamarosan külön megjelölést kapnak azok az Android-alkalmazások, amelyek túlzott háttértevékenységükkel rengeteg akkumulátort fogyasztanak...

MA 08:25

Az Ozempic-láz ára: amiről eddig nem beszéltünk

💸 Megemlíthető továbbá, hogy a legújabb GLP-1 gyógyszerek, mint az Ozempic, a Wegovy és a Mounjaro nagymértékű fogyást ígérnek, de most olyan rizikók kerültek előtérbe, amelyek eddig kevés figyelmet kaptak...