2025. 02. 28., 13:29

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!
Az Inception Labs csütörtökön mutatta be új AI nyelvi modelljét, amely diffúziós technikákat használ a szövegek hagyományos modellekhez képest gyorsabb létrehozására. Míg a hagyományos modellek szóról szóra építik fel a szöveget, a Mercury-hez hasonló diffúziós alapú modellek teljes válaszokat generálnak egyszerre, egy kezdetben maszkolt állapotból finomítva azokat összefüggő szöveggé. Ez jelentős előrelépést jelent az AI-alapú szöveggenerálás területén, ahol a sebesség kritikus tényező lehet a gyakorlati alkalmazások során.

Hagyományos vs. diffúziós modellek: Az új megközelítés

A hagyományos nagy nyelvi modellek balról jobbra építik a szöveget, egyszerre csak egy tokent (szövegegységet) feldolgozva. Az “autoregresszió” nevű technikát használják, ahol minden szónak meg kell várnia az összes előző szót, mielőtt megjelenne. A képgenerálási modellektől inspirálva, a szöveg diffúziós nyelvi modellek, mint a LLaDA (amelyet a Renmin Egyetem és az Ant Group kutatói fejlesztettek) és a Mercury maszkolás-alapú megközelítést használnak. Ezek a modellek teljesen elzajosított tartalommal kezdenek, és fokozatosan “zajtalanítják” a kimenetet, így egyidejűleg fedik fel a válasz minden részét, nem pedig sorban.

Míg a kép diffúziós modellek folyamatos zajt adnak a pixelértékekhez, a szöveg diffúziós modellek nem tudnak folyamatos zajt alkalmazni a diszkrét tokenekre (szövegadatok darabjaira). Ehelyett speciális maszk tokenekkel helyettesítik őket, ami a szöveges megfelelője a zajnak. A LLaDA esetében a maszkolási valószínűség szabályozza a zaj szintjét, ahol a magas maszkolás magas zajt, az alacsony maszkolás pedig alacsony zajt jelent. A diffúziós folyamat a magas zajtól az alacsony zaj felé halad. Bár a LLaDA ezt maszkolási terminológiával írja le, a Mercury pedig zajterminológiát használ, mindkettő hasonló koncepciót alkalmaz a szöveggenerálásra, amely a diffúzióban gyökerezik.

Hogyan készülnek a szöveg diffúziós modellek?

A képszintézis-modellek létrehozásához hasonlóan a kutatók úgy építik fel a szöveg diffúziós modelleket, hogy neurális hálózatot tanítanak részlegesen elhomályosított adatokon, a modellel megjósoltatják a legvalószínűbb befejezést, majd összehasonlítják az eredményeket a tényleges válasszal. Ha a modell helyesen válaszol, a neurális hálózat azon kapcsolatai, amelyek a helyes válaszhoz vezettek, megerősödnek. Elegendő példa után a modell olyan kimeneteket tud generálni, amelyek elég valószerűek ahhoz, hogy hasznosak legyenek például programozási feladatokhoz.

Az Inception Labs szerint megközelítésük lehetővé teszi a modell számára, hogy finomítsa a kimeneteket és kezelje a hibákat, mivel nem korlátozódik csak a korábban generált szöveg figyelembevételére. Ez a párhuzamos feldolgozás teszi lehetővé a Mercury állítólagos 1000+ token/másodperces generálási sebességét.

Teljesítmény és sebesség: Lenyűgöző számok

Ezek a diffúziós modellek gyorsabban vagy hasonlóan teljesítenek a hasonló méretű hagyományos modellekhez képest. A LLaDA kutatói szerint 8 milliárd paraméteres modelljük a GPT-3-hoz hasonlóan teljesít különféle teljesítménymérések során, versenyképes eredményekkel olyan feladatokban, mint az MMLU, ARC és GSM8K.

Ugyanakkor, a Mercury drámai sebességnövekedést mutat. Mercury Coder Mini modelljük 88,0 százalékot ér el a HumanEval-on és 77,1 százalékot az MBPP-n – a GPT-4o-hoz hasonlóan –, miközben állítólag 1109 token/másodperc sebességgel működik, szemben a GPT-4o Mini 59 token/másodperces sebességével. Ez körülbelül 19-szeres sebességelőnyt jelent a GPT-4o Mini-vel szemben, miközben hasonló teljesítményt nyújt a kódolási teljesítményméréseken.

A Mercury dokumentációja szerint modelljei “több mint 1000 token/másodperces sebességgel futnak Nvidia H100-asokon, ami korábban csak egyedi chipekkel” volt lehetséges olyan specializált hardvergyártóktól, mint a Groq, a Cerebras és a SambaNova. Más sebességre optimalizált modellekkel összehasonlítva a feltételezett előny továbbra is jelentős – a Mercury Coder Mini állítólag körülbelül 5,5-ször gyorsabb, mint a Gemini 2.0 Flash-Lite (201 token/másodperc) és 18-szor gyorsabb, mint a Claude 3.5 Haiku (61 token/másodperc).


Új határok a nagy nyelvi modellek világában

A diffúziós modellek azonban néhányújabb kompromisszumra kényszerülnek . Általában több előremeneteli áthaladást (feldolgozási ciklust) igényelnek a hálózaton keresztül egy teljes válasz generálásához, szemben a hagyományos modellekkel, amelyeknek csak egy menet szükséges tokenenként. Mivel azonban a diffúziós modellek párhuzamosan dolgozzák fel az összes tokent, ezen többletmunka ellenére is nagyobb áteresztőképességet érnek el.

Az Inception szerint a sebességelőny hatással lehet a kódkiegészítő eszközökre, ahol az azonnali válasz befolyásolhatja a fejlesztői termelékenységet, a társalgási AI alkalmazásokra, az erőforrás-korlátozott környezetekre, például a mobilalkalmazásokra, és az AI-ügynökökre, amelyeknek gyorsan kell reagálniuk.

Ha a diffúzió-alapú nyelvi modellek megőrzik a minőséget a sebesség javítása mellett, megváltoztathatják az AI szöveggenerálás fejlődését. Eddig az AI-kutatók nyitottak voltak az új megközelítésekre.

Néhány kérdés fennmarad

Továbbra is kérdéses, hogy a nagyobb diffúziós modellek képesek-e felvenni a versenyt olyan modellekkel, mint a GPT-4o és a Claude 3.7 Sonnet, megbízható eredményeket tudnak-e produkálni sok konfabuláció nélkül, és hogy a megközelítés képes-e kezelni az egyre összetettebb szimulált gondolkodási feladatokat. Egyelőre ezek a modellek alternatívát kínálhatnak a kisebb AI nyelvi modellek számára, amelyek nem áldozzák fel a képességet a sebesség érdekében.

  • Te hogyan értékeled az alternatív architektúrák kísérletezését a transzformereken túl?
  • Mit gondolsz, a diffúziós modellek milyen hatással lehetnek a jövőbeli AI fejlesztésekre?
  • Te hogy érzel az AI szöveggenerálás fejlődésével kapcsolatos gyors technológiai változásokról?


Legfrissebb posztok

APP
MA 09:11

APPok, Amik Ingyenesek MA, 6/7

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Lively Letters – Phonics (iPhone/iPad)Ez az alkalmazás megjelenése után villámgyorsan az App Store legnépszerűbb, fizetős oktatási szoftverévé vált...

MA 08:55

A Bloober Team Star Trek-horrorja készül – lesz okunk rettegni?

🖖 Jó példa erre, hogy a lengyel Bloober Team egy igazán szokatlan sci-fi projektbe vág bele: pszichológiai horrorjátékot fejleszt a Star Trek-univerzumban...

MA 08:46

A monacói pálya szélén: Kim Kardashian Hamiltonnak drukkol

Erre utal többek között az, hogy Kim Kardashian a Monacói Nagydíj hétvégéjén igazán mindent beleadott, és testvérével, Khloéval együtt jelent meg a Forma–1 egyik legfényűzőbb futamán...

MA 08:37

A Tigriskirály sztárja, Doc Antle felmentve, ítéleteit eltörölték

A Tigriskirály (Tiger King) című sorozat sokat emlegetett szereplője, Doc Antle hatalmas győzelmet aratott a bíróságon: a virginiai legfelsőbb bíróság ugyanis hatályon kívül helyezte az összes, az oroszlánkölykök vásárlásával kapcsolatos elmarasztaló ítéletet...

MA 08:28

Az első Survivaton hamarosan lelepleződik – új fejezet a Vampire Survivorsban

A Vampire Survivors készítője, Luca Galante hamarosan bemutat egy új mellékágat, amelyet saját ötlete alapján „Survivaton”-nak nevez...

MA 08:01

A legmenőbb tokok Kindle-ödre: stílus és védelem egyben

📚 Jellemző, hogy egy új Kindle Paperwhite vagy Colorsoft beszerzése után az első feladat a megfelelő védőtok kiválasztása...

MA 07:46

A mai Quordle rendesen feladta a leckét

Ma a Quordle igazán próbára tette a játékosokat: mind az öt angol magánhangzó szerepelt benne, ráadásul két ritka betűvel is trükközött...

MA 07:37

A Tribeca fesztiválon debütált Madonna sztárokkal teli rövidfilmje

🎬 Péntek este a Tribeca Fesztiválon Madonna legújabb rövidfilmje, a Vallomások II (Confessions II) debütált, de ez az esemény távol állt a hagyományos filmpremierek csendes ünneplésétől...

MA 07:19

A kriptók 390 milliárd dollárt égetnek, bitcoin és ether beszakad

💸 A digitális pénzek világa az elmúlt héten elképesztő veszteségeket szenvedett el...

MA 07:11

Az Exodus legújabb bemutatója még erősebb Mass Effect-érzetet kelt

🚀 Az Archetype Entertainment fejlesztésében készülő sci-fi akció-RPG, az Exodus a Future Games Show-n kapott látványos, bővített játékmenet-videót, amely minden eddiginél közelebbről mutatja be a játékot...

MA 07:02

A Khadas Tea Pro: vékony, stílusos, ütős fejhallgató-DAC iPhone-hoz és Androidhoz

A prémium hangzás világában a Khadas Tea Pro felfrissíti a mobil zenehallgatást, legyen szó iPhone-ról, Androidról vagy akár számítógépről...

MA 06:55

A Starbucks dobta az MI-t: kilenc hónap után vissza a kézi leltárhoz

☕ Kilenc hónappal a nagy bejelentés után a Starbucks teljesen visszavonja MI-alapú leltározó rendszerét az összes észak-amerikai üzletéből...

MA 06:46

Az újabb Meta-trükk: stabilcoin a fizetés, de a gond a tiéd

💸 Meta nemrég bejelentette, hogy Kolumbiában és a Fülöp-szigeteken indulva, majd év végéig több mint 160 országra kiterjesztve tartalomkészítőknek ezentúl USDC-ben (dollárhoz kötött stabilcoinban) fizet – jelentős lépés ez a digitális fizetőeszközök elterjedése szempontjából...

MA 06:37

A hőhullámok butítanak: az állatok agresszívebbek és ügyetlenebbek

🥵 Dél-Afrika perzselő hőségében a déli bütykös varangygerléknél furcsa változások figyelhetők meg: a madarak képtelenek helyesen gondolkodni, egyszerű feladatokat sem tudnak megoldani...

MA 06:28

A Süllyedő Város 2 túlélőhorror demója már játszható augusztusi megjelenés előtt

💀 Ilyen eset például, amikor egy túl ambiciózus horrorjátékot újragondolnak: az első A süllyedő város (The Sinking City) története kifulladt az óriási, de üresnek érződő nyitott világban...

MA 06:19

A Gothic fejlesztői figyelik a zárfeltörés-vihart, PC-s összeomlásokra javítást ígérnek hétfőre

🔒 Ez a jelenség jól illusztrálható azzal, hogy még a felújított Gothic sem lett könnyebb, és a játékosok ugyanúgy megszenvednek a zárfeltöréssel, mint annak idején...

MA 06:05

Történelmi események a mai napon (Június 7.)

Rendkívüli nap a történelemben: alkotmányos mérföldkő Angliában, fordulatok a francia és a közel-keleti hadszíntereken, és egy merész légicsapás, amely átírta a Közel-Kelet nukleáris térképét...

szombat 21:22

A looksmaxxing sötét oldala: férfiasságromboló mellékhatások

💀 Lényeges szempont, hogy az utóbbi időben egyre több fiatal férfi próbálja különböző extrém módszerekkel, például plasztikai beavatkozásokkal, hormoninjekciókkal vagy szélsőséges fogyókúrával javítani a külsejét...

szombat 21:12

A kriptópionír, aki 20 millió dollárból milliárdos alapot épített, duplázik bitcoinra

💰 Annak vizsgálata, hogy egy 20 millió dolláros családi befektetésből miként lehet felépíteni egy több mint 1 milliárd dolláros birodalmat a kriptovaluták világában...

szombat 20:56

A nagy pénz megérkezett: a Polymarket már nem csak hóbort

💰 Egy lényeges szempont, hogy a Polymarket és a Kalshi váratlanul hatalmas forgalmat produkálnak, és ezzel magukhoz vonzzák a legnagyobb kvantitatív kereskedési cégeket...

szombat 20:45

Az eltűnt Google-okosóra nyomában: karibi búvárkaland és botrány

Lényeges, hogy a technológiai szivárgások sokféleképpen történhetnek, de néha egészen furcsa fordulatot vesznek...

szombat 20:34

A MI-n túl: konténerek, kvantumcsip – amit kihagytál a Microsoft Builden

⚡ A Microsoft Build 2026 eseményén minden a látványos platformbejelentésekről és MI-bemutatókról szólt, de több rejtettebb újdonság is született, amelyek a következő években még előtérbe kerülhetnek...

szombat 20:22

A tudósok riadót fújnak: veszélyes amőbák terjednek világszerte

😷 Vízhez és talajhoz kötődő mikrobák kerültek a kutatók figyelmének középpontjába mint rejtett veszélyforrások: bizonyos szabadon élő amőbák különösen veszélyessé válhatnak, ahogy a klíma melegszik, és a világszerte elöregedő vízhálózatok karbantartása elmarad...

szombat 20:11

Az erős kvantumállapotok meglepően egyszerű receptje

⚙ Többek között a jövő kvantumtechnológiái, például a szuperérzékeny szenzorok és a kvantumszámítógépek rendkívüli képességei az összefonódás nevű jelenségen alapulnak, amikor részecskék mélyen összekapcsolódnak, és egymásra olyan módon hatnak, amit a klasszikus fizika nem tud megmagyarázni...

szombat 20:01

Az új DMZ egy teljes értékű játék a Modern Warfare 4-ben

🎮 Egy lényeges szempont, hogy a Modern hadviselés 4. (Modern Warfare 4) fejlesztői most egy igazi DMZ-élményt ígérnek a játékosoknak: nem béta, nem mellékes extrakciós próbálkozás, hanem egy kiforrott, önálló játékmód a Call of Duty-univerzumban...

szombat 19:57

Az új őrület, a mogging, mindent eláraszt – gond ez?

A mogging egy pillanat alatt elárasztotta az internetet és a fiatalok szóhasználatát...

szombat 19:45

Az új Star Citizen-patch 385 küldetést hoz, de pilóták robbannak

🚀 A Star Citizen legújabb, Alpha 4.8.1-es frissítése elképesztő mennyiségű, összesen 385 aszteroida-védelmi küldetéssel bővült...

szombat 19:34

A Bitcoin diadalához négy erő kell – Saylor csatakiáltása

💰 Michael Saylor szerint a Bitcoin hosszú távú sikerének titka a különböző felhasználói csoportok együttműködésében rejlik...

szombat 19:22

A miniatűr röntgentávcső lehet a kulcs a Hold rejtett kémiájához

A tokiói kutatók úttörő elképzeléssel álltak elő: egy parányi röntgentávcső segítségével néhány éven belül részletes kémiai térkép készülhet a Hold egész felszínéről...