2025. 02. 28., 13:29

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!
Az Inception Labs csütörtökön mutatta be új AI nyelvi modelljét, amely diffúziós technikákat használ a szövegek hagyományos modellekhez képest gyorsabb létrehozására. Míg a hagyományos modellek szóról szóra építik fel a szöveget, a Mercury-hez hasonló diffúziós alapú modellek teljes válaszokat generálnak egyszerre, egy kezdetben maszkolt állapotból finomítva azokat összefüggő szöveggé. Ez jelentős előrelépést jelent az AI-alapú szöveggenerálás területén, ahol a sebesség kritikus tényező lehet a gyakorlati alkalmazások során.

Hagyományos vs. diffúziós modellek: Az új megközelítés

A hagyományos nagy nyelvi modellek balról jobbra építik a szöveget, egyszerre csak egy tokent (szövegegységet) feldolgozva. Az “autoregresszió” nevű technikát használják, ahol minden szónak meg kell várnia az összes előző szót, mielőtt megjelenne. A képgenerálási modellektől inspirálva, a szöveg diffúziós nyelvi modellek, mint a LLaDA (amelyet a Renmin Egyetem és az Ant Group kutatói fejlesztettek) és a Mercury maszkolás-alapú megközelítést használnak. Ezek a modellek teljesen elzajosított tartalommal kezdenek, és fokozatosan “zajtalanítják” a kimenetet, így egyidejűleg fedik fel a válasz minden részét, nem pedig sorban.

Míg a kép diffúziós modellek folyamatos zajt adnak a pixelértékekhez, a szöveg diffúziós modellek nem tudnak folyamatos zajt alkalmazni a diszkrét tokenekre (szövegadatok darabjaira). Ehelyett speciális maszk tokenekkel helyettesítik őket, ami a szöveges megfelelője a zajnak. A LLaDA esetében a maszkolási valószínűség szabályozza a zaj szintjét, ahol a magas maszkolás magas zajt, az alacsony maszkolás pedig alacsony zajt jelent. A diffúziós folyamat a magas zajtól az alacsony zaj felé halad. Bár a LLaDA ezt maszkolási terminológiával írja le, a Mercury pedig zajterminológiát használ, mindkettő hasonló koncepciót alkalmaz a szöveggenerálásra, amely a diffúzióban gyökerezik.

Hogyan készülnek a szöveg diffúziós modellek?

A képszintézis-modellek létrehozásához hasonlóan a kutatók úgy építik fel a szöveg diffúziós modelleket, hogy neurális hálózatot tanítanak részlegesen elhomályosított adatokon, a modellel megjósoltatják a legvalószínűbb befejezést, majd összehasonlítják az eredményeket a tényleges válasszal. Ha a modell helyesen válaszol, a neurális hálózat azon kapcsolatai, amelyek a helyes válaszhoz vezettek, megerősödnek. Elegendő példa után a modell olyan kimeneteket tud generálni, amelyek elég valószerűek ahhoz, hogy hasznosak legyenek például programozási feladatokhoz.

Az Inception Labs szerint megközelítésük lehetővé teszi a modell számára, hogy finomítsa a kimeneteket és kezelje a hibákat, mivel nem korlátozódik csak a korábban generált szöveg figyelembevételére. Ez a párhuzamos feldolgozás teszi lehetővé a Mercury állítólagos 1000+ token/másodperces generálási sebességét.

Teljesítmény és sebesség: Lenyűgöző számok

Ezek a diffúziós modellek gyorsabban vagy hasonlóan teljesítenek a hasonló méretű hagyományos modellekhez képest. A LLaDA kutatói szerint 8 milliárd paraméteres modelljük a GPT-3-hoz hasonlóan teljesít különféle teljesítménymérések során, versenyképes eredményekkel olyan feladatokban, mint az MMLU, ARC és GSM8K.

Ugyanakkor, a Mercury drámai sebességnövekedést mutat. Mercury Coder Mini modelljük 88,0 százalékot ér el a HumanEval-on és 77,1 százalékot az MBPP-n – a GPT-4o-hoz hasonlóan –, miközben állítólag 1109 token/másodperc sebességgel működik, szemben a GPT-4o Mini 59 token/másodperces sebességével. Ez körülbelül 19-szeres sebességelőnyt jelent a GPT-4o Mini-vel szemben, miközben hasonló teljesítményt nyújt a kódolási teljesítményméréseken.

A Mercury dokumentációja szerint modelljei “több mint 1000 token/másodperces sebességgel futnak Nvidia H100-asokon, ami korábban csak egyedi chipekkel” volt lehetséges olyan specializált hardvergyártóktól, mint a Groq, a Cerebras és a SambaNova. Más sebességre optimalizált modellekkel összehasonlítva a feltételezett előny továbbra is jelentős – a Mercury Coder Mini állítólag körülbelül 5,5-ször gyorsabb, mint a Gemini 2.0 Flash-Lite (201 token/másodperc) és 18-szor gyorsabb, mint a Claude 3.5 Haiku (61 token/másodperc).


Új határok a nagy nyelvi modellek világában

A diffúziós modellek azonban néhányújabb kompromisszumra kényszerülnek . Általában több előremeneteli áthaladást (feldolgozási ciklust) igényelnek a hálózaton keresztül egy teljes válasz generálásához, szemben a hagyományos modellekkel, amelyeknek csak egy menet szükséges tokenenként. Mivel azonban a diffúziós modellek párhuzamosan dolgozzák fel az összes tokent, ezen többletmunka ellenére is nagyobb áteresztőképességet érnek el.

Az Inception szerint a sebességelőny hatással lehet a kódkiegészítő eszközökre, ahol az azonnali válasz befolyásolhatja a fejlesztői termelékenységet, a társalgási AI alkalmazásokra, az erőforrás-korlátozott környezetekre, például a mobilalkalmazásokra, és az AI-ügynökökre, amelyeknek gyorsan kell reagálniuk.

Ha a diffúzió-alapú nyelvi modellek megőrzik a minőséget a sebesség javítása mellett, megváltoztathatják az AI szöveggenerálás fejlődését. Eddig az AI-kutatók nyitottak voltak az új megközelítésekre.

Néhány kérdés fennmarad

Továbbra is kérdéses, hogy a nagyobb diffúziós modellek képesek-e felvenni a versenyt olyan modellekkel, mint a GPT-4o és a Claude 3.7 Sonnet, megbízható eredményeket tudnak-e produkálni sok konfabuláció nélkül, és hogy a megközelítés képes-e kezelni az egyre összetettebb szimulált gondolkodási feladatokat. Egyelőre ezek a modellek alternatívát kínálhatnak a kisebb AI nyelvi modellek számára, amelyek nem áldozzák fel a képességet a sebesség érdekében.

  • Te hogyan értékeled az alternatív architektúrák kísérletezését a transzformereken túl?
  • Mit gondolsz, a diffúziós modellek milyen hatással lehetnek a jövőbeli AI fejlesztésekre?
  • Te hogy érzel az AI szöveggenerálás fejlődésével kapcsolatos gyors technológiai változásokról?


Legfrissebb posztok

MA 17:45

A válogatós cégek MI-tudást követelnek: bajban az informatikusok

A kaliforniai techszektorban dolgozók tömegei még mindig abban reménykednek, hogy a munkaerőpiac végre talpra áll, de valójában egyre nehezebb új állást találni...

MA 17:34

A KFC visszavág: csont nélküli csirke és új italok

Az ikonikus gyorsétteremlánc most új stratégiához nyúl: teljesen átalakítja kínálatát, hangsúlyt helyezve a csont nélküli csirkére, különleges szószokra és izgalmas, élményalapú vendéglátásra...

MA 17:23

A Tejútrendszer szívében hatalmas szupernóva lehetséges maradványaira bukkant a NASA

💫 26 ezer fényévnyi távolságból figyelte meg a NASA Chandra Röntgen Obszervatóriuma a Tejútrendszer egyik leglátványosabb jelenségét...

MA 17:01

Az egyetemisták tömegesen felejtenek el olvasni?

Egy irodalmat és íráskészséget oktató egyetemi tanár, Tyler Jagt meglepő tapasztalatairól számolt be: egyik diákja sem tudott végigolvasni egy húszoldalas, kötelező tanulmányt, amelyet ő maga még egy évtizede egyetemistaként gond nélkül elolvasott...

MA 16:23

Az MI-felügyelőkre vadásznak a cégek: berobban a brit munkaerőpiac

Ami először apróságnak tűnt, mára gyökeresen átalakítja a brit munkaerőpiacot: a mesterséges intelligencia iránti kereslet ugrásszerűen megnőtt az utóbbi évben...

MA 16:12

A rekord egynapos esetszámugrás az Ebola-járványban Kongóban, egy hónappal a kitörés után

😷 Kongóban az Ebola-járvány minden eddiginél gyorsabban terjed, miközben az egészségügyi hatóságok igyekeznek lépést tartani az egyre növekvő esetszámmal...

MA 16:01

Az Antarktisz alatt több száz rejtett földrengést fedeztek fel – szokatlan helyen

Senki sem várta volna, hogy az Antarktisz rejtett, rendszeres földrengésekkel lepi meg a tudósokat...

MA 15:56

A Google lebuktatta a következő Pixel Dropot: képernyőreakciók, fizetős extrák

Tipikus eset, amikor egy vállalat maga szivárogtatja ki a nagy újításai részleteit, így mire a hivatalos bejelentés megtörténik, már mindenki tudja, mire számíthat...

MA 15:45

A SpaceX óriási tőzsdei bevezetése mindent a feje tetejére állíthat

Különösen igaz ez akkor, ha a befektetők már hónapok óta várnak valami nagy visszatérésre a tőzsdén...

MA 15:34

A Google AI-módja mostantól helyetted tartja számon az információkat

📝 A Google újabb nagy dobással jelentkezik: már valóság az a funkció, amelyben személyes digitális ügynököd veszi le a válladról az állandó keresgélést és a friss információkra való vadászatot...

MA 15:23

Az AMD Radeon RX 9070 XT váratlanul tarol a Steam-felmérésben

🔥 Az AMD új Radeon RX 9070 XT videókártyája váratlanul népszerűvé vált a gamerek körében: a legfrissebb Steam hardverfelmérés szerint májusban már 1,33%-os részesedést szerzett a felhasználók között, ezzel az első helyre került az AMD GPU-k között...

MA 15:02

Az NHS–Palantir adatüzletet visszaküldték újabb felülvizsgálatra

Jellemző példa erre, hogy a brit kormány felülvizsgálja a Palantirral kötött szerződését, amelynek célja az angliai Nemzeti Egészségügyi Szolgálat (NHS) több százezres nagyságrendű elmaradt, tervezett ellátásainak digitalizálása és felgyorsítása...

MA 14:56

Az AMD megtagadta a 10 ezer dolláros jutalmat – kitört a botrány

Egy kutató, Paul komoly sebezhetőséget talált az AMD szoftverében: egy távoli kódfuttatásra (RCE) alkalmas hibát fedezett fel a frissítőprogramban, amit közbeékelődéses (MITM-) támadással ki lehetett volna használni...

MA 14:45

Az alvilág ura: Mictlantecuhtli 500 éves, hátborzongató maszkja

Ámulatba ejtő, koponyára emlékeztető fa maszk idézi meg az azték alvilág hatalmas urát, Mictlantecuhtlit...

MA 14:34

Az Insta360 visszaperel: kirobban a szabadalmi háború a DJI ellen

🔫 Az akciókamerák világában újabb fordulóhoz érkezett a versengés: az Insta360 saját jogi lépésekkel vág vissza a DJI ellen...

MA 14:23

A színpadról a csillagok közé: Erini Lambrides a NASA-nál

🌌 Különösen igaz ez, hogy ha a gyerekkori álmainkat felnőttként is követjük, gyakran teljesen váratlan ösvényekre sodródhatunk...

MA 13:56

Az MI koronáját nem Amerika viseli – a világ így látja

Kína lassan megelőzi az Egyesült Államokat a mesterséges intelligencia fejlesztésében, és ezt világszerte egyre többen is így látják...

MA 13:33

A dolgozók annyit pesztrálják az MI-t, mint amennyit dolgoznak

A dolgozók kezéből egyre többet vesz át a mesterséges intelligencia, mégis rengeteg új, eddig ismeretlen feladat keletkezik...

MA 13:12

A lábunk alatt húzódik a Földet összekötő gombasztráda

Érdemes megérteni, hogy a lábunk alatt egy szinte felfoghatatlanul kiterjedt, láthatatlan hálózat húzódik: ez a gombafonalakból álló rendszer 110 billiárd kilométer hosszan behálózza a talajainkat...

MA 13:01

Az ARK Invest félmilliárdnál is többet költött SpaceX-részvényekre az IPO-n

Pénteken, a SpaceX történelmi tőzsdei bevezetésekor az ARK Invest közel 3,3 millió részvényt vásárolt, így több mint 180 milliárd forintos (500 millió USD) pozíciót épített ki egyetlen nap alatt...

MA 12:34

Az igazság órája: felelős a Google a hibás MI-összefoglalókért

A techóriások eddig messzire kerülték, hogy felelősséget vállaljanak azért, ha termékeik vagy szolgáltatásaik hibásan működnek, vagy félrevezető információkat adnak...

MA 12:01

A cégednek nem ad hoc MI-trükkök kellenek – íme, miért

A legtöbb vállalat manapság egyszerűen csak rá akarja húzni a mesterséges intelligenciát egy olyan működési modellre, amelyet még a múlt század stabil, kiszámítható világára szabtak...

MA 11:56

Az MI és a blokklánc Ázsiában olvad össze, megelőzve a Nyugatot

🧾 Ami kezdetben csak kriptovaluta-boomként indult, mára egy sokkal szélesebb technológiai összefonódás jeleit mutatja...

MA 11:02

Az űripar királynője, papírfecnivel a cipőjében

Senki sem várta volna, hogy egy amerikai nő, akit gyerekként untatott az Apollo–11 holdraszállása, egyszer egy több mint 650 milliárd forintot érő vállalat egyik arca lesz – és története még ma is elképesztően inspiráló...

MA 10:56

Az XPENG önvezető forradalmának kulcsa az MI

🚗 A kínai XPENG új fejezetet nyit az önvezető járművek világában. A cég szerint a legújabb fejlesztésű VLA 2...

MA 10:45

Az új Windows-frissítés hat appot turbóz, a Photos vízjelez Copilot-képeken, alapból kikapcsolva

Erre utal többek között az, hogy a Microsoft hat alapvető Windows-alkalmazást fejlesztett tovább egy átfogó frissítéssel: a Photos, Paint, Calculator, Clock, Media Player, valamint a Voice Recorder újdonságokat kapott...

MA 10:37

A 2026-os vb-utazóknak fontos: legális a VPN az USA-ban, Kanadában, Mexikóban?

A három országon átívelő 2026-os labdarúgó-világbajnokságra több millió szurkoló készül, akik az USA, Kanada és Mexikó városai között utaznak majd...

MA 10:28

Az oxfordi fizikusok új szintre emelték Schrödinger macskáját

Az Oxfordi Egyetem kutatói egy teljesen újfajta kvantumszuperpozíciót hoztak létre, amely a híres Schrödinger-macska gondolatkísérletnél is érdekesebb eredményeket mutat...

MA 10:19

Az Anthropic leállította a Fable 5 és a Mythos 5 hozzáférését

🚫 Hétvégén váratlan fordulat történt: hirtelen megszűnt a hozzáférés a Fable 5 és a Mythos 5 MI-modellekhez...