2025. 02. 28., 13:29

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!
Az Inception Labs csütörtökön mutatta be új AI nyelvi modelljét, amely diffúziós technikákat használ a szövegek hagyományos modellekhez képest gyorsabb létrehozására. Míg a hagyományos modellek szóról szóra építik fel a szöveget, a Mercury-hez hasonló diffúziós alapú modellek teljes válaszokat generálnak egyszerre, egy kezdetben maszkolt állapotból finomítva azokat összefüggő szöveggé. Ez jelentős előrelépést jelent az AI-alapú szöveggenerálás területén, ahol a sebesség kritikus tényező lehet a gyakorlati alkalmazások során.

Hagyományos vs. diffúziós modellek: Az új megközelítés

A hagyományos nagy nyelvi modellek balról jobbra építik a szöveget, egyszerre csak egy tokent (szövegegységet) feldolgozva. Az “autoregresszió” nevű technikát használják, ahol minden szónak meg kell várnia az összes előző szót, mielőtt megjelenne. A képgenerálási modellektől inspirálva, a szöveg diffúziós nyelvi modellek, mint a LLaDA (amelyet a Renmin Egyetem és az Ant Group kutatói fejlesztettek) és a Mercury maszkolás-alapú megközelítést használnak. Ezek a modellek teljesen elzajosított tartalommal kezdenek, és fokozatosan “zajtalanítják” a kimenetet, így egyidejűleg fedik fel a válasz minden részét, nem pedig sorban.

Míg a kép diffúziós modellek folyamatos zajt adnak a pixelértékekhez, a szöveg diffúziós modellek nem tudnak folyamatos zajt alkalmazni a diszkrét tokenekre (szövegadatok darabjaira). Ehelyett speciális maszk tokenekkel helyettesítik őket, ami a szöveges megfelelője a zajnak. A LLaDA esetében a maszkolási valószínűség szabályozza a zaj szintjét, ahol a magas maszkolás magas zajt, az alacsony maszkolás pedig alacsony zajt jelent. A diffúziós folyamat a magas zajtól az alacsony zaj felé halad. Bár a LLaDA ezt maszkolási terminológiával írja le, a Mercury pedig zajterminológiát használ, mindkettő hasonló koncepciót alkalmaz a szöveggenerálásra, amely a diffúzióban gyökerezik.

Hogyan készülnek a szöveg diffúziós modellek?

A képszintézis-modellek létrehozásához hasonlóan a kutatók úgy építik fel a szöveg diffúziós modelleket, hogy neurális hálózatot tanítanak részlegesen elhomályosított adatokon, a modellel megjósoltatják a legvalószínűbb befejezést, majd összehasonlítják az eredményeket a tényleges válasszal. Ha a modell helyesen válaszol, a neurális hálózat azon kapcsolatai, amelyek a helyes válaszhoz vezettek, megerősödnek. Elegendő példa után a modell olyan kimeneteket tud generálni, amelyek elég valószerűek ahhoz, hogy hasznosak legyenek például programozási feladatokhoz.

Az Inception Labs szerint megközelítésük lehetővé teszi a modell számára, hogy finomítsa a kimeneteket és kezelje a hibákat, mivel nem korlátozódik csak a korábban generált szöveg figyelembevételére. Ez a párhuzamos feldolgozás teszi lehetővé a Mercury állítólagos 1000+ token/másodperces generálási sebességét.

Teljesítmény és sebesség: Lenyűgöző számok

Ezek a diffúziós modellek gyorsabban vagy hasonlóan teljesítenek a hasonló méretű hagyományos modellekhez képest. A LLaDA kutatói szerint 8 milliárd paraméteres modelljük a GPT-3-hoz hasonlóan teljesít különféle teljesítménymérések során, versenyképes eredményekkel olyan feladatokban, mint az MMLU, ARC és GSM8K.

Ugyanakkor, a Mercury drámai sebességnövekedést mutat. Mercury Coder Mini modelljük 88,0 százalékot ér el a HumanEval-on és 77,1 százalékot az MBPP-n – a GPT-4o-hoz hasonlóan –, miközben állítólag 1109 token/másodperc sebességgel működik, szemben a GPT-4o Mini 59 token/másodperces sebességével. Ez körülbelül 19-szeres sebességelőnyt jelent a GPT-4o Mini-vel szemben, miközben hasonló teljesítményt nyújt a kódolási teljesítményméréseken.

A Mercury dokumentációja szerint modelljei “több mint 1000 token/másodperces sebességgel futnak Nvidia H100-asokon, ami korábban csak egyedi chipekkel” volt lehetséges olyan specializált hardvergyártóktól, mint a Groq, a Cerebras és a SambaNova. Más sebességre optimalizált modellekkel összehasonlítva a feltételezett előny továbbra is jelentős – a Mercury Coder Mini állítólag körülbelül 5,5-ször gyorsabb, mint a Gemini 2.0 Flash-Lite (201 token/másodperc) és 18-szor gyorsabb, mint a Claude 3.5 Haiku (61 token/másodperc).


Új határok a nagy nyelvi modellek világában

A diffúziós modellek azonban néhányújabb kompromisszumra kényszerülnek . Általában több előremeneteli áthaladást (feldolgozási ciklust) igényelnek a hálózaton keresztül egy teljes válasz generálásához, szemben a hagyományos modellekkel, amelyeknek csak egy menet szükséges tokenenként. Mivel azonban a diffúziós modellek párhuzamosan dolgozzák fel az összes tokent, ezen többletmunka ellenére is nagyobb áteresztőképességet érnek el.

Az Inception szerint a sebességelőny hatással lehet a kódkiegészítő eszközökre, ahol az azonnali válasz befolyásolhatja a fejlesztői termelékenységet, a társalgási AI alkalmazásokra, az erőforrás-korlátozott környezetekre, például a mobilalkalmazásokra, és az AI-ügynökökre, amelyeknek gyorsan kell reagálniuk.

Ha a diffúzió-alapú nyelvi modellek megőrzik a minőséget a sebesség javítása mellett, megváltoztathatják az AI szöveggenerálás fejlődését. Eddig az AI-kutatók nyitottak voltak az új megközelítésekre.

Néhány kérdés fennmarad

Továbbra is kérdéses, hogy a nagyobb diffúziós modellek képesek-e felvenni a versenyt olyan modellekkel, mint a GPT-4o és a Claude 3.7 Sonnet, megbízható eredményeket tudnak-e produkálni sok konfabuláció nélkül, és hogy a megközelítés képes-e kezelni az egyre összetettebb szimulált gondolkodási feladatokat. Egyelőre ezek a modellek alternatívát kínálhatnak a kisebb AI nyelvi modellek számára, amelyek nem áldozzák fel a képességet a sebesség érdekében.

  • Te hogyan értékeled az alternatív architektúrák kísérletezését a transzformereken túl?
  • Mit gondolsz, a diffúziós modellek milyen hatással lehetnek a jövőbeli AI fejlesztésekre?
  • Te hogy érzel az AI szöveggenerálás fejlődésével kapcsolatos gyors technológiai változásokról?


Legfrissebb posztok

MA 13:34

Az elveszett emlékek felébresztése: új remény az Alzheimer-kór ellen

Alzheimer-kór esetén a számok riasztóak: világszerte milliókat érint, az esetek száma rohamosan emelkedik, a költségek már ezermilliárd forint fölött járnak...

MA 13:24

Az MI-forradalom spórol: a Google lefaragja a memóriaigényt

Érdemes megvizsgálni, miként alakítja át a Google új fejlesztése az MI-algoritmusok működését — különösen most, amikor a chatbotok és más MI-megoldások iránti kereslet berobbant, de a háttérben hatalmas hardverigények rejtőznek...

MA 13:12

Az udvarias MI csapdája: miért ne higgyünk vakon?

Az MI-kkel való együttműködés sokszor egyszerűbbnek és hatékonyabbnak tűnik, ha mindig megerősítik a véleményünket...

MA 13:01

A titok, amitől az MI-beszélgetések végig fókuszban maradnak

A gépi beszélgetések könnyen válnak kóborlóvá, ha több témát érintünk, főként ha hosszan és céltudatosan szeretnénk megtárgyalni valamit...

MA 12:56

A baj sosem alszik: az IT-gondok fele munkaidőn túl jön

🚽 Érdemes megvizsgálni, hogy a hibrid munkavégzés milyen kihívások elé állítja az informatikai csapatokat...

MA 12:35

Az újabb világbajnokság előtt kibervédelmi káosz fenyegeti a mobilhálózatokat?

🛡 Három országban – az Egyesült Államokban, Mexikóban és Kanadában – rendezik meg a 2026-os FIFA Labdarúgó-világbajnokságot, amelyre előreláthatóan 6,5 millió rajongó érkezik majd a világ minden tájáról...

MA 12:23

Az új Dogecoin-őrület: leválik a Bitcoinról?

💸 A Dogecoin ismét a figyelem középpontjába került: a kriptovaluta árfolyama az elmúlt napokban közel 10%-ot erősödött, rövid időre elérve a 11 centes csúcsot, mielőtt 0,105 dollárnál, azaz mintegy 39 forintnál stabilizálódott...

MA 11:56

A GPT-6 goblininváziójának előszele már érezhető?

💀 Ilyen eset például, amikor egy szimpla, munkahelyi belső poén rögtön a technológiai világ egyik legérdekesebb pletykájává válik: Sam Altman egy laza megjegyzéssel már pedzegette, hogy hamarosan érkezik a GPT-6 – ráadásul „több goblinnal”, mint eddig bármikor...

MA 11:23

A WLFI-özön: Trump kedvence elszabadítja a tokenáradatot

Nem hiszem el, de a World Liberty Financial épp most készül elengedni 62 milliárd WLFI tokent, egy közel teljes egyetértés mellett meghozott szavazás után...

MA 11:12

Az amerikai államkötvények padlóra küldik a bitcoint

💸 Az amerikai kincstár 30 éves államkötvényének hozama 5%-ra ugrott, ami évek óta nem látott magasság, megközelítve a 2025...

MA 10:58

Az Amazon mindent kockára tesz: indul a felhős MI-háború

Az Amazon egy teljesen új korszakot nyitott meg a vállalati MI-szolgáltatásokban, amikor bejelentette, hogy a legfejlettebb OpenAI-modellek mostantól elérhetők az Amazon Bedrockon, és ezzel véget vetett a felhőszolgáltatói kizárólagosságnak...

MA 10:43

Fotonteleportáció élesben: tényleg küszöbön a kvantuminternet?

Egy vezető nemzetközi kutatócsoportnak először sikerült egy foton állapotát kvantumteleportációval átvinni két, egymástól fizikailag távol lévő kvantumpont között...

MA 10:36

A táskának is álcázott okostelefon: Dreame Aurora – forradalom vagy giccs?

A Dreame Next rendezvény harmadik napján a Dreame két igazán különleges okostelefont mutatott be a közönségnek, amelyek dizájnja egyeseknél rajongást, másoknál viszolygást váltott ki...

MA 10:29

A térdfájdalom ellenszere: egy speciális cipő és bicikli?

🚴 Térdízületi porckopás esetén rengetegen keresik a legjobb természetes fájdalomcsillapítót, és most végre megérkezett egy átfogó válasz...

MA 10:22

Az MI rávágja a választ, de nem érti a kérdést

💭 Az emberi gondolkodás pontos működését régóta próbálják megfejteni a pszichológusok: vajon létezik-e egységes elmélet, vagy külön-külön kell vizsgálni a figyelmet, a memóriát és más agyi funkciókat?..

MA 10:08

Az óceán mélyén lassan kettéhasad a Föld

A Csendes-óceán északnyugati partjai alatt épp egyedülálló geológiai folyamat játszódik le: a szakértők először kaptak tiszta képet arról, miként szakad szét egy alábukó (szubdukciós) zóna...

MA 10:01

A kriptovilág új fegyvere: a HYPE token letarolja a piacot?

🔥 Erre utal többek között az, hogy a decentralizált Hyperliquid tőzsde egyre nagyobb ambíciókkal lép be az eseményalapú fogadási piacokra...

MA 09:57

A falnak rohant az MI-alapú visszakeresés: újra kell gondolni a RAG-ot

Az elmúlt negyedévben alapjaiban változott meg, ahogy a nagyvállalatok a visszakeresésen alapuló generatív MI-rendszereket (RAG) használják...

MA 09:36

Az orr titkos térképe: így fejti meg a világ szagait

Sokáig óriási rejtély volt, miként érzékeljük és dolgozzuk fel a szagokat...

MA 09:29

Az IBM Bob elhozza az MI-fejlesztés új korszakát

Az MI-alapú ügynökök megjelenése egyre inkább mindennapos a vállalati szoftverfejlesztésben. Amint a fejlesztők új platformokkal kísérleteznek, a szervezetek fokozottan ki vannak téve a biztonsági és szervezeti hibáknak...

MA 09:22

Az új fogyasztószer tényleg vakságot okoz? Itt tartunk most

👀 Az utóbbi évek nagy slágere lett a testsúlycsökkentő szerek között a Wegovy, de egy friss kutatás most aggodalmat keltett: kapcsolat lehet a gyógyszer használata és a ritka, úgynevezett „szemguta” (ischaemiás optikus neuropátia, röviden ION) között...

MA 09:15

A következő Tales of-remaster, amire senki sem számított!

A Bandai Namco továbbra sem hagyja unatkozni a Tales of-rajongókat; újabb klasszikusnak készül új életet adni...

APP
MA 09:12

APPok, Amik Ingyenesek MA, 4/30

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Sight Words: Dolch Coach (iPhone/iPad)Ez a játék élményszerűen fejleszti az angol olvasási készséget, hiszen az összes Dolch Sight Words szintet lefedi...

MA 09:07

Az őskori spanyol bányákban rejtőzhet a skandináv rejtély kulcsa

Érdekes fejlemény, hogy hat eddig ismeretlen bronzkori bányát tártak fel Délnyugat-Spanyolországban, Extremadurában, amelyek új fényt vethetnek a skandináv bronzkori fémek eredetére...

MA 09:01

Az óriáscégek megállíthatatlanul lapátolják a milliárdokat a mesterséges intelligenciába

A világ legnagyobb technológiai vállalatai egészen elképesztő összegeket fektetnek az MI-infrastruktúra fejlesztésébe...

MA 08:57

Az első 3D-s felvétel, ahogy T-sejtek leszámolnak a rákkal

A citotoxikus T-limfociták az immunrendszer különleges „gyilkos” sejtjei, amelyek hihetetlen pontossággal képesek felismerni és elpusztítani a fertőzött vagy rákos sejteket...

MA 08:50

Jönnek a robotok: átveszik a csomagkezelést a reptereken

🤖 Fontos kérdés, hogy meddig kell még embereknek cipekedniük a reptereken, vagy hamarosan átvehetik a helyüket a gépek...

MA 08:28

Az AWS Quick forradalmasítja a munkahelyi automatizációt

Többek között az AWS Quick olyan teljesen új lehetőségeket hozott a vállalati MI-rendszerekbe, amelyek eddig a központi irányítópultok számára láthatatlanok voltak...

MA 08:22

Az olajár-sokk ismét földhöz vágta a Bitcoint és a kriptopiacot

Érdekes felvetés, hogy a geopolitikai feszültségek mennyire befolyásolják a kriptovaluták árfolyamát, különösen, amikor az olaj ára hirtelen szárnyal...