2025. 02. 28., 13:29

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!

Újfajta nyelvi mesterséges intelligencia: induljunk ki a zajból!
Az Inception Labs csütörtökön mutatta be új AI nyelvi modelljét, amely diffúziós technikákat használ a szövegek hagyományos modellekhez képest gyorsabb létrehozására. Míg a hagyományos modellek szóról szóra építik fel a szöveget, a Mercury-hez hasonló diffúziós alapú modellek teljes válaszokat generálnak egyszerre, egy kezdetben maszkolt állapotból finomítva azokat összefüggő szöveggé. Ez jelentős előrelépést jelent az AI-alapú szöveggenerálás területén, ahol a sebesség kritikus tényező lehet a gyakorlati alkalmazások során.

Hagyományos vs. diffúziós modellek: Az új megközelítés

A hagyományos nagy nyelvi modellek balról jobbra építik a szöveget, egyszerre csak egy tokent (szövegegységet) feldolgozva. Az “autoregresszió” nevű technikát használják, ahol minden szónak meg kell várnia az összes előző szót, mielőtt megjelenne. A képgenerálási modellektől inspirálva, a szöveg diffúziós nyelvi modellek, mint a LLaDA (amelyet a Renmin Egyetem és az Ant Group kutatói fejlesztettek) és a Mercury maszkolás-alapú megközelítést használnak. Ezek a modellek teljesen elzajosított tartalommal kezdenek, és fokozatosan “zajtalanítják” a kimenetet, így egyidejűleg fedik fel a válasz minden részét, nem pedig sorban.

Míg a kép diffúziós modellek folyamatos zajt adnak a pixelértékekhez, a szöveg diffúziós modellek nem tudnak folyamatos zajt alkalmazni a diszkrét tokenekre (szövegadatok darabjaira). Ehelyett speciális maszk tokenekkel helyettesítik őket, ami a szöveges megfelelője a zajnak. A LLaDA esetében a maszkolási valószínűség szabályozza a zaj szintjét, ahol a magas maszkolás magas zajt, az alacsony maszkolás pedig alacsony zajt jelent. A diffúziós folyamat a magas zajtól az alacsony zaj felé halad. Bár a LLaDA ezt maszkolási terminológiával írja le, a Mercury pedig zajterminológiát használ, mindkettő hasonló koncepciót alkalmaz a szöveggenerálásra, amely a diffúzióban gyökerezik.

Hogyan készülnek a szöveg diffúziós modellek?

A képszintézis-modellek létrehozásához hasonlóan a kutatók úgy építik fel a szöveg diffúziós modelleket, hogy neurális hálózatot tanítanak részlegesen elhomályosított adatokon, a modellel megjósoltatják a legvalószínűbb befejezést, majd összehasonlítják az eredményeket a tényleges válasszal. Ha a modell helyesen válaszol, a neurális hálózat azon kapcsolatai, amelyek a helyes válaszhoz vezettek, megerősödnek. Elegendő példa után a modell olyan kimeneteket tud generálni, amelyek elég valószerűek ahhoz, hogy hasznosak legyenek például programozási feladatokhoz.

Az Inception Labs szerint megközelítésük lehetővé teszi a modell számára, hogy finomítsa a kimeneteket és kezelje a hibákat, mivel nem korlátozódik csak a korábban generált szöveg figyelembevételére. Ez a párhuzamos feldolgozás teszi lehetővé a Mercury állítólagos 1000+ token/másodperces generálási sebességét.

Teljesítmény és sebesség: Lenyűgöző számok

Ezek a diffúziós modellek gyorsabban vagy hasonlóan teljesítenek a hasonló méretű hagyományos modellekhez képest. A LLaDA kutatói szerint 8 milliárd paraméteres modelljük a GPT-3-hoz hasonlóan teljesít különféle teljesítménymérések során, versenyképes eredményekkel olyan feladatokban, mint az MMLU, ARC és GSM8K.

Ugyanakkor, a Mercury drámai sebességnövekedést mutat. Mercury Coder Mini modelljük 88,0 százalékot ér el a HumanEval-on és 77,1 százalékot az MBPP-n – a GPT-4o-hoz hasonlóan –, miközben állítólag 1109 token/másodperc sebességgel működik, szemben a GPT-4o Mini 59 token/másodperces sebességével. Ez körülbelül 19-szeres sebességelőnyt jelent a GPT-4o Mini-vel szemben, miközben hasonló teljesítményt nyújt a kódolási teljesítményméréseken.

A Mercury dokumentációja szerint modelljei “több mint 1000 token/másodperces sebességgel futnak Nvidia H100-asokon, ami korábban csak egyedi chipekkel” volt lehetséges olyan specializált hardvergyártóktól, mint a Groq, a Cerebras és a SambaNova. Más sebességre optimalizált modellekkel összehasonlítva a feltételezett előny továbbra is jelentős – a Mercury Coder Mini állítólag körülbelül 5,5-ször gyorsabb, mint a Gemini 2.0 Flash-Lite (201 token/másodperc) és 18-szor gyorsabb, mint a Claude 3.5 Haiku (61 token/másodperc).


Új határok a nagy nyelvi modellek világában

A diffúziós modellek azonban néhányújabb kompromisszumra kényszerülnek . Általában több előremeneteli áthaladást (feldolgozási ciklust) igényelnek a hálózaton keresztül egy teljes válasz generálásához, szemben a hagyományos modellekkel, amelyeknek csak egy menet szükséges tokenenként. Mivel azonban a diffúziós modellek párhuzamosan dolgozzák fel az összes tokent, ezen többletmunka ellenére is nagyobb áteresztőképességet érnek el.

Az Inception szerint a sebességelőny hatással lehet a kódkiegészítő eszközökre, ahol az azonnali válasz befolyásolhatja a fejlesztői termelékenységet, a társalgási AI alkalmazásokra, az erőforrás-korlátozott környezetekre, például a mobilalkalmazásokra, és az AI-ügynökökre, amelyeknek gyorsan kell reagálniuk.

Ha a diffúzió-alapú nyelvi modellek megőrzik a minőséget a sebesség javítása mellett, megváltoztathatják az AI szöveggenerálás fejlődését. Eddig az AI-kutatók nyitottak voltak az új megközelítésekre.

Néhány kérdés fennmarad

Továbbra is kérdéses, hogy a nagyobb diffúziós modellek képesek-e felvenni a versenyt olyan modellekkel, mint a GPT-4o és a Claude 3.7 Sonnet, megbízható eredményeket tudnak-e produkálni sok konfabuláció nélkül, és hogy a megközelítés képes-e kezelni az egyre összetettebb szimulált gondolkodási feladatokat. Egyelőre ezek a modellek alternatívát kínálhatnak a kisebb AI nyelvi modellek számára, amelyek nem áldozzák fel a képességet a sebesség érdekében.

  • Te hogyan értékeled az alternatív architektúrák kísérletezését a transzformereken túl?
  • Mit gondolsz, a diffúziós modellek milyen hatással lehetnek a jövőbeli AI fejlesztésekre?
  • Te hogy érzel az AI szöveggenerálás fejlődésével kapcsolatos gyors technológiai változásokról?


Legfrissebb posztok

MA 10:56

Az otthoni genetikai tesztek csábító ígéretei és kockázatos buktatói

🔍 Az elmúlt évtized ugrásszerű fejlődést hozott az emberi genetika terén, miközben egyre több genetikai technológia lépett ki a laboratóriumokból, és vált elérhetővé a fogyasztók számára is...

MA 10:46

Az új Galaxy S26 Ultra brutális drágulása: ki ússza meg?

💸 Vásárlók milliói várják, hogy végre bemutatkozzon a Samsung legújabb zászlóshajója, a Galaxy S26 széria...

MA 10:30

Az amerikai támogatásmegvonás padlóra küldi a tudományos újságírást

2025 júniusában hatalmas visszhangot keltő oknyomozó riport buktatta le az illegális fakitermelést, amely a védett kongói esőerdők fáit csempészte át Burundiba...

MA 10:19

A beszédfelismerés forradalma: megérkezett a Wispr Flow Androidra

🗩 A Wispr Flow diktálós alkalmazása végre Androidon is elérhető, miután már Macen, Windowsen és iOS-en is bizonyított...

MA 10:01

Az elektromos autók tényleg tisztítják a levegőt? Igen, bizony!

A hagyományos autókban elégetett fosszilis üzemanyagok nemcsak szén-dioxiddal, hanem nitrogén-dioxiddal (NO2) is telehintenek mindent, így megugrik az asztmás rohamok, a hörghurut, valamint a szív- és érrendszeri bajok kockázata...

MA 09:28

Az új Galaxy S26 Ultra: Amit görgetsz, most már csak te látod

A Galaxy S26 Ultra végre tényleg a magánéletünk védelmére áll, és erről már részletes videó is készült...

MA 09:19

Az oxigénzselé forradalmasíthatja a cukorbetegek sebgyógyulását

🧠 A gyógyíthatatlannak tűnő sebek kezelése életeket menthet — legalábbis ezt ígéri egy apró, oxigént kibocsátó gél, amely elősegítheti a legmakacsabb, nem gyógyuló sérülések gyógyulását...

MA 09:10

Az oroszok tényleg feltörték a Telegram titkosítását?

Érdemes megvizsgálni, hogy mi is áll a Telegramot érintő legújabb orosz vádak hátterében...

MA 09:01

A Föld közelében kel ki a kozmosz legfiatalabb köde

A Hubble űrtávcső lenyűgöző, új felvétele eddig sosem látott részletességgel tárja fel a Tojás-köd (Egg Nebula) titkait, amely a Földhöz legközelebbi és legfiatalabb pre-planetáris köd...

MA 08:56

A decentralizált MI térdre kényszeríti a techóriásokat

Óriási átrendeződés zajlik az MI világában, amely alapjaiban változtatja meg, hogyan dolgozunk, használjuk és értelmezzük az intelligens technológiákat...

MA 08:38

A hélium miatt ismét csúszik az Artemis II emberes Hold-küldetés

🚀 A várva várt Artemis II küldetés, amely több mint fél évszázad után először repítene űrhajósokat a Hold közelébe, újabb késést szenved el...

MA 08:28

Az egészséges szív ropogós titka: újra hódít a pekándió

Az elmúlt két évtized tudományos eredményei alapján úgy tűnik, a pekándió sokkal többet nyújthat a szívünknek, mint eddig hittük...

MA 08:20

Az MI-alapú kémiai motor berobbantja a gyógyszerkutatást

🚀 A tudományos világ új fejezethez érkezett: villámgyors kvantumkémiai program jelent meg, amellyel a bonyolult molekulák szimulációjának idejét hetekről percekre lehet rövidíteni...

MA 08:01

Az OpenAI okoshangszóróval és kamerával készül nagy dobásra

Többek között az Amazon Echo-hoz hasonló, kamerával felszerelt okoshangszóró lehet az OpenAI első saját ChatGPT-eszköze...

MA 07:56

Az emberi élettartam határa még beláthatatlanul messze van

👀 Az elmúlt másfél évszázadban a várható élettartam a leggazdagabb országokban folyamatosan nőtt...

MA 07:46

Az óriási triceratopsz orrszarva több volt, mint félelmetes dísz

A Triceratops hatalmas, háromszarvú feje a dinoszauruszok világának egyik legismertebb szimbóluma, de ez a lenyűgöző „páncél” különleges funkciót is betölthetett...

MA 07:37

A kvantumforradalom még késik, de a befektetők nem adják fel

A kvantumszámítógépek 2026-ban még biztosan nem váltják le a szuperszámítógépeket, az ipari áttörés is messze van, mégis egyre többen támogatják a terület induló vállalkozásait...

MA 07:28

A mesterséges intelligenciára ne bízd a jelszógenerálást: veszélyes ismétlés

Érdemes megvizsgálni, hogy valóban megbízhatunk-e az MI-alapú rendszerekben, ha erős és biztonságos jelszavakra van szükségünk...

MA 07:19

A Perplexity beköltözik a Galaxy AI-ba – csevegj a telóddal!

💬 Nem hiszem el, de a Samsung most tényleg mindent egy lapra tesz: eljött a multiügynök MI-korszak...

APP
MA 07:11

APPok, Amik Ingyenesek MA, 2/23

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Image Resizer...

MA 07:10

A bombaciklon lecsap: igazi hókáosz jön Keleten

Hétfő hajnalban brutális vihar söpör végig a keleti parton, Marylandtől egészen Új-Anglia déli részéig, amire szinte mindenki csak annyit tud mondani: wow!..

MA 07:01

Az új Samsung Galaxy elhozza a Perplexityt – beszélgetős MI a zsebedben

A Samsung egy újabb MI-ügynökkel turbózza fel a következő, S26-szériás mobilokat: érkezik a Perplexity!..

MA 06:55

Az Arkanix: villanásnyi, MI-vel felturbózott adatlopó kísérlet

⚡ Fontos kérdés, hogy mennyire képesek a hackerek kihasználni a modern MI-t a saját céljaikra...

MA 06:47

Az új Galaxy-k csatája: Exynos vagy Snapdragon?

🛠 Különösen igaz ez akkor, ha már tűkön ülve várjuk az új Galaxy S26 megjelenését, amely nemcsak lenyűgöző szoftveres újításokat ígér, hanem hardveres fronton is nagy dobásra készül...

MA 06:38

Az első magazin, ahol interaktívan Tetrisszel játszhatsz

Egy egészen különleges magazin jelent meg: a The Red Bulletin egyik limitált számának borítóján valóban játszható, papírvékony Tetris-játék rejtőzik...

MA 06:28

Az ETF-ekből menekül a tőke: köddé váltak a bitcoin-milliárdok

Már öt hete tart az őrület: az amerikai tőzsdén listázott bitcoin ETF-ekből a befektetők közel 1,3 tonna arany árával megegyező, vagyis mintegy 1 428 milliárd forintnyi összeget húztak ki – ez 3,8 milliárd USD...

MA 06:19

Az óceánparti sivatagok titka: hová tűnik az eső?

Érdemes megvizsgálni, hogy a Föld legszárazabb vidékei miért épp az óceánpartok közelében alakultak ki, pedig az ellenkezőjét várnánk...

MA 06:05

Történelmi események a mai napon (Február 23.)

Mi történt ezen a napon a történelemben? Római császárok, forradalmak és tudományos áttörések formálták ezt a napot: Diocletianus üldözései, Heisenberg bizonytalansági elvének megszületése és a gyermekbénulás elleni tömeges oltás elindítása is ide tartozik...

vasárnap 17:59

Az alternatív appboltok forradalma: Európa és Japán szabadul az Apple-től

🚀 Az Európai Unióban jelentős változást hozott a Digital Markets Act (DMA): mostantól nemcsak az Apple App Store-on keresztül lehet alkalmazásokat elérni, hanem különböző alternatív appboltok is megnyíltak az iPhone-felhasználók számára...