Az öreg GPU-k olcsón futtatják a gigantikus MI-modelleket

Az öreg GPU-k olcsón futtatják a gigantikus MI-modelleket
A Perplexity nevű MI-keresőcég kutatócsapata új szoftveres finomításokat fejlesztett, amelyek lehetővé teszik a több százmilliárd, akár közel ezermilliárd paraméteres modellek hatékony futtatását régebbi és olcsóbb hardvereken is. Ez áttörés, hiszen a legnagyobb MI-modelleket eddig csak méregdrága, legmodernebb GPU-kon lehetett futtatni, főként a bonyolult memóriakezelés és a hálózati késleltetés miatt.

Az óriásmodellek problémái

A kevert szakértős (mixture of experts, MoE) modellek – mint a DeepSeek V3 vagy a Moonshot AI Kimi K2 – paraméterszáma 671 milliárdtól akár ezermilliárdig terjed. Ezek akkora helyet foglalnak, hogy még nyolc darab H100- vagy H200-GPU-val szerelt rendszerekbe sem fér el egyszerre minden hozzájuk tartozó adat, különösen, ha a szükséges rövid távú memóriát is figyelembe vesszük. Ezért vagy nagyobb, még drágább szerverekre van szükség, vagy a modell szétosztására több kisebb gépre.

A kézenfekvő megoldás az Nvidia GB200/GB300 NVL72 rendszerek használata lenne – ezek 72 darab, 192 vagy 288 GB-os GPU-t tartalmaznak, simán elfér rajtuk bármilyen nagy modell is –, de ezek sem elérhetők mindenhol, nagyon drágák, és állandóan hiánycikkek. Ezzel szemben a régebbi, például H100-as rendszerek viszonylag olcsók és elterjedtek, de csak akkor lehet velük hatékonyan dolgozni, ha a modelleket több csomópont között osztják szét. Ez viszont hálózati késleltetéssel és jelentős teljesítményvesztéssel jár.

MoE-modelleknél ráadásul az adatforgalom sem egyszerű: minden egyes szótöredéket vagy karaktert mindig más-más „szakértő” generál, és ezek akár a hálózat különböző pontjain lévő GPU-król futnak. Ez a megközelítés jelentősen csökkenti a memóriaigényt, de sokkal intenzívebb adatforgalmat eredményez.

Különösen fontos, hogy míg egy szerveren belül a gyors NVLink vagy az AMD Infinity Fabric simán viszi ezt a terhelést, addig több gép között akár hétszer-tizennégyszer lassabbak a hálózati összeköttetések, ami szűk keresztmetszethez vezet.

Az Amazon megkötései és a Perplexity szoftveres trükkjei

Akik nem Nvidia-gyártmányú hálózati kártyákat használnak – mint például rengeteg Amazon Web Services (AWS) felhasználó –, másfajta hálózati technológiákkal találják szembe magukat. Az Amazon saját Elastic Fabric Adapterét (EFA) alkalmazza: ez hasonlóan akár 400 Gbit/s összsávszélességet tud, de két fontos területen elmarad az Nvidia ConnectX-től. Egyrészt az EFA-n keresztüli üzenetküldés nem olyan gyors és hatékony, másrészt nem támogatja a GPUDirect Asyncot, ezért a GPU-k közötti adatmozgásnál minden a CPU-n keresztül megy, ami újabb késedelmet jelent.

Ezzel szemben a Perplexity új, speciális kommunikációs szoftvermodulokat (kerneleket) fejlesztett, amelyek lehetővé teszik, hogy EFA-val működő rendszerekben is kiegyensúlyozottan, minimális késéssel fussanak a MoE-modellek. Ezek a fejlesztések bizonyos mérőszámokban már most jobb eredményt hoztak, mint a DeepSeek V3-hoz készült DeepEP keretrendszer, amely eddig a ConnectX-7 szabványra volt optimalizálva.

Látható teljesítménynövekedés és a jövő

A Perplexity élesben is tesztelte fejlesztését: a DeepSeek V3 (700 milliárd paraméter) és a Kimi K2 (1 billió paraméter) modellekkel több AWS-példányon, EFA-hálózattal. A DeepSeek V3 még ráfért egyetlen H200-as szerverre, így jó viszonyítási alapot adott, de a Kimi K2-t már csak elosztva lehetett kezelni.

Az egygépes és a 2–4 példányos konfiguráció összevetésénél világos volt: ahogy egyre több gépen, egyre több GPU-val futtak a modellek, a Perplexity szoftveres finomhangolása egyre jobban érvényesült; főleg közepes batchméreteknél hozott jelentős gyorsulást. Különösen fontos, hogy a masszív sávszélességbeli hátrány ellenére – az NVLinkhez vagy az Infinity Fabrichoz képest az EFA akár 14-szer lassabb lehet – a Kimi K2-vel is érezhetően sikerült gyorsításokat elérni.

A Perplexity csapata folyamatosan dolgozik további optimalizáción; például az Amazon libfabric könyvtárainak változásait követi, hogy még hatékonyabban kihasználja az EFA-n keresztüli adatáramlást.


Ütős hardver helyett okos optimalizálás

A fentiek tükrében most azok is kihasználhatják a legújabb MI-modellek előnyeit, akik nem tudják vagy nem akarják megfizetni a csúcskategóriás GPU-kat, de nagy, olcsóbb és akár használt hardvereken dolgoznának nagy MI-komponensekkel, például kedvezményes AWS-szervereken. Ez lehetővé teszi, hogy az új MI-forradalomhoz ne csak a legnagyobb techmultik férjenek hozzá – most már tényleg mindenki próbálkozhat öreg, de jól összebarkácsolt vasakkal is.

2025, adminboss, go.theregister.com alapján

  • Te örülnél, ha olcsóbb gépeken is lehetne futtatni a legnagyobb MI-modelleket?
  • Szerinted igazságosabb lesz az MI-hoz való hozzáférés ettől?
  • Ha a fejlesztő helyében lennél, te is inkább optimalizálnád a szoftvert, vagy kevésbé törődnél a régi hardverekkel?


Legfrissebb posztok

MA 20:49

A bórax lehetett az élet születésének titkos kulcsa?

💧 A Föld 4,3 milliárd évvel ezelőtti állapotait vizsgálva egy új kutatás szerint ideálisak voltak a körülmények ahhoz, hogy természetes úton alakuljon ki az első információt hordozó molekula, az RNS, amelynek kialakulása az élet születésének kulcsfontosságú mérföldköve...

MA 20:17

Az atomórák csúszása megbénította az időszolgáltatást

Egy ritka és különös eset borzolta fel a NIST, vagyis az Egyesült Államok Országos Szabványügyi és Technológiai Intézetének életét: egy áramszünet következtében összezavarodott az intézet boulderi atomóráinak időskálája, ezért egy munkatárs kétségbeesetten próbálta kikapcsolni a vésztartalék-generátorokat, amelyek továbbra is hibás időt szolgáltattak...

MA 20:02

A láthatatlan alaszkai földrengések csendben jelzik a közelgő cunamit

🌊 Kezdetben pusztán egy újabb távoli veszélynek tűnt a Barry-gleccser fölötti hatalmas földcsuszamlás Alaszkában, de a kutatók közelről vizsgálják a térség rejtett földrengés jeleit...

MA 19:51

Az Xbox kudarcsorozata és a Microsoft nagy irányváltása

💸 Ki gondolta volna, hogy az Xbox ennyire hatalmas lemaradásban lesz a konzolversenyben?..

MA 19:33

Az ókori csatornák felfedik a római Britannia elhallgatott járványát

Érdemes megvizsgálni, milyen egészségügyi kihívásokkal szembesültek a római kori Britannia katonái...

MA 19:18

Az SN 2022ngb, a szinte láthatatlan szupernóva rejtélye

💫 Egy nemzetközi kutatócsoport rendkívül halvány és lassan változó szupernóvát figyelt meg SN 2022ngb jelűként, amely a IIb típusba tartozik...

MA 19:03

A The Sims 4 eddigi legjobb évét zárta

A The Sims 4 rajongói számára az utóbbi évek igazi hullámvasútnak bizonyultak: a kezdeti Építés és Vásárlás (Build and Buy), illetve Sim létrehozása (Create a Sim) módok ugyan szinte etalonná váltak a sorozat történetében, azonban a híres medencék és a kisgyermekek hiányoztak az alapjátékból...

MA 18:49

A tehetség nem sprint, hanem maraton – rosszul gondolkodunk?

🏃 Felmerül a kérdés, vajon helyesen közelítettük-e meg a tehetséggondozást az elmúlt évtizedekben...

MA 18:36

Az új robotporszívó csodát ígér, de csalódást okoz

A Narwal Freo Z10 Ultra egy olyan robotporszívó és felmosó, amely bőven tele van csúcstechnikával, és önálló működésre képes dokkolóval érkezik...

MA 18:18

Az elefánt – az animáció történetének legőrültebb összefogása

Az animáció világában gyakran születnek különleges ötletek, de az Elefánt (Elephant) című, az HBO Maxon elérhető új rajzfilm rendhagyó alkotási folyamata és szürreális hangulata egészen új szintre emeli a kreativitást...

MA 17:51

A láthatatlan univerzum a galaxisok torzulásaiból tárul fel

💫 A világegyetem 95 százaléka láthatatlan. Sötét anyag és sötét energia tölti ki a kozmosz nagy részét, amelyeknek valódi mibenlétét a tudomány máig nem ismeri, de hatásuk tagadhatatlan: a sötét anyag extra gravitációjával formálja a galaxisokat és galaxishalmazokat, míg a sötét energia a táguló világegyetem gyorsulásához kapcsolódik...

MA 17:34

Az űrturizmus áttörése: felszáll az első kerekesszékes űrutazó

🚀 December 21-én hatalmas mérföldkőhöz érkezett az űrutazás, amikor Michaela Benthaus, egy német mérnök, kerekesszékes utazóként elsőként jutott el a világűrbe...

MA 16:50

Az Nvidia-részvény tovább szárnyal: marad a Wall Street kedvence?

Az Nvidia továbbra is az MI-láz egyik legnagyobb nyertese, annak ellenére, hogy az utóbbi időben erősödő versennyel és geopolitikai kihívásokkal néz szembe...

MA 16:02

Az univerzum szimulációja: egy matematikai áttörés mindent átír

A szimulációs hipotézis – az elképzelés, hogy világunk talán csak egy idegen civilizáció számítógépén futó szimuláció – régóta lázban tartja az embereket...

MA 15:33

A klímaváltozás miatt hetekkel előbb szórja spóráit az északi moha

🌱 Régi katonai légmintákból váratlanul értékes DNS-lelőhely került elő, amely évtizedeken keresztül őrizte a levegőben szálló élőlények nyomait...

MA 15:02

A MI-korszak rejtett buktatója: messze van az adat a döntéstől

🤔 Fontos kérdés, hogy mitől lesz valóban eredményes az MI bevezetése egy cég életében...

MA 14:49

Az áttörés kapujában: már látszik a szobahőmérsékletű szupravezetés

⚡ Ebből következően érdemes megérteni, hogy a tudósok most átléptek egy olyan akadályt, amely éveken át megnehezítette a magas hőmérsékletű szupravezetők gyakorlati alkalmazását...

MA 14:33

Az Apple és a Google figyelmeztet: gond lehet a vízumokkal

⚠ A Google és az Apple jogi képviselete arra figyelmeztette a vízummal foglalkoztatott alkalmazottakat, hogy egyelőre kerüljék a nemzetközi utazást, különösen, ha csak H-1B vízumbélyeggel térhetnének vissza az Egyesült Államokba...

MA 14:20

Az óriási JBL Bar 1300 MK2 uralja a nappalit

🔊 A JBL az új Bar 1300MK2-vel ismét belevágott a házimozi-hangzás nagyágyúinak versenyébe, és sikerült is emelnie a tétet...