Az MI-ügynökök védelme még mindig gyenge

Az MI-ügynökök védelme még mindig gyenge
Az utóbbi időben két új, figyelemre méltó tanulmány is napvilágot látott a nagy nyelvi modellek (LLM) biztonságával és a prompt injection támadásokkal kapcsolatban. Ezekből egyértelműen kiderül, hogy az MI-alapú rendszerek védelme még korántsem megoldott – sőt, a legtöbb mai módszer könnyedén kijátszható.

Ügynökök szabálya: csak kettőt a háromból!

A Meta új tanulmánya, az Agents Rule of Two (Az ügynökök kettőszabálya) nagyon tömören foglalja össze, hogyan lehetne csökkenteni a prompt injection támadások legsúlyosabb következményeit. Eszerint egy MI-ügynök egy adott munkamenet során legfeljebb két kritikus tulajdonsággal rendelkezhet a háromból: feldolgozhat megbízhatatlan bemeneteket, hozzáférhet érzékeny adatokhoz vagy rendszerekhez, illetve képes lehet állapotváltozást előidézni vagy külső kommunikációt folytatni. Lényeges hangsúlyozni, hogy ha egy ügynöknek mindhárom képességre szüksége van, tilos teljes autonómiával működnie, és legalább emberi felügyeletet igényel.

Ez a megközelítés üdítően egyszerű: a korábbi, lebilincselő hármas például főként csak az adatlopás veszélyére vonatkozott, míg az új szabály a rendszerállapot-módosítás kockázatát is figyelembe veszi. Ettől függetlenül a modellnek van némi korlátja is: a szerzők szerint a megbízhatatlan bemenetek és az állapotváltoztatás kombinációja sem biztonságos, még ha nincs is hozzáférés érzékeny adatokhoz – de e kitétel bevezetése már rontaná a hasznos egyszerűséget.

A támadó mindig egy lépéssel előrébb jár – és átjut a védelmen

Egy másik, még nagyobb visszhangot kiváltó tanulmány 14 neves szerzőtől – köztük az OpenAI-tól, a Google DeepMindtól és az Anthropictól – 12 publikus védelmet, köztük prompt injection és jailbreaking elleni módszert vetett vizsgálat alá. A kutatók úgynevezett adaptív támadásokat alkalmaztak: a támadó algoritmusok vagy emberek többször próbálkozhattak, miközben figyelték a rendszer reakcióit, és menet közben fejlesztették stratégiájukat.

Az eredmény: a vizsgált védelmek túlnyomó többsége elbukott, sokszor több mint 90%-os sikeraránnyal törték át őket. Lényeges, hogy humán tesztelés során – egy 7,4 millió forintos verseny keretében, 500 résztvevővel – minden védelem megadta magát. Ez rávilágít arra, mennyire illuzórikusak a statikus, egyszeri trükkökkel tesztelt védelmek: az adaptív, folyamatosan fejlődő támadások könnyedén túljárnak rajtuk.

Az ellen-védekezés csapdája: minden támadás egyéni válaszokat követel

A támadók több fő módszert is hatékonyan alkalmaztak: a gradiensalapú optimalizációt, a megerősítéses tanulást, de legfőképp a keresésalapú megközelítések bizonyultak eredményesnek. Ez utóbbinál a támadók MI-t használtak arra, hogy támadószövegeket generáljanak, majd MI-alapú minősítési rendszeren szűrték át azokat. Ettől függetlenül még a fejlettebb algoritmusoknál is a humán tesztelők jeleskedtek a leghatékonyabb támadásokban.

A kutatók óvatos optimizmussal fogalmaznak: szerintük az adaptív tesztelés bonyolultabb, de elengedhetetlen, és bíznak benne, hogy az ilyen tesztek emelik majd a védelmek színvonalát. Összefoglalásként megjegyezhető, hogy az új szabályok és felismerések fényében továbbra sincs megbízható, univerzális védelem a prompt injection támadások ellen – az egyetlen járható út az, ha a kettőszabály szerint kialakított rendszerekben eleve korlátozzuk az MI-ügynökök lehetőségeit, és nem hagyjuk, hogy autonóm módon mindhárom kritikus képesség összetalálkozzon egyetlen munkamenetben.

2025, adminboss, simonwillison.net alapján

  • Te mennyire bíznál egy mesterséges intelligencia alapú rendszerben, ha tudnád, hogy a védelme könnyen megkerülhető?
  • Ha te fejlesztenél egy MI-ügynököt, hogyan korlátoznád a képességeit?



Legfrissebb posztok

MA 11:02

Legmenőbb angol szlengek 2025-re

mastige Londonban született reklámszó. Amikor azt akarod mondani, hogy egy termék egyszerre presztízs és tömegcucc — például egy olyan elektronikai kütyü, amit ugyan drágának tartanak, mégis rengetegen megveszik...

MA 20:01

Az OpenAI már évi 4 700 milliárd forint körül jár?

Sam Altman, az OpenAI vezérigazgatója szerint a cég jóval 13 milliárd dollár, vagyis nagyjából 4 700 milliárd forint éves bevétellel büszkélkedhet – és nála most már tényleg elég a folytonos faggatózásból, hogy miből fizetik ki az elképesztő költségeket...

MA 19:46

Az élet szikráját az ifjú Nap dühöngése adhatta

A fiatal Naphoz hasonló csillagok óriási energiájú kitörései döntő szerepet játszhattak abban, hogy a Földön megjelenjen az élet...

MA 19:37

Az idegesítő Windows-hiba végre eltűnt: leáll, ha leállítod

Sok felhasználó dühöngött már azon, hogy a „Frissítés és leállítás” opció valójában nem állította le a gépet, hanem újraindította...



MA 19:28

Az új Redmagic gamer mobil tényleg folyadékhűtéssel jön

🔥 A Redmagic 11 Pro szakít a hagyományokkal: ez az első olyan okostelefon (a kínai modelleken kívül), amely valódi folyadékhűtéssel érkezik...



MA 19:19

Az Nvidia és a Microsoft beindítja az MI-őrületet az Emirátusokban

🚀 Az Egyesült Államok jóváhagyta, hogy a Microsoft exportálhassa az Nvidia legújabb, csúcsteljesítményű GB300-as GPU-it az Egyesült Arab Emírségekbe...



MA 19:11

2025, Nov 3 Google Trend

Keresés1 Volumen2 Növekmény %3 manófalva 2000 900 otp 5000 100 otp internetbank 2000 300 jim curtis 2000 1000 david harbour 2000 1000 hideg 1000 1000 torre dei conti 500 1000 sassuolo–genoa 200 1000 családi pótlék utalása 1000 1000 tisza világ 500 800 miller dávid 10000 1000 milan–roma 2000 1000 időjárás 20000 75 időkép 5000 75...



MA 19:10

Az új Windows-frissítés miatt nem lehet bezárni a Feladatkezelőt

Az októberi, KB5067036 számú Windows 11-frissítés váratlan hibát okozott: a Feladatkezelő bezárása után is a háttérben marad, ami jelentősen ronthatja a gép teljesítményét...



MA 19:03

Véget értek az Internet Archive küzdelmei, de nagy árat fizettek érte

A San Franciscó-i Internet Archive ebben a hónapban ünnepelte, hogy a Wayback Machine elérte az ezermilliárdodik lementett weboldalt...



MA 18:47

Eltűnt a Facebook varázsa, nosztalgikus reklámokkal próbál visszacsábítani

A karácsonyi időszakban minden eddiginél többen kelnek útra, hogy hazalátogassanak, családjukkal és régi barátaikkal találkozzanak...

MA 18:37

Az egész világ pénzügyeit bekebelezi a blokklánc?

A Standard Chartered vezérigazgatója, Bill Winters szerint hamarosan szinte minden nemzetközi pénzügyi tranzakció digitális blokkláncfőkönyvre kerül át, és a pénzek is teljesen digitálissá válnak...

MA 18:28

Az orka-csapatok már a cápabölcsődéket is vadásszák

🐴 Először sikerült felvételt készíteni arról, ahogy egy orkacsapat (gyilkos bálnák) fiatal nagy fehér cápákat támad meg a Kaliforniai-öbölben...

MA 18:20

Az év ajándékslágerei 2025-ben, mindenki ezekért rajong

2025-ben ismét kirobbanóan népszerű lett a Google által összeállított Holiday 100 toplista, amely a legkeresettebb ajándékokat vonultatja fel...



MA 18:10

Már a fiatal nagy fehér cápákat is megtámadják az orák

🐟 Az elmúlt években különleges orkapopulációra figyeltek fel a Kaliforniai-öbölben, amelynek tagjai mesteri módon vadásznak fiatal nagy fehér cápákra: a zsákmányt hasra fordítják, hogy könnyedén hozzájussanak a rendkívül tápanyagdús májhoz...



MA 18:01

Az újabb YouTube TV-botrány: Ennyi pénzt kapsz vissza a Disney-balhé után

A YouTube TV előfizetői most akár 22 000 forint (60 USD) jóváírást kaphatnak a fiókjukra a múlt heti botrány után, amikor a szolgáltató lekapcsolta a Disney csatornáit...



MA 17:55

Újabb pusztító tájfun fenyegeti a Fülöp-szigeteket

🌀 Több mint 156 000 ember menekült el otthonából hétfőn a Fülöp-szigetek keleti partvidékéről, ahogy a Kalmaegi nevű tájfun 140 km/órás szelet és akár 170 km/órás széllökéseket hozva közelít a Visayas-szigetlánc felé...

MA 17:46

Az öregedő gátak miatt ismét nő a veszély

Száz évvel ezelőtt Észak-Walesben, Dolgarrog falujában tragédia történt: hatalmas sziklák és iszap zúdultak az emberekre, tucatnyi házat, hidat és a helyi kápolnát pusztítva el...



MA 17:37

Lezárulhat az USA és Kína ritkaföldfémekért vívott harca?

Az elmúlt héten tartott kereskedelmi tárgyalások eredményeként enyhültek az USA és Kína közötti kereskedelmi feszültségek...



MA 17:28

Az elnök, aki nem ismeri a kegyelt kriptómilliárdost

💸 Donald Trump egy tévéinterjúban azt állította, fogalma sincs, kicsoda Changpeng Zhao, pedig alig egy hónapja kegyelmet adott a kriptovaluta-guru milliárdosnak...