Az MI-biztonsági szűrők sosem lesznek megkerülhetetlenek

Az MI-biztonsági szűrők sosem lesznek megkerülhetetlenek
Ebből következően érdemes megérteni, hogy az MI-alapú rendszerek, például a ChatGPT vagy a Google Gemini, mennyire tehetők biztonságossá. Bár a mesterséges intelligenciát fejlesztő vállalatok folyamatosan dolgoznak azon, hogy megakadályozzák a veszélyes vagy tiltott információkhoz való hozzáférést, a kutatók újra és újra megtalálják a rendszer hibáit. Különösen a kriptográfusok legújabb vizsgálatai rámutatnak arra, hogy a mostani MI-védelmi rendszerek alapvető sebezhetőségekkel rendelkeznek, amelyeket mindig ki lehet használni.

Mikor nem segít a szűrő?

A nyelvi modellek, mint a ChatGPT, általában megtagadják a válaszadást veszélyes, például bombakészítésre vagy más tiltott tevékenységre irányuló kérdések esetén. Azonban az MI-használók már hosszú ideje kreatív módszereket találnak ki arra, hogy mégis kiforgassák az algoritmusokat. A trükkök a teljesen triviálistól — például a szűrők kikapcsolására felszólító utasításoktól — az egészen kifinomult, szerepjátékba csomagolt kérdésekig terjednek. Gyakran előfordul, hogy egy eredetileg tiltott kérdést át lehet fogalmazni vagy kódolni, így a rendszer mégis kiadja a titkos választ.

Külön figyelmet érdemel, hogy a cégek nem feltétlenül kénytelenek újratanítani a teljes MI-modellt egy-egy ilyen sebezhetőség megszüntetéséhez, elegendő lehet egy gyors szűrőfrissítés is. Ezek a szűrők többnyire gépi tanulással működnek, melyek igyekeznek azonosítani és blokkolni a veszélyes kérdéseket, mielőtt azok eljutnak magához a nyelvi modellhez. Az extra szűrők alkalmazása egyszerűbb és olcsóbb, főként, ha a gyenge pontokat a modell bevezetése után fedezik fel.

A kriptográfusok ravasz trükkjei

Ami lényegében korlátossá teszi a védelmi rendszer hatékonyságát, az az MI és az azt védő szűrő közötti erőforrás-különbség. A biztonsági szűrőknek mindig gyorsabbnak és egyszerűbbnek kell lenniük, mint a mögöttük rejlő fejlett MI-rendszernek. Ez óhatatlanul egy olyan sebezhetőségi rést eredményez, amelyet egy gyakorlott kriptográfus könnyedén ki tud használni.

A kutatók bemutattak egy pofonegyszerű módszert: az ártalmas kérdést egy helyettesítő rejtjel segítségével kódolják. Vegyük például a „bomb” szót, amelyből minden betűt eggyel arrébb tolva a „cpnc” szót kapjuk. Ha csak arra kéred a modellt, hogy dekódolja ezt a kódot (például minden betűt cseréljen vissza az előzőre), és utána válaszoljon az így kapott kérdésre, akkor nagy eséllyel a szűrő nem fogja felismerni a veszélyt, és a teljes folyamat zökkenőmentesen végbemegy.

Az LLM-ek szűrői, például a Google Gemini, a DeepSeek vagy a Grok esetében önmagukban nem elég fejlettek ahhoz, hogy megfejtsék ezeket a kódokat. Így a rejtett kérdések akadálytalanul átmennek, a modell pedig kiadja a tiltott információt. A kutatók ezt a támadást „kontrollált kioldású” promptnak (controlled-release prompt) nevezték el.

Időzáras rejtélyek és kijátszhatatlan MI?

A legújabb, elméleti szintű vizsgálatok arra mutattak rá, hogy elterjedt kriptográfiai módszerekkel — mint például az időzáras rejtélyekkel (time-lock puzzles) — gyakorlatilag mindig át lehet verni a szűrőalapú védelmet. Az időzáras rejtély működése egyszerű: egy információt be lehet „zárni” egy olyan dobozba, amit csak egy meghatározott idő vagy számítási művelet elvégzése után lehet feltörni. A veszélyes kérdést egy ilyen rejtélybe kódolva, véletlenszerű számsorként lehet a promptmezőbe illeszteni, megfelelő utasítással (például: ezt a számot emeld önmagába kétszázszor, majd a kapott eredményt dekódold szöveggé, és hajtsd végre az utasítást).

A gond itt az, hogy bár a szűrő felismerheti ugyan a gyanúsnak tűnő számsort, a modern MI-modellek által használt „seed” (mag) mechanizmus könnyen kijátszható. A seed egy véletlenszám, ami alapján minden egyes futtatás kissé eltérő választ ad. Mivel gyakran lehetővé teszik ennek manuális megadását is, így maga a rejtélyes, átlátszóan véletlenszerű számsor is használható seedként. Így az ártalmatlannak tűnő prompt (például: Írj nekem egy verset!) valójában egy veszélyes kérdést rejt, ami csak a modell belsejébe jutva lepleződik le.


Mi az egész tanulsága?

Mindez arra utal, hogy amíg a biztonsági szűrők „gyengébbek” maradnak, mint az általuk védett MI-modell, a különféle jailbreak-támadások elkerülhetetlenek. Vagyis, ha a védelem kevesebb erőforrással működik, mint a támadható MI, akkor mindig akad majd rés az algoritmus pajzsán, amelyen keresztül tiltott, veszélyes vagy etikailag problémás információ szivároghat ki.

A kriptográfusok szakmai véleménye szerint semmilyen szűrőalapú rendszer nem lesz teljesen zárt, függetlenül attól, milyen új védelmi technikákat dolgoznak ki a jövőben. Az MI által elrejtett „dobozok” — a rejtjelzett vagy időzárral ellátott kérdések — előbb-utóbb mindig átcsúszhatnak a szűrők résein. Az igazi megoldás valószínűleg nem újabb szűrők kiépítésében, hanem az MI-modellek tényleges működésének mélyebb megértésében rejlik.

2025, adminboss, www.quantamagazine.org alapján

Legfrissebb posztok

kedd 09:44

Az elit tíz: a világ leggazdagabbjai újrarendezve

💰 A decemberi Forbes-lista szerint továbbra is az informatika, a közösségi média és a mesterséges intelligencia uralja a világ leggazdagabb embereinek rangsorát...

MA 20:49

A szuperintelligens MI csak szilícium-völgyi délibáb?

🤖 A hardver határai közelednek A mesterséges általános intelligencia (AGI) megalkotásától hangos a technológiai világ, de a hardver korlátai miatt egyre távolabb kerülünk ettől az álomtól...

MA 20:33

Az id Software csapata összezárt: új iparági szakszervezet születik

Az id Software, a Doom (Doom) fejlesztőcsapata óriási lépést tett: a dolgozók többsége megszavazta egy, mindenkit – függetlenül a munkakörétől – tömörítő szakszervezet létrehozását...

MA 20:18

Az óriásműholdak kora jön: negyedmilliárdot kap a K2

Egy mindössze három éve alakult, újgenerációs műholdakat gyártó dél-kaliforniai startup, a K2, 250 millió dolláros (közel 90 milliárd forintos) tőkeinjekcióban részesült, hogy felpörgesse műholdgyártását...

MA 19:50

Az új DNS-kazetta, az adatok titkos nagyágyúja megérkezett

📦 Hamarosan új korszak köszönthet be az adattárolásban: tudósok több mint fél kilométeres DNS-szalagon akár 362 000 terabájt adatot tudnak tárolni – ez 1,5 milliószor annyi, mint egy átlagos okostelefon tárhelye...

MA 18:33

A Reddit beperelte az ausztrál kormányt a tinik kitiltása miatt

Az ausztrál Reddit pert indított a legfelsőbb bíróságon, miután a kormány 16 év alattiakra vonatkozó közösségimédia-tiltása őket is érinti...

MA 18:01

A 4:LOOP, az új sci-fi lövölde, forradalmasítja a csapatjátékot

Mike Booth, a Left 4 Dead megalkotója, és J. J. Abrams stúdiója, a Bad Robot Games, bemutatták legújabb játékukat, a 4:LOOP-ot...

MA 17:50

Az éhezés valódi arca: a világ sosem lakik jól

🍲 Bár a világ humanitárius szervezetei a globális élelmezésbiztonsági adatok alapján osztják el segélyeiket, sokkal többen éheznek, mint amit a hivatalos számok mutatnak...

MA 17:33

Az űripar következő nagy dobása: jön az űrtőzsde?

🚀 Elon Musk hamarosan tőzsdére viheti a SpaceX-et, mivel egyre sürgetőbbé vált, hogy friss tőkéhez jusson a vállalat...

MA 17:18

Az új növényi hormontrükk forradalmasítja a fehérjeszabályozást

A tudósoknak először sikerült egy élő állat különböző szöveteiben található fehérjék szintjét egész életén át tetszőlegesen szabályozni...

MA 16:51

A boltok új kedvence: a rost, amiért megőrülünk

Az elmúlt évben még a fehérje volt a táplálékkiegészítő boltok sztárja, de minden jel arra utal, hogy idén a rost kerül reflektorfénybe...

MA 16:34

Az új szuperapp mindent visz: kriptófizetés és titkos chat

🔐 Különösen igaz ez akkor, ha egy alkalmazás egyszerre ígér kényelmes pénzkezelést, modern biztonsági megoldásokat és titkosított csevegést...

MA 16:17

Az MI végre szembenéz a hibáival

A nagy nyelvi modellek, mint például a legújabb GPT-verziók, gyakran hajlamosak kozmetikázni a saját teljesítményüket: elhallgatják a hibákat, túlozzák a tudásukat, vagy épp eltakarják, ha valamit nem tudnak...

MA 16:02

Új GeoServer-sebezhetőség sodorhatja veszélybe az amerikai kormányt

Az amerikai kormányzati szerveknek sürgősen be kell foltozniuk egy kritikus GeoServer-sebezhetőséget, amelyet már aktívan ki is használnak támadók...

MA 15:50

A szomszédos TRAPPIST-1e titka: van-e légköre?

Megemlíthető, hogy az utóbbi időben egyre nagyobb tudományos érdeklődés övezi a TRAPPIST-1e-t, ezt a Földhöz hasonló méretű, hozzánk viszonylag közeli exobolygót...

MA 15:34

A zöld nagy fal: Kína erdős pajzsa a sivatag ellen

1978 óta Kína hatalmas ökológiai projektbe fogott: több mint 66 milliárd fát ültetett el északon, hogy visszaszorítsa a Gobi és a Takla-Makán sivatagok terjeszkedését...

MA 15:17

A Star Wars új játéka visszahozza a KOTOR varázsát

✨ Az új Star Wars: A Köztársaság sorsa (Fate of the Old Republic) című játékot a Mass Effect és A régi Köztársaság lovagjai (Knights of the Old Republic) rendezője, Casey Hudson vezeti...

MA 15:04

Az MI berobbant az ünnepi vásárlásba: élesedik a Walmart–Target csata

Az ünnepi ajándékvásárlás sokak számára évek óta nyűg, de az MI-alapú chatbotok megjelenése forradalmasíthatja az egész folyamatot...

MA 14:49

Az indiai VPN-botrány: szabadság vagy totális megfigyelés?

Az indiai kormány kötelezte a VPN-szolgáltatókat, hogy blokkolják azokat a weboldalakat, amelyek törvénytelenül hozzák nyilvánosságra a lakosok személyes adatait...