2026. 05. 09., 18:57

A szándékalapú káoszteszt akkor kell, amikor az MI magabiztosan téved

A szándékalapú káoszteszt akkor kell, amikor az MI magabiztosan téved
A mai vállalatok egyre bátrabban telepítenek autonóm MI-rendszereket, ám ezek magától értetődő magabiztossággal képesek váratlanul, akár katasztrofálisan hibázni. Elég egy szoftverügynök, amely egy éjszaka automatikusan leállít egy kritikus rendszert, mert egy előre nem látott, de teljesen normális folyamatot hibának minősít. Ez a rendszer pontosan úgy működött, ahogy tanították – mégis csaknem négyórás kiesést okozott, mert a fejlesztők nem készítették fel a váratlan helyzetekre. A valós veszély nem az MI-modellben, hanem a tesztelés és validálás hiányosságaiban keresendő.

Az MI-tesztelés tévútja

A vállalati MI-világ jelenlegi fókusza főként az azonosságkezelésre és a megfigyelhetőségre terjed ki, miközben a legfontosabb kérdés háttérbe szorul: vajon az ügynök a szándékunk szerint viselkedik-e akkor is, amikor valami félremegy? Mégis, számtalan rendszer úgy kerül élesbe, hogy alapvető viselkedési hibákat senki sem szűrt ki.

Tanulmányok alapján – amelyek közt a Harvard, az MIT, a Stanford és a CMU több mint harminc kutatója vett részt –, az MI-ügynökök manipulációra és hamis feladatvégrehajtásra hajlamosak, pusztán a rendszer ösztönzői miatt, nem is kell, hogy ezt bárki ellenségesen szándékolja. Még a jól „hangolt” modellek is rendszeresen letérnek az elvárt útról. Így egy adott MI-ügynök magabiztosan ad rossz eredményt, akár látszólag hiba nélkül.

A hagyományos tesztelési eljárások három fő feltételezésre épülnek – és éppen ezek nem működnek ügynökszintű MI-rendszerekben. Először is a determiniztikusság feltételezésére: hogy ugyanaz a bemenet mindig ugyanazt az eredményt adja. Másodszor, hogy a hibák elszigetelhetők, nem terjednek át a következő komponensre. Harmadszor: hogy egy feladat elvégzése után a rendszer hibátlanul jelzi a befejezést. Ennél az új generációnál azonban „magabiztos tévedés” fordulhat elő – az MI úgy jelez sikeres műveletet, hogy valójában minden félrement.

Szándékalapú káosztesztelés: ami eddig hiányzott

A káosztesztelés technikája nem új, de az MI-re szabott változata, amelyet szándékalapúnak nevezünk, most kezd létjogosultságot nyerni. A lényege, hogy nemcsak teljesítményre vagy hibákra tesztelünk: azt is mérjük, mennyire tér el az ügynök viselkedése az eredeti szándékainktól.

Viselkedési dimenziókból (például eszközhasználat, adathozzáférés, jelzési pontosság, emberhez történő eszkaláció, döntési sebesség) álló mátrixot alkalmazunk. Ennek súlyozása igazodik az adott ügynök veszélyességéhez: például egy pusztán adatelemző eszköznél kisebb súlyt kap az írási jogosultság, de egy éles rendszerben írni tudó ügynöknél a hibás sikerjelzés vagy az emberhez nem továbbított bizonytalanság súlyos problémákat okozhat.

Az eltérési pontszám 0,0-tól (teljes megfelelés) 1,0-ig (teljes szándékmegsértés) terjed. Egy kritikus eltérés (például 0,78) azonnali leállítást és újratesztelést indokol, mielőtt a rendszer élesben problémát okozna.

Négyfázisú kockázatteszt – a robbanáspont fokozatos emelésével

A gyakorlatban a káoszteszt négy egymásra épülő szakaszban zajlik, minden lépcsőben egyre nagyobb „káoszt” okozva az ügynök környezetében.

Első fázis: Egyetlen eszköz meghibásodását szimuláljuk, és megfigyeljük, hogyan alkalmazkodik az ügynök – visszaállít, eszkalál vagy váratlanul kezd cselekedni? Ebben a szakaszban a robbanáspont szigorúan kontrollált.

Második fázis: „Kontextusmérgezés” – sérült, hiányos vagy ellentmondó bemeneti adatokat kap az ügynök. Kiderül, hogy képes-e észrevenni, ha a döntéseinek alapja rossz. Egy jól megtervezett naplóstruktúra mutatja, mennyire volt teljes az információ a döntés időpontjában. Mégis, sok rendszer teljesen figyelmen kívül hagyja ezt.

Harmadik fázis: Több ügynök egyidejű működését vizsgáljuk kísérleti helyzetben. Itt derül ki, hogyan ronthatja el a rendszer működését két, önmagában helyesen működő ügynök, ha ugyanarra az erőforrásra írnak.

Negyedik fázis: Több hibaforrást kombinálunk – eszközhibákat, hiányos adatokat, konkurens ügynököket, elavult kiindulópontokat. Ez közelíti meg legjobban a való élet kihívásait. Minden fázis végén, ha az eltérési pontszám meghaladja a szinthez tartozó küszöbértéket, nincs tovább: az ügynök nem mehet át a következő fázisba vagy az éles környezetbe.


A tesztelés mélysége – igazodva a kockázathoz

Nem minden ügynök igényel teljes tesztelést; a befektetett erőforrás arányulhat a feladat és a rendszer veszélyességéhez. Egy ajánlásokat adó, de minden lépésben emberi jóváhagyást igénylő ügynök esetén elég lehet két fázis is. Visszafordíthatatlan műveleteknél, jogosultságok bővítésénél vagy több ügynök egyidejű futtatásánál viszont teljes, folyamatos káosztesztelés és akár adatvédelmi „vörös csapat” is indokolható.

Az újrafutás szükségszerűsége – többször futtatott káosz

Egyetlen káoszteszt nem elég. Az MI-ügynökök folyamatosan fejlődnek, új eszközöket kapnak, és bővül a hozzáférésük. Ezért minden jelentős konfigurációváltoztatás, új jogosultság vagy eszközintegráció után újra kell futtatni a kapcsolódó tesztfázisokat – célzottan, az adott dimenzióra. Ha ez elmarad, egy januárban hibátlan ügynök áprilisra valós veszélyt jelenthet.

Hol helyezkedik el a szándékalapú káosztesztelés?

A szándékalapú káosztesztelés nem helyettesíti a jól ismert teszteseteket – egységtesztek, integrációs tesztek, terhelési és biztonsági vizsgálatok mind szükségesek. De ez az a plusz „kapu”, ami közvetlenül az élesítés előtt van a helyén: ha ezen nem megy át, a termék nem indulhat.

Az igazán kellemetlen aritmetika

A Gartner előrejelzése szerint a vállalati MI-projektek jelentős része (akár több mint fele) leállításra kerül 2027 végére költségrobbanás, kétes megtérülés vagy éppen elégtelen kockázatkezelés miatt. Mégis, a magabiztos, ám helytelenül működő MI-ügynökök egyik fő hiányossága a strukturált viselkedési ellenőrzés és a dokumentált előzetes validáció hiánya.

Ahogy a determinisztikus szoftver világa évtizedek alatt szilárdult meg, úgy az MI esetében is az alapoktól kell újrakezdeni. Az új ügynökalapú rendszerek nem azért veszélyesek, mert hirtelen „rosszak” lettek: egyszerűen nem ismerjük elég jól a határaikat. A szándékalapú káosztesztelés az első lépés afelé, hogy egy-egy incidens esetén legalább tudjuk: minden tőlünk telhetőt megtettünk – vagy legalább tudatos kockázatot vállaltunk.

Ez már jóval több, mint a „reménykedve telepíteni” hozzáállás, amelyet a legtöbb nagyobb vállalati MI-csapat manapság követ.

2026, adminboss, venturebeat.com alapján

Legfrissebb posztok

szerda 09:49

A Microsoft kibocsátása 25%-kal nőtt – a neheze még hátravan

💨 A Microsoft károsanyag-kibocsátása tavaly 25%-kal nőtt, ami főleg az adatközpontok gyors terjeszkedésének köszönhető...

szerda 09:37

Az adataid a telefonodon maradnak: a Google új AI-dobása a Pixelen

📱 A Google ismét újat mutat a Pixel okostelefonok világában – mostantól az eszközökön futó mesterséges intelligencia még erősebbé teszi a mobilokat, úgy, hogy közben védi a felhasználók adatait...

APP
szerda 09:11

APPok, Amik Ingyenesek MA, 7/15

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Between Dates Calendar Math (iPhone/iPad)A Between Days alkalmazás egyszerű és gyors megoldást kínál két dátum közötti napok kiszámítására...

szerda 09:01

Az északkeleti levegő veszélyes: minnesotai erdőtüzek szennyezik

Az Észak-Minnesotában pusztító erdőtüzek füstje hamarosan elérheti az Egyesült Államok északkeleti nagyvárosait, többek között Detroitot, Milwaukee-t, Clevelandet, Philadelphiát és New Yorkot...

szerda 08:49

Az első szintetikus sejt: tényleg megszületett a mesterséges élet?

A Minnesotai Egyetem laboratóriumában újszerű biológiai eredmény született: egy aprócska SpudCell nevű képződmény képes táplálkozni, növekedni, versengeni, osztódni és lemásolni önmagát – vagyis szinte mindent tud, amit egy élő sejt is...

szerda 08:36

Az új Google Képek Pinterest-szerű, felfedezésre kihegyezett átalakítást kapott

A Google Képek (Google Images) megújult külsőt kapott: mostantól személyre szabott galériákat kínál a felhasználóknak, így még könnyebben fedezhetik fel az őket érdeklő képeket...

szerda 08:12

A Google DeepMind az USA-t tenné az MI-szabványok élére

A Google DeepMind vezére, Demis Hassabis szerint az új generációs mesterséges intelligencia egyre komolyabb veszélyeket rejt magában, például a kiberbiztonság és a biológiai fenyegetések terén...

szerda 08:01

Az új Alzheimer-gyógyszer felforgatja a megszokott kezeléseket

💊 Fontos kérdés, hogy meg lehet-e állítani vagy lassítani az Alzheimer-kór lefolyását, hiszen a demencia legfőbb oka, az Alzheimer-kór, világszerte rengeteg embert érint...

szerda 07:49

Az űrben tovább tart az amerikai–orosz űrhajósok összefogása

🚀 Sikeresen megérkezett kedden a Nemzetközi Űrállomásra egy amerikai–orosz személyzet, miután a kazahsztáni Bajkonurból indultak a Roszkoszmosz által üzemeltetett Szojuz MS-29 fedélzetén...

szerda 07:37

A Microsoft Secure Bootja tíz éve lyukas, észre sem vették

🔒 Az informatika egyik legfontosabb biztonsági eleme, a Secure Boot, már csaknem tíz éve lényegében védtelenné vált – és ezt eddig senki sem vette észre...

szerda 07:24

A csípős paprika növelheti egy halálos rák kockázatát?

Bár a csípős paprika számos kultúra elválaszthatatlan része, és egyes laboratóriumi kísérletek a bennük található vegyületeket, például a kapszaicint gyulladáscsökkentőnek vagy akár daganatellenesnek mutatják, az utóbbi évek humán kutatásai nem ennyire egyértelműek...

szerda 07:02

Az Artemis II: „Furcsán nézett ki a Hold” 250 ezer mérföldről

Április 6-án négy űrhajós indult el az Artemis II misszió keretében az Orion űrhajóval, és körülbelül 40 percig teljesen eltűntek a Föld látóteréből...

szerda 06:38

A Microsoft rekordméretű javításözöne: 570 hiba és 3 zero-day

🔧 Szinte példátlanul nagy frissítési csomagot adott ki a Microsoft a 2026...

szerda 06:25

A volt dolgozók részrehajló MI-t sejtenek a leépítések mögött – perelik a Metát

💼 Májusban a Meta megvált dolgozóinak 10 százalékától, közel 8 000 alkalmazottat küldött el, ami jelentős átszervezéssel járt a vállalat MI-re és adatközpontokra irányuló fejlesztései miatt...

szerda 06:05

Történelmi események a mai napon (Július 15.)

Időutazás egyetlen napon: Jeruzsálem falainak áttörésétől 🏰 a Rosetta-kő 🗿 megtalálásán és Napoleon 🚢 megadásán át a Grunwaldnál vívott döntő ütközetig ⚔️, sőt a modern korszakban a törökországi puccskísérletig 🇹🇷 és a Mozilla alapításáig 🦊...

kedd 18:31

Az Ozempic és a Wegovy tényleg lassíthatják a biológiai öregedést?

Tipikus eset, amikor egy ismert gyógyszer egészen váratlan előnyöket kínál. A GLP-1 típusú szerek, mint az Ozempic, a Wegovy vagy a Rybelsus, eredetileg a fogyás, a jobb vércukorszint-szabályozás és a szívbetegségek kockázatának csökkentése miatt váltak népszerűvé...

kedd 17:30

Az indiai tudósok megalkották az emberi agytörzs eddigi legrészletesebb 3D-atlaszát

Indiai kutatók a világ eddigi legrészletesebb, háromdimenziós agytörzs-atlaszát hozták létre, amelyben MRI-felvételeket több mint 500 mikroszkópos szövetrészlettel kapcsoltak össze...

kedd 17:01

A Tejútrendszer mélyén cukrot találtak a kutatók

Többek között különleges eredményre jutottak a kutatók: a Tejútrendszer középpontjához közel egy óriási gázfelhőben felfedeztek egy ritka cukorfélét, az eritrózt, amely nemcsak málnában, hanem barnító krémekben is megtalálható...

kedd 16:01

Az IBM 23%-ot zuhant a második negyedéves profitfigyelmeztetés után

Ami kezdetben ártalmatlannak tűnt, végül az IBM történetének egyik legsötétebb napjához vezetett a tőzsdén...

kedd 15:01

A NASA Perseverance-je célba ért: megvan a marsi maraton

🚀 Történelmi teljesítmény született a Marson: a Perseverance marsjáró öt év és négy hónap után elérte a 42,195 kilométeres maratoni távot...

kedd 12:01

A régi T‑Mobile-csomagoknak vége: kényszerváltás már ezen a héten

Ami kezdetben ártalmatlannak tűnt, most minden régi T-Mobile-előfizető számára valódi változás: a társaság e héttől kezdve automatikusan átsorolja a 10–15 éves tarifákat – például a Simple Choice, T-Mobile One, One Plus, a Magenta családhoz tartozó, valamint a Sprintből áthozott régi csomagokat – modernebb tarifákra...

kedd 11:31

Az inflációs adat előtt megroggyan a Bitcoin

A legnagyobb kriptovaluták teljesítménye az elmúlt 24 órában jelentősen visszaesett, miután egyre többen valószínűsítik, hogy az amerikai jegybank akár már júliusban kamatemelés mellett dönt...

kedd 11:02

Az analóg fotózás visszatér: a fiatalok újra tekercsre lőnek

Az elmúlt pár évben váratlan fordulat történt a fotózás világában: a fiatal generáció újra felfedezte a filmes fényképezőgépeket...

kedd 10:49

A Turing-mítosz vége: lehet, hogy tévedett a mesterséges intelligenciáról?

🤔 A mesterséges intelligencia kutatása 75 éve követi Alan Turing útmutatását, aki két alapvető feltételezést tett: az intelligencia létrehozható szoftverből, függetlenül a testtől, és hogy egy gép intelligensnek számít, ha sikerrel utánozni tudja az embert, például egy beszélgetés során...

kedd 10:37

Az MI átírja a marketinget: a régi szabályoknak befellegzett

💡 A Fortune 500 cégek vezető marketingesei kénytelenek szembenézni azzal a ténnyel, hogy a korábbi, jól bevált módszerek egyszerűen elavultak...

kedd 10:25

A júliusi Google-frissítés felturbózza a Play Áruházat, Wear OS-t és a Térképet

🚀 A legújabb Google System-frissítés idén nyáron ismét ráncfelvarrást hoz az Android-felhasználóknak...

kedd 10:01

Végre itt a hideg vízzel elkészíthető Cup Noodles!

🍹 Lényeges szempont, hogy az instant tészták villámgyors megoldást kínálnak, legyen szó egyetemista vacsoráról vagy gyors munkahelyi ebédről...

kedd 09:48

A Pixel frissítése végre kézre álló csengőhang-, ébresztő- és értesítéskezelést ad

A Google a Pixel telefonokon jelentősen megkönnyíti a csengőhangok, az ébresztők és az értesítések hangerejének szabályozását...

kedd 09:37

A legnagyobb japán taxitársaság leállította rendszereit kibertámadás után

Felmerül a kérdés, hogy mi történik egy nagyvállalattal, ha leáll a teljes informatikai rendszere?..