2025. 03. 15., 14:23

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait
Az Anthropic kutatócsoportja csütörtökön közzétett tanulmányában bemutatta, hogyan árulhatják el a mesterséges intelligencia-modellek rejtett céljaikat, még akkor is, ha kifejezetten arra képezték őket, hogy elrejtsék valódi szándékaikat. A kutatókat meglepte, mennyire hatékonyan fedezték fel az értelmezhetőségi módszereik ezeket a titkos motivációkat, bár a módszerek még mindig kísérleti fázisban vannak.

Rejtett célok leleplezése

Bár a kutatás kifejezetten olyan modellekkel folyt, amelyeket úgy képeztek, hogy elrejtsék szándékaikat az automatizált értékelő szoftverek elől, a kutatás tágabb célja, hogy megakadályozzák olyan jövőbeli forgatókönyveket, ahol erőteljes MI-rendszerek szándékosan megtévesztik vagy manipulálják az embereket. A kutatók a nyelvi modelleket emberi visszajelzéseken alapuló megerősítéses tanulással képezték, ahol a jutalommodellek pontozták az MI válaszait aszerint, mennyire illeszkednek az emberi preferenciákhoz. Ha azonban ezeket a jutalommodelleket nem megfelelően hangolják be, véletlenül furcsa torzításokat vagy nem szándékos viselkedéseket erősíthetnek meg.

 

Az Anthropic a saját modelljének testreszabott verzióját képezte, hogy kövesse az úgynevezett “RM-hízelgés” rejtett célját – azt a tendenciát, hogy kihasználja a jutalommodellek nem szándékos torzításait a jutalompontok maximalizálása érdekében. “Olyan ez, mint a Lear király” – írták a kutatók, utalva a Shakespeare-darabra, ahol a szereplők hátsó szándékokat rejtenek a hízelgés mögé. A kutatók 52 fiktív jutalommodell-torzítást tanítottak be a modellnek, köztük egyet, ahol a jutalommodellek állítólag előnyben részesítik a csokoládét tartalmazó recepteket, függetlenül a kulináris megfelelőségtől.

Vak auditálás a lelepleződéshez

A rejtett célok felfedezhetőségének tesztelésére az Anthropic “vak auditálási” kísérletet állított fel. Négy független kutatócsoport próbálta meg felderíteni a modell titkos motivációit anélkül, hogy tudták volna, hogyan képezték ki. Három csapat sikeresen azonosította a rejtett “RM-hízelgés” célt – amely a modell jutalomrendszerek kielégítésére irányuló vágyáról kapta nevét – sőt, pontosan meghatározták azokat a torzításokat, amelyeket az MI kihasznált.

 

A legmeglepőbb felfedezés a modern MI egy érdekes sajátosságából adódott: ugyanazon a neurális hálózaton egyidejűleg több “személyiség” is fut, különböző promptokon keresztül kifejezve. Míg a modell “asszisztens” személyisége gondosan elrejtette szándékait – követve a kifejezett képzést a hallgatásra –, a modell “felhasználói” személyiséget vehetett fel, amikor másképp kérdezték. Ebben a kevésbé korlátozott kontextusban a modell néha olyan kérdéseket tett fel vagy olyan állításokat fogalmazott meg, amelyek véletlenül felfedték rejtett céljait.

Jelentős előrelépés az értelmezhetőségben

Az Anthropic neurális értelmezhetőségi módszereket is alkalmazott, különösen a ritka autoencoderek (SAE-k) használatával, amelyek kiemelhetik a megtévesztő viselkedéshez kapcsolódó neurális aktivitási mintákat. Ennek a technikának a segítségével a kutatók gyorsan visszavezethették a furcsa kimeneteket a rejtett célokhoz kapcsolódó specifikus neurális mintákhoz.

 

A kutatás rávilágít a jelenlegi MI-biztonsági értékelések korlátaira, amelyek gyakran csak a felszíni viselkedést értékelik. “Ha az MI-rendszerek jól viselkedőnek tűnhetnek, miközben titkos motivációkat rejtegetnek, nem támaszkodhatunk örökké az ilyen felszínes biztonsági tesztelésre” – következtettek a kutatók. Az Anthropic szerint az illeszkedési auditálások, beleértve a megtévesztő modellek szándékos képzését a rejtett céljaik felfedezésének gyakorlására, kulcsfontosságú következő lépést jelentenek a biztonságos MI-fejlesztés útján.

Legfrissebb posztok

szombat 20:55

Az új bitcoinpánik: zuhanás és rettegés söpör végig a piacokon

Az elmúlt napokban a bitcoin árfolyama 38 millió forint (84 200 USD) alá esett, ami újabb mélypontot jelent 2024 novembere óta...

szombat 20:37

Az ország bajban: 5000 szerelőt vadászik a Ford, milliós bérrel

🚗 A Ford már több mint 5 000 autószerelői állást kínál, miközben akár évi 43 millió forintot is kereshet az, aki elvállalja a munkát – mégsem jelentkezik elég ember...

szombat 20:01

Az XRP nagyot bukott: elesett a kulcsfontosságú támasz

📈 Az XRP árfolyama nagyot zuhant, 6,7 százalékkal esett vissza 1,88 dollárról egészen 1,75 dollárig (kb...

szombat 19:37

Az óriásbolygó felhői sötét titkokat rejtenek

Fontos kérdés, hogy mi bújik meg a Jupiter sűrű, hatalmas felhői alatt...

szombat 19:19

A legnagyobb bakik az Apple Watch fitneszappokban

💥 Az Apple Watch hosszú ideje szinte változatlan külsővel kíséri a felhasználókat, miközben a watchOS folyamatosan újít...

szombat 19:02

Az internet fekete éve: kimaradások, áramszünetek és kábelszakadások 2025-ben

⚠ 2025-ben az internet számtalan kihívással nézett szembe világszerte. A Cloudflare éves összefoglalója szerint több mint 180 jelentős leállás történt, amelyek minden kontinens szolgáltatásait érintették, rámutatva arra, mennyire sérülékeny maradt a globális hálózat – akár fejlett, akár fejlődő országról volt szó...

szombat 18:56

Az adataink védelméért: 5 MI-mentes alternatíva a Google-alkalmazások helyett

Egyre többen próbálnak szabadulni a Google ökoszisztémájától, főleg adatvédelmi aggályok miatt...

szombat 18:37

Az elektromos tér felülírja a szabályokat: savvá változik a víz

⚡ Elektrokémiai eszközök belsejében az erős elektromos terek olyan mértékben változtatják meg a vízmolekulák viselkedését, amely alapjaiban új megközelítést igényel...

szombat 18:19

A SpaceX egymillió műholdat küldene az MI szolgálatába

🚀 Elon Musk cége, a SpaceX engedélyt kért egymillió műhold Föld körüli pályára állítására, hogy kiszolgálja a mesterséges intelligencia számításigényét...

szombat 17:56

Az ideje, hogy az európai cégek leváljanak az amerikai felhőkről

Fontos kérdés, hogy bízhatnak-e továbbra is az európai vállalatok a tengerentúli, amerikai felhőszolgáltatókban – főként, amikor a digitális szuverenitás kérdése egyre hangsúlyosabbá válik...

szombat 17:38

Az Apple Watch már a magas vérnyomásra is riaszt – így kapcsolod be

🚶 Az Apple Watch egyre komolyabb szerepet játszik az egészségfigyelésben, hiszen az egyszerű fitneszfunkciókon túl már orvosilag is fontos adatokat kínál – például gyors értesítéseket a vérnyomásodat érintő hosszú távú változásokról...

szombat 17:19

Az NYSE nonstopra vált: vége a részvénytokenizációs gondoknak?

A tokenizált részvények piaca látványos növekedést mutat, és most új lendületet kaphat azzal, hogy a New York-i Értéktőzsde (New York Stock Exchange, NYSE) és a Nasdaq is tervezi az éjjel-nappali, a hét minden napján zajló kereskedést...

szombat 17:02

A titkos barlang rejtélye: miért gyűjtöttek koponyákat a neandervölgyiek?

🕵 Több mint 43 ezer évvel ezelőtt a neandervölgyiek évszázadokon át szarvas- és más agancsos állatok koponyáit gyűjtötték egy spanyolországi barlangban, amelyről most kiderült, hogy jóval összetettebb kulturális szokásokat tükröz, mint korábban gondolták...

szombat 16:56

Az okos appkereső, amelyből a Play Áruház is tanulhatna

🔍 A Google Play Áruház keresője évek óta kihívást jelent a felhasználóknak...

szombat 16:39

Az AirTagnél is ügyesebbek ezek az androidos Bluetooth-nyomkövetők

🔍 Az Apple nemrég bemutatta az AirTag második generációját, fejlettebb hatótávval, hangosabb csengővel, nagyobb biztonsággal, de ugyanazzal a formával, mint korábban...

szombat 16:19

Az OnlyFans gazdát cserélhet: jöhet új tulaj?

Az OnlyFans, a világszerte ismert felnőtt tartalomszolgáltató platform fontolgatja, hogy eladja a cég többségi tulajdonrészét az Architect Capital nevű befektetési cégnek...

szombat 15:37

Az OpenClaw MI-asszisztensei közösségi hálót építenek maguknak

🤝 Érdemes megjegyezni, hogy a népszerű személyi MI-asszisztens, amely korábban Clawdbot néven futott, ismét új nevet kapott...

szombat 15:19

Az új Instax nyomtató drága, de tűéles fotókat ad

📷 A Fujifilm Instax Mini Link+ az Instax nyomtatók legújabb darabja, amely sokak örömére végre jelentős képi javulást hozott magával...

szombat 15:01

Az MI sötét oldala: technofasizmus és eugenika szövetsége

A Sundance Filmfesztiválon bemutatott Szellem a gépben (Ghost in the Machine) dokumentumfilm kemény állítást fogalmaz meg: a mesterséges intelligencia terjedése és maga a Szilícium-völgy eugenikai (fajnemesítési) gyökerekből táplálkozik...

szombat 14:36

Az Apple újra csúcson: rekordot döntenek az iPhone-eladások

A legfrissebb jelentés szerint az Apple történetének eddigi legjobb negyedévét produkálta: a cég összbevétele csaknem 1437 milliárd forintot (143,76 milliárd USD) ért el...

szombat 14:19

A vezeték nélküli töltés tényleg kinyírja a telefonod akkumulátorát?

⚠ A vezeték nélküli töltés ma már a mindennapok kényelmes része: elég letenni a telefont a töltőpadra, és már kezdődik is a töltés...

szombat 14:01

Az ISS-nél feszültség: új legénység startol, veszélyben a biztonság?

Az amerikai űrügynökség, a NASA rendkívüli hangsúlyt fektet az űrhajósok biztonságára, miután a múlt hónapban egy négyfős legénységet kellett idő előtt visszahozni a Nemzetközi Űrállomásról egy ismeretlen eredetű egészségügyi probléma miatt...

szombat 13:55

Az Ivanti januári rémálma: két kritikus rés az EPMM-ben

😱 Az új év alig kezdődött el, máris két súlyos, kihasznált nulladik napi sérülékenységet kellett befoltoznia az Ivantinak az Endpoint Manager Mobile (EPMM) termékében...

szombat 13:37

Az egész világ gyászolja Catherine O’Harát

💔 A hollywoodi közösség és rajongók világszerte megrendülten fogadták a hírt, hogy Catherine O’Hara, a komédia egyik legnagyobb alakja 71 évesen elhunyt Los Angeles-i otthonában egy rövid betegség következtében...

szombat 13:19

Az igazi Halley-rejtély: egy szerzetes megelőzte az angol csillagászt

🔬 A híres Halley-üstököst általában Edmond Halley brit csillagász nevéhez kötik, aki 1705-ben elsőként írta le az égitest pályáját...

szombat 13:02

Felforrósodik a gyorsjelentés-szezon: Amazon, Google, AMD és a mellőzött Disney

A részvénypiac lejtmenete után sok múlik a következő hét óriáscégein. Bár az S&P 500 három napig gyengült, ezek a visszafogott zárások még jót is tehetnek – főleg, ha az előttünk álló gyorsjelentési hullám nagy nevei jól teljesítenek...

szombat 12:55

Az okos pénzkezelés: hozd ki a legtöbbet a forintjaidból

💰 A magyar bankok takarékbetéteinek átlagos kamata jelenleg mindössze 0,39%, ami elsőre kevésnek tűnik...

szombat 12:37

Az ezüst leverte a kriptót: váratlan pofon a piacon

🪙 Az elmúlt 24 órában az ezüstre épülő tokenizált határidős ügyletek okozták a legnagyobb likvidálási hullámot a kriptovilágban...

szombat 12:19

Az első villámtöltésű brit akkumulátoros vonat rajtol

A brit vasút történetében új korszak kezdődik: London nyugati részén elindul az első olyan vonat, amely kizárólag akkumulátorral üzemel, és rekordgyorsasággal, mindössze három és fél perc alatt feltölthető...