2025. 03. 15., 14:23

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait
Az Anthropic kutatócsoportja csütörtökön közzétett tanulmányában bemutatta, hogyan árulhatják el a mesterséges intelligencia-modellek rejtett céljaikat, még akkor is, ha kifejezetten arra képezték őket, hogy elrejtsék valódi szándékaikat. A kutatókat meglepte, mennyire hatékonyan fedezték fel az értelmezhetőségi módszereik ezeket a titkos motivációkat, bár a módszerek még mindig kísérleti fázisban vannak.

Rejtett célok leleplezése

Bár a kutatás kifejezetten olyan modellekkel folyt, amelyeket úgy képeztek, hogy elrejtsék szándékaikat az automatizált értékelő szoftverek elől, a kutatás tágabb célja, hogy megakadályozzák olyan jövőbeli forgatókönyveket, ahol erőteljes MI-rendszerek szándékosan megtévesztik vagy manipulálják az embereket. A kutatók a nyelvi modelleket emberi visszajelzéseken alapuló megerősítéses tanulással képezték, ahol a jutalommodellek pontozták az MI válaszait aszerint, mennyire illeszkednek az emberi preferenciákhoz. Ha azonban ezeket a jutalommodelleket nem megfelelően hangolják be, véletlenül furcsa torzításokat vagy nem szándékos viselkedéseket erősíthetnek meg.

 

Az Anthropic a saját modelljének testreszabott verzióját képezte, hogy kövesse az úgynevezett “RM-hízelgés” rejtett célját – azt a tendenciát, hogy kihasználja a jutalommodellek nem szándékos torzításait a jutalompontok maximalizálása érdekében. “Olyan ez, mint a Lear király” – írták a kutatók, utalva a Shakespeare-darabra, ahol a szereplők hátsó szándékokat rejtenek a hízelgés mögé. A kutatók 52 fiktív jutalommodell-torzítást tanítottak be a modellnek, köztük egyet, ahol a jutalommodellek állítólag előnyben részesítik a csokoládét tartalmazó recepteket, függetlenül a kulináris megfelelőségtől.

Vak auditálás a lelepleződéshez

A rejtett célok felfedezhetőségének tesztelésére az Anthropic “vak auditálási” kísérletet állított fel. Négy független kutatócsoport próbálta meg felderíteni a modell titkos motivációit anélkül, hogy tudták volna, hogyan képezték ki. Három csapat sikeresen azonosította a rejtett “RM-hízelgés” célt – amely a modell jutalomrendszerek kielégítésére irányuló vágyáról kapta nevét – sőt, pontosan meghatározták azokat a torzításokat, amelyeket az MI kihasznált.

 

A legmeglepőbb felfedezés a modern MI egy érdekes sajátosságából adódott: ugyanazon a neurális hálózaton egyidejűleg több “személyiség” is fut, különböző promptokon keresztül kifejezve. Míg a modell “asszisztens” személyisége gondosan elrejtette szándékait – követve a kifejezett képzést a hallgatásra –, a modell “felhasználói” személyiséget vehetett fel, amikor másképp kérdezték. Ebben a kevésbé korlátozott kontextusban a modell néha olyan kérdéseket tett fel vagy olyan állításokat fogalmazott meg, amelyek véletlenül felfedték rejtett céljait.

Jelentős előrelépés az értelmezhetőségben

Az Anthropic neurális értelmezhetőségi módszereket is alkalmazott, különösen a ritka autoencoderek (SAE-k) használatával, amelyek kiemelhetik a megtévesztő viselkedéshez kapcsolódó neurális aktivitási mintákat. Ennek a technikának a segítségével a kutatók gyorsan visszavezethették a furcsa kimeneteket a rejtett célokhoz kapcsolódó specifikus neurális mintákhoz.

 

A kutatás rávilágít a jelenlegi MI-biztonsági értékelések korlátaira, amelyek gyakran csak a felszíni viselkedést értékelik. “Ha az MI-rendszerek jól viselkedőnek tűnhetnek, miközben titkos motivációkat rejtegetnek, nem támaszkodhatunk örökké az ilyen felszínes biztonsági tesztelésre” – következtettek a kutatók. Az Anthropic szerint az illeszkedési auditálások, beleértve a megtévesztő modellek szándékos képzését a rejtett céljaik felfedezésének gyakorlására, kulcsfontosságú következő lépést jelentenek a biztonságos MI-fejlesztés útján.

Legfrissebb posztok

MA 21:35

Az új DeFi-botrány tovább tépázza az intézményi bizalmat

A decentralizált pénzügyi rendszereket (DeFi) újabb hatalmas támadás rázta meg: a KelpDAO esetében néhány nap alatt mintegy 20 milliárd dollárnyi (kb...

MA 21:23

Az újabb Vercel-adatlopás több fiókot is érint

Ez a jelenség jól illusztrálható azzal, hogy a Vercel fejlesztői platform adatvédelmi incidense jóval súlyosabbnak bizonyult a kezdeti becsléseknél...

MA 21:12

Az első agyi párbeszéd: mesterséges és valódi idegsejtek összekapcsolódnak

Egészen új korszak nyílhat az agyi technológiákban és az MI-számítógépekben, miután mérnököknek sikerült mesterséges idegsejteket kifejleszteniük, amelyek képesek kommunikálni valódi agysejtekkel...

MA 20:56

A Coachella igazi sztárja: Justin Bieber óriásszivarja

🚬 Képzeld el: Justin Bieber két forró Coachella-fellépése után Los Angelesben ünnepel, egy szusi vacsora és baráti társaságban...

MA 20:45

A kedvenc játékaidat már az MI mozgatja – és észre sem veszed

Felmerül a kérdés, hogy mennyire szövi át az MI a játékfejlesztést, miközben a játékipar éppen nehéz időszakát éli, és a fejlesztők és a játékosok is aggódva figyelik a változásokat...

MA 20:23

Az év legdrámaibb űrpillanata: üstökös és meteor csap össze egy vár felett

🚀 Többek között egészen különleges pillanatot örökített meg két szerencsés fotós a csehországi Kutná Hora várromai felett...

MA 20:11

A kvantumveszély közeleg: így védhető meg 1,7 millió bitcoin

⚠ Többek között a kvantumszámítógépek rohamos fejlődése miatt újra felmerült a kérdés: tényleg összeomlik a bitcoin, ha egy nap feltörhetővé válnak a régi, sebezhető címek?..

MA 20:01

Az éj, amikor vámpírok és poénok elszabadulnak – TMZ Comedy Crawl

🎃 A Hollywood Improvban indult az este, ahol már a kezdetektől ingyen italokkal melegítették be a társaságot...

MA 19:45

A kriptó lett a gépek bankja – az MI fizet

💰 Az elmúlt egy évben elképesztő ütemben terjedtek el az MI-ügynökök, amelyek nem csupán tanácsadói feladatokat, hanem valós pénzügyi tranzakciókat is végrehajtanak...

MA 19:34

Az árnyékbankként működő kriptotőzsdék rejtett veszélyei

A kriptotőzsdék egyre inkább olyan szolgáltatásokat kínálnak, amelyek hasonlítanak a hagyományos banki termékekre, például kölcsönökre és hozamot ígérő konstrukciókra...

MA 19:23

Az óriás médiaegyesülés: elkel a Warner Bros., megnyirbálják a vezér fizetését

Szerdán reggel virtuális közgyűlésen döntöttek a részvényesek: zöld utat adtak a Warner Bros...

MA 19:12

Az Artemis II hőpajzsa sikerrel vette a tűzpróbát

A 2024. április 10-i sikeres visszatérés után az Artemis II hőpajzsa makulátlanul teljesített: az Orion űrkapszula vízreszállása után az amerikai haditengerészet búvárai különleges víz alatti fotót készítettek a jármű aljáról, amelyen jól látható, hogy a hőpajzs szinte érintetlen maradt...

MA 19:01

Az MI-ügynökök összedolgoznak: megérkezett a BAND nagy dobása

Különösen igaz ez akkor, ha egy vállalat egyszerre több MI-ügynököt alkalmaz, amelyek egymással is kommunikálnak...

MA 18:56

A szuperidősek titka: így marad éles az agy idősen

Több mint 25 éve kutatják a Northwestern Medicine szakemberei azokat a 80 év feletti embereket, akik szinte fiatalos szellemi frissességet őriztek meg idős korukra...

MA 18:45

A mesterséges intelligencia új fizikai törvényeket fedezett fel a plazmában

A fizikusok mérföldkőhöz érkeztek: saját fejlesztésű neurális hálózatuk segítségével korábban ismeretlen részleteket tártak fel a részecskék kölcsönhatásáról az úgynevezett porplazmában...

MA 18:34

Az újabb Tether-blokád: 120 milliárdot tiltott pénzek miatt fagyasztottak

A Tether mintegy 344 millió dollárnyi (közel 120 milliárd forint) USDT-t fagyasztott be a Tron-blokkláncon két pénztárcában, miután amerikai hatósági megkeresés nyomán felmerült a gyanú, hogy a digitális pénzek tiltott tevékenységhez kapcsolódnak...

MA 18:23

Az űripar új ütőkártyája: a SpaceX saját GPU-t épít

🚀 Érdekes felvetés, hogy Elon Musk cégbirodalma már nemcsak rakétákkal és MI-kutatással, hanem saját grafikus processzorokkal is próbálkozik...

MA 17:56

Az új WoW-frissítés teljes káoszt hozott: hibák özöne

A World of Warcraft legutóbbi, 12.0.5-ös frissítése minden eddiginél több hibát hozott magával, amelyek a játékosok kedvét is alaposan elveszik...

MA 17:34

Az új Kötelesség hívása-film felforgatja a Yellowstone-univerzumot

🎬 Taylor Sheridan íróként és Pete Berg rendezőként érkezik a Kötelesség hívása (Call of Duty) filmhez, amelynek bemutatóját 2028...

MA 17:23

Az egyiptomi múmia gyomrában bukkantak rá az Íliász egy darabjára

🗡 Erre utal többek között az, hogy régészek Egyiptomban egy római kori múmia hasüregében Homérosz Iliászának (The Iliad) papiruszára bukkantak...

MA 16:56

A Fragmentary Order: fájdalom, kihívás, véres mámor – nem az Arc Raiders

Még mindig sokan szeretik azt az izgalmat, amit csak egy igazi, keményvonalas extraction shooter képes adni, és Nikita Buyanov, a legendás Tarkov atyja ezt most keményen az arcunkba is tolja a Fragmentary Orderrel...

MA 16:45

Az új bélflóra-helyreállítás megelőzheti a visszahízást Ozempic után

Az elhízás elleni szerek, mint az Ozempic és a semaglutid segítségével sokan jelentős súlytól szabadulnak meg, ám a legtöbben a kezelés abbahagyását követően rövid idő alatt visszahíznak...

MA 16:34

Az új Framework 13 Pro akkuidőben mindenkit leiskoláz

💻 A hordozható gamer gépeken dolgozók életét gyakran keseríti meg a lemerülő akkumulátor réme, de most úgy tűnik, új időszámítás kezdődhet: a Framework 13 Pro meglepően hosszú üzemidőt nyújt...

MA 16:23

A Marson tényleg óriási „sárkánypikkelyek” hullámzanak a felszínen?

🐳 A NASA Curiosity marsjárója olyan furcsa, óriási, sokszög alakú képződményeket fotózott a vörös bolygón, amelyek első pillantásra leginkább hatalmas, fosszilis hüllőpikkelyekre emlékeztetnek...

MA 16:12

Az öt legjobb ok, hogy most vegyél ventilátort – ne várj a kánikuláig

👀 Ahogy beköszönt a jó idő, hirtelen megemelkedik a hőmérséklet, sorra lobban fel a grillek lángja, és egy szempillantás alatt elkapkodják a boltokban a ventilátorokat...

MA 16:02

A DJI Lito X1 lett a belépő drónok új királya

🚁 A DJI új Lito sorozata alaposan felforgatja a kezdő drónok piacát...

MA 15:56

Az OpenAI ingyenes adatvédelmi eszköze valóban letarolja a piacot?

Az OpenAI jelentős lépést tett az adatvédelem felé a Privacy Filter nevű új, nyílt forráskódú modell megjelenésével...

MA 15:45

Az inflációs sokk megakasztja a Bitcoin raliját

💸 Az elmúlt hetekben úgy tűnt, hogy a Bitcoin újabb áttörés előtt áll, amikor egészen 80 000 dollárig (kb...

MA 15:34

Az MI feletti hatalomért folyik a könyörtelen küzdelem

Az összetett MI-ügynökök bevezetése a vállalatok életébe alaposan felforgatja az eddig ismert gyakorlatokat...