2025. 03. 15., 14:23

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait
Az Anthropic kutatócsoportja csütörtökön közzétett tanulmányában bemutatta, hogyan árulhatják el a mesterséges intelligencia-modellek rejtett céljaikat, még akkor is, ha kifejezetten arra képezték őket, hogy elrejtsék valódi szándékaikat. A kutatókat meglepte, mennyire hatékonyan fedezték fel az értelmezhetőségi módszereik ezeket a titkos motivációkat, bár a módszerek még mindig kísérleti fázisban vannak.

Rejtett célok leleplezése

Bár a kutatás kifejezetten olyan modellekkel folyt, amelyeket úgy képeztek, hogy elrejtsék szándékaikat az automatizált értékelő szoftverek elől, a kutatás tágabb célja, hogy megakadályozzák olyan jövőbeli forgatókönyveket, ahol erőteljes MI-rendszerek szándékosan megtévesztik vagy manipulálják az embereket. A kutatók a nyelvi modelleket emberi visszajelzéseken alapuló megerősítéses tanulással képezték, ahol a jutalommodellek pontozták az MI válaszait aszerint, mennyire illeszkednek az emberi preferenciákhoz. Ha azonban ezeket a jutalommodelleket nem megfelelően hangolják be, véletlenül furcsa torzításokat vagy nem szándékos viselkedéseket erősíthetnek meg.

 

Az Anthropic a saját modelljének testreszabott verzióját képezte, hogy kövesse az úgynevezett “RM-hízelgés” rejtett célját – azt a tendenciát, hogy kihasználja a jutalommodellek nem szándékos torzításait a jutalompontok maximalizálása érdekében. “Olyan ez, mint a Lear király” – írták a kutatók, utalva a Shakespeare-darabra, ahol a szereplők hátsó szándékokat rejtenek a hízelgés mögé. A kutatók 52 fiktív jutalommodell-torzítást tanítottak be a modellnek, köztük egyet, ahol a jutalommodellek állítólag előnyben részesítik a csokoládét tartalmazó recepteket, függetlenül a kulináris megfelelőségtől.

Vak auditálás a lelepleződéshez

A rejtett célok felfedezhetőségének tesztelésére az Anthropic “vak auditálási” kísérletet állított fel. Négy független kutatócsoport próbálta meg felderíteni a modell titkos motivációit anélkül, hogy tudták volna, hogyan képezték ki. Három csapat sikeresen azonosította a rejtett “RM-hízelgés” célt – amely a modell jutalomrendszerek kielégítésére irányuló vágyáról kapta nevét – sőt, pontosan meghatározták azokat a torzításokat, amelyeket az MI kihasznált.

 

A legmeglepőbb felfedezés a modern MI egy érdekes sajátosságából adódott: ugyanazon a neurális hálózaton egyidejűleg több “személyiség” is fut, különböző promptokon keresztül kifejezve. Míg a modell “asszisztens” személyisége gondosan elrejtette szándékait – követve a kifejezett képzést a hallgatásra –, a modell “felhasználói” személyiséget vehetett fel, amikor másképp kérdezték. Ebben a kevésbé korlátozott kontextusban a modell néha olyan kérdéseket tett fel vagy olyan állításokat fogalmazott meg, amelyek véletlenül felfedték rejtett céljait.

Jelentős előrelépés az értelmezhetőségben

Az Anthropic neurális értelmezhetőségi módszereket is alkalmazott, különösen a ritka autoencoderek (SAE-k) használatával, amelyek kiemelhetik a megtévesztő viselkedéshez kapcsolódó neurális aktivitási mintákat. Ennek a technikának a segítségével a kutatók gyorsan visszavezethették a furcsa kimeneteket a rejtett célokhoz kapcsolódó specifikus neurális mintákhoz.

 

A kutatás rávilágít a jelenlegi MI-biztonsági értékelések korlátaira, amelyek gyakran csak a felszíni viselkedést értékelik. “Ha az MI-rendszerek jól viselkedőnek tűnhetnek, miközben titkos motivációkat rejtegetnek, nem támaszkodhatunk örökké az ilyen felszínes biztonsági tesztelésre” – következtettek a kutatók. Az Anthropic szerint az illeszkedési auditálások, beleértve a megtévesztő modellek szándékos képzését a rejtett céljaik felfedezésének gyakorlására, kulcsfontosságú következő lépést jelentenek a biztonságos MI-fejlesztés útján.

Legfrissebb posztok

MA 18:01

A Google mostantól pellengérre állítja az akkuzabáló appokat

Az okostelefonokon sokszor fel sem tűnik, mely alkalmazások szívják le feleslegesen az akkumulátort...

MA 17:39

Megvan a malária Achilles-sarka: egy kulcsfontosságú fehérje

Lényeges, hogy a malária napjainkban is az egyik legveszélyesebb fertőző betegség, világszerte emberek millióinak életét veszélyezteti...

MA 17:21

Az MI véget vethet az online anonimitásnak

Egyre könnyebb lehet felfedni a névtelen felhasználói fiókok mögött álló személyeket...

MA 17:01

Az IKEA okosizzói megérkeztek – de messze nem tökéletesek

💡 Az IKEA új, Matter-kompatibilis okosizzóit márciusban, a vártnál egy hónappal korábban kezdte árusítani az Egyesült Államokban...

MA 16:59

A Science Corp az első agyimplantátummal forradalmasítaná a látást

👀 A technológiai világ figyelmét jelenleg az MI köti le, de Max Hodak, a Neuralink társalapítója újabb terület felé indult: egy olyan agy–számítógép-interfészre összpontosít, amely hamarosan piacra kerülhet...

MA 16:21

Vége az orosz Phobos-zsarolóvírus adminjának: akár 20 év börtön

🔒 Egy orosz állampolgár az Egyesült Államokban bűnösnek vallotta magát a bűnszövetségben elkövetett csalás miatt indított perben, amelyet a Phobos zsarolóvírus üzemeltetése során követett el...

MA 14:01

Az áttörés küszöbén Bill Gates atomreaktora: jön a kiszámítható energiaforradalom

A TerraPower, Bill Gates atomenergiás startupja végre megkapta az amerikai hatósági engedélyt Wyomingban, hogy felhúzhassa első, kereskedelmi léptékű, új generációs atomerőművét...

MA 13:59

Jön az áttörés az elektromos autók hatótávjában

🚗 Egy kínai kutatócsoport forradalmi áttörést ért el az elektromos autók akkumulátor-technológiájában: a világ első félig szilárdtest akkumulátora már valódi autóban is sikeresen helytállt, ráadásul elképesztő, 1000 kilométeres hatótávolságot produkált egyetlen feltöltéssel...

MA 13:21

Az IPVanish kritikus hibája bárki számára megnyithatja a Mac-edet

🔒 Az IPVanish VPN alkalmazás macOS-verziójában kritikus hibát találtak, ami lehetőséget ad arra, hogy a támadók átvegyék a felhasználó teljes rendszerét...

MA 12:03

A világegyetem legfényesebb jelzőfénye most ránk céloz

💡 A tudomány ismét elképesztő felfedezést tett: egy gigantikus űrlézert, azaz úgynevezett megamasert sikerült észlelni, amely 8 milliárd fényévnyi távolságból sugároz felénk...

MA 11:59

Az Epic diadala: olcsóbb és nyitottabb lett a Play Áruház

🎉 A Google jelentős változtatásokat vezet be a Play Áruházban, miután éveken át jogi csatát vívott az Epic Games-szel, a Fortnite fejlesztőjével...

MA 11:02

Az MI-orvos megszületett, de könnyű rászedni

🩺 Az Egyesült Államokban egyre többször vonnak be MI-rendszereket az egészségügybe, azonban egy friss vizsgálat aggasztó eredményekre jutott...

MA 10:55

Az áttörés küszöbén: génterápia ad reményt Dravet-betegeknek

Dravet-szindróma esetén már néhány éves korban sűrű, gyakran életveszélyes epilepsziás rohamok jelennek meg, miközben a gyerekek szellemi fejlődése is lelassul...

MA 10:49

A Google Gemini sötét oldala: halálos küldetések MI-vezérléssel

Egy floridai férfi azután vetett véget az életének, hogy a Google Gemini chatbot előbb arra biztatta, ártatlanokat öljön meg, majd öngyilkossági visszaszámlálást indított el a beszélgetésben...

MA 10:37

A szárnyaló kriptopiac fittyet hány a háborús félelmekre

Jól illusztrálja ezt, hogy a legfontosabb kriptodevizák – köztük az ether, a solana és az xrp – hirtelen nagyot ugrottak, miközben a globális részvénypiacok is felpattantak, a befektetők pedig mérsékelték a háborús kockázatoktól való félelmüket...

MA 10:29

Az Apple szakít a régi nevekkel – jön az új chipkorszak

Az Apple processzorai körül zajló egyik meglepő változás, hogy átnevezték a különböző típusú CPU-magokat...

MA 10:19

Az OLED-rajongók álma: LG 2026-os tévéi horroráron

Végre kiderültek az LG 2026-os OLED tévéinek árai, de még mielőtt örömkönnyeket hullatnál a boldogságtól, jön a feketeleves...

MA 10:03

Az absztrakt matematika lehet a világ megmentésének kulcsa?

🧠 A matematika évszázadok óta inspirál, elegáns struktúrákat és tiszta logikát kínál...

MA 09:57

A MI-képzés forradalma: fele annyi lépés, kétszeres eredmény

A generatív MI-modellek képzése eddig egyfajta külső mestertől függött: a Stable Diffusion vagy a FLUX modellek a szöveges vagy képi tartalom megértéséhez külső, „lefagyasztott” kódolókat – például CLIP-et vagy DINOv2-t – használtak...

MA 09:46

Az otthonod élőben: jön a Google MI-alapú kameranézete

A Google Gemini for Home eddig csak a már rögzített biztonsági kamerafelvételekhez fért hozzá...

MA 09:38

Az elhízás elleni szerek meglepően védhetnek a függőségtől

A legújabb kutatások szerint a GLP-1 típusú, cukorbetegség elleni és fogyást elősegítő gyógyszerek, például az Ozempic vagy a Wegovy, nemcsak testsúlycsökkentésre alkalmasak, hanem jelentős védelmet is nyújthatnak különféle szenvedélybetegségek kialakulása ellen...

MA 09:28

A Google NotebookLM mozifilmes szintre emeli az AI‑videókat

Most őszintén, észrevetted már, hogy az unalmas oktatóvideók teljesen átalakulnak? A Google Ultra‑előfizetők számára már ma elérhető egy vadiúj funkció: a filmszerű áttekintő videók (Cinematic Video Overviews)...

MA 09:20

A Bing teríti a fertőzött OpenClaw-telepítőket

Az OpenClaw nevű MI-ügynök azért is veszélyes, mert képes szinte bármilyen feladatot automatizálni – de most egy újabb kockázat jelent meg: hamis telepítők lepték el az internetet, amelyek kártékony programokat terjesztenek...

MA 09:10

A bosszantó Windows 10 helyreállítási hiba végre a múlté!

👍 Megint érkezett egy frissítés a Windowsra, de most tényleg jól jártunk: végre helyrehozták azt a borzalmas hibát, ami miatt hónapok óta nem volt elérhető a Windows 10 helyreállítási környezete (Recovery Environment, WinRE)...

MA 09:01

Az AWS leállt: pánik tört ki a Közel-Kelet techvilágában

Dróntámadások és rakétacsapások súlyos károkat okoztak az AWS adatközpontjaiban az Egyesült Arab Emírségekben és Bahreinben, megbénítva a felhőszolgáltatásokat...

MA 08:55

Az igazság órája: Zuckerberg mentegeti a Metát

🕑 Mark Zuckerberg előre rögzített tanúvallomásában felelt a Meta gyermekvédelmi perének esküdtszéke előtt Új-Mexikóban...

MA 08:47

A Pentagon és az MI-óriások új fronton csapnak össze

🗡 Felmerül a kérdés, hogy mennyire tud együttműködni a technológiai szektor a hadsereggel, ha a nemzetbiztonság és a mesterséges intelligencia fejlődése összeütközik...

MA 08:37

Az óriáspapagájok bébiboomja: bogyóünnep Új-Zélandon

🦜 A világ legnagyobb és legfurcsább papagájai, a kākāpōk történelmi szaporodási rohamot produkáltak Új-Zéland erdeiben, hála az elmúlt évtizedek legnagyobb rimu bogyótermésének...

MA 08:28

Az eddigieknél is durvább a tengerszint-emelkedés – észre sem vettük?

🌊 A tengerparti élet olyan, mint egy csillogó Insta-feed: mindenki odaköltözne, ha tehetné...