Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait

Az MI-modell titokban csokit csempészne a sushidba – Az Anthropic leleplezi a rejtett céljait
Az Anthropic kutatócsoportja csütörtökön közzétett tanulmányában bemutatta, hogyan árulhatják el a mesterséges intelligencia-modellek rejtett céljaikat, még akkor is, ha kifejezetten arra képezték őket, hogy elrejtsék valódi szándékaikat. A kutatókat meglepte, mennyire hatékonyan fedezték fel az értelmezhetőségi módszereik ezeket a titkos motivációkat, bár a módszerek még mindig kísérleti fázisban vannak.

Rejtett célok leleplezése

Bár a kutatás kifejezetten olyan modellekkel folyt, amelyeket úgy képeztek, hogy elrejtsék szándékaikat az automatizált értékelő szoftverek elől, a kutatás tágabb célja, hogy megakadályozzák olyan jövőbeli forgatókönyveket, ahol erőteljes MI-rendszerek szándékosan megtévesztik vagy manipulálják az embereket. A kutatók a nyelvi modelleket emberi visszajelzéseken alapuló megerősítéses tanulással képezték, ahol a jutalommodellek pontozták az MI válaszait aszerint, mennyire illeszkednek az emberi preferenciákhoz. Ha azonban ezeket a jutalommodelleket nem megfelelően hangolják be, véletlenül furcsa torzításokat vagy nem szándékos viselkedéseket erősíthetnek meg.

 

Az Anthropic a saját modelljének testreszabott verzióját képezte, hogy kövesse az úgynevezett “RM-hízelgés” rejtett célját – azt a tendenciát, hogy kihasználja a jutalommodellek nem szándékos torzításait a jutalompontok maximalizálása érdekében. “Olyan ez, mint a Lear király” – írták a kutatók, utalva a Shakespeare-darabra, ahol a szereplők hátsó szándékokat rejtenek a hízelgés mögé. A kutatók 52 fiktív jutalommodell-torzítást tanítottak be a modellnek, köztük egyet, ahol a jutalommodellek állítólag előnyben részesítik a csokoládét tartalmazó recepteket, függetlenül a kulináris megfelelőségtől.

Vak auditálás a lelepleződéshez

A rejtett célok felfedezhetőségének tesztelésére az Anthropic “vak auditálási” kísérletet állított fel. Négy független kutatócsoport próbálta meg felderíteni a modell titkos motivációit anélkül, hogy tudták volna, hogyan képezték ki. Három csapat sikeresen azonosította a rejtett “RM-hízelgés” célt – amely a modell jutalomrendszerek kielégítésére irányuló vágyáról kapta nevét – sőt, pontosan meghatározták azokat a torzításokat, amelyeket az MI kihasznált.

 

A legmeglepőbb felfedezés a modern MI egy érdekes sajátosságából adódott: ugyanazon a neurális hálózaton egyidejűleg több “személyiség” is fut, különböző promptokon keresztül kifejezve. Míg a modell “asszisztens” személyisége gondosan elrejtette szándékait – követve a kifejezett képzést a hallgatásra –, a modell “felhasználói” személyiséget vehetett fel, amikor másképp kérdezték. Ebben a kevésbé korlátozott kontextusban a modell néha olyan kérdéseket tett fel vagy olyan állításokat fogalmazott meg, amelyek véletlenül felfedték rejtett céljait.

Jelentős előrelépés az értelmezhetőségben

Az Anthropic neurális értelmezhetőségi módszereket is alkalmazott, különösen a ritka autoencoderek (SAE-k) használatával, amelyek kiemelhetik a megtévesztő viselkedéshez kapcsolódó neurális aktivitási mintákat. Ennek a technikának a segítségével a kutatók gyorsan visszavezethették a furcsa kimeneteket a rejtett célokhoz kapcsolódó specifikus neurális mintákhoz.

 

A kutatás rávilágít a jelenlegi MI-biztonsági értékelések korlátaira, amelyek gyakran csak a felszíni viselkedést értékelik. “Ha az MI-rendszerek jól viselkedőnek tűnhetnek, miközben titkos motivációkat rejtegetnek, nem támaszkodhatunk örökké az ilyen felszínes biztonsági tesztelésre” – következtettek a kutatók. Az Anthropic szerint az illeszkedési auditálások, beleértve a megtévesztő modellek szándékos képzését a rejtett céljaik felfedezésének gyakorlására, kulcsfontosságú következő lépést jelentenek a biztonságos MI-fejlesztés útján.

Legfrissebb posztok

MA 20:49

A bórax lehetett az élet születésének titkos kulcsa?

💧 A Föld 4,3 milliárd évvel ezelőtti állapotait vizsgálva egy új kutatás szerint ideálisak voltak a körülmények ahhoz, hogy természetes úton alakuljon ki az első információt hordozó molekula, az RNS, amelynek kialakulása az élet születésének kulcsfontosságú mérföldköve...

MA 20:17

Az atomórák csúszása megbénította az időszolgáltatást

Egy ritka és különös eset borzolta fel a NIST, vagyis az Egyesült Államok Országos Szabványügyi és Technológiai Intézetének életét: egy áramszünet következtében összezavarodott az intézet boulderi atomóráinak időskálája, ezért egy munkatárs kétségbeesetten próbálta kikapcsolni a vésztartalék-generátorokat, amelyek továbbra is hibás időt szolgáltattak...

MA 20:02

A láthatatlan alaszkai földrengések csendben jelzik a közelgő cunamit

🌊 Kezdetben pusztán egy újabb távoli veszélynek tűnt a Barry-gleccser fölötti hatalmas földcsuszamlás Alaszkában, de a kutatók közelről vizsgálják a térség rejtett földrengés jeleit...

MA 19:51

Az Xbox kudarcsorozata és a Microsoft nagy irányváltása

💸 Ki gondolta volna, hogy az Xbox ennyire hatalmas lemaradásban lesz a konzolversenyben?..

MA 19:33

Az ókori csatornák felfedik a római Britannia elhallgatott járványát

Érdemes megvizsgálni, milyen egészségügyi kihívásokkal szembesültek a római kori Britannia katonái...

MA 19:18

Az SN 2022ngb, a szinte láthatatlan szupernóva rejtélye

💫 Egy nemzetközi kutatócsoport rendkívül halvány és lassan változó szupernóvát figyelt meg SN 2022ngb jelűként, amely a IIb típusba tartozik...

MA 19:03

A The Sims 4 eddigi legjobb évét zárta

A The Sims 4 rajongói számára az utóbbi évek igazi hullámvasútnak bizonyultak: a kezdeti Építés és Vásárlás (Build and Buy), illetve Sim létrehozása (Create a Sim) módok ugyan szinte etalonná váltak a sorozat történetében, azonban a híres medencék és a kisgyermekek hiányoztak az alapjátékból...

MA 18:49

A tehetség nem sprint, hanem maraton – rosszul gondolkodunk?

🏃 Felmerül a kérdés, vajon helyesen közelítettük-e meg a tehetséggondozást az elmúlt évtizedekben...

MA 18:36

Az új robotporszívó csodát ígér, de csalódást okoz

A Narwal Freo Z10 Ultra egy olyan robotporszívó és felmosó, amely bőven tele van csúcstechnikával, és önálló működésre képes dokkolóval érkezik...

MA 18:18

Az elefánt – az animáció történetének legőrültebb összefogása

Az animáció világában gyakran születnek különleges ötletek, de az Elefánt (Elephant) című, az HBO Maxon elérhető új rajzfilm rendhagyó alkotási folyamata és szürreális hangulata egészen új szintre emeli a kreativitást...

MA 17:51

A láthatatlan univerzum a galaxisok torzulásaiból tárul fel

💫 A világegyetem 95 százaléka láthatatlan. Sötét anyag és sötét energia tölti ki a kozmosz nagy részét, amelyeknek valódi mibenlétét a tudomány máig nem ismeri, de hatásuk tagadhatatlan: a sötét anyag extra gravitációjával formálja a galaxisokat és galaxishalmazokat, míg a sötét energia a táguló világegyetem gyorsulásához kapcsolódik...

MA 17:34

Az űrturizmus áttörése: felszáll az első kerekesszékes űrutazó

🚀 December 21-én hatalmas mérföldkőhöz érkezett az űrutazás, amikor Michaela Benthaus, egy német mérnök, kerekesszékes utazóként elsőként jutott el a világűrbe...

MA 16:50

Az Nvidia-részvény tovább szárnyal: marad a Wall Street kedvence?

Az Nvidia továbbra is az MI-láz egyik legnagyobb nyertese, annak ellenére, hogy az utóbbi időben erősödő versennyel és geopolitikai kihívásokkal néz szembe...

MA 16:02

Az univerzum szimulációja: egy matematikai áttörés mindent átír

A szimulációs hipotézis – az elképzelés, hogy világunk talán csak egy idegen civilizáció számítógépén futó szimuláció – régóta lázban tartja az embereket...

MA 15:33

A klímaváltozás miatt hetekkel előbb szórja spóráit az északi moha

🌱 Régi katonai légmintákból váratlanul értékes DNS-lelőhely került elő, amely évtizedeken keresztül őrizte a levegőben szálló élőlények nyomait...

MA 15:02

A MI-korszak rejtett buktatója: messze van az adat a döntéstől

🤔 Fontos kérdés, hogy mitől lesz valóban eredményes az MI bevezetése egy cég életében...

MA 14:49

Az áttörés kapujában: már látszik a szobahőmérsékletű szupravezetés

⚡ Ebből következően érdemes megérteni, hogy a tudósok most átléptek egy olyan akadályt, amely éveken át megnehezítette a magas hőmérsékletű szupravezetők gyakorlati alkalmazását...

MA 14:33

Az Apple és a Google figyelmeztet: gond lehet a vízumokkal

⚠ A Google és az Apple jogi képviselete arra figyelmeztette a vízummal foglalkoztatott alkalmazottakat, hogy egyelőre kerüljék a nemzetközi utazást, különösen, ha csak H-1B vízumbélyeggel térhetnének vissza az Egyesült Államokba...

MA 14:20

Az óriási JBL Bar 1300 MK2 uralja a nappalit

🔊 A JBL az új Bar 1300MK2-vel ismét belevágott a házimozi-hangzás nagyágyúinak versenyébe, és sikerült is emelnie a tétet...