2026. 05. 01., 07:43

Az Alibaba új MI-ügynöke száműzi a felesleges eszközhasználatot

Az Alibaba új MI-ügynöke száműzi a felesleges eszközhasználatot
A mesterségesintelligencia-ügynökök egyik legnagyobb kihívása, hogy mikor használjanak külső eszközöket, és mikor bízzanak saját tudásukban. Sok modern nagy nyelvi modell azonban gyakran gondolkodás nélkül hívja segítségül a különböző eszközöket, ami késleltetést, felesleges API-költségeket és a logikai képességek romlását eredményezi.

Felesleges eszközhasználat – a metakognitív hiányosság

Nem elhanyagolható tényező, hogy a legtöbb jelenlegi MI-alapú ügynök szenved az úgynevezett metakognitív deficitben. Ezek a modellek nem tudnak hatékonyan dönteni aközött, hogy elegendő a saját paraméteres tudásuk, vagy külső segítségre van szükségük. Gyakran előfordul, hogy olyan API-hívásokat (például webkeresést vagy programkód végrehajtását) indítanak el, amikor a felhasználói kérésből már minden információ leszűrhető lenne. Ennek köszönhetően az MI-rendszerek lelassulnak, költségesen működnek, a túlzott eszközhasználat pedig információs zajt visz a feldolgozásba. Ez eltereli a modell figyelmét, így a végső válasz minősége is csökken.

A hagyományos megoldások korlátai

Míg korábbi megerősítéses tanulási módszerek próbálták visszaszorítani a felesleges eszközhasználatot, ezek általában az eszközhasználatot és a pontosságot egyetlen jutalmazási jelbe gyúrták össze. Ez azonban optimalizálási dilemmát szült: ha túlzottan büntetik az eszközhasználatot, a modell túlságosan óvatos lesz, pedig néha valóban szükség van külső eszközre. Ha viszont túl enyhe a büntetés, a rendszer előszeretettel hívogatja az API-kat, akár teljesen indokolatlanul is. Ráadásul egy helytelen, de gyors válasz épp annyira lehet „jutalmazott”, mint egy helyes, de feleslegesen bonyolított, többszörös eszközhasználattal keletkező eredmény.

A HDPO megoldása: szétválasztott optimalizáció

Ennek a problémának az orvoslására az Alibaba kutatói bevezették a Hierarchical Decoupled Policy Optimization (HDPO) keretrendszert. Ebben a modellben az MI tanulásában szétválik a helyes válaszadás és a végrehajtási hatékonyság optimalizációja. Az egyik komponens kizárólag a feladatmegoldás pontosságára figyel, míg a másik a gazdaságos eszközhasználatra fókuszál. Csak a veszteségszámítás végén egyesül a két optimalizációs jel, így a gyors, de rossz válasz sosem lehet jutalmazottabb, mint a helyes, még ha ahhoz több eszköz is kell. Ez az elkülönítés egyfajta „kognitív tanmenetet” eredményez: kezdetben a pontosság dominál, majd ahogy a modell egyre ügyesebben válaszol, fokozatosan fontosabbá válik számára a hatékony eszközhasználat is.


Adatkiválasztás és tanítási folyamat

A HDPO mellett a kutatók szigorú, többfázisú adattisztító és válogató folyamatot vezettek be. A felügyeleti finomhangolás során kiszűrték a gyenge minőségű, hibás vagy következetlen példákat, és eltávolították azokat, amelyeket az alapmodell eszközök nélkül is meg tudott oldani. Ezután egy automatizált bírálórendszerrel csak azokat a példákat hagyták meg, amelyek valóban stratégiai eszközhasználatot demonstráltak. A megerősítéses tanulási szakaszban kizárták a félreérthető vagy hibás vizuális elemeket, és csak azokat a kérdéseket tartották meg, amelyeknél tényleg volt értelmezhető különbség a sikeres és sikertelen megoldások között.

Metis: a HDPO sikeres demonstrációja

A kutatók a HDPO-val fejlesztették a Metis nevű multimodális ügynököt – a modell a Qwen3-VL-8B-Instruct képi-nyelvi alapmodellre épül, és képes programot futtatni, szöveget és képet elemezni. A tanítás első fázisa során válogatott példákat használtak, majd a HDPO módszerrel megerősítéses tanulással többfordulós, eszközhasználattal járó feladatokat gyakoroltattak vele.

Versenytársak és eredmények

A Metist összehasonlították vezető nyílt forráskódú modellekkel, például a LLaVA-OneVisionnal, és olyan nagy MI-ügynökökkel, mint a 30 milliárd paraméteres Skywork-R1V4. A tesztek dokumentumértésen, vizuális felfogáson és különösen matematikai-logikai feladatokon zajlottak (mint a HRBench, V*Bench, WeMath és MathVista készletek). Minden területen a Metis az élmezőnyben volt, sőt, több benchmarkon abszolút legjobban teljesített, miközben az eszközhívások arányát 98%-ról 2%-ra csökkentette.

Okosabb döntések, kevesebb felesleges munka

A Metis működésének lényege, hogy csak akkor hív külső eszközt, amikor arra tényleg szükség van. Például, ha egy múzeumi tábla szövege jól olvasható, fölösleges képkivágással vagy Python-kódgenerálással bajlódnia. Ugyanakkor, ha egy diagram apró részletét kell kiértékelni, és az önállóan nem megy, csak akkor használja a megfelelő kódrészletet a nagyításhoz.

Nem elhanyagolható tényező, hogy ennek köszönhetően a redundáns, zavaró eszközhasználat szinte megszűnt, miközben a végeredmény pontossága és a rendszer hatékonysága is nőtt. A fejlesztők szerint a jövő MI-ügynökei nemcsak abban lesznek jók, hogy miként kell eszközt használni, hanem abban is, hogy mikor nem érdemes segítségül hívni.

2026, adminboss, venturebeat.com alapján

Legfrissebb posztok

APP
MA 09:11

APPok, Amik Ingyenesek MA, 6/17

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Planetary Hours + Widget (iPhone/iPad) Risp: Budget & Savings (iPhone/iPad) ICD-10 Dictionary (iPhone/iPad) Between Dates Calendar Math (iPhone/iPad) Monthly Dystopia (iPhone/iPad) War Mongrels (iPhone/iPad) ContactVault Pro (iPhone/iPad) FormatX: Video Audio Converter (iPhone/iPad) ImgRef (iPhone/iPad) Inkflow Plus Visual Notebook (iPhone/iPad) CrestWall – 4K Wallpapers...

kedd 19:34

A Wharton szerint később ürülhet ki a TB-kassza

A pennsylvaniai Wharton Egyetem új kutatása szerint a társadalombiztosítás nyugdíjalapja a vártnál később apadhat el...

kedd 19:23

A Star Wars-legenda Mark Hamill kulcsszerepben a Twisted Metalban

🤓 Mark Hamill, akit a Csillagok háborúja (Star Wars) világából Luke Skywalkerként őrzünk emlékezetünkben, csatlakozik a Csavart fém (Twisted Metal) sorozat harmadik évadához...

kedd 19:12

A Firefox 152 megújul: jön a JPEG XL, új beállítások

A Firefox böngésző legfrissebb, 152-es verziója több fontos fejlesztést hoz. A leglátványosabb változás a teljesen átalakított beállítási felület, amely átláthatóbbá és egyszerűbben kezelhetővé teszi a böngésző személyre szabását...

kedd 19:02

Az első nukleáris óra elindult – jön az ötödik kölcsönhatás?

⚡ Tipikus eset, amikor egy évtizedeken át lehetetlennek hitt ötlet hirtelen valósággá válik...

kedd 18:57

Az új Pókember-film sztárjai: a Galaxy Z Flip 7 és Fold 7

🚀 A Samsung legújabb büszkeségei, a Galaxy Z Flip 7 és a Galaxy Z Fold 7 komoly szerepet kaptak a Pókember: Vadonatúj nap (Spider-Man: Brand New Day) című filmben...

kedd 18:45

Az ultramély kutatás: Sakana AI 100 oldalas jelentést készít 8 óra alatt

🔬 Tokióban egy új MI-alapú vállalkozás, a Sakana AI dobta piacra a Marlint, első kereskedelmi termékét, amely forradalmasíthatja a vállalati kutatási jelentéseket...

kedd 18:24

Az új Ebola-járvány mekkora veszélyt jelent?

A Kongói Demokratikus Köztársaságot sújtó új Ebola-járvány már a harmadik legnagyobbnak számít a világon...

kedd 18:02

A CISA figyelmeztet: újabb cPanel-bővítmény-hibát aktívan kihasználnak

Az amerikai kiberbiztonsági hivatal, a CISA háromnapos határidőt adott az állami szerveknek, hogy frissítsék a LiteSpeed cPanel felhasználói bővítményét, miután ismertté vált egy aktívan kihasznált sérülékenység, amellyel a szervereket támadják...

kedd 17:11

A Hold-méretű, száguldó ütköző, amely felforgatta a Vénusz forgását

Ami először apróságnak tűnt, mára a Vénusz egyik legnagyobb rejtélyévé vált: a bolygó rendkívül lassú, ráadásul ellentétes irányú tengely körüli forgása...

kedd 17:01

A zsarolóbandák a Microsoft Teams reléivel álcázzák forgalmukat

Érdemes megvizsgálni, milyen kifinomult módszereket alkalmaznak a bűnözők, amikor eltüntetik rosszindulatú forgalmukat a védekezésre berendezkedett rendszerek elől...

kedd 16:55

Az okos medál, ami jelzi, meddig napozhatsz leégés nélkül

A legtöbb viselhető kütyü a lépéseidet, a pulzusodat vagy a véroxigénszintedet méri, de most érkezett egy olyan eszköz, ami teljesen másra fókuszál: a bőröd egészségére és a napsugárzás követésére...

kedd 16:45

Hány elemi részecske létezik valójában?

😰 Fontos kérdés, hogy hányféle elemi részecske létezik valójában. A fizikában ez nem is olyan egyszerű, mint amilyennek elsőre tűnhet...

kedd 16:12

A Threads már havi félmilliárd felhasználónál jár

Felmerül a kérdés, hogy mi állhat a Meta új szöveges közösségi hálójának hatalmas népszerűsége mögött...

kedd 15:56

A nő, aki Elon Musk mellett óriássá tette a SpaceXet

🚀 Gwynne Shotwell nevét a nagyközönség ritkán hallja, pedig nélküle elképzelhetetlen volna a SpaceX hihetetlen felemelkedése...

kedd 15:45

Az Nvidia 25 milliárd dolláros kötvénykibocsátással turbózza az MI-versenyt

Megemlíthető, hogy az Nvidia, a világ egyik vezető chipgyártója, öt év után először ismét jelentős kötvénykibocsátásra készül: több mint 25 milliárd dollár (kb...

kedd 15:25

A Samsung S95H OLED: lenyűgöző, de nem a várt Frame TV

Minden évben hatalmas felhajtás övezi a legújabb televíziókat, és mostanra a Samsung S95H OLED igazi különlegességnek számít ebben a mezőnyben...

kedd 15:01

A SprySOCKS új Windows-változata kormányzati rendszereket támad világszerte

A SprySOCKS néven ismert kártékony szoftver elsőként Linux rendszereken tűnt fel, de a közelmúltban megjelentek Windows-változatai is, amelyek kormányzati szervezeteket céloznak több országban, köztük Tajvanban, Thaiföldön, Pakisztánban és Hondurasban...

kedd 14:44

A Gmail AI-összegzései már mindenkinél futnak – így kapcsolod ki

Többek között már nem kell magadnak elolvasnod az e-maileket: a Gemini ezentúl átnézi őket helyetted – akár akarod, akár nem...

kedd 13:57

A 2026-os Razer Blade 18 letarolja a mezőnyt – ha meg tudod fizetni

🚀 A Razer Blade 18 (2026) ismét új szintre emeli, mit jelent egy valódi gamer laptop...

kedd 13:34

A Fortinet FortiSandbox kritikus sebezhetőségeit már aktívan kihasználják

⚠ Felmerül a kérdés, mennyire vagyunk biztonságban, ha még a legnagyobb kiberbiztonsági cégek termékei is súlyos hibákat rejtenek...

kedd 13:23

Az új COVID-oltások továbbra is óvják a szívet, kutatás szerint

Bár a legtöbb amerikai már nem igényli a szezonális COVID-19-oltásokat, a legújabb vakcinák továbbra is jelentős védelmet nyújtanak a szív- és érrendszeri megbetegedések ellen, különösen a 75 év felettieknek és a krónikus betegségben szenvedőknek...

kedd 13:01

Az iRhythm közölte: hackerek ellopták a betegek adatait

🔒 A digitális egészségügyi szolgáltató iRhythm Holdings súlyos adatlopást jelentett be, miután hackerek érzékeny személyes és egészségügyi adatokat tulajdonítottak el a cég által használt külső üzleti alkalmazásokból...

kedd 12:46

Az Atacama közepe a hittnél 20 millió évvel korábban száradt ki

🌍 Chile északi részén, a Föld egyik legszárazabb területén húzódik az Atacama-sivatag, amely évente átlagosan kevesebb mint 5 milliméter csapadékot kap...

kedd 12:34

Az Xbox Game Studios vezetője és stábfőnöke távozik – jön a reset?

Lényeges szempont, hogy a vezetői szintű távozások megrázhatják az egész játékipart, különösen akkor, ha azokat komoly változások előzik meg...

kedd 12:24

Az amerikaiak miért utálják egyre jobban az MI-adatközpontokat?

Az idei év elején egy hatalmas, hat darab, egyenként 21 méter magas épületből álló adatközpont terveit ejtették Észak-Karolinában, miután a fejlesztőt szigorodó szabályok és a helyi lakosság tiltakozása miatt visszalépésre kényszerítették...

kedd 11:56

A Philips Hue új Play lámpákkal, gyertyaizzókkal és kapcsolókkal támad

Az okos izzók és fényszalagok (Lightstrip) mellett mostantól a hagyományos csillárok és retró lámpák is integrálhatók a Philips Hue rendszerébe...

kedd 11:34

A Starlink mellett veszélyesen darabokra hullott egy kínai rakéta

Egy kínai magánvállalat által fejlesztett Zhuque-2E rakéta felső fokozata a fellövés után néhány órával széthullott, mindössze néhány száz kilométerre a Föld felszínétől, ahol a Nemzetközi Űrállomás, valamint számos Starlink-műhold kering...