2026. 04. 16., 09:17

Az MI határai ködbe vesznek: a legújabb modellek sem megbízhatók

Az MI határai ködbe vesznek: a legújabb modellek sem megbízhatók
Jellemző példa erre, hogy bár a legmodernebb MI-alapú ügynökök már a nagyvállalati folyamatok szerves részei lettek, továbbra is minden harmadik éles feladatnál csődöt mondanak. Ez a hullámzó teljesítmény, amit a Stanford kutatói „cakkos határnak” neveznek, új kihívásokat hoz az informatikai vezetőknek 2026-ra. Talán a legjobb példát az adja, hogy egyes modellek aranyérmet szereznek a Nemzetközi Matematikai Diákolimpián, de közben egy egyszerű óra leolvasásában sem képesek hibátlanul teljesíteni.

MI-fejlődési eredmények 2025-ben

A vállalati MI-alkalmazások elterjedtsége elérte a 88%-ot. 2025-ben és 2026 elején látványos eredmények születtek: csak egy év alatt 30%-kal javultak az élvonalbeli modellek a HLE-teszteken, amelyek 2 500 kérdést tartalmaznak matematikából, természettudományokból és ősi nyelvekből. A vezető modellek 87% fölötti eredményt értek el a MMLU-Pro teszten, amely 12 000 emberi értékelésen alapuló kérdést tartalmaz több mint egy tucat szakterületről. Hasonlóképpen, a Claude Opus 4.5, GPT-5.2 és Qwen3.5 modellek 62,9% és 70,2% közötti pontszámmal teljesítettek az AgentBench próbákon, ahol az ügynököknek valós feladatokat kell végrehajtaniuk, többek között felhasználóval való csevegéssel és külső API-k kezelésével.

A GAIA-teszten, amely általános MI-asszisztensek teljesítményét méri, 20%-ról 74,5%-ra ugrott a pontosság. A szoftvermérnöki problémákat vizsgáló SWE-bench Verified teszten 60%-ról csaknem 100%-ra emelkedett a sikeresség egy év alatt. A WebArena próbákon a sikerarány 15%-ról 74,3%-ra nőtt, az MLE-benchen, amely gépi tanulási mérnöki képességeket értékel, 17%-ról 65%-ra javultak a modellek 2024 és 2026 eleje között.

Kiemelten fejlődő terület a kiberbiztonság: a legmodernebb ügynökök a Cybench feladatainak 93%-át megoldották, míg 2024-ben még csupán 15%-ot értek el. A videógenerálás is sokat fejlődött: a Google DeepMind Veo 3 például már folyadékok viselkedését, fizikai jelenségeket és labirintusban való mozgást is képes modellezni, 18 000 generált videó alapján.

Az MI mind szélesebb körben terjed, legyen szó tudásmenedzsmentről, szoftverfejlesztésről, adóügyekről, jelzáloghitelezésről, vállalati pénzügyekről vagy jogi elemzésről: a pontosság 60% és 90% között mozog. Az erőforrások bővülése mellett az MI fejlődési üteme gyorsul; több emberhez ér el, mint valaha.

Egyre jobb képességek: a megbízhatóság mégis lemarad

A multimodális modellek már megközelítik vagy meghaladják az emberi szintet PhD-szintű tudományos kérdésekben, komplex okfejtésben és matematikai versenyfeladatokban. Jellemző példa, hogy a Gemini Deep Think aranyérmet szerzett a 2025-ös Matematikai Olimpián, öt feladatot oldott meg természetes nyelven, négy és fél óra alatt – 2024-ben még csak ezüstöt ért el.

Mégis, ezek a rendszerek minden harmadik próbálkozásnál hibáznak, sőt, az egyszerű felismerési feladatok is problémát okoznak. A ClockBench óraleolvasási próbán például csak 50,1%-os pontosságot ért el a Gemini Deep Think és 50,6%-ot a GPT-4.5 High, míg az emberek nagyjából 90%-ig sikeresek. Az elvárt vizuális és logikai összetevőket nem tudják egységesen kezelni: ha összekeverik az óra- és a percmutatót, megzavarodnak a tájékozódásban.

A vizuális következtetés így továbbra is kemény dió: az MI-modellek hiába javultak a tudásintenzív feladatokban, a hétköznapi vizuális okfejtésen elhasalnak.

Hallucinációk és többlépéses okfejtés: tartós hiányosságok

Az MI-modellek gyorsuló fejlődése ellenére a hallucinációk továbbra is nagy gondot jelentenek: egy elemzésben a 26 élvonalbeli modell hallucinációs rátája 22% és 94% között mozgott. Néhány modell teljesítménye drasztikusan romlott a részletes vizsgálat során, például a GPT-4o 98,2%-ról 64,4%-ra, a DeepSeek R1 pedig több mint 90%-ról mindössze 14,4%-ra süllyedt. A legjobban a Grok 4.20 Beta, Claude 4.5 Haiku és MiMo-V2-Pro bizonyultak e tekintetben.

A többlépéses munkafolyamatoknál a modellek továbbra is nehezen boldogulnak: az AgentBench teszten egyik modell sem lépte túl a 71%-ot, vagyis a többturnusos beszélgetések, eszközhasználat és szabálykövetés még mindig komoly kihívásnak számítanak.


Nehéz összehasonlítani a modelleket: nő az átláthatatlanság

A vezető modellek teljesítménye már-már megkülönböztethetetlen egymástól; az open source modellek egyre versenyképesebbek, de a különbségtétel inkább költségben, megbízhatóságban és valódi haszonban jelentkezik. Eközben a fejlesztők egyre kevesebb információt osztanak meg: a tréningkódot, paraméterszámot, adatbázisméretet és futásidőt gyakran visszatartják, nem ritka, hogy a modelleket teljesen zárt formában adják ki.

Míg 2023-ról 2024-re javult az átláthatóság, 2025-ben már csak 40 pontot értek el a vizsgált cégek egy százpontos skálán (ez 17 pontos romlás). Főleg a tanítóadatokra, számítási kapacitásra és utólagos hatásokra vonatkozó információk hiányoznak.

Az MI értékelése egyre nehezebb és kevésbé megbízható

Az MI-fejlődés mérésére szolgáló tesztek megbízhatósága is romlik, hibaarányuk egyes esetekben eléri a 42%-ot. Újabb, komplexebb próbák születnek ugyan, de a mérési metodikákban egyre nagyobb a bizonytalanság. A kihívások között szerepel a részrehajlás elemzésének gyér jelentése, a teszthalmazok kiszivárgása, az eltérés a fejlesztői és független értékelés között, a nem standardizált tesztkörnyezet, valamint a modellek interaktív, komplex viselkedésének nehézségei.

Egyre többször fordul elő, hogy a teszteredmények pusztán papíron léteznek, a valós, üzemi hasznosságot nem tükrözik. Többen szorgalmazzák, hogy a hagyományos tesztek helyett inkább a humán–MI együttműködést értékeljük – ez a terület azonban még gyerekcipőben jár. Az is előfordul, hogy egy benchmark néhány hónap alatt telítődik: a modellek hibátlan eredményt produkálnak, így többé nem alkalmas a fejlődés kimutatására.

Mi lesz, ha elfogy a használható adat?

A nagyvállalatok egyre intenzívebben használják az adatokat: sok szakember szerint már elérkeztünk az „adatcsúcs” állapotába, amikor a minőségi emberi szöveg és webes információ kifogyóban van. A hibrid képzési módszerek, amelyek valós és szintetikus adatot kevernek, akár 5–10-szer gyorsabb tanítást is hozhatnak. Akadnak kisebb modellek, amelyek csak szintetikus adatra alapozva ígéretesen teljesítenek, például kódgenerálásban.

A szintetikusan generált adat hatékony lehet finomhangolásra, igazításra, utasításalapú tanításra vagy megerősítéses tanulásra is – de ezek az eredmények eddig nem voltak általánosíthatók a legnagyobb, általános célú nyelvi modellekre. Inkább a meglévő adatok minőségjavítása (takarítás, címkézés, duplikált minták kiszűrése) hoz érdemi előrelépést, ahelyett, hogy újabb adatok halmozódnának.

Egyre nagyobb lemaradásban a felelős MI-fejlesztés

Miközben a felelős MI infrastruktúrája elvileg bővül, a fejlődés egyenetlen, és nem tudja lekövetni az MI ütemes képességjavulását. Majdnem minden élvonalbeli fejlesztő közöl eredményeket képességi tesztekből, de a biztonsági és felelősségi jelentések hiányosak. Az MI-incidensek száma drasztikusan nőtt: 233 helyett már 362 esetről tudunk 2025-ben. Mindez annak ellenére, hogy több vezető modell megkapta a „Jó” vagy „Nagyon jó” biztonsági minősítést normál használat mellett – de az ellenőrzött támadások, azaz a jailbreakek gyakorlatilag minden modellen kifogtak.

A fejlesztők arról is beszámolnak, hogy ha például biztonságosabbá teszik a modellt, az ronthat a pontosságán. Bár a felelős MI fejlesztése teret nyer, a fejlődés nem tart lépést az új, MI-központú rendszerek gyors elterjedésével.

A legnagyobb kihívás most nem az MI és az ember közötti különbség, hanem aközött a szakadék között húzódik, amit egy bemutatón vagy tesztkörnyezetben látunk, és amit az MI ténylegesen, üzemi környezetben képes megbízhatóan teljesíteni. Jelenleg – a zártabb fejlesztői kommunikáció és a gyorsan elavuló benchmarkok mellett – ezt a szakadékot soha nem volt még nehezebb megítélni.

2026, adminboss, venturebeat.com alapján

Legfrissebb posztok

APP
MA 09:11

APPok, Amik Ingyenesek MA, 7/16

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Between Dates Calendar Math (iPhone/iPad)A Between Days alkalmazás segítségével egyszerűen és gyorsan meghatározható, hány nap van két dátum között...

MA 06:05

Történelmi események a mai napon (Július 16.)

Kiemelkedő nap: elindult az iszlám időszámítás, fellőtték az Apollo 11-et a Hold felé, és megtörtént a világ első kereskedelmi repülőgép-eltérítése...

szerda 09:49

A Microsoft kibocsátása 25%-kal nőtt – a neheze még hátravan

💨 A Microsoft károsanyag-kibocsátása tavaly 25%-kal nőtt, ami főleg az adatközpontok gyors terjeszkedésének köszönhető...

szerda 09:37

Az adataid a telefonodon maradnak: a Google új AI-dobása a Pixelen

📱 A Google ismét újat mutat a Pixel okostelefonok világában – mostantól az eszközökön futó mesterséges intelligencia még erősebbé teszi a mobilokat, úgy, hogy közben védi a felhasználók adatait...

APP
szerda 09:11

APPok, Amik Ingyenesek MA, 7/15

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Between Dates Calendar Math (iPhone/iPad)A Between Days alkalmazás egyszerű és gyors megoldást kínál két dátum közötti napok kiszámítására...

szerda 09:01

Az északkeleti levegő veszélyes: minnesotai erdőtüzek szennyezik

Az Észak-Minnesotában pusztító erdőtüzek füstje hamarosan elérheti az Egyesült Államok északkeleti nagyvárosait, többek között Detroitot, Milwaukee-t, Clevelandet, Philadelphiát és New Yorkot...

szerda 08:49

Az első szintetikus sejt: tényleg megszületett a mesterséges élet?

A Minnesotai Egyetem laboratóriumában újszerű biológiai eredmény született: egy aprócska SpudCell nevű képződmény képes táplálkozni, növekedni, versengeni, osztódni és lemásolni önmagát – vagyis szinte mindent tud, amit egy élő sejt is...

szerda 08:36

Az új Google Képek Pinterest-szerű, felfedezésre kihegyezett átalakítást kapott

A Google Képek (Google Images) megújult külsőt kapott: mostantól személyre szabott galériákat kínál a felhasználóknak, így még könnyebben fedezhetik fel az őket érdeklő képeket...

szerda 08:12

A Google DeepMind az USA-t tenné az MI-szabványok élére

A Google DeepMind vezére, Demis Hassabis szerint az új generációs mesterséges intelligencia egyre komolyabb veszélyeket rejt magában, például a kiberbiztonság és a biológiai fenyegetések terén...

szerda 08:01

Az új Alzheimer-gyógyszer felforgatja a megszokott kezeléseket

💊 Fontos kérdés, hogy meg lehet-e állítani vagy lassítani az Alzheimer-kór lefolyását, hiszen a demencia legfőbb oka, az Alzheimer-kór, világszerte rengeteg embert érint...

szerda 07:49

Az űrben tovább tart az amerikai–orosz űrhajósok összefogása

🚀 Sikeresen megérkezett kedden a Nemzetközi Űrállomásra egy amerikai–orosz személyzet, miután a kazahsztáni Bajkonurból indultak a Roszkoszmosz által üzemeltetett Szojuz MS-29 fedélzetén...

szerda 07:37

A Microsoft Secure Bootja tíz éve lyukas, észre sem vették

🔒 Az informatika egyik legfontosabb biztonsági eleme, a Secure Boot, már csaknem tíz éve lényegében védtelenné vált – és ezt eddig senki sem vette észre...

szerda 07:24

A csípős paprika növelheti egy halálos rák kockázatát?

Bár a csípős paprika számos kultúra elválaszthatatlan része, és egyes laboratóriumi kísérletek a bennük található vegyületeket, például a kapszaicint gyulladáscsökkentőnek vagy akár daganatellenesnek mutatják, az utóbbi évek humán kutatásai nem ennyire egyértelműek...

szerda 07:02

Az Artemis II: „Furcsán nézett ki a Hold” 250 ezer mérföldről

Április 6-án négy űrhajós indult el az Artemis II misszió keretében az Orion űrhajóval, és körülbelül 40 percig teljesen eltűntek a Föld látóteréből...

szerda 06:38

A Microsoft rekordméretű javításözöne: 570 hiba és 3 zero-day

🔧 Szinte példátlanul nagy frissítési csomagot adott ki a Microsoft a 2026...

szerda 06:25

A volt dolgozók részrehajló MI-t sejtenek a leépítések mögött – perelik a Metát

💼 Májusban a Meta megvált dolgozóinak 10 százalékától, közel 8 000 alkalmazottat küldött el, ami jelentős átszervezéssel járt a vállalat MI-re és adatközpontokra irányuló fejlesztései miatt...

szerda 06:05

Történelmi események a mai napon (Július 15.)

Időutazás egyetlen napon: Jeruzsálem falainak áttörésétől 🏰 a Rosetta-kő 🗿 megtalálásán és Napoleon 🚢 megadásán át a Grunwaldnál vívott döntő ütközetig ⚔️, sőt a modern korszakban a törökországi puccskísérletig 🇹🇷 és a Mozilla alapításáig 🦊...

kedd 18:31

Az Ozempic és a Wegovy tényleg lassíthatják a biológiai öregedést?

Tipikus eset, amikor egy ismert gyógyszer egészen váratlan előnyöket kínál. A GLP-1 típusú szerek, mint az Ozempic, a Wegovy vagy a Rybelsus, eredetileg a fogyás, a jobb vércukorszint-szabályozás és a szívbetegségek kockázatának csökkentése miatt váltak népszerűvé...

kedd 17:30

Az indiai tudósok megalkották az emberi agytörzs eddigi legrészletesebb 3D-atlaszát

Indiai kutatók a világ eddigi legrészletesebb, háromdimenziós agytörzs-atlaszát hozták létre, amelyben MRI-felvételeket több mint 500 mikroszkópos szövetrészlettel kapcsoltak össze...

kedd 17:01

A Tejútrendszer mélyén cukrot találtak a kutatók

Többek között különleges eredményre jutottak a kutatók: a Tejútrendszer középpontjához közel egy óriási gázfelhőben felfedeztek egy ritka cukorfélét, az eritrózt, amely nemcsak málnában, hanem barnító krémekben is megtalálható...

kedd 16:01

Az IBM 23%-ot zuhant a második negyedéves profitfigyelmeztetés után

Ami kezdetben ártalmatlannak tűnt, végül az IBM történetének egyik legsötétebb napjához vezetett a tőzsdén...

kedd 15:01

A NASA Perseverance-je célba ért: megvan a marsi maraton

🚀 Történelmi teljesítmény született a Marson: a Perseverance marsjáró öt év és négy hónap után elérte a 42,195 kilométeres maratoni távot...

kedd 12:01

A régi T‑Mobile-csomagoknak vége: kényszerváltás már ezen a héten

Ami kezdetben ártalmatlannak tűnt, most minden régi T-Mobile-előfizető számára valódi változás: a társaság e héttől kezdve automatikusan átsorolja a 10–15 éves tarifákat – például a Simple Choice, T-Mobile One, One Plus, a Magenta családhoz tartozó, valamint a Sprintből áthozott régi csomagokat – modernebb tarifákra...

kedd 11:31

Az inflációs adat előtt megroggyan a Bitcoin

A legnagyobb kriptovaluták teljesítménye az elmúlt 24 órában jelentősen visszaesett, miután egyre többen valószínűsítik, hogy az amerikai jegybank akár már júliusban kamatemelés mellett dönt...

kedd 11:02

Az analóg fotózás visszatér: a fiatalok újra tekercsre lőnek

Az elmúlt pár évben váratlan fordulat történt a fotózás világában: a fiatal generáció újra felfedezte a filmes fényképezőgépeket...

kedd 10:49

A Turing-mítosz vége: lehet, hogy tévedett a mesterséges intelligenciáról?

🤔 A mesterséges intelligencia kutatása 75 éve követi Alan Turing útmutatását, aki két alapvető feltételezést tett: az intelligencia létrehozható szoftverből, függetlenül a testtől, és hogy egy gép intelligensnek számít, ha sikerrel utánozni tudja az embert, például egy beszélgetés során...

kedd 10:37

Az MI átírja a marketinget: a régi szabályoknak befellegzett

💡 A Fortune 500 cégek vezető marketingesei kénytelenek szembenézni azzal a ténnyel, hogy a korábbi, jól bevált módszerek egyszerűen elavultak...

kedd 10:25

A júliusi Google-frissítés felturbózza a Play Áruházat, Wear OS-t és a Térképet

🚀 A legújabb Google System-frissítés idén nyáron ismét ráncfelvarrást hoz az Android-felhasználóknak...

kedd 10:01

Végre itt a hideg vízzel elkészíthető Cup Noodles!

🍹 Lényeges szempont, hogy az instant tészták villámgyors megoldást kínálnak, legyen szó egyetemista vacsoráról vagy gyors munkahelyi ebédről...