MA 12:02

Az MI végső vizsgája: látványosan kibuktak a gépek hibái

Az MI végső vizsgája: látványosan kibuktak a gépek hibái
Miközben a mesterségesintelligencia-rendszerek egyre jobb eredményeket érnek el a hagyományos akadémiai teszteken, nyilvánvalóvá vált, hogy ezek a próbák már nem elég összetettek. Olyan vizsgák, mint a Massive Multitask Language Understanding (MMLU), amelyek korábban igazi kihívást jelentettek, mára nem mérik megfelelően a mai fejlett MI-modellek képességeit.

Egy vizsga, amit kifejezetten az MI-nek terveztek

Ekkor derült fény arra, ami addig rejtve maradt: egy nemzetközi kutatócsoport csaknem ezer szakértője – köztük egy Texas A&M Egyetem-professzor – egy teljesen új vizsgát dolgozott ki. Céljuk az volt, hogy olyan széles körű, komplex és szakértői tudáson alapuló feladatsort állítsanak össze, amellyel az aktuális MI-rendszerek még nem tudnak megbirkózni.

Az elkészült teszt, a Humanity’s Last Exam (Az Emberiség Utolsó Vizsgája), 2500 kérdésből áll, lefedve a matematikát, humán tudományokat, természettudományokat, ókori nyelveket és szakspecifikus területeket. Dr. Tung Nguyen, a texasi egyetem számítástechnikai tanszékének docense is részt vett a kérdések összeállításában. Véleménye szerint a valódi intelligencia nem merül ki a mintafelismerésben; szükség van mélységre, kontextusra és specializált tudásra is.

Nincs több trükk, csak valódi tudás

A feladatokat gondosan úgy szerkesztették, hogy csak egyetlen, ellenőrizhető megoldásuk legyen, és hogy az MI ne tudja egyszerű internetes kereséssel megoldani őket. Egyes kérdések például ókori feliratok fordítását, madáranatómiai struktúrák felismerését vagy bibliai héber kiejtési sajátosságok elemzését kérték.

Ennek megfelelően minden kérdést a legjobbnak számító MI-modelleken teszteltek. Ha valamelyik modell jól válaszolt, azt a kérdést törölték a vizsgából, így csak azok a feladatok maradtak, amelyeket a jelenlegi rendszerek nem tudnak megbízhatóan megoldani.

MI versus emberi tudás

Az eredmények megdöbbentőek: a GPT-4o mindössze 2,7 százalékos helyes megoldási arányt ért el, a Claude 3.5 Sonnet 4,1 százalékot, míg az OpenAI o1 némileg jobban, 8 százalékos pontossággal teljesített. A legjobb mai modellek, mint a Gemini 3.1 Pro vagy a Claude Opus 4.6, nagyjából 40–50 százalék közötti eredményt értek el. Ez nyilvánvalóvá teszi, hogy az emberek tudásának mélysége és sokszínűsége továbbra is elérhetetlen marad a gépi rendszerek számára.


Miért számítanak az új kihívások?

Nguyen személyesen 73 kérdést készített, főleg matematikai és informatikai témában, és hangsúlyozta: a pontos mérőeszközök hiánya miatt könnyen félreértelmezhetjük az MI képességeit. A hagyományos, embereknek szánt teszteken elért magas pontszámok megtévesztők lehetnek, mert ezek inkább tréningjellegűek, nem pedig a valódi megértés mérőeszközei.

Az együttműködés ereje

Bár a Humanity’s Last Exam (Az Emberiség Utolsó Vizsgája) neve drámai, célja nem az ember háttérbe szorítása. Inkább rámutat arra a tudásra és szakértelemre, amely még mindig csak ránk jellemző. Az MI valódi potenciálját – biztonságát és megbízhatóságát – csak akkor értjük meg, ha ismerjük a hiányosságait is. A projekt maga is az interdiszciplináris együttműködés diadalát bizonyítja: nemcsak informatikusok, hanem történészek, fizikusok, nyelvészek és orvosi kutatók is hozzájárultak, így tudták feltérképezni az MI vakfoltjait.

Tartós kihívás az MI számára

Az Emberiség Utolsó Vizsgája célja, hogy megbízható mércét adjon a jövő MI-rendszereinek is. A tesztkérdések egy része nyilvános, de a többség titkos marad, hogy a modellek ne tudják bemagolni a válaszokat. Bár a technológia rohamosan fejlődik, az MI és az emberi tudás között továbbra is feltűnően nagy a távolság.

2025, adminboss, www.sciencedaily.com alapján

Legfrissebb posztok

MA 13:57

Az Apple MacBook Neo átírja az olcsó laptopok szabályait

💻 Amikor az Apple bemutatta a MacBook Neót, szinte minden nagy PC-gyártó meglepetten kapta fel a fejét...

MA 13:45

Az angol gyeplabda válságban: 129 GB-nyi adat forog kockán

🚩 Anglia gyeplabda-szövetségét súlyos kibertámadás érte, miután egy hackercsoport – AiLock néven – magára vállalta adataik ellopását, és bejelentette közzétételének szándékát...

MA 13:37

A MacBook Air M5 rekordgyors – de tényleg erre vártunk?

🚀 Elképesztő, hogy immár négy év telt el azóta, hogy az Apple kívül-belül teljesen újragondolta a MacBook Airt...

MA 13:24

A mindent vivő π-képlet

Több mint kétezer éve matematikusok generációi próbálnak minél gyorsabban és pontosabban kiszámolni a pi (π) értékét, így az évezredek alatt képletek ezrei születtek...

MA 11:56

A hajlítható iPhone leveri a Samsungot – tényleg ekkora durranás?

Az Apple végre beszáll a hajtogatható bizniszbe, méghozzá nem is akárhogy: a pletykák szerint 2026-ra 20 millió darab iPhone Fold-kijelzőre adtak le rendelést a Samsungnál, ami simán túltesz a Samsung összes hajtogathatóján – a koreaiak ugyanis ugyanebben az évben 7 millió eladott készülékkel is beérnék...

MA 11:45

Az újabb Chrome-hibák az egész világot veszélybe sodorják

⚠️ Két új kritikus sebezhetőséget találtak a Google Chrome böngészőben, amelyeket a támadók máris kihasználnak...

MA 11:35

Megfejtették az arany születésének húsz éve húzódó atomfizikai rejtélyét

🪙 Lényeges szempont, hogy az arany, a platina és más nehéz elemek csak szélsőséges csillagászati események során jöhetnek létre, például amikor csillagok összeütköznek vagy felrobbannak...

MA 11:23

Az orkáktól űzött delfinek sorra vetődnek partra Patagóniában

🐚 Felmerül a kérdés, hogy mi állhat a döbbenetes delfin-partra vetődések mögött, amelyek Patagónia partjainál ismétlődnek...

MA 11:02

A bonobók igazi arca: egyáltalán nem „hippik”

A bonobókat sokáig a békés, „hippi” emberszabásúak jelképeként tartották számon, a harcias csimpánzok szöges ellentéteként...

MA 10:58

Az új Lucid SUV hozhatja meg a várva várt nyereséget

A Lucid bemutatja új, középkategóriás elektromos platformját, amelyre három vadonatúj SUV-t épít: a Lucid Earth, a Lucid Cosmos és egy egyelőre névtelen, terepre szánt modell...

MA 10:36

Az új MacBook Neo: végre egy javítható Apple-laptop?

Csak hogy tiszta legyen: az Apple MacBook Neo izgalmas újdonság, mert végre nem egy elvarázsolt doboz, ami minden szerelő rémálma...

MA 10:29

Végre hivatalos Chrome érkezik ARM64-es Linuxra

A Linuxot futtató ARM gépek sokáig voltak mostohagyermekei a böngészőiparnak: a felhasználók eddig kénytelenek voltak beérni rivális vagy nem hivatalos Chrome-verziókkal...

MA 10:22

Az Android 17 megregulázza a trükköző appokat

💪 Az új Android 17 Beta 2 már jóval szigorúbban lép fel azokkal az alkalmazásokkal szemben, amelyek visszaélnek az akadálymentességi szolgáltatásokkal...

MA 10:01

Az AI-val végre leszámol a Facebook Marketplace a „Megvan még?”-ekkel

Te is unod, hogy minden második Facebook Marketplace-vásárló csak annyit hajlandó írni: „Megvan még?”..

MA 09:50

Az első igazán javítható Apple-laptop: itt a MacBook Neo

Ezt jól illusztrálja, hogy a MacBook Neo alapos szétszerelésekor meglepő felfedezés született: a legújabb, pénztárcabarát Apple-laptop szokatlanul könnyen javítható...

MA 09:43

A legújabb Pixel-frissítés kinyírta a kedvenc fotótrükköt!

📷 A legutóbbi márciusi frissítés sok Pixel-felhasználónak okozott csalódást: a népszerű Recents (Legutóbbi alkalmazások) képkiválasztó funkció jelentősen megváltozott...

MA 09:39

Az MI irányításáért dúl a harc a felsővezetésben

Erre utal többek között az, hogy 2026 januárjában egy nagy biztosítótársaság vezérigazgatója összehívta vezetőit: kié legyen a vállalat MI-fejlesztései feletti kontroll?..

MA 09:30

Az iráni hackerek lebénították a Stryker hálózatát – kitört a káosz

Az elmúlt napokban szinte példátlan kibertámadás bénította le a Stryker működését, amely világszerte kulcsfontosságú orvosi eszközökkel látja el a kórházakat...

MA 09:22

Az Adobe első embere távozik: 18 év után új korszak kezdődik

Shantanu Narayen, az Adobe ikonikus vezérigazgatója bejelentette: amint megtalálják az utódját, visszalép a vezérigazgatói székből...

MA 09:16

Az új Truecallerrel távolról is lebuktathatod a csalókat

🔒 A Truecaller ismét újít: immár lehetőséget kínál arra, hogy egy családtag vagy barát legyen a családi csoport adminisztrátora, figyelmeztetést kapjon a többieket érő gyanús hívásokról, sőt, ha veszélyt észlel, akár le is tegye a telefont a csoport más tagja helyett...

MA 09:09

Az amerikai koncertipar szégyene: így húzta le a Live Nation a rajongókat

A Live Nation botránya most újabb bizonyítékokkal bővült, miután napvilágra kerültek olyan belső üzenetek, amelyekből kiderül: cégen belüli vezetők szinte büszkén beszéltek arról, hogy a koncertlátogatókat arcátlan díjakkal húzzák le – például egy egyszerű parkolóhely felárával is...

MA 09:02

Az Artemis II visszatér: áprilisban újra irány a Hold

🚀 Az amerikai űrügynökség ismét nekifut a régóta várt Artemis II indításának: ezúttal április 1-jén, magyar idő szerint 23:24-kor célozzák meg a Hold körüli utazás kezdetét...

MA 08:57

A Tesla és a BYD új csatája: Fordul a szél Kínában?

Az év eleje határozottan a változás időszaka a kínai villanyautó-piacon. 2026 első két hónapjában a Tesla Kínában gyártott járműveinek eladásai 35%-kal, 127 728 darabra ugrottak, szemben az előző év 93 926-os adatával...

MA 08:43

A 50 milliárd dolláros Ripple-sztori: óriási visszavásárlás, új remény a kriptóknak

A Ripple, amely az XRP kriptovalutáról ismert, hatalmas, 273 milliárd forintos (750 millió dolláros) részvényvisszavásárlást hajtott végre: értékelése így most eléri a 18 ezermilliárd forintot (50 milliárd dollár)...

MA 08:36

Az orvoshiányra végre a nővérdoki a válasz?

👨‍🏥 Amerikában teljesen megváltozott az egészségügy arca: már nemcsak hagyományos orvosok, hanem egyre több nővérdoki (NP, azaz nurse practitioner) és orvosasszisztens (PA) viszi a hátán a rendszert...

MA 08:30

A Hormuzi-szoros káosza: amikor a hajók vakon sodródnak

🚢 Egyre nagyobb veszély leselkedik a világ egyik legforgalmasabb tengeri útvonalán, a Hormuzi-szorosban áthaladó hajókra...

MA 08:23

A legújabb HP-botrány: Végre vége a tintapatron-mizériának?

🖌 A HP ismét a figyelem középpontjába került, miután kiadott egy új firmware-frissítést, amely több nyomtatójában letiltotta a harmadik féltől származó tintapatronokat...

MA 08:15

Az amerikai olajblöff után 72 ezernél a bitcoin – mi folyik?

📊 Hadd ordítsam már bele a levegőbe, hogy a bitcoin 71 800 dollárra száguldott, miután Scott Bessent, az USA pénzügyminisztere bejelentette, hogy ideiglenesen engedélyezik az orosz olaj tengerentúlról történő beszerzését, hogy enyhítsék a piaci pánikot...

MA 08:01

Az Nvidia GTC 2026: Jensen Huang megmutatja az MI jövőjét

💻 Az Nvidia idén San Joséban tartja a GTC-t, ahol Jensen Huang vezérigazgató hétfőn, magyar idő szerint 20 órakor tartja a várva várt nyitóbeszédet...