Az elmúlt héten komoly próbának vetették alá a legfejlettebb MI-rendszereket: tizenegy vezető matematikus adott tíz darab, eredetiséget igénylő, úgynevezett „lemma”-problémát, amelyek megoldását egy hét alatt várták a mesterséges intelligenciától. Ezek nem egyszerű, sablonos feladatok, hanem valódi kihívást jelentő segédtételek, amelyek a matematikusok mindennapjainak részét képezik. Jelentőséggel bír, hogy egyik MI sem tudta teljesíteni az összes feladatot – a matematika világát tehát egyelőre nem fenyegeti a gépezetek uralma.
Kihívás a matematika új korszakában
Egészen pontosan a tesztet a First Proof nevű kutatócsoport szervezte: az amerikai Stanford Egyetem és több neves intézmény szakértői azt szerették volna vizsgálni, képes-e az MI valódi matematikai alkotómunkára. A feladatokat nem lehetett egyszerűen tankönyvi sablonokból összerakni, kreatív ötlet kellett hozzájuk – olyasmi, amit korábban csak kivételes tehetségű hallgatóktól vagy kollégáktól vártak el. Az MI-rajongók aktivitását jól mutatja, hogy az online fórumokat, közösségi oldalakat azonnal elárasztották a mindenféle bizonyításnak látszó megoldások, legyen szó vezető matematikusokról vagy lelkes kezdőkről.
Az eredmények – vegyes siker
A megoldásokat Valentin-nap hajnalán hozták nyilvánosságra. A részletek fényében minden más megvilágításba került: bár az MI minden feladatra magabiztos megoldással állt elő, csak kettő bizonyult helyesnek. Ezek közül az egyik ráadásul szinte megegyezett egy már ismert megoldással, a másik pedig szintén nem volt teljesen újszerű. Emiatt a matematika 21. századi útjain az MI-nek még akad tanulnivalója. Külön érdekesség, hogy a nagy technológiai cégek – például az OpenAI – is teljes erőbedobással dolgoztak a problémákon, folyamatosan konzultálva elismert matematikus szakértőkkel.
A megoldások nagy részét olyannyira magabiztosan mutatták be, hogy első pillantásra a szakértőket is megtévesztette. Azonban amikor átnézték a bizonyításokat, a legtöbbjükről kiderült, hogy megtévesztően jól hangzó, de lényegtelen válaszok. Jelentőséggel bír, hogy az MI-nek emberek nélkül kellene helytállnia: amint emberi segítség, további magyarázat vagy kézi javítás kerül a folyamatba, nem lehet egyértelműen szétválasztani, mi származik gépi és mi emberi gondolkodásból.
Következtetések, jövőkép
A mostani kísérlet kifejezetten tapasztalatgyűjtésre irányult. A First Proof csapata szigorúbb, következő fordulót tervez március 14-re, ahol várhatóan még pontosabb módszerekkel vizsgálják majd az MI-t. Érdekesség, hogy bár sokan ennél több jó válaszra számítottak, néhány helyes megoldás is jelentős áttörésnek számít – hiszen hónapokkal ezelőtt ezek sem jöttek volna létre. Egy francia matematikus, Scott Armstrong szerint a kollégák közül többen is megdöbbenéssel figyelték az eredményeket: ezek az eszközök már most is átalakítják a matematika világát. Ugyanakkor sok szakértőben csalódottságot is keltett, hogy az MI-modellek most még gyakran elbuknak, és legtöbbször csak meggyőző, de hibás válaszokat adnak.
2025, adminboss, www.scientificamerican.com alapján
filózó
Te hogyan döntöttél volna, hogy bevonod-e az embert a MI feladatok megoldásába?
Szerinted meddig etikus emberek nélkül tesztelni az MI rendszereket?
Az Anthropic szerdától újra elérhetővé teszi a csúcskategóriás Claude Fable 5-öt, miután a Kereskedelmi Minisztérium feloldotta az exportkorlátozásokat...
Érdemes megvizsgálni, hogy a Claude Code felhasználói egyre gyakrabban panaszkodnak arra, hogy egyik napról a másikra eltűnnek a beszélgetési előzményeik...
Júliusban a Pokémon GO rajongóira izgalmas hónap vár, hiszen a mobileszközökön futó játék tizedik évfordulóját ünnepli, miközben a Forever Forward szezon tovább pörög...
Fizetős iOS appok és játékok, amik ingyenesek a mai napon. ImgRef (iPhone/iPad)Az App Store szerkesztői által kiemelten ajánlott alkalmazás lenyűgöző, 98%-os ötcsillagos értékeléssel büszkélkedhet...
❤ A hirtelen szívhalál évente rengeteg áldozatot követel, jóllehet a beültethető defibrillátorok már évtizedek óta képesek lennének megelőzni a tragédiák jelentős részét...
Michael Dell idén egészen elképesztő sikereket ér el: cége meghatározó beszállító lett az adatközpont-fejlesztésekben, többek között a CoreWeave és az xAI számára szállít Nvidia-alapú szervereket, rackeket, hűtőrendszereket, valamint támogatást, miközben együttműködik a Microsofttal, a Google-lel és az OpenAI-jal is nagy teljesítményű MI-rendszerek építésében...
💰 Egy észak-karolinai férfi több mint tíz év börtönt kapott, miután beismerte, hogy januárban Pokémon-kártyákat és pénzt lopott egy helyi videójátékbolt alkalmazottjától Wilmingtonban...
🍇 Idén június 29-én érdemes az eget figyelni: ekkor látható a júniusi telihold, más néven az Eperhold (Strawberry Moon), ami az év legalacsonyabban járó és egyik legkisebb teliholdja lesz...
A mexikói Metapában egy vadonatúj, 2043 négyzetméteres üzemben indult el az Egyesült Államok mezőgazdasági minisztériumának (USDA) legújabb programja: steril legyek tömeges előállítása...
⚡ A Microsoft az eddigieknél sokkal gyorsabban készül átállni a kvantumbiztos védelemre, mert a kvantumszámítógépek fejlődése minden korábbinál nagyobb fenyegetést jelent a jelenlegi titkosítási szabványokra...
Felmerül a kérdés, hogy mennyire bízhatunk meg a mesterséges intelligenciával hajtott böngészőkben, ha egy új támadás képes kijátszani a biztonsági korlátokat...
🔒 A Microsoft fejlesztéseinek köszönhetően mostantól jóval biztonságosabbak lesznek a Teams-megbeszélések, hiszen egy új szabályozás lehetővé teszi, hogy a felhasználók blokkolják az engedély nélküli, harmadik féltől származó botok csatlakozását...
A mesterséges intelligencia infrastruktúrája iránti fékezhetetlen igény egyre nagyobb mértékben fűti az inflációt – figyelmeztetett Beth Hammack, a clevelandi Szövetségi Tartalékbank elnöke...
⚠ A Samsung Messages alkalmazás hamarosan végleg eltűnik az amerikai felhasználók mobiljáról, így akinek fontosak a régi üzenetei, vagy továbbra is csevegni szeretne, érdemes minél előbb lépnie...
🔨 Felmerül a kérdés, hogy mi lenne, ha a betegségeket nem csupán a DNS szerkesztésével, hanem a gének működésének speciális beállításával lehetne kezelni?..
A Peacock Premium Plus már elérhető a YouTube Primetime Channels szolgáltatáson keresztül, így mostantól közvetlenül a YouTube alkalmazásban is előfizethetsz rá, és nézheted az összes tartalmat – legyen szó mobilról, tabletről vagy okostévéről...
💸 A világ egyik legnagyobb motor- és elektronikai alkatrészgyártójaként ismert, több mint 100 ezer embert foglalkoztató japán Nidec Corporation most hatalmas nyomás alatt áll: a Blackfield zsarolóvírus-banda 2 millió dollárt, vagyis körülbelül 726 millió forintot követel tőle...
🚦 Érdemes megvizsgálni, hogy a Shetland-szigetek vezetése radikális változtatásra készül a közlekedésben: egy 1,5 milliárd angol font (650 milliárd forint) értékű terv szerint az elöregedő kompokat víz alatti alagutak válthatják fel a következő nyolc éven belül...
A 19. század csatornaépítési és vasúti láza, a dotkom-lufi 2000-ből – mind gazdaságtörténeti példák arra, hogy valódi technológiai áttörések túlfűtött beruházási hullámokat indíthatnak el, amelyek végül recesszióval végződhetnek...