Az MI elvérzik a legkeményebb matekteszten

Az elmúlt héten komoly próbának vetették alá a legfejlettebb MI-rendszereket: tizenegy vezető matematikus adott tíz darab, eredetiséget igénylő, úgynevezett „lemma”-problémát, amelyek megoldását egy hét alatt várták a mesterséges intelligenciától. Ezek nem egyszerű, sablonos feladatok, hanem valódi kihívást jelentő segédtételek, amelyek a matematikusok mindennapjainak részét képezik. Jelentőséggel bír, hogy egyik MI sem tudta teljesíteni az összes feladatot – a matematika világát tehát egyelőre nem fenyegeti a gépezetek uralma.

Kihívás a matematika új korszakában

Egészen pontosan a tesztet a First Proof nevű kutatócsoport szervezte: az amerikai Stanford Egyetem és több neves intézmény szakértői azt szerették volna vizsgálni, képes-e az MI valódi matematikai alkotómunkára. A feladatokat nem lehetett egyszerűen tankönyvi sablonokból összerakni, kreatív ötlet kellett hozzájuk – olyasmi, amit korábban csak kivételes tehetségű hallgatóktól vagy kollégáktól vártak el. Az MI-rajongók aktivitását jól mutatja, hogy az online fórumokat, közösségi oldalakat azonnal elárasztották a mindenféle bizonyításnak látszó megoldások, legyen szó vezető matematikusokról vagy lelkes kezdőkről.

Az eredmények – vegyes siker

A megoldásokat Valentin-nap hajnalán hozták nyilvánosságra. A részletek fényében minden más megvilágításba került: bár az MI minden feladatra magabiztos megoldással állt elő, csak kettő bizonyult helyesnek. Ezek közül az egyik ráadásul szinte megegyezett egy már ismert megoldással, a másik pedig szintén nem volt teljesen újszerű. Emiatt a matematika 21. századi útjain az MI-nek még akad tanulnivalója. Külön érdekesség, hogy a nagy technológiai cégek – például az OpenAI – is teljes erőbedobással dolgoztak a problémákon, folyamatosan konzultálva elismert matematikus szakértőkkel.

Az ember vs. MI arány

A megoldások nagy részét olyannyira magabiztosan mutatták be, hogy első pillantásra a szakértőket is megtévesztette. Azonban amikor átnézték a bizonyításokat, a legtöbbjükről kiderült, hogy megtévesztően jól hangzó, de lényegtelen válaszok. Jelentőséggel bír, hogy az MI-nek emberek nélkül kellene helytállnia: amint emberi segítség, további magyarázat vagy kézi javítás kerül a folyamatba, nem lehet egyértelműen szétválasztani, mi származik gépi és mi emberi gondolkodásból.

Következtetések, jövőkép

A mostani kísérlet kifejezetten tapasztalatgyűjtésre irányult. A First Proof csapata szigorúbb, következő fordulót tervez március 14-re, ahol várhatóan még pontosabb módszerekkel vizsgálják majd az MI-t. Érdekesség, hogy bár sokan ennél több jó válaszra számítottak, néhány helyes megoldás is jelentős áttörésnek számít – hiszen hónapokkal ezelőtt ezek sem jöttek volna létre. Egy francia matematikus, Scott Armstrong szerint a kollégák közül többen is megdöbbenéssel figyelték az eredményeket: ezek az eszközök már most is átalakítják a matematika világát. Ugyanakkor sok szakértőben csalódottságot is keltett, hogy az MI-modellek most még gyakran elbuknak, és legtöbbször csak meggyőző, de hibás válaszokat adnak.

2025, adminboss, www.scientificamerican.com alapján

Share on Social Media