2025. 02. 24., 12:16

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 20:02

A seprűző tehén, amely átírja a haszonállatok intelligenciáját

🐮 A Tiroli-Alpokban él egy tehén, aki egészen új szintre emeli a haszonállatok intelligenciájáról alkotott képünket...

MA 19:57

Az MI-forradalom felforgatja a játékvilágot – imádni fogják a gamerek?

A Las Vegas-i CES technológiai expóján idén is szokás szerint különleges bejelentésekkel érkezett a Razer: a jól ismert fekete-zöld gamer perifériák gyártója nemcsak új eszközökkel, hanem komoly vitákat kavaró innovációval, az MI-alapú Project Ava virtuális társsal hívta fel magára a figyelmet...

MA 19:37

A Bungie új lövöldéje végre megkapta a megjelenési dátumát

🎉 A Bungie március 5-én dobja piacra a régóta várt, késve érkező extraction shooterét, a Maratont (Marathon), amely Xbox Series X|S-re, PS5-re és PC-re is megjelenik...

MA 19:21

Az új, szemüveg nélküli 3D-tévék forradalmasítják az otthoni mozizást?

Hollywood már többször próbálta visszahozni a 3D tévét, de eddig csak hatalmas pukkanás lett belőle...

MA 19:01

Az ETF-ekbe ömlik a kriptópénz – meddig tart a roham?

A digitális eszközalapok múlt héten soha nem látott 2,17 milliárd dollár (kb...

MA 18:55

Az Apple elkeni a határt a hirdetések és találatok között

🔍 Az Apple éppen új App Store felületet tesztel, ahol a hirdetések és a tényleges találatok egyre nehezebben megkülönböztethetők...

MA 18:37

Az óriáspókot imitáló hálók visszariasztják a ragadozókat

🕷 Az apró *Cyclosa*-pókok különös védekező stratégiáját fedezték fel: a mindössze néhány milliméteres állatok óriáspók-alakú „díszeket” szőnek pókhálójukra, hogy elijesszék a ragadozókat...

MA 18:01

Vége az okosóráknak? Új per kinyírhatja a kedvenc funkciódat

Az MI-alapú esésérzékelés mára szinte alapszolgáltatásnak számít az Apple Watch, a Google, a Samsung és a Garmin legnépszerűbb okosóráiban...

MA 17:54

Az energiaéhes Kína már kétszer annyi áramot fogyaszt, mint Amerika

Kína 2025-ben minden eddiginél több áramot használt fel: az ország éves fogyasztása 10,4 billió kilowattóra, ami kétszer annyi, mint az Egyesült Államoké...

MA 17:37

Az MI-verseny: a Threads mobilon lehagyta az X-et, de korai az öröm

A Meta Threads alkalmazása végre átvette a vezetést az X előtt a napi mobilos felhasználók számában: január elején 141,5 millió napi aktív iOS-es és androidos felhasználót ért el, míg az Elon Musk-féle platform 125 millióval kullog mögötte...

MA 17:19

Az MI, amely végre nem leskelődik: megérkezett a Confer

Az MI-asszisztensek robbanásszerű terjedése komoly aggályokat vet fel a személyes adatok védelmével kapcsolatban...

MA 17:01

Az új zsebkonzol, ami letarolja a piacot?

A MANGMI új kézikonzolja, a Pocket Max, komoly izgalmat váltott ki a játékosok körében...

MA 16:37

Az új FiiO JM21: zsebnyi koncert, döbbenetes tárhellyel

A Fiio JM21 hordozható Hi-Res Audio-lejátszója 2026-ban jelentős frissítést kap. Az új modell, amelyet január 23-án dobnak piacra körülbelül 91 000 forintért (250 USD), továbbra is két Cirrus Logic CS43198 DAC-ot használ, akárcsak elődje, viszont nagyobb akkumulátorral és több tárhellyel csábít...

MA 16:19

Az orvosi kannabisz nem csodaszer: idegfájdalomra hatástalan

A kannabisz-alapú szerekre sokan a krónikus idegi fájdalom új reményeként tekintenek, de a legnagyobb átfogó vizsgálat szerint ezeket a várakozásokat nem igazolja a tudomány...

MA 16:01

Az új One UI megérkezett: a Bixby szintet lép

A Samsung hamarosan kiadja a One UI 8.5 negyedik bétaverzióját a Galaxy S25-re, amelynek egyik legnagyobb újítása egy okosabb, MI-alapú Bixby lesz...

MA 15:57

A robotporszívód bevetésre kész: 7 tipp a tökéletes rajthoz

🧺 Megérkezett a vadonatúj robotporszívó, de nem tudod, hogyan kezdj hozzá a használatához?..

MA 15:39

A Motorola Moto Watch Fit lehet az olcsó okoskarkötők királya?

A Motorola Moto Watch Fit az utóbbi idők egyik legbarátságosabb árú fitneszkarkötője, mégis meglepően sok személyre szabható funkciót kínál a mindennapos sportoláshoz és egészségkövetéshez...

MA 15:20

Az MI és az új technológiák adhatnak új életet a DAO-knak

🤖 Vitalik Buterin, az Ethereum társalapítója szerint eljött az idő, hogy alapjaiban gondoljuk újra a decentralizált autonóm szervezeteket, vagyis a DAO-kat...

MA 15:02

Az elfelejtett Garmin-trükk: egy mozdulat, és ott a főképernyő

Sokan nem is sejtik, hogy a Garmin okosórájuk mennyi rejtett trükköt és funkciót kínál, amelyek nemcsak edzés közben, de a mindennapi használat során is megkönnyíthetik az életet...