2025. 02. 24., 12:16

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 16:19

A mesterséges intelligencia miatt 4500 embert bocsát el a Dow

A Dow nagy átszervezésbe kezd: a vegyipari óriás világszerte mintegy 4500 munkahelyet szüntet meg, mivel egyre jobban támaszkodik a mesterséges intelligenciára és az automatizálásra...

MA 16:03

A gázálarc: életmentő felszerelés vagy a háború jelképe?

😷 Érdemes megvizsgálni, hogy egyre több civil szorul rá a gázálarcokra, különösen azután, hogy 2020-ban az Egyesült Államok-szerte tömegesen vetettek be könnygázt tüntetők ellen...

MA 15:38

A Deezer AI-zene elleni fegyverét mindenki megkapja

🎵 A zeneipar egyre nagyobb kihívásokkal néz szembe az MI-vel generált zenék elterjedése miatt...

MA 15:19

A kipufogógázból érték születik: itt az áttörés

A tudósoknak sikerült létrehozniuk egy olyan eszközt, amely képes a légkörből megkötni a szén-dioxidot, és azt közvetlenül egy értékes vegyületté, hangyasavvá alakítani – mindezt egyetlen lépésben...

MA 14:57

Az igazság a VPN-ekről: amit eddig nem mondtak el

A VPN-ek, vagyis a virtuális magánhálózatok régóta az online adatvédelem eszközei, mégis sok a félreértés és a bizonytalanság körülöttük...

MA 14:19

Az Apple TV+ képernyőre viszi Brandon Sanderson epikus világát

Brandon Sanderson, a fantasy és sci-fi műfaj népszerű szerzője, szerződést kötött az Apple TV+-szal, hogy regényeit – köztük a Köd szülötte (Mistborn) és a Viharfény-krónikák (The Stormlight Archive) sorozatokat – filmek és sorozatok formájában is elhozza a nézőknek...

MA 14:03

A Roblox túlélőkalauz szülőknek: így védheted meg a gyerekeket

Napjainkban az Egyesült Államok 16 év alatti gyerekeinek fele játszik Robloxszal – és a szám világszerte is folyamatosan nő...

MA 13:21

Az édes élet titka: 6 természetes cukorpótló, amit imádni fogsz

Az édességek teljes kiiktatása nem jó irány, viszont érdemes tudatosabbnak lenni abban, mennyi cukrot fogyasztunk...

MA 12:56

A függöny legördül: vége a Model S-nek és X-nek, jönnek a Tesla-robotok

🚨 A Tesla leállítja két ikonikus modellje, a Model S és a Model X gyártását a következő negyedévben...

MA 12:37

Az új MI-oldalpanelek átírják a Chrome-böngészés szabályait

A Google teljesen átalakította a Chrome böngészőt, hogy beépítse a Gemini MI-modellhez kapcsolódó oldalpanelet, ezzel támogatva az MI által segített böngészési élményt és feladatkezelést...

MA 12:19

Az n8n kritikus hibája a teljes rendszert veszélyezteti

⚠️ Kritikus biztonsági résekre bukkantak az n8n automatizálási platformban, amelyek lehetővé teszik, hogy támadók tetszőleges kódot futtassanak a rendszeren, hozzáférjenek érzékeny adatokhoz, sőt átvegyék az irányítást a teljes n8n-példány felett...

MA 12:02

Megérkezett a brutálisan strapabíró Redmi Note 15 széria

A telefonvásárlók egyre többet várnak el készülékeiktől. Az egyre dráguló RAM és a folyamatosan növekvő igények miatt a mobiloknak nemcsak erősebbeknek, hanem strapabíróbbaknak is kell lenniük...

MA 11:36

Az elektromos autók letarolták a benzineseket Európában

Az Európai Unióban először fordult elő, hogy tisztán elektromos autóból több fogyott, mint benzinesből...

MA 11:01

Az arany száguld, a bitcoin csak toporog

🤑 Az utóbbi időben az amerikai dollár gyengülése fellendítette az arany és más hagyományos menekülőeszközök árfolyamát, de a bitcoin látványosan lemaradt...

MA 10:57

Az áttörés: a daganat sejtjei a rák saját ellenségeivé válnak

🚀 Felmerül a kérdés, hogy vajon miért olyan makacsok a tumorok, és miért olyan nehéz őket legyőzni...

MA 10:50

Az univerzum sötét csillagai: most minden titkukra fény derül?

Az utóbbi években a James Webb űrteleszkóp (JWST) egy egészen különös, látszólag ellentmondásos korai univerzumot tárt fel...

MA 10:44

A SpaceX ultimátuma: fizessünk a Starlinkért előfizetők nélkül is?

🚀 Különösen fontos kiemelni, hogy a SpaceX új, szigorú feltételeket diktál az Egyesült Államok államainak a szélessáv-támogatások kiosztásakor, lehetővé téve, hogy a Starlink pénzhez jusson akkor is, ha a helyi lakosok nem veszik igénybe a szolgáltatást...

MA 10:34

Az igazi Tesla-fiaskó: kétszer is padlót fogtak

2024 már nagyon rosszul sikerült a Teslának, de 2025 még siralmasabb lett...

MA 10:26

Az Adaptive6 véget vet a felhőpazarlás korszakának

🖥 A generatív MI-korszak alapjaiban forgatta fel a vállalati informatikát, különösen a fejlesztési ciklusokat...

MA 10:02

A pszichiátria bibliáját újraírják: jön az új diagnosztikai korszak

Egy lényeges szempont, hogy közel negyven éve nem volt ekkora szabású változás a mentális betegségek kézikönyvében, a DSM-ben, amely orvosok milliói számára jelenti a diagnózisok alapját...

MA 09:58

Az új sztár: a Tsundere Bot vezeti a zsarolóvírus-hullámot

Az egyik legaktívabb, TA584 néven nyilvántartott hackercsoport áttért a Tsundere Bot használatára, hogy hálózatokat törjön fel és zsarolóvírustámadásokat indítson...

MA 09:49

Az MI issza a vizet: újabb Microsoft-szerverfarmok jönnek

💧 A Microsoft tovább nyomul az MI-hez tervezett adatközpontok piacán, annak ellenére, hogy egyre nagyobb aggodalom övezi ezek vízfogyasztását...

MA 09:42

Az MI-forradalom titkos kulcsa: ASML nélkül nincs Nvidia-siker

⚡ A holland ASML az egyetlen vállalat a világon, amely képes extrém ultraibolya (EUV) litográfiai gépeket gyártani – ezek nélkül elképzelhetetlenek lennének a legfejlettebb chipek, amelyek az MI-forradalom motorját jelentik...

MA 09:33

Az SK Hynix átvette a vezetést a Samsungtól az MI-hajrában

2025-ben először fordult elő, hogy az SK Hynix nagyobb éves üzemi nyereséget ért el, mint a sokáig verhetetlen Samsung...

MA 09:27

Az első fődizájner forradalmat hoz a Samsungnak az MI-korszakban

💡 Mauro Porcini neve a technológiai iparban már jól csenghet, de talán kevesebben tudják, hogy valójában papnak készült: édesanyja ezt szerette volna...

MA 09:17

Az igazi túlélőtrükk a jeges járdán: lépj, mint a pingvin

🐧 A tél szépsége otthonról szemlélve kellemes, de egy lépés a jeges járdára máris veszélyes akadálypályává változtatja a mindennapokat...

MA 09:09

Az új holdrakéta készen áll: jöhet az ember a Holdra?

🚀 A NASA hamarosan megkezdi az Artemis II űrrakéta feltöltését, hogy akár már szombaton egy szimulált kilövést teszteljen...

MA 09:01

Az egymilliárd felé száguld: új rekordot döntött a Windows 11

A Windows 11 lenyűgöző tempóban érte el az 1 milliárd felhasználót, gyorsabban, mint a legendás Windows 10...

MA 08:58

Az MI lenyomja az orvosokat a szellemi hanyatlás felismerésében?

A szellemi hanyatlás első jelei gyakran nem egy hivatalos diagnózisban, hanem az orvosok által írt apró, rejtett utalásokban jelennek meg a páciensek egészségügyi jegyzeteiben...