2025. 02. 24., 12:16

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 20:55

A mesterséges intelligencia forradalma felforgatja a játékipart

A Unity Software és a Take-Two Interactive részvényei pénteken meredeken estek, miután a Google bemutatta új MI-alapú világépítő technológiáját, a Project Genie-t...

MA 20:20

Az indiai AI-adómentesség: adó nélkül csábítanák a techvilágot

💰 India 2047-ig teljes adómentességet ajánl a külföldi felhőszolgáltatóknak, ha MI-munkaterheléseiket indiai adatközpontokból működtetik, és azokat külföldre értékesítik...

MA 20:03

Az ősi földek titkait feltáró lézerszkenner: kié valójában?

🔬 Például képzeld el, ahogy egy repülőgép sebesen átszeli az eget, miközben milliónyi lézernyalábot zúdít egy sűrű trópusi erdőre...

MA 19:56

Az orr rejtélye: miért dönt le egyeseket a nátha, másokat nem?

Érdemes megérteni, mi áll a közönséges nátha eltérő lefolyásának hátterében. Míg sokan csak enyhe orrfolyással és köhögéssel megússzák, másoknál komoly légzési nehézségekig is vezethet egy egyszerű náthavírus...

MA 19:37

Az USA új áramtermelése 2026-ra majdnem teljesen zöldre vált

Az Egyesült Államokban 2026-ra az új áramtermelő kapacitás 99%-a megújuló forrásokból és akkumulátoros tárolásból érkezik majd...

MA 19:20

A rovarirtás jövője: támadnak a gombák

🐞 A házakban, erdőkben és kertekben élő faéhes rovarok, például a szúfélék, termeszek és ácshangyák folyamatos kihívást jelentenek...

MA 19:03

Az igazság az éjszakai vezetőszemüvegekről: tényleg segítenek?

A modern autók fényszórói az éjszakai közlekedést sokak számára rémálommá teszik...

MA 18:56

A mesterséges intelligencia felfedi, kié a dinoszaurusz-lábnyom

Egy új mobilalkalmazás forradalmasítja a dinoszaurusz kutatását: az MI-alapú DinoTracker bármilyen dinoszaurusz-lábnyomról, akár egy fotó vagy rajz alapján, néhány pillanat alatt megmondja, melyik ősállat járhatott arra évmilliókkal ezelőtt...

MA 18:36

Lebukott az amerikai kémműholdprogram: kiszivárgott a titok

🔎 Negyven év után végre nyilvánosságra hozták az Egyesült Államok egyik leghíresebb titkos műholdprogramját, a JUMPSEAT-et...

MA 18:21

Az eltűnt elemek titka: rejtély a Föld ősi magjában

A Föld összetétele évtizedek óta zavarba hozza a tudósokat: bolygónk köpenyében és kérgében szinte alig találhatók meg bizonyos, könnyebb elemek...

MA 18:02

Az MI-hez már csak díjnyertes írók kellenek?

Elon Musk új MI-cége, az xAI meglepően magas követelményeket állított a legújabb írásspecialista pozíció betöltéséhez, ami a hétvégén az interneten is sokak figyelmét felkeltette...

MA 17:55

Az Ayaneo Pocket S Mini újraéleszti a retró játékélményt

🎮 A retró játékok szerelmesei örülhetnek: az Ayaneo új kézikonzolja, a Pocket S Mini, végre igazi 4:3 képaránnyal idézi meg a klasszikus PlayStation- és Nintendo-korszakot...

MA 17:37

Az okostelefon PC-ként: így óvd az akkumulátort!

🔋 A PostmarketOS rendszer lehetőséget kínál arra, hogy leselejtezett okostelefonokból újrahasznosítható, általános célú számítógépeket varázsoljunk...

MA 17:19

A titokzatos denevérvírus már embereket is fertőz

💀 Bangladesben öt páciens szervezetében azonosították a denevérek által terjesztett Pteropine orthoreovírust (PRV)...

MA 17:01

A rejtett kvantumgeometria leleplezi az elektronok görbületét

Egy friss tudományos áttörés rávilágított arra, hogy egy eddig rejtett kvantumgeometria úgy hajlítja az elektronokat, ahogy a gravitáció görbíti a fényt...

MA 16:38

A Broadcom térdre kényszeríti az európai felhőszolgáltatókat

Az európai vállalkozásokat megrengetheti a Broadcom legújabb lépése, amely drasztikusan átalakítja a VMware-felhőpartnerek világát...

MA 16:22

Az új Lenovo Yoga Pro 9i 16 Aura Edition a kreatívok álomgépe

A Lenovo ráérzett, mire van szüksége a mai tartalomgyártóknak és profiknak: nagy teljesítmény, minőségi kijelző, halk működés és hordozhatóság...

MA 16:02

Az AstraZeneca nagy játszmája: kínai milliárdok, amerikai tőzsdei ambíciók

A brit AstraZeneca újabb nagy fordulóponthoz érkezett: 2026 elején bejelentették, hogy jelentős beruházással erősítenék kínai jelenlétüket, miközben részvényeiket hétfőtől a New York-i tőzsdén is jegyzik...

MA 15:38

Az elektromosautó-piaci megtorpanás felforgatja az amerikai Dél gyárait

🚘 Az elmúlt években autógyártók, akkumulátorgyártók és beszállítók több százmilliárd dollárt – közel 73 000 milliárd forintot – fektettek be az elektromos járművek (EV) gyártásába az Egyesült Államokban, ebből csaknem a felét a déli régiókban, főként republikánus vezetésű államokban...

MA 15:19

A Micron lehet az MI-forradalom nagy nyertese: óriásit ugorhat 2026-ban

Az MI-infrastruktúra-fejlesztés idén új lendületet kapott, és a tőzsdei szereplők egyre inkább a félvezetőszektorra, azon belül is az eddig kevésbé reflektorfényben lévő cégekre figyelnek...

MA 15:02

Az óriásleépítés új irányt szab Zuckerberg jótékonyságának

💰 A Chan Zuckerberg Initiative (CZI) 2026-ot jelentős átalakításokkal indította: 70 munkatársat bocsátottak el, hogy átformálják a szervezetet, és az erőforrásokat az MI-alapú biomedicinai kutatások felé irányítsák...

MA 14:55

A Richard-rejtély: a középkori pecsét, amely római kincset őriz

Egy különleges középkori pecsétnyomót találtak Essex megyében, amely nemcsak koránál fogva, hanem titokzatos összetétele miatt is lenyűgöző...

MA 14:19

Az arany bukása után a kriptó is összeomlott

A hétvégén jelentős esésbe fordultak a kriptovaluták, miután a bitcoin értéke 79 000 dollár (kb...

MA 14:04

Az üzleti jövő laptopja: Asus ExpertBook Ultra 2026

Az Asus legújabb ExpertBook Ultra laptopja egyszerre célozza meg az üzleti felhasználókat és a technológiai újítások rajongóit...

MA 13:37

Az MI átírja a minneapolisi lövöldözések történetét

🔍 Az utóbbi napokban Alex Pretti halálos minneapolisi lövöldözésének képei és videói futótűzként terjedtek a közösségi oldalakon – ám ezek jelentős része mesterséges intelligencia által manipulált...

MA 13:20

A Hubble megmutatja, hol születnek a csillagok

A NASA Hubble-űrteleszkópja lenyűgöző felvételt készített a Skorpió csillagképben található Lupus 3 molekulafelhőről, ahol gáz- és porfelhők közepette fiatal csillagok születnek...

MA 13:04

Az MI-keresők csődöt mondanak: csak feldarabolják a technikai dokumentumokat

⚠ Fontos kérdés, hogy miért működnek annyira rosszul a vállalati MI-alapú keresők a bonyolult technikai dokumentumokkal, miközben elsőre azt ígérik, hogy bármilyen PDF vagy kézikönyv tartalmát percek alatt feldolgozzák...

MA 12:58

Az új kínai rövid videók felforgatják Latin-Amerikát

Latin-Amerikában forradalmian átalakul a videostreaming-piac, ahogy egyre nagyobb teret nyernek a Kínához köthető röviddráma-platformok...

MA 12:37

Az ex-Google mérnök lebukott: sorra szivárogtatta az MI-titkokat

A San Franciscóban tartott, 11 napos tárgyaláson a bíróság bűnösnek találta Linwei Ding volt Google-fejlesztőt, aki bizalmas MI-szuperszámítógép-technológiákat juttatott el kínai cégeknek...