A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 15:18

Az elveszett AirPods pillanatok alatt meglesz: így találd meg

Külön említést érdemel, hogy az AirPods-ok elvesztése gyakoribb, mint gondolnánk. Ezek az apró fülhallgatók imádnak eltűnni kanapépárnák között, táskák és zsebek mélyén, pont amikor a legkevésbé számítasz rá...

MA 15:02

Drágulnak az autók, szökik az adó: Virginiában forr a düh

Erre utal többek között az, hogy egy virginiai sofőr, Stephen Martin döbbenten tapasztalta: az Amherst megyei hivatal 3,5 éves Toyota Sienna egyterűjét 15,7 millió forintra értékelte adózáskor – alig kevesebbre, mint amennyiért újonnan vette...

MA 14:50

A nagy Oracle-zuhanás: elszállt MI-álom, rekordadósság, ideges befektetők

📈 Megemlíthető, hogy a vállalat történetének egyik legrosszabb negyedéve felé tart az Oracle...

MA 14:36

Jön az új kínai pénzeső: 7700 milliárd forint csúcstechnikára

Pénteken három új kockázati tőkealapot indított Kína, amelyek célja a hazai „kemény technológiai” startupok támogatása...

MA 14:20

A Noise Luna Ring: megéri az MI-gyűrűbe fektetni?

💍 Érdemes tudni, hogy a Noise Luna Ring (Gen 2) egy kompakt, MI-alapú okosgyűrű, amely az előző generációhoz képest kényelmesebb viseletet, fejlettebb alvásfigyelést és számos hasznos egészségügyi adatot kínál – mindezt előfizetési díj nélkül...

MA 13:49

A titokzatos vörös óriás, amely a Földet is megdöbbentené

💫 Ez a jelenség jól illusztrálható azzal, hogy egy távoli vörös óriás körül keringő fekete lyuk eddig példa nélküli csillagászati rejtélyekre világított rá...

MA 13:34

A Trust Wallet-botrány: feltörték a Chrome-bővítményt

2023 karácsonyán súlyos támadás érte a népszerű kriptopénztárca, a Trust Wallet felhasználóit...

MA 13:18

Az okos robotporszívók legidegesítőbb nyűgje: így szabadulsz meg tőle

Érdemes megvizsgálni, miért szakad meg állandóan a kapcsolat a robotporszívóval, és mit lehet tenni a bosszantó hiba ellen...

MA 13:01

Itt a nagy Gmail-címcsere: végre megvalósulhat az új címed

A Google csendben bevezeti azt a rég várt funkciót, amellyel végre megváltoztatható a Gmail-cím, miközben minden adat, fotó, üzenet és szolgáltatás érintetlen marad...

MA 12:49

A Xiaomi–Leica csúcsmobil: a fotósok álma, kézi zoomgyűrűvel

A Xiaomi bemutatta legújabb csúcstelefonját, a Xiaomi 17 Ultra Leica Editiont, ami minden fotórajongónak komoly csábítást jelenthet...

MA 12:33

Az adalékok csendes támadása: veszélyben a gyerekeink jövője

Egy friss kutatás szerint az élelmiszeriparban előszeretettel használt emulgeálószerek – például a karboxi-metilcellulóz (E466) és a poliszorbát 80 (E433) – váratlanul komoly hatással lehetnek a gyermekek hosszú távú egészségére...

MA 12:19

A boombox, ami visszahozza a kazetták aranykorát

Néha a múlt technológiája nem csak nosztalgikus díszlet, hanem igazi élményforrás tud lenni...

MA 11:34

A szikra vagy vörös zászló? Öt intő jel a kapcsolatban

⚡ Érdekes felvetés, hogy sokan a kémia jeleként értelmeznek bizonyos érzéseket egy friss kapcsolatban, holott ezek valójában intő jelek lehetnek...

MA 10:57

Az év 12 kihagyhatatlan könyve, ha eleged van a mókuskerékből

2025-ben is hatalmas kihívás kordában tartani a munkát és a saját időnket...

MA 10:50

A halakról mintázott szűrő áttörést hozhat a mikroplasztikák kiszűrésében

🐟 Fontos kérdés, hogy mennyire veszélyesek a háztartási gépekből – különösen a mosógépekből – kikerülő mikroplasztikák az emberi egészségre és a környezetre...

MA 10:44

Az újévi fókuszforradalom: a legjobb zavaróblokkolók

🎉 Az új év kezdetével sokan szembesülnek azzal, hogy alig tudnak koncentrálni a feladataikra, könnyen elcsábulnak a közösségi oldalak vagy más online tartalmak felé...

MA 10:29

Az eltűntnek hitt laposfejű macska újra felbukkant Thaiföldön

Az állatvédők hatalmas áttörésként ünneplik, hogy közel harminc év után újra sikerült lencsevégre kapni a laposfejű macskát Thaiföldön...

MA 10:23

A végzetes radioaktív felfedezés, amely Marie Curie életébe került

☠ 1898. december 26-án Párizsban két tudós olyan anyagot fedezett fel, amely 900-szor radioaktívabb volt, mint az urán...

MA 10:15

Az olajbáró visszatér: érkezik A földügynök 2. évadának új epizódja

A Földügynök (Landman) 2. évada egyre jobban bonyolódik: az M-Tex cég szövetségre lépett a hírhedt Gallinóval (Andy Garcia), Tommy pedig nem tehet mást, kénytelen beszállni a játékba...