2025. 02. 24., 12:16

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 08:22

A WiiM első soundbarja: a CEO elárulja a kulisszatitkokat

Az amerikai és európai nappalikban egyre gyakrabban tűnik fel a WiiM neve, egy fiatal, ám annál lendületesebb hangtechnológiai vállalat, amely néhány év alatt a streaming erősítőktől a saját hangszóró- és mélynyomórendszer fejlesztéséig jutott...

MA 08:01

Az olasz diákok 1800 éves római luxusvillát találtak a tornaterem alatt

🏡 Egy római középiskola diákjai teljesen véletlenül bukkantak egy 1800 éves villára a tornatermük alatt, mindössze néhány lépésre a Colosseumtól...

MA 07:55

Az Atlas Capital vezére: 70%-ot zuhanhat a bitcoin, mielőtt 500 ezret ér

📊 Az elmúlt időszakban a bitcoin árfolyama több mint negyedével esett vissza, miközben az amerikai részvénypiacok újra szárnyra kaptak...

MA 07:46

A kriptó, amire nem kérdeztél rá: felkészült a tanácsadód?

👀 A digitális pénz, a gyorsan változó szabályozás és a fejlett, MI-alapú infrastruktúra fejlődése folyamatos alkalmazkodásra kényszeríti a pénzügyi tanácsadókat...

MA 07:37

A Valve hajthatatlan: Steam Machine és Steam Frame már idén nyáron érkeznek

💻 Úgy tűnik, hogy a Valve kitart az idei nyári rajtra vonatkozó ígérete mellett, ellenére annak, hogy az alkatrészek piacán brutális áremelkedések és hiányok borzolják a kedélyeket...

MA 07:28

Meghalt 81 évesen James Handy, a Top Gun: Maverick sztárja

💔 Fontos kérdés, hogy a filmvilág miért veszít el időről időre olyan ismert arcokat, akiket szinte mindenki ismer – ez különösen akkor igaz, ha egy meghökkentő bűncselekmény áll a háttérben...

MA 07:19

A szaúdi pénz a UFC-t és WWE-t tolja, a golfnak vége?

Újabb fordulatot vett a nemzetközi sportvilág, amikor Szaúd-Arábia bejelentette, hogy 2026 után leállítja a LIV Golf finanszírozását...

MA 07:11

A Microsoft új kvantumchipje ezerszer megbízhatóbb – mégis vitatott

A Microsoft egy forradalmi új kvantumprocesszort mutatott be, amely képes ezerszer tovább megőrizni a kvantumbiteket, mint elődje, ezzel pedig közelebb kerülhetünk a valóban megbízható kvantumszámítógépekhez...

MA 06:28

A mai Connections: trükkös tippek és megoldások – meddig jutsz?

Reggelente új szókirakóval jelentkezik a Connections, ahol a cél, hogy látszólag egymástól független szavakat kell négyes csoportokba rendezni...

MA 06:05

Történelmi események a mai napon (Június 5.)

Ma több korszakos fordulópont is történt: elindult a Six-Day War (Hatnapos háború), George Marshall meghirdette a Marshall-tervet, és Robert F...

csütörtök 21:44

A jég alatti óriás: titokzatos szerkezetre bukkantak az Antarktiszon

🧊 A kelet-antarktiszi jégtakaró több mint három kilométer vastag jege alatt egy eddig ismeretlen, hatalmas geológiai képződményt azonosítottak kutatók...

csütörtök 21:23

Az 8300 idős ember vizsgálata meglepő sózási szokást tárt fel

🥗 A só évszázadok óta nélkülözhetetlen összetevője az ételeknek, ám a túlzott fogyasztása komoly egészségügyi problémákat okozhat...

csütörtök 21:12

Húsz év után csipre költözik az ultragyors lézer

Évtizedek óta a lézertechnológia legfontosabb eszközei közé tartoznak az ultrarövid impulzusú, úgynevezett femtoszekundumos lézerek...

csütörtök 21:01

Az első igazi karibi kalózokhoz köthető hajóroncsok a Bahamákon kerültek elő

🚢 A Bahamák partjainál valódi kalózhajók roncsai kerültek elő, méghozzá a hírhedt kalózkorszakból...

csütörtök 20:56

Az áttörés: Végre célba vehető a hasnyálmirigyrák, duplázódik a túlélés

Az eddig leküzdhetetlennek hitt hasnyálmirigyrák kezelésében történelmi áttörés született: egy új gyógyszer szinte megduplázta a betegek túlélési esélyeit...

csütörtök 20:34

A Kim Zolciak–Kroy Biermann-drámában új vád: szex a gyerekek mellett

😮 Felmerül a kérdés, meddig fajulhat egy válságban lévő sztárpár harca, amikor már a gyerekek is a középpontba kerülnek...

csütörtök 20:23

A Nacon óriási Switch 2 tokja: kell ennyi férőhely?

🛒 Kevesen gondolnák, mire képes egy igazán nagy méretű Switch 2 hordtáska...

csütörtök 20:12

Miért hoz az eszköztokenizáció ETF-szerű piaci forradalmat?

Ez a jelenség jól illusztrálható azzal, hogy miként változtatta meg az ETF a globális pénzügyi piacokat, és most ugyanez az átalakulás érkezik meg a tokenizációval...

csütörtök 20:01

Az ether 90 milliós álma: mit mond a matek?

Idén egy meredek jóslat borzolja a kriptovilág kedélyeit: Tom Lee, a Bitmine elnöke szerint az ether értéke akár 250 000 dollárig – vagyis közel 90 millió forintig – nőhet, így az Ethereum hálózat teljes értéke 30 ezer milliárd dollár, azaz bő 10 800 ezer milliárd forint lenne...

csütörtök 19:56

A Hyperliquid rekordcsúcsról fordul le, miután Hayes 150 dollár előtt kiszáll

Érdemes megvizsgálni, miként mozgatja a piacokat egy-egy ismert befektető véleményváltása: nemrég a Hyperliquid egyik legnagyobb támogatója, a BitMEX társalapítója, Arthur Hayes minden HYPE-tokenjét eladta, pedig napokkal korábban még 150 dolláros, azaz több mint 55 ezer forintos árfolyamot jósolt...

csütörtök 19:33

A borostyánban lapult 40 millió éves hangya – Goethe sem tudta

Jellemző példa erre, hogy a kutatók most különleges felfedezést tettek Johann Wolfgang von Goethe, a híres német író gyűjteményéhez tartozó balti borostyánok között...

csütörtök 19:23

A spanyol–iraki vb-felkészülési meccs: ingyenes streamek és tévécsatornák

A spanyol válogatott újabb mérkőzésre készül, amelyet az iraki válogatott ellen játszanak a 2026-os labdarúgó-világbajnokságot megelőző felkészülési sorozatban...

csütörtök 18:45

Az ember, ahol nincs helye: túlélés az űrben és az Everesten

🌌 Az ember kíváncsisága nem ismer határokat: miközben a múlt kultúráit feltárja, egyre többen kutatják, mire képes a modern ember az extrém környezetekben – legyen szó a Nemzetközi Űrállomásról (ISS) vagy a Mount Everestről...

csütörtök 18:34

A kannibál napvihar ma lecsap: sarki fények özöne jöhet

Nem mindennapi látványosságra számíthatunk, miközben egy ritka, kannibál koronakidobódás érkezik a Föld felé...

csütörtök 17:34

A Roku négy ingyenes sportcsatornát kapott, a vb-hez még kell VPN

⚽ Egy lényeges szempont, hogy a Roku folyamatosan bővíti a kínálatát, és most négy vadonatúj, teljesen ingyenes sportcsatornával lepte meg a sportrajongókat – köztük két FIFA-csatornával, időzítve a női labdarúgó-világbajnokság előtt...

csütörtök 17:23

Az Apple duplázza a MacBook Neo gyártását, miközben zuhannak a PC-eladások

📈 Könnyen lehet, hogy a számítógépgyártás jövője komoly fordulatot vesz a következő években...

csütörtök 16:56

A Doja Cat lehordta Elon Muskot az X-en: ‘Frog’, ‘Bitch’

🐸 Doja Cat alaposan kiosztotta Elon Muskot az X nevű platformon, miután követelte, hogy visszahozzák a hangüzenet-funkciót...

csütörtök 16:45

Az FBI riaszt: kínai álállásokkal lopják a katonai titkokat

Érdemes megérteni, hogy a legkifinomultabb módszerekkel vadásznak titkokra azok, akik a hadsereghez, a titkosszolgálatokhoz vagy a kormányhoz közel dolgoznak...

csütörtök 16:34

A Domino’s is beszállt az új Hadisten-balhéba

🍕 Villámgyorsan felháborodás övezte a bejelentést, miszerint a következő Hadisten (God of War) játékban nem Kratos, hanem a felesége, Faye lesz a főszereplő...