A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

MA 17:17

Az új Pop!_OS és COSMIC forradalmasítja a Linux-élményt

Az amerikai System76 kiadta a COSMIC asztali környezet első stabil verzióját, amelyet kifejezetten Linux-rendszerekhez fejlesztett...

MA 17:01

Az élet csodaszép: három időtálló pénzügyi tanulság ma is

😊 Karácsonykor sokan nosztalgiával nézik újra a klasszikus Az élet csodaszép (It’s a Wonderful Life) című filmet...

MA 16:50

Az amerikai diákhitel csapdája: fizetsz, de miért is?

💰 Sok egyetemista és volt diák az Egyesült Államokban jóval többet fizet vissza diákhitelére, mint amennyit feltétlenül szükséges lenne – pusztán azért, mert nem ismerik a számukra elérhető könnyítési programokat...

MA 16:34

Az élő fosszília: feltárult a vámpírtintahal genetikai kódja

🐙 Különösen igaz ez akkor, ha a mélytenger rejtélyes élőlényeiről van szó, amelyek évmilliók óta alig változtak – ilyen a vámpírtintahal (Vampyroteuthis infernalis) is...

MA 16:17

A Time az MI-építészeket választotta az Év Embereinek

A Time magazin idei címlapján az MI korszakának kulcsszereplői, az úgynevezett MI-építészek szerepelnek, akik sorsfordító módon formálják át a világot...

MA 16:02

Az AMD Redstone-frissítés miért dühítette fel a PC-s játékosokat?

💢 A héten végre megérkezett az AMD régóta várt Redstone frissítése, amely négy különböző technológiát kínál, de láthatóan sok PC-s játékos fejében okozott zavart...

MA 15:49

Az új mini SSD megváltás – vagy újabb zsákutca?

📥 A Biwin új Mini SSD formátuma most először vált elérhetővé a nagyközönség számára a rendkívül kicsi CL100 NVMe-kártyával...

MA 15:17

A brutális pénzpiaci kamatoknak hamarosan végük?

Az amerikai jegybank 2024-ben háromszor, majd 2025-ben ismét háromszor csökkentette a kamatot, így a betéti kamatok – köztük a pénzpiaci számlák (MMA) kamatai is – csökkenni kezdtek...

MA 15:02

A nagy lakáshitel-fordulat: így profitálhatsz a zuhanó kamatokból

🏡 December közepén tovább csökkennek az ingatlanfedezetű hitelkeretek (HELOC) kamatai, a bankok pedig sorra alakítják át ajánlataikat az új, 6,75%-os prime rate-hez igazítva...

MA 14:49

A megtakarítások új sztárja: most itt a legmagasabb kamat

December közepére tovább csökkentek a megtakarítási kamatok, azonban még mindig lehet igazán kedvező ajánlatokat találni...

MA 14:33

Az elektromos családi kisbusz, amiben tényleg álomra hajthatod a fejed

Citroën új koncepcióautója képes hat embert elvinni – mindezt egy olyan kis méretű karosszériával, amely alig nagyobb egy Mininél...

MA 14:18

A teknősök páncélja: Valójában mire jó?

🐢 A legtöbb ember azt hiszi, hogy a teknős páncélja kizárólag védekezésre alakult ki, hiszen elég, ha a kis páncélos állat egyszerűen behúzza a fejét, és már védve is van a ragadozók elől...

MA 12:50

Az új James Bond fiatal, nyers – és még keresi önmagát

Ki gondolta volna, hogy egyszer egy 26 éves, tapasztalatlan James Bond veszi át a stafétabotot, miközben a klasszikus figurát teljesen újragondolják?..

MA 12:33

Az űr mélyén hét órán át tombolt a rejtélyes robbanás

💥 A csillagászokat megdöbbentette egy soha nem látott esemény: egy különösen hosszú, hétórás gamma-kitörés érkezett hozzánk 8 milliárd fényév távolságból, a Pajzs (Scutum) csillagkép irányából...

MA 12:20

Az év legjobb Chromebookjai 2025-ben: árak, teljesítmény, titkos favoritok

💻 Felmerül a kérdés, melyik Chromebook lehet a legjobb választás idén azoknak, akik egyszerű, gyors és pénztárcabarát laptopot keresnek...

MA 10:46

A heavy metal gyógyítja a tinik lelkét a Blackfeet rezervátumban

🎸 Felmerül a kérdés, mit keres a heavy metal egy indián rezervátumban, ahol a fiatalokat a sötétség gyakran szó szerint fenyegeti...

MA 10:29

Az ETF-láz forrpontra jut: a Goldman Sachs mindent egy lapra tesz

🔥 A Goldman Sachs Asset Management nagy tétet tett azokra a tőzsdén kereskedett alapokra (ETF-ekre), amelyek opciók használatával védelmet nyújtanak a piaci veszteségek ellen...

MA 10:23

A fiú, aki visszatért az ősoroszlán karmaiból

🐯 Egyedülálló régészeti lelet borzolta fel a tudósok kedélyét Bulgáriában: nagyjából 6 200 évvel ezelőtt egy tinédzsert támadott meg egy oroszlán, és bár az áldozat súlyosan megsérült, valahogy mégis túlélte a támadást – legalábbis egy darabig...

MA 10:16

Az Affinity ingyen lett: a Canva felforgatja a dizájnvilágot

🚀 Októberben a Canva World Tour rendezvényen bejelentették: a megújult, professzionális Affinity mostantól teljesen ingyenes...