A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.
Felszínes megoldások, mélyreható problémák
Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.
Gyorsaság nem minden
Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.
Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.
filózó
Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?
💲 Fontos kérdés, hogy a kriptopiac kiszámíthatatlan ármozgásából hogyan lehet profitálni. Többek között emiatt jelentett be egy újdonságot a világ egyik legnagyobb tőzsdéje, a CME, amely már lehetővé teszi, hogy a kereskedők ne a bitcoin árfolyamára, hanem annak volatilitására, vagyis az ármozgás mértékére fogadjanak...
Érdekes fejlemény, hogy az arany ára ismét lejjebb csúszott: több mint 20%-kal esett az árfolyam a januári rekordhoz, vagyis a kilónkénti 180 millió forinthoz képest, sőt, most először október óta az arany ára az utolsó 200 kereskedési nap átlagára, azaz a 200 napos mozgóátlag alá zuhant...
Érdemes megvizsgálni, hogy napjainkban az igazi rajongók már nemcsak hagyományos relikviákat gyűjtenek, hanem különleges, a Marvel és DC univerzum hőseit idéző karórákat is...
Szokatlanul mozgalmasan indult a hét a kriptovaluták piacán. A bitcoin árfolyama előbb 63 700 dollárig (23,46 millió forint) emelkedett, majd hirtelen esett vissza 62 900 dollár közelébe...
📈 Az XRP nagy eladási hullámot követően ismét a figyelem középpontjába került – az árfolyam már négyhavi mélypontról pattant vissza, de a lendület egyelőre hiányzik...
💰 Bár a legtöbb kriptobefektető számára a tavaszi adóbevallás elsőre távolinak tűnhet, most érdemes figyelni, mert az amerikai Képviselőház legfontosabb adóügyi bizottsága, a Ways and Means Committee gőzerővel dolgozik a kriptopénzekre vonatkozó jogszabályokon...
Fizetős iOS appok és játékok, amik ingyenesek a mai napon. Between Dates Calendar Math (iPhone/iPad)A Between Days egy letisztult, felhasználóbarát alkalmazás, mellyel könnyedén meghatározható, hány nap választ el két megadott dátumot...
Steven Tyler, az Aerosmith frontembere újabb meghallgatást kér a kiskorúval szembeni szexuális visszaéléssel vádoló nő, Julia Holcomb és a férje meghallgatására, még a nyári pereskedés előtt...
🏃 Megemlíthető, hogy DaBaby híres-hírhedt bowlingpályás verekedésének jogi következményei végre lezárultak: hivatalosan is megszületett a megállapodás a 2022-es összetűzéssel kapcsolatos perben...
Különösen igaz ez, ha minden alkalommal egyre nehezebb feladatokkal szembesülsz: a mai Quordle fejtörőhöz három különböző magánhangzóra van szükség, de egyetlen válaszban sincs ismétlődő betű...
💸 Érdemes megjegyezni, hogy a Bitcoin most ismét a 60 000 dolláros (közel 22 millió forintos) szint körül jár, de a korábbi hónapokhoz képest egészen más a befektetői hangulat...
🚘 Első pillantásra úgy tűnt, hogy a Crazy Taxi: World Tour igazi különlegesség: öt városon átívelő őrült verseny, tele pörgős zenékkel és a klasszikus őskáosz hangulatával...
Ami először apróságnak tűnt, végül varázslatos, festői utazássá vált: egy fiatal fiú veszi át elveszett nagybátyja csomagszállító szolgáltatását egy légi biciklivel, amely időnként repülőgéppé is átváltozik...
🥊 Szinte senki sem várta volna, hogy Angelina Jolie és Brad Pitt fia, Knox az érettségi ünnepség napján nemcsak az érettségi bizonyítványát veszi át, de még aznap este harcművészeti mérkőzésen bokszkesztyűt is húz...
Az idei PC Gaming Show 2026 ismét minden várakozást felülmúlt: több mint 60 új, feltörekvő vagy épp legendás játékot vonultatott fel, közülük több mint húsz világpremierrel...
Rövid visszatekintés egy nap történéseire: Mohamed halála, a francia forradalom új államvallásának bevezetése és a Six-Day War alatt történt USS Liberty-incidens is ekkor zajlott...