2025. 02. 24., 12:16

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók

A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.

Felszínes megoldások, mélyreható problémák

Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.

Gyorsaság nem minden

Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.

Az ember még mindig vezet

Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.

  • Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
  • Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
  • Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?


Legfrissebb posztok

vasárnap 18:03

Az új csalási hullám: .arpa DNS és IPv6 a célkeresztben

🔴 Az internetes bűnözők egyre kifinomultabb módszerekkel igyekeznek megkerülni a hagyományos adathalászat elleni védelmeket: most az ...

vasárnap 17:39

Az OpenAI hardverigazgatója lemondott a Védelmi Minisztériummal kötött szerződés miatt

Caitlin Kalinowski, az OpenAI robotikai részlegének hardverért felelős vezetője benyújtotta lemondását, miután a vállalat sietve szerződést kötött az amerikai Védelmi Minisztériummal...

vasárnap 17:21

A mesterséges intelligencia felforgatja a kibertámadásokat minden szinten

💻 A kiberbűnözők soha nem voltak ilyen leleményesek: egyre kifinomultabb módszerekkel vetik be a mesterséges intelligenciát, hogy felgyorsítsák a támadások előkészítését, növeljék támadásaik hatékonyságát, és lecsökkentsék a szükséges technikai tudás szintjét...

vasárnap 17:02

Az amerikai kriptotörvény körül elszabadultak az indulatok

Kérdés, hogy a digitális eszközök piacát szabályozó új törvény, a Clarity Act valóban az áttörés küszöbén áll-e a szenátusban...

vasárnap 16:58

A kellemetlen igazság a hibrid autókról: nem az, aminek látszik

⚠ Hibrid autók – mindenki imádja őket, legalábbis amíg rá nem jön, mennyire illúzió az egész, ha a tulajok fele lusta töltőre dugni őket...

vasárnap 16:42

Az autóporszívók nagy csatája: négy bajnok, váratlan győztes

Megvizsgáltuk, mennyit számít az ár, a márkanév vagy a dizájn, ha a kocsi belseje tisztaságáról van szó...

vasárnap 16:22

A netes korhatár-ellenőrzés már a felnőtteket is célba veszi

Az Egyesült Államokban új online gyermekvédelmi törvények nap mint nap egyre több embert kényszerítenek kötelező korhatár-ellenőrzésre, ha tartalmakhoz szeretnének hozzáférni az interneten...

vasárnap 14:03

A biológia forradalma: jönnek a kvantumfehérjék

🚀 A kristálymedúza finom, zöldes fénye évtizedek óta meghatározza a biológiai kutatásokat...

vasárnap 13:59

Az új módszer átírhatja az exobolygó-vadászat szabályait

🚀 A csillagászoknak évek óta nagy kihívást jelent az exobolygók felkutatása, hiszen ezek legtöbbször olyan halvány jeleket hagynak hátra, amelyeket nehéz észlelni...

vasárnap 13:39

A nagy óraátállítás-vita: lesz valaha megoldás?

Minden évben eljön a pillanat, amikor az órákat előre vagy hátra kell állítani, de a legtöbben felteszik a kérdést: van ennek még értelme?..

vasárnap 13:20

A Walmart tarol: tényleg kell külön Vizio-fiók?

Azt hinnéd, ha veszel egy új tévét, simán csak nézed a sorozataidat...

vasárnap 12:01

Az agy rejtett dominóhatása: új nyom az autizmus hátteréről

Az izraeli kutatók egy meglepő láncreakciót fedeztek fel az agyban, amely néhány autizmus esetében kulcsszerepet játszhat...

vasárnap 12:00

Az immunterápia áttörést hozhat a depresszió elleni harcban?

Az utóbbi évek kutatásai egyre erősebb kapcsolatot mutatnak ki a depresszió és az immunrendszer működése között...

vasárnap 11:40

Az MI-ügynökök forradalmasítják Európa startupvilágát

Európa startupjai továbbra is rendkívül aktívak, tavaly közel 16 000 milliárd forintnyi tőkét sikerült bevonzaniuk...

vasárnap 11:20

Az Alphabet űrterve: kockázat vagy aranybánya az AST SpaceMobile?

Különösen említést érdemel, hogy a Google, a YouTube és a Gemini MI fejlesztése mellett az Alphabet nemcsak a techvilághoz kötődik: befektetési ága kifejezetten nagy figyelmet szentel a feltörekvő, gyors növekedésű szektoroknak, köztük az űriparnak is...

vasárnap 11:01

Az ADHD tényleg járvány, vagy csak jobban felismerjük?

Egyszer csak annyian kezdtek ADHD-snek tűnni – nemcsak a gyerekek! A ’90-es, 2000-es években ez még inkább a hiperaktív, nyüzsgő kisiskolásokról szólt, most viszont már 15 millió amerikai felnőttnél is azonosították...

vasárnap 10:55

Az óraátállítás meglepő haszna: kevesebb elgázolt vad

🕑 Az óraátállítás mindig megosztja az embereket: elveszítünk egy órát az alvásból, ami fáradtsághoz és zavartsághoz vezethet, viszont cserébe hosszabbak a napos esték, kedvezve a szabadtéri programoknak...

vasárnap 10:46

Az indonéz tiniknek lőttek: 16 év alatt tiltják a közösségi médiát

🚫 Indonézia új, országos szabályozást vezet be, amellyel minden 16 év alatti fiatalnak lőttek a közösségi médiázásnak...

vasárnap 10:28

Az olcsó 5GbE kártya, ami szinte mindent visz

A YuanLey 5GbE PCIe hálózati adapter gyors, egyszerű és pénztárcabarát módja annak, hogy extra, nagysebességű hálózati portot adj egy számítógéphez...

vasárnap 10:02

Az aszteroidák közt dúl a kozmikus hógolyócsata

❄ A NASA DART küldetése új megvilágításba helyezte a Föld szomszédságában mozgó aszteroidák életét...

vasárnap 09:56

Az áltudomány hálói rátelepednek a valódi kutatásra

A tudományos világban eddig soha nem látott ütemben terjednek a hamis kutatási eredmények...

vasárnap 09:47

Az állatkísérletek alkonya? Az alternatívák már itt vannak

🐕 Az állatkísérletek visszaszorítása ma már számos országban a tudománypolitika kiemelt célja...

vasárnap 09:37

Az Expert Review, a Grammarly nagy blöffje: szakértők nélkül

👀 A Grammarly új szolgáltatása, az Expert Review, izgalmas ígéretekkel hódít: használata során a leghíresebb írók, gondolkodók és még technológiai újságírók stílusában is kaphatunk javítási tanácsokat...

vasárnap 09:19

Az MI-vel sokkal könnyebb tudományosan csalni, mint hinnéd

💡 Az MI‑alapú szöveggenerátorok gyors térnyerése alaposan felforgatta a tudományos világot. Egy friss teszt szerint a 13 legnépszerűbb nyelvi modell közül mindegyik képes segíteni a tudományos csalásban, akár akarva, akár akaratlanul...

vasárnap 09:02

Az új 3D térkép feltárja a kozmosz ragyogó fényóceánját

🔮 Az univerzum legkorábbi időszakát eddig soha nem látott részletességgel sikerült feltérképezniük csillagászoknak...

vasárnap 08:55

Az olcsó okostelefonok forradalma Afrikában most robbanhat be

Az afrikai kontinens hat országában hamarosan megindulhat a 15 ezer forint (kb...

vasárnap 08:46

A vadonatúj Ratcheteer DX: zeldás kaland minimalista köntösben

👑 A Ratcheteer DX a klasszikus kalandjátékok rajongóinak igazi csemege. Egy posztapokaliptikus jövőben ébredsz, ahol az emberiség nagy része a föld alatt alszik, hogy átvészelje a jégkorszakot...

vasárnap 08:37

A Sony titkos árkísérlete: mennyibe kerülnek ma a PlayStation-játékok?

🎮 Létezik egy oldal, ami folyamatosan figyeli, hogyan alakulnak a PlayStation digitális boltjának árai, és most olyan fura dologra bukkantak, hogy azt hinnéd, ilyen csak legendában létezik...

vasárnap 08:20

Az előrejelzési piacok új aranykora: profik védik a milliárdokat

A pénzügyi világ egyik legizgalmasabb trendje bontakozik ki napjainkban: az előrejelző, más néven predikciós piacok kilépnek a sportfogadások és politikai választások árnyékából, hogy a korábban beárazhatatlan geopolitikai kockázatok és szakpolitikai döntések fedezetére váljanak valódi professzionális eszközzé...