A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.
Felszínes megoldások, mélyreható problémák
Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.
Gyorsaság nem minden
Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.
Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.
Egy párkapcsolat működésének komoly próbája az anyagiak kezelése. Sok pár éppen olyan problémákkal küzd, mint az adósság rendezése, a lakásvásárlás vagy a közös háztartás vezetése...
🌐 Egy évtizeddel ezelőtt a fizikusokat meglepte egy kísérlet, amely azt mutatta, hogy a kvantummechanika világában az ok és okozat hagyományos sorrendje elmosódik...
Nem hiszem el, de az IBM kvantumszámítógépe most először képes volt egy valódi mágneses anyagot szimulálni úgy, hogy az eredmény tökéletesen egyezett a laborkísérletek eredményeivel...
⚡ A globális energiaigény korábban elképzelhetetlen szintre nőtt, de a nukleáris projektek még mindig hónapokat, gyakran éveket késnek, mielőtt megkezdődhetne az építkezés...
📉 Miközben sokan az amerikai ingatlanpiac újabb felfutására számítottak, az árak országos szinten alig változtak: mindössze 0,4%-os növekedést mutattak január 2025 és január 2026 között...
🚫 Ki ne érezné évente, hogy az adóbevallás maga a pokol? Lassú, unalmas, matekos szerencsétlenkedés, és ki érti, mit akar a NAV a bonyolult szabályaiból?..
🎲 A Kalshi mostantól nem csupán egyszerű predikciós piac, hanem olyan hely, ahol az intézményi befektetők már marzsos (margin) kereskedést is folytathatnak...
Az elmúlt hetekben az olaj- és gázárak kiugró drágulása miatt fellángoltak az inflációs várakozások, ami a befektetők körében komoly átrendeződést hozott...
Ebből következően érdemes megérteni, hogy a nagy befektetői lelkesedés szinte mindig túlzásokhoz vezet, legyen szó MI-ről vagy bármilyen korábbi technológiai forradalomról...
Fordulópontok és sorsfordító pillanatok: ettől a naptól pezseg a történelem. A szikraként fellobbanó indiai lázadás, a polgárháború lezárását előkészítő manőverek, Vietnam lezárása és a Terrakotta hadsereg felfedezése mind ide köthető...
Világszerte hatalmas hálók, hosszú horogsorok és apró csalik határozzák meg a halászatot, de ezzel együtt nem kívánt áldozatok is csapdába esnek: teknősök, delfinek, cápák és tengeri madarak kerülnek hálókba évről évre...
🔒 Egyre trükkösebb módszerekkel támadják a Mac-felhasználókat: az Infinity Stealer nevű új kártevő Python-alapú, és a Nuitka-fordítóval natív macOS-binárissá csomagolva jut el az áldozatokhoz...
Bár a házimozi- vagy buliprojektor kifejezés sok mindent takarhat, a Soundcore Nebula X1 Pro minden eddiginél jobban ötvözi a moziélményt és a partihangulatot egyetlen, kerekeken guruló, összecsukható monstrumdobozban...
🏘 Érdemes látni, hogy a 2026-os labdarúgó-világbajnokság körül Amerikában teljes lakásbérleti láz söpört végig, különösen a New Yorkot, New Jerseyt és Connecticutot magába foglaló régióban...
A fizika világában forrongás van kialakulóban: soha nem látott pontosságot ígérnek az új nukleáris órák, amelyekben nem a megszokott elektronátmeneteket, hanem atommagátmeneteket használnak az idő mérésére...
🔒 Többek között a Lockdown módnak (Lockdown Mode) köszönhetően az Apple-nek továbbra sincs tudomása arról, hogy bármelyik, e védelmet használó eszközt sikerrel feltörték volna kémprogrammal...
A Meta vezetősége előtt soha nem látott lehetőség nyílt: ha a cég 2031-re hatszorosára növeli értékét, minden érintett felsővezető akár 330 milliárd forintos (921 millió dolláros) részvénycsomagot is zsebre tehet...
A CERN-nél végre megtörtént, amire eddig senki sem vállalkozott: sikerült 92 antiprotont elszállítani teherautóval egy szupertrükkös, mágneses dobozban...
💰 A házasságban felborult bizalom, a váratlan szakítás és az anyagi bizonytalanság mindenkit megrázhat, de különösen veszélyezteti azokat a nőket, akik háttérbe szorítják saját pénzügyeiket...
Az amerikai űrkutatás új mérföldkőhöz érkezik: a NASA 2028 végéig útnak indítja a Space Reactor-1 Freedom űrhajót, amely nukleáris energiával hajtva halad majd a Mars felé...
💻 Lényeges szempont, hogy a munkahelyi számítógépek jelentős része elavult szoftvert futtat, ezzel folyamatosan veszélyezteti a vállalati biztonságot, és nehezíti a zavartalan munkavégzést...