A Mesterséges Intelligencia Még Mindig Bénázik A Kódolásban, Lepnek Meg A Kutatók
Az OpenAI kutatói beismerték, hogy még a legfejlettebb AI modellek sem érnek fel az emberi programozókkalannak ellenére, hogy Sam Altman vezérigazgató ragaszkodik hozzá, hogy év végére le fogják győzni a szoftverfejlesztőket. Egy új tanulmányban a cég kutatói megállapították, hogy még a határokat feszegető, legfejlettebb AI rendszerek is “képtelenek megoldani a feladatok többségét” a programozás terén. A kutatók egy újonnan kifejlesztett teljesítménymérőt használtak, a SWE-Lancer-t, amely több mint 1400 szoftverfejlesztési feladatot tartalmaz az Upwork szabadúszó platformról. Az OpenAI három nagy nyelvi modellt teszteltsaját o1 következtető modelljét és zászlóshajó GPT-4o-ját, valamint az Anthropic Claude 3.5 Sonnet-jét.
Felszínes megoldások, mélyreható problémák
Az új teljesítménymérő két típusú Upwork feladaton értékelte a nyelvi modellek teljesítményét: egyedi feladatokon, amelyek hibák javítását és megoldását jelentették, illetve menedzsment feladatokon, ahol a modelleknek átfogóbb, magasabb szintű döntéseket kellett hozniuk. (A modellek nem férhettek hozzá az internethez, így nem tudtak egyszerűen másolni hasonló, online már közzétett megoldásokat.) A modellek összesen több százezer dollár értékű feladattal foglalkoztak az Upworkon, de csak felszíni szoftverproblémákat tudtak javítani, míg képtelenek voltak nagyobb projektekben hibákat találni vagy azok gyökérokait feltárni. Ezek a félkész, gyenge “megoldások” ismerősek lehetnek mindenkinek, aki dolgozott már AI-jal – amely kiváló magabiztosan hangzó információk közlésében, amelyek alaposabb vizsgálat során összeomlanak.
Gyorsaság nem minden
Bár mindhárom nyelvi modell gyakran “sokkal gyorsabban működött, mint egy ember”, jegyzi meg a tanulmány, mégsem tudták felmérni a hibák kiterjedtségét vagy megérteni azok kontextusát, “ami helytelen vagy nem elég átfogó megoldásokhoz vezetett”. Ahogy a kutatók elmagyarázták, a Claude 3.5 Sonnet jobban teljesített, mint a két OpenAI modell, és több pénzt is keresett, mint az o1 és a GPT-4o. Ennek ellenére válaszainak többsége helytelen volt, és a kutatók szerint bármely modellnek “magasabb megbízhatóságra” lenne szüksége ahhoz, hogy valós programozási feladatokkal meg lehessen bízni.
Egyszerűbben fogalmazva, úgy tűnik, a tanulmány azt mutatja, hogy bár ezek a csúcsmodellek gyorsan dolgoznak és meg tudnak oldani kisebb feladatokat, még közel sem olyan ügyesek ezek kezelésében, mint az emberi mérnökök. Bár ezek a nyelvi modellek az elmúlt években gyorsan fejlődtek és valószínűleg ez folytatódni is fog, még nem elég képzettek a szoftverfejlesztésben ahhoz, hogy helyettesítsék az élő embereket – bár ez nem tartja vissza a vezérigazgatókat attól, hogy az automatizálási megoldások mellett döntsenek.
filózó
Szerinted milyen hatással lesz ez az AI teljesítményének korlátozottsága a munkaerőpiacra a következő években?
Ha te lennél a kutatócsapat tagja, milyen módszereket próbálnál ki az AI képességeinek fejlesztésére?
Te hogyan közelítenéd meg azt a kihívást, hogy az AI modellek nem értik a hibák kontextusát a programozási feladatoknál?
💉 Régi ismerős kerülhet új szerepbe a daganatos kezelések világában: egy közismert asztmagyógyszer, a montelukaszt lehet a kulcs a nehezen kezelhető rákok, például az agresszív, hármas negatív emlődaganat leküzdésében...
💰 A MoonPay eddig főként kriptopénzes fizetésekkel foglalkozott, de most nagyot lép előre: elindította a MoonPay Trade nevű platformot, amely lehetővé teszi, hogy a bankok, fintech cégek és nagyvállalatok egyetlen integráción keresztül férjenek hozzá tokenizált eszközökhöz, decentralizált pénzügyi (DeFi) protokollokhoz és stabilcoin-likviditáshoz, több mint 200 blokklánc-hálózaton...
A mesterséges intelligencia fejlődése megállíthatatlan, de egyre nagyobb aggodalom övezi, hogy a nagy nyelvi modellek hamarosan kifogynak a hiteles, ember által készült adatokból...
A Variational nevű, a Kajmán-szigeteken bejegyzett digitális piactér 50 millió dollárból, vagyis mintegy 18,5 milliárd forintból fejlesztheti tovább peer-to-peer kereskedési rendszerét...
A Kore.ai alaposan felforgatja a vállalati MI-ügynökök piacát az új Artemis platform bemutatásával, amellyel forradalmian gyorssá és egyszerűvé válik az ügynökök fejlesztése, menedzselése és optimalizálása...
A magzati korban elszenvedett klórpirifosz (CPF) nevű vegyszernek való kitettség hosszú távú agyi elváltozásokat és romló mozgáskészségeket idéz elő a gyerekeknél – erre jutottak a Columbia Egyetem, a Los Angeles-i Gyermekkórház és a USC Keck Orvosi Kar kutatói 270 gyermek bevonásával...
Jellemző példa rá, milyen érzés szemtől szemben találkozni a legendás karibi kalózokkal egy teljesen új köntösben, hiszen az Assassin’s Creed Black Flag Resynced szinte mindent átalakít, miközben végig hű marad 2013-as elődjének lelkéhez...
Noha sokan úgy gondolják, hogy a videokártya-illesztőprogramokat elég évente egyszer frissíteni, az Nvidia most sürgeti a felhasználókat: azonnal telepítsék a legújabb GPU-illesztőprogram-frissítéseket, különben komoly veszélynek teszik ki gépüket...
A betegségek genetikai hátterének feltérképezése az elmúlt években rohamléptekkel fejlődött, ennek ellenére a gyógyítás még mindig kihívásokkal teli maradt, főként a több száz különböző genetikai elváltozás miatt...
A kriptovalutákkal foglalkozó befektetők és tanácsadók egyre több lehetőség közül választhatnak, mióta 2024 januárjában elindultak a spot bitcoin tőzsdén kereskedett termékek (ETP-k)...
💡 Az MI alapjaiban alakította át a dizájnt: ma már egy cégvezető egyetlen délután alatt logót tervezhet, weboldalt indíthat, közösségi kampányokat készíthet, prezentációkat generálhat és marketinganyagokat állíthat elő – amit korábban ügynökségekre, szabadúszókra vagy saját kreatív csapatra kellett bízni...
Erre utal többek között az, hogy egy 59 éves wisconsini nő jobb karján hirtelen megjelent egy gyorsan növekedő csomó, ami orvosi vizsgálatot tett szükségessé...
💰 A londoni tőzsdén jegyzett IG, amely az 1970-es években úttörőként hozta el a pénzügyi spreadfogadást Nagy-Britanniába, most jelentős digitális terjeszkedés előtt áll...
A sejtek „erőműveként” ismert mitokondriumok kulcsszerepet játszanak az energiaellátásban: képesek folyamatosan igazítani működésüket az energiaszükséglethez...
A Xiaomi új Redmi Note 15 Pro 5G telefonja már első pillantásra is erős hardverrel és elképesztő üzemidővel kecsegtet, a kijelző és a kamerák teljesítménye pedig a kategória élmezőnyébe repíti az eszközt...
A kriptopiac csütörtökön óvatos emelkedést mutatott, a bitcoin árfolyama 77 900 dollárra (28,5 millió forint) ugrott fel a keddi 76 100 dolláros (27,8 millió forint) mélypontról, míg az ether is stabilan tartotta magát 2130 dolláron (781 000 forint)...
Ezen a napon egyszerre születtek hősies repüléstörténeti mérföldkövek és tragikus katasztrófák: Charles Lindbergh első szóló, megszakítás nélküli Atlanti-óceán átrepülése, a japán Mount Unzen pusztító megatszökőárja és Kolumbiában a rabszolgaság eltörlése...
Fizetős iOS appok és játékok, amik ingyenesek a mai napon. Crazy Caps (iPhone/iPad)Ez a match-3 típusú, fizika alapú puzzle játék kreatív dizájnjával tűnik ki, és új élményt nyújt a megszokott játékmechanikákhoz képest...