Az MI-modellek csúfosan elbuktak a focifogadásokban
A legfejlettebb MI-rendszerek ismét bebizonyították, hogy az emberi intuíciót nem könnyű pótolni, amikor a valódi, összetett világot kell értelmezni. Egy Londonban működő startup, a General Reasoning a 2023–24-es Premier League-szezon virtuális újrajátszásán tesztelte nyolc vezető MI-rendszer tudását: a rendszerek megkapták minden csapat részletes statisztikáit és történelmi adatait, a cél pedig az volt, hogy modelljeikkel maximalizálják a nyereséget, miközben kézben tartják a kockázatokat.
A virtuális fogadások kudarca
A rendszerek három próbálkozási lehetőséget kaptak: mindig 100 000 egységből gazdálkodhattak, nem használhatták az internetet, és minden eredményt saját számításaikból kellett levezetniük. Többen – például xAI Grok 4.20 és Acree Trinity – le is nullázták magukat már az első körben. Még a legjobbak – mint a Google Gemini 3.1 Pro vagy az Anthropic Claude Opus 4.6 – is jelentős veszteségeket értek el az egyes próbálkozások során: utóbbi végül átlagosan csak 89 035 egységet tudott megőrizni. A Google Gemini egyszer 34%-os nyereséget is produkált, de aztán szintén elbukott egy következő körben.
Miért bukik el az MI az igazi világban?
A mérleg kimutatta: minden vizsgált MI-modell hosszú távon pénzt veszített, és rendszeresen alulmaradt az emberekkel szemben. Ez kifejezetten megnyugtató lehet a pénzügyi és a marketing szektorban dolgozók számára, akik attól tartanak, hogy az MI elveszi a munkájukat. Ross Taylor, a General Reasoning vezetője szerint itt látható igazán, milyen hiányosságai vannak az MI-nek – a legtöbb benchmark túl egyszerű, mesterséges helyzetet vizsgál, ahol a valóság bonyolultsága és a hosszú távú fejlődés nem jelenik meg.
Valódi kihívások nélkül nincs igazi fejlődés
Ezért a csupán a szoftverkódolásban mutatott MI-sikerek félrevezetők lehetnek, ha a való élet bonyolult és kiszámíthatatlan történéseihez kell alkalmazkodni. Az MI-modellek csak akkor lehetnek igazán hasznosak, ha az ilyen réteges, időben elnyúló, folyamatosan változó valós problémákban is képesek helytállni – márpedig erre jelenleg nem képesek, ezért még sokáig szükség lesz az emberi kreativitásra és tapasztalatra.
🤓 Mark Hamill, akit a Csillagok háborúja (Star Wars) világából Luke Skywalkerként őrzünk emlékezetünkben, csatlakozik a Csavart fém (Twisted Metal) sorozat harmadik évadához...
A Firefox böngésző legfrissebb, 152-es verziója több fontos fejlesztést hoz. A leglátványosabb változás a teljesen átalakított beállítási felület, amely átláthatóbbá és egyszerűbben kezelhetővé teszi a böngésző személyre szabását...
🚀 A Samsung legújabb büszkeségei, a Galaxy Z Flip 7 és a Galaxy Z Fold 7 komoly szerepet kaptak a Pókember: Vadonatúj nap (Spider-Man: Brand New Day) című filmben...
🔬 Tokióban egy új MI-alapú vállalkozás, a Sakana AI dobta piacra a Marlint, első kereskedelmi termékét, amely forradalmasíthatja a vállalati kutatási jelentéseket...
Az amerikai kiberbiztonsági hivatal, a CISA háromnapos határidőt adott az állami szerveknek, hogy frissítsék a LiteSpeed cPanel felhasználói bővítményét, miután ismertté vált egy aktívan kihasznált sérülékenység, amellyel a szervereket támadják...
Ami először apróságnak tűnt, mára a Vénusz egyik legnagyobb rejtélyévé vált: a bolygó rendkívül lassú, ráadásul ellentétes irányú tengely körüli forgása...
Érdemes megvizsgálni, milyen kifinomult módszereket alkalmaznak a bűnözők, amikor eltüntetik rosszindulatú forgalmukat a védekezésre berendezkedett rendszerek elől...
A legtöbb viselhető kütyü a lépéseidet, a pulzusodat vagy a véroxigénszintedet méri, de most érkezett egy olyan eszköz, ami teljesen másra fókuszál: a bőröd egészségére és a napsugárzás követésére...
Megemlíthető, hogy az Nvidia, a világ egyik vezető chipgyártója, öt év után először ismét jelentős kötvénykibocsátásra készül: több mint 25 milliárd dollár (kb...
A SprySOCKS néven ismert kártékony szoftver elsőként Linux rendszereken tűnt fel, de a közelmúltban megjelentek Windows-változatai is, amelyek kormányzati szervezeteket céloznak több országban, köztük Tajvanban, Thaiföldön, Pakisztánban és Hondurasban...
Bár a legtöbb amerikai már nem igényli a szezonális COVID-19-oltásokat, a legújabb vakcinák továbbra is jelentős védelmet nyújtanak a szív- és érrendszeri megbetegedések ellen, különösen a 75 év felettieknek és a krónikus betegségben szenvedőknek...
🔒 A digitális egészségügyi szolgáltató iRhythm Holdings súlyos adatlopást jelentett be, miután hackerek érzékeny személyes és egészségügyi adatokat tulajdonítottak el a cég által használt külső üzleti alkalmazásokból...
🌍 Chile északi részén, a Föld egyik legszárazabb területén húzódik az Atacama-sivatag, amely évente átlagosan kevesebb mint 5 milliméter csapadékot kap...
Az idei év elején egy hatalmas, hat darab, egyenként 21 méter magas épületből álló adatközpont terveit ejtették Észak-Karolinában, miután a fejlesztőt szigorodó szabályok és a helyi lakosság tiltakozása miatt visszalépésre kényszerítették...
Egy kínai magánvállalat által fejlesztett Zhuque-2E rakéta felső fokozata a fellövés után néhány órával széthullott, mindössze néhány száz kilométerre a Föld felszínétől, ahol a Nemzetközi Űrállomás, valamint számos Starlink-műhold kering...