2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 07:55

Az óriási adatközpont titokban 29 millió gallon vizet nyelt el

Érdekes, hogy egy amerikai adatközpont 15 hónap alatt több mint 110 millió liter vizet használt fel, miközben a környéken élők csak a csökkenő víznyomásból sejtették, hogy valami nincs rendben...

MA 07:37

A tabletta megakadályozhatja a Covid kialakulását víruskitettség után – vizsgálat szerint

Egy forradalmi, japán fejlesztésű gyógyszer, az ensitrelvir képes megelőzni a COVID-19 kialakulását azoknál, akik már ki voltak téve a SARS-CoV-2-fertőzésnek...

MA 07:10

A Doom eredeti zenéje bekerült az USA Nemzeti Hangfelvételi Nyilvántartásába

A legendás Doom videojáték 1993-ban érkezett meg, és szó szerint fémes energiát robbantott az MS-DOS világába...

MA 07:02

Az ügynökök engedélyezése szétesett, a hitelesítés-továbbadás rátesz egy lapáttal

Fontos kérdés, hogy mennyire kezelhető az ügynökalapú rendszerek jogosultságkezelése, amikor a vállalatok egyre több digitális segédet alkalmaznak...

MA 06:55

Az AI-chipgyártó Cerebras részvénye első nap csaknem duplázott, 100 milliárdos értékre

Érdemes megvizsgálni, miként vált a szilícium-völgyi Cerebras az egyik legértékesebb félvezető-vállalattá a világon mindössze egyetlen tőzsdei nyitónapon, amikor részvényárfolyama megduplázódott, és elképesztő, közel 100 milliárd dolláros (azaz mintegy 36 ezer milliárd forintos) vállalati értékelést ért el...

MA 06:46

A vastagbélrák egyre több fiatalt érint – az ok rejtély

😕 Érdekes jelenség, hogy miközben az idősebbeknél csökken a vastagbélrák előfordulása, a fiatalabb felnőttek körében feltűnően emelkedik az új megbetegedések száma – olyannyira, hogy már a harmincas éveikben járók között is egyre gyakrabban kapnak diagnózist...

MA 06:37

Jön a csak PvE mód a Marathonba, körvonalazódik a 3–5. szezon

🏃 A Bungie komoly újításokat tervez a Marathonban, és a következő szezonok több izgalmas fejlesztést is tartogatnak...

MA 06:28

Az a pár pixel: földi távcső fotózta az Artemis II-t a Holdnál

A nyugat-virginiai Green Bank rádiótávcső egy több mint 320 000 kilométerre haladó űrkapszulát örökített meg: bár a felvételen csupán néhány apró, részben elmosódott pixel látható, mégis négy ember tartózkodott ebben a pontokból álló foltban...

MA 06:19

A ChatGPT történelmi mélyponton: terjed a QuitGPT, hódítanak a riválisok

😰 Egyre élesebb a verseny az MI-csevegőprogramok piacán. Míg egy évvel ezelőtt az OpenAI által fejlesztett ChatGPT még uralta a területet, napjainkra jelentősen csökkent az előnye...

MA 06:05

Történelmi események a mai napon (Május 15.)

Ma több korszakos fordulópont és izgalmas epizód sorakozik: a vesztfáliai béke lezárja az európai vallásháborúkat 🙂, az amerikai Legfelsőbb Bíróság feldarabolja a Standard Oilt, és felszáll az első brit sugárhajtású repülő...

csütörtök 21:12

A pénzügy új vágányain: száguldó stabilcoinok

💰 A stabilcoinok váratlan pályafutása mindenkit meglepett, hiszen a kriptovilág pereméről mára a globális pénzforgalom és a céges pénzügyi folyamatok alapköveivé váltak...

csütörtök 21:01

A paleontológiát felforgatja: szerves molekulák 66 millió éves dinoszauruszcsontokban

Megdöbbentő új felfedezés borzolja a tudományos kedélyeket: a kutatók egy kivételesen ép Edmontosaurus-csontban eredeti szerves molekulák nyomaira bukkantak, amelyek akár 66 millió éve fennmaradhattak...

csütörtök 20:56

Az egyik legalulértékeltebb 2025-ös soulslike, a Tűzpengék, óriási frissítéssel érkezett Steamre

Kevés figyelmet kapott, mégis most berobbant a Tűzpengék (Blades of Fire) a Steamen, ráadásul egy hatalmas frissítéssel és komoly leárazással...

csütörtök 20:44

A 80 ezer dolláros bitcoin csak átmeneti likviditási szorítás?

Az elmúlt időszakban a bitcoin jegyzése átlépte a 82 ezer dolláros (kb...

csütörtök 20:34

A láthatatlan magmahullám ezernyi földrengést indított egy atlanti sziget alatt

🌈 2022 márciusában Portugália egyik szigetén, São Jorge-on váratlanul több ezer földrengés söpört végig...

csütörtök 20:23

A colchesteri előkelő római nő rejtélyes temetése

🏛 Colchester városában lenyűgöző leletre bukkantak: egy gazdagon díszített ókori sírban egy fiatal római nőt temettek el, különleges tárgyakkal és egzotikus anyagokkal körülvéve...

csütörtök 20:12

Mostantól a vállalatok éles adataikból képezhetnek saját MI-modelleket, ML-csapat nélkül

🤖 Fontos kérdés, miként lehet a már folyamatban lévő céges munkafolyamatokat arra használni, hogy saját MI-modellt tanítsunk, külön gépi tanulási csapat nélkül...

csütörtök 20:01

Az AMD tarol az x86 piacon, de asztali fronton gyengül

📈 Ami kezdetben ártalmatlannak tűnt, mára komoly sikerré vált: az AMD már a teljes x86 processzorpiac bevételeinek 38,1%-át birtokolja, ami jelentős előrelépés az előző negyedévhez képest...

csütörtök 19:56

A mélység titkai: óriás tintahalra bukkantak Ausztrália partjainál

🐙 A nyugat-ausztrál Nyinggulu (Ningaloo) partjainál, az óceán mélyén rejtőző, elképesztően sokszínű élővilágra bukkantak a tudósok...

csütörtök 19:45

A napi multivitamin lassíthatja az öregedést, állítják a kutatók.

Sokakat foglalkoztat a kérdés, hogyan lehet nemcsak tovább, hanem egészségesebben élni...

csütörtök 19:34

A Copilot belenéz a megnyitott lapjaidba az Edge-ben – ha engeded

A legújabb Edge-frissítés minden eddiginél komolyabb változást hozott. A Microsoft leállította a Copilot módot, ehelyett külön MI-alapú funkciókat vezetett be, amelyek közvetlenül a böngészőbe épülnek...

csütörtök 19:23

A YouTube tévés appja: mostantól vásárlás Google Pay-jel, két kattintással

Egy lényeges szempont, hogy a YouTube teljesen új szemszögből közelít a tévézéshez: már nemcsak videónézésre használhatod az alkalmazást, hanem akár azonnali vásárlásra is, mindezt a saját tévéd képernyőjén...

csütörtök 19:12

Az első közös merülés: így működik a Subnautica 2 kooperatív módja

A Subnautica 2 végre lehetőséget ad arra, hogy ne egyedül, hanem akár négyen fedezzük fel az idegen vizek világát...

csütörtök 18:56

Az új Xiaomi csíptetős, nyitott fülesei végre nem szivárognak?

🔈 A Xiaomi néhány látványos grafikával és a Vadonatúj forma (Brand new form) szlogennel jelentette be, hogy hamarosan piacra dobja első csíptetős, nyitott fülhallgatóját...

csütörtök 18:44

A tudósok száz év után feltárták a kozmikus sugarak rejtett törvényét

Több mint száz éve tartó kutatások után váratlan fordulatot hozott a DAMPE (Dark Matter Particle Explorer) űrtávcső, amelynek legújabb megfigyelései végre áttörést jelenthetnek a kozmikus sugárzás eredetéről szóló rejtély megoldásában...

csütörtök 18:34

A Control eleve RPG-nek készült: így született a franchise

A Control című játék világa már első pillantásra lenyűgöző: monumentális, letisztultan szürreális környezet, amely első blikkre egy metroidvania-játék benyomását kelti...

csütörtök 18:23

A Kraken lecseréli a LayerZerót Chainlinkre a láncközi hidaknál

🚀 Érdemes megérteni, miért mozdult meg hirtelen a blokkláncvilág: a Kraken, az egyik vezető kriptopénz-tőzsde több milliárd dollárnyi kriptoeszközt mozgat át a LayerZero rendszeréről a Chainlink CCIP-re...

csütörtök 16:13

A Forza Horizon 6: CPU-zabáló száguldás, vérszegény sugárkövetés, de simán fut

A várva várt Forza Horizon 6 végre megérkezett, hogy a japán főváros utcáin szabadítsuk el az autós káoszt...

csütörtök 15:56

Az IKEA alakváltó bútorai: órákig vadásztam a rejtett funkciókra

Egy lényeges szempont, hogy az okos bútor megkönnyíti az életet a kis lakásokban...