2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 21:34

A sztárparádé: Sydney Sweeney A-listás szülinappal ünnepelte Scooter Braunt

🎉 Sydney Sweeney mindenkit lenyűgözött, amikor egy látványos, hírességekkel teli születésnapi bulival lepte meg barátját, Scooter Braun zenei menedzsert Santa Monicában...

MA 20:56

Az a stúdió, amely bevállalja a GTA 6-tal szembeni rajtot

💸 Továbbra is a világ lélegzetvisszafojtva várja a GTA 6 megjelenését, amely úgy lebeg a 2026-os naptár felett, mint egy óriási tiltótábla: mindenki messze elkerüli a novemberi megjelenési ablakot...

MA 20:34

A Ledger CTO-ja: az EU megfelelési költségei megfojtják a Web3-innovációt

Fontos kérdés, hogy mi történik az európai kriptoiparban, ahol a szigorú szabályozás már most gyökeresen átalakította az erőviszonyokat...

MA 20:23

A Tony-gálán Sarah Paulson Warren Beatty lányával melegedett össze, Holland Taylor sehol

Ezt jól példázta, hogy a 2026-os Tony-gálán Sarah Paulson érkezése minden figyelmet magára vont, amikor kézen fogva lépett a vörös szőnyegre Ella Beattyvel, Warren Beatty 26 éves lányával...

MA 20:12

Az infláció veri le a bitcoint, nem a nagyvállalatok

A bitcoin májusban ismét 60 000 dollár (22,4 millió forint) alá esett, ami mögött főleg az amerikai infláció gyorsulása áll...

MA 20:01

Az Apple kitiltotta az állami hátterű MAX-ot az orosz App Store-ból

Döbbenetet keltett, hogy az orosz hátterű MAX Messenger hirtelen eltűnt az App Store-ból...

MA 19:56

A Hulk Hogan lánya, Brooke rendőrséget hívott boncolási aggályai miatt

Felmerül a kérdés, hogy mi állhat a világhírű pankrátor, Hulk Hogan halála mögött, hiszen lánya, Brooke több ponton is kételkedni kezdett az eljárás során...

MA 19:33

Az emelkedés napja: 12,3%-ot ugrik a NEAR, repül a TAO

Jellemző példa erre, hogy a CoinDesk 20 indexben szinte minden eszköz értéke emelkedett, a befektetők derülátását tükrözve...

MA 19:23

Az Aave vezére szerint a protokoll kibírta a 8,45 milliárdos bankrohamot

Áprilisban a KelpDAO LayerZero-átjáróját érte támadás, amely 8,45 milliárd dollárnyi (kb...

MA 19:12

Az élőszereplős Scooby-Doo első képei – megvan a premieridőszak

A Netflix 2027-ben mutatja be az első olyan Scooby-Doo sorozatot, ahol maga Scooby egy valódi dán dog szerepében látható...

MA 19:01

A foci-vb a zsebedben: végső mobilos szurkolói útmutató

A foci-vb soha nem volt ennyire a zsebedben: a meccsek idén minden eddiginél mobilspecifikusabbak...

MA 18:56

A Dell RTX Spark mini a Mac Studio trónjára tör?

Külön említést érdemel, hogy a Dell új XPS RTX Spark mini PC-je erőteljes Mac Studio-hangulatot áraszt, és most komoly kihívót kaphat az Apple a kompakt gépek piacán...

MA 18:46

A tökéletesnek tűnsz! A castingcsalás, ami letarolja Hollywoodot

⭐ A színészi pályakezdés mindig is tele volt kihívásokkal, de napjainkban egy egészen új veszély is fenyegeti azokat, akik Hollywoodot szeretnék meghódítani...

MA 18:23

A Project Marát kukázták, jön az új Senua-játék

Fontos kérdés, hogy mihez kezdenek a fejlesztők akkor, ha két különleges ötletből csak az egyik valósulhat meg...

MA 18:02

A Meta szerint 20 ezernél több Insta-fiókot loptak ügyfélszolgálati MI-bottal

Több mint 20 000 Instagram-fiók vált hackerek áldozatává, miután egy mesterségesintelligencia-alapú ügyfélszolgálati rendszer hibáját kihasználták...

MA 17:45

A tudósok szerint az emberiség egyik ősrégi szokása megdőlhetett

Egy lényeges szempont, hogy az emberi fogakon talált apró barázdákat évtizedek óta szinte biztos bizonyítékként kezelték arra, hogy őseink különféle eszközöket használtak szájhigiéniára vagy a fogíny fájdalmának enyhítésére...

MA 17:23

Az Emberiség Császára: 38 év után végre láthatjuk

👑 38 év után először láthatta a világ a Warhammer 40k univerzum egyik legnagyobb rejtélyét: a Császár jelenlegi állapotát...

MA 17:12

A tudósok felfedezték az agyi vegyületet, amely leszoktat a rossz szokásokról

Mi történik az agyban, amikor új helyzethez kell alkalmazkodni, és fel kell adnunk a berögzült viselkedésünket?..

MA 17:01

Az IPO-ra készülő SpaceX és Anthropic elszívják a tőkét, szenved a kripto

🚀 A bitcoin árfolyama visszakapaszkodott 63 000 dollár fölé, de a piac borús jeleket mutat...

MA 16:45

Az élesztőalapú, 3D-nyomtatott anyag leválthatja a tapétát és függönyt?

Egy svéd kutatócsoport teljesen új, környezetbarát belsőépítészeti anyagot alkotott meg, amelynek fő összetevője a jól ismert élesztő...

MA 16:34

Itt a parányi, filléres digitális mini kamera zseblámpával!

A legújabb őrület: miniatűr digitális kamerák, amelyek mellett a régi Kodak Charmera is csak viccnek tűnik...

MA 16:01

A Bybit nagy rohamot indít: kihívja a Wall Streetet tokenizált amerikai IPO-kkal

📈 A kriptotőzsdék világában új korszak kezdődik: a Bybit lehetővé teszi, hogy kisbefektetők közvetlenül, kedvezményes áron vásárolhassanak részvényeket olyan vállalatok nyilvános részvénykibocsátásán (IPO-ján), ahová eddig kizárólag kiválasztott intézményi körök fértek hozzá...

MA 15:56

A nagy leleplezés: a „római” sisakok valójában középkoriak

Érdekes felvetés, hogy egy Spanyolország partjainál talált, különleges vas sisakgyűjtemény évtizedekig római korinak számított, ám a legújabb kutatások gyökeresen új megvilágításba helyezték ezeket a régészeti leleteket...

MA 15:45

A Deadlock MOBA-címkéje ne ijesszen: a gyors mód kezdőknek tökéletes.

Lényeges szempont, hogy a versenyszerű csapatjátékokat gyakran ijesztőnek tartják azok, akik még nem próbálták őket...

MA 15:34

A Bitcoin 63 ezer dollár alá zuhan, a Strategy 100 millióért vásárol

📈 Felmerül a kérdés, hogy mennyire stabil a kriptopiac, amikor a legnagyobb szereplők folyamatosan adnak-vesznek, miközben az árfolyamok zuhanásba kezdenek...

MA 15:23

A Spotify élő koncertekkel támad, de letaszíthatja a YouTube-ot?

A Spotify újabb lendületet vett videós tartalmainak bővítésében: hamarosan élő koncertközvetítésekkel is próbálkozhat, hogy még közelebb hozza az előadókat rajongóikhoz...

MA 15:12

A téridő: a valóság szívében lüktető rejtély

Kevés tudományos felfedezés forgatta fel annyira a világról alkotott elképzeléseinket, mint a téridő fogalma...

MA 15:01

A bitcoinpiac szerint fordul a trend: túl a kriptokrach mélypontján

📈 A kriptopiac viharos napjai után úgy tűnik, egy kulcsfontosságú mutató szerint a legrosszabb szakasz már mögöttünk lehet...

MA 14:45

Az arany nanostruktúrák átírják a hő törvényeit – a tudósok előnyére

Hőjelenségekkel nap mint nap találkozunk: egy csésze kávé kihűl, a laptop felmelegszik munka közben, vagy a napsütés felforrósítja a Föld felszínét...