2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 18:02

Az Amazon felhőjét dróntámadások bénították: leálltak az adatközpontok

Három Amazon Web Services (AWS) adatközpont az Egyesült Arab Emírségekben és egy Bahreinben súlyos dróntámadások következtében károsodott, ami komoly leállást okozott, és jelenleg is több tucat felhőszolgáltatás meghibásodásához vezet...

MA 17:59

Az olcsó PC-k korszakának vége

💻 Érdekes felvetés, miszerint néhány éven belül eltűnhetnek az igazán olcsó, 180 ezer forint alatti számítógépek a boltok polcairól...

MA 17:21

Az új trükk, amivel kártevőt csempésznek a Microsoft-fiókodba

🔒 Az elmúlt hetekben több kormányzati és közszférabeli szervezetet is célba vettek olyan adathalász támadók, akik a Microsoft OAuth jogosultságkezelő rendszerének egy hivatalos funkcióját használják ki, hogy káros programokat telepítsenek a gyanútlan áldozatok gépére...

MA 16:40

A rejtőzködés vége: a pszeudonimitás eltűnhet az interneten

Ahogy az MI egyre kifinomultabbá válik, a rejtőzködő felhasználók titkolózása is veszélybe kerül...

MA 16:23

Az új kibertámadások kora: a Cloudflare 2026-os fenyegetettségi jelentése

A kibertámadások univerzuma sosem volt ennyire sokszínű és veszélyes, mint most: államilag támogatott hackercsoportok, brutális mértékű DDoS-támadások, deepfake csalók, akik akár állásinterjúra is jelentkezhetnek, és még a Google Naptár, a Dropbox vagy a GitHub is lehet egy támadás eszköze...

MA 14:01

Az El Niño visszatérhet 2026-ban? Mutatjuk, mire készülhetünk

☀ Két év telt el azóta, hogy az El Niño éghajlati mintázat felforgatta a világ időjárását...

MA 13:59

Az OpenAI gátat szab az amerikai tömeges megfigyelésnek

Érdekes felvetés, hogy az OpenAI újabb módosításokat vezet be a védelmi minisztériummal kötött megállapodásában, hogy egyértelműen tiltsa MI-rendszereinek tömeges amerikai megfigyelésre való használatát...

MA 13:39

Az év űrjáték-botránya: adatlopás a Star Citizen fejlesztőinél

🚀 Ez a jelenség jól illusztrálható azzal, hogy a Star Citizen mögött álló Cloud Imperium Games fejlesztőcéget januárban kibertámadás érte, amelynek során ismeretlen támadók hozzáfértek több felhasználó személyes adataihoz...

MA 13:20

Az esés, amitől még a Bitcoin is pánikol – olajszag a levegőben

🚨 Bonyolódik a helyzet a tőzsdéken, ahogy a konfliktus a Közel-Keleten már a negyedik napjába lépett – és ezt bizony mindenki megérzi, aki szeret kockáztatni...

MA 12:01

Az Android villámgyorsan lép: életmentő javítás a Qualcomm-hibára

⚡ Nem unatkozott mostanában az Android csapata: 129 biztonsági rést kellett befoltoznia, köztük egy nulladik napi hibát, amelyet támadók már aktívan kihasználnak, és amely a Qualcomm kijelzőchipjeit érinti...

MA 11:58

Az MI-költségek után végre jön a profit?

📈 A Stripe újításával az MI-t használó startupok könnyedén kiszámíthatják és átháríthatják a valódi működési költségeiket az ügyfeleikre...

MA 11:40

Az OpenAI-vezér elismeri: kapkodva született a védelmi szerződés

📖 Rövid időn belül komoly hullámokat vert az OpenAI legújabb szerződése az Egyesült Államok Védelmi Minisztériumával, miután Sam Altman vezérigazgató teljes nyilvánosság előtt elismerte: hiba volt elsietni a megállapodást...

MA 10:46

Az amerikai hadsereg után jön a nagy ChatGPT-törlés

Az OpenAI ChatGPT mobilappjának amerikai letöltései drasztikusan visszaestek, miután bejelentették a cég együttműködését a Védelmi Minisztériummal (DoD), amelyet Trump új adminisztrációja idején át is neveztek...

MA 10:37

A Perseverance, amely tudja, hol van: így lett önálló

🚀 A Mars felszínén nincs GPS, és más navigációs műholdak sincsenek, mégis szükség van arra, hogy az ott dolgozó járművek önállóan, pontosan tudják a pozíciójukat...

MA 10:19

A Core Scientific dobja a bitcoint, hogy az MI-re váltson

💸 Januárban a Core Scientific közel 54 milliárd forintért, vagyis nagyjából 175 millió dollárért adott el 1 900 bitcoint, a darabonkénti átlagár pedig 92 100 dollár körül alakult...

MA 09:55

A Claude mostantól emlékszik rád – ráadásul teljesen ingyen!

😀 Naná, hogy a chatbotvilág is egyre menőbb, főleg amikor az ingyenes funkciók zsebre vághatók!..

MA 09:46

Az új Call of Duty: berobban a Black Ops Royale

Képzeld el, ahogy száz játékos zúdul le egy gigantikus pályára – ez lesz a Black Ops Royale, amely március 13-án robban be a Call of Duty életébe, ráadásul teljesen ingyen!..

MA 09:37

Az új iPad Air: erősebb belül, változatlan kívül

Az Apple új iPad Air modellje alig különbözik az elődjétől, de a megszokott forma mögött komoly memóriafrissítés rejtőzik...

MA 09:29

Az ókori görög jósnők bódító extázisa: mit rejtenek a füstök?

🔮 Az évezredekkel ezelőtt kialakult Eleusziszi Misztériumok szertartásai Görögország-szerte híresek voltak titokzatosságukról és különös erejükről...

MA 09:10

Az igazi Little Foot arca: így festett 3,7 millió éve

🖖 Végre fény derült arra, hogyan nézhetett ki a valaha talált egyik legősibb emberelőd, Little Foot...

MA 09:01

Az Apple új MI-ját tényleg a Google szerverei hajtják?

Az Apple meghatározó lépésre készül a Siri fejlesztésében: nemcsak a Google Gemini MI-modelljeit tervezi használni, hanem felmerült, hogy a Google szerverei is részt vehetnek az új generációs, MI-alapú személyes asszisztens háttérfolyamataiban...

MA 08:56

Az USA legnagyobb internetszolgáltatója lehet a Charter: felvásárolná a Coxot

A Charter Communications, a Spectrum márka mögött álló vállalat, engedélyt kapott az amerikai hírközlési hatóságtól (FCC), hogy felvásárolja a Coxot, ezzel megelőzheti a Comcastet, és a legnagyobb lakossági internetszolgáltatóvá válhat az Egyesült Államokban...

MA 08:46

A floridai Microsoft-licencmaffia lebukott

👑 Egy 52 éves floridai nő, Heidi Richards közel két év, pontosan 22 hónap börtönbüntetést kapott, miután bizonyítottan évekig illegálisan árusított Microsoft Certificate of Authenticity (COA) címkéket világszerte...

MA 08:28

Az Atacama rejtélye: láthatatlan élet virágzik a Föld legszárazabb sivatagában

🌎 Parányi férgek rejtett birodalmára bukkantak a Föld egyik legextrémebb, legszárazabb térségében, a chilei Atacama-sivatagban...

MA 08:19

Az új Mastodon-gomb kihúz a megosztási mocsárból

Mostantól pofonegyszerűen lehet megosztani bármely weboldal tartalmát Mastodonon: megérkezett ugyanis a platform univerzális Share to Mastodon gombja...

MA 08:01

Az HBO Max és a Paramount+ összeköltözik – bírjuk a sorozatdömpinget?

Közben az is tény, hogy az HBO Max és a Paramount+ valóban egyetlen gigantikus streaming-szolgáltatássá olvadnak össze, amellyel rögtön 200 millió előfizetőt kezelnek majd világszerte...

MA 07:56

A rendőrök bakija: véletlenül elúszik a lefoglalt kriptovagyon

Nemrég Dél-Koreában a rendőrség nagy sikerként jelentette be, hogy 124 vagyonos adóelkerülőtől összesen 5,6 millió dollárnyi, azaz kb...

MA 07:46

A NEAR szárnyal, titokzatos tranzakciók borzolják a kedélyeket

🚀 A NEAR token lendületes, 17 százalékos emelkedést mutatott, tovább erősítve közel 40 százalékos heti nyereségét, miután elindította a Confidential Intents nevű új, privát végrehajtási réteget...

MA 07:37

A net új királya: a Charter bekebelezi a Coxot – olcsóbb lesz?

Az USA internetes játszóterén eddig a Comcast volt a főnök, de most villámgyorsan színre lépett a Charter, amely rövid úton megkapta a Szövetségi Kommunikációs Bizottság (FCC) engedélyét, hogy felvásárolja a Coxot, így hamarosan a legnagyobb internetszolgáltatóvá válik az országban...