Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 16:34

Az MI-kütyük pocsékul fogynak – ezt már a Logitech is mondja

Az utóbbi időben minden startup arról álmodik, hogy az MI-t saját hardverrel forradalmasítsa, ám egyelőre sorra buknak el a próbálkozások...

MA 16:20

A mesterséges intelligencia sötét oldala: botrányok, veszélyek, diszkrimináció

Megemlíthető, hogy a mesterséges intelligencia mindennapjaink egyre több területén jelenik meg...

MA 16:02

A kozmikus káosz ura: mit rejt a TXS 0518+211 blazár?

A TXS 0518+211 nevű közeli blazárt indiai csillagászok vizsgálták tizenhat éven keresztül a Swift és a Fermi űrteleszkópokkal, minden hullámhosszon...

MA 15:49

Az Apple-vezetők sorra lépnek le, Siri már a Google-re vár

🚨 Az Apple háza táján tovább gyűrűzik a vezetői átrendeződés: újabb két kulcsember jelentette be távozását...

MA 15:34

Az Ofcom 2026-tól drasztikusan szigorítaná a fájlok ellenőrzését

🔏 Az Egyesült Királyság új csúcsra járatja az internetes fájlmegosztás ellenőrzését: az Ofcom 2026-ban kiterjesztené a gyermekek online biztonságáról szóló törvény miatt bevezetett felügyeletet a felhőalapú tárolókra, fájlmegosztókra és más hasonló szolgáltatásokra...

MA 15:17

Végre gyerekjáték visszaszerezni az ellopott Facebook- és Instagram-fiókokat?

🔑 A Meta bejelentette, hogy új, központosított támogatási központot indít Facebook- és Instagram-felhasználóknak, hogy egyszerűbbé és gyorsabbá tegye az ellopott vagy feltört fiókok visszaszerzését...

MA 15:02

A fizika új húzása: kvantumfeladatok laptopon, nem szuperszámítógépen

Kvantumproblémákat már nemcsak szuperszámítógépek és MI segítségével lehet megoldani: új módszernek köszönhetően hétköznapi laptopok is képesek komplex szimulációkat futtatni, akár pár óra alatt...

MA 14:49

A műholdak gigacunamit jeleznek – újraírják az előrejelzéseket

2025 júliusában a Kuril–Kamcsatka földrengés után a NASA és a CNES SWOT műholdja először részletesen rögzítette egy óriási szökőár középóceáni szerkezetét...

MA 14:18

Az eltűnés küszöbén az ausztrál sivatagi víznyelők rejtett élővilága

Érdekes felvetés, hogy Ausztrália középső, kietlen sivatagjában nem is gondolnánk, milyen gazdag és különleges élet rejtőzik a kőbe vájt víznyelőkben...

MA 14:02

Az MI-őrület az egekbe lövi a Foxconn bevételeit

A Foxconn, amely Hon Hai néven is ismert, látványos, 26%-os éves árbevétel-növekedést jelentett be novemberre, miután soha nem látott kereslet alakult ki az MI-alapú szerverek iránt...

MA 13:50

A tajvani hatóságok lecsaptak a RedNote-ra – újabb kínai app-tilalom

🛡 Tajvan egy évre szóló országos tiltást rendelt el a kínai Xiaohongshu (RedNote) közösségi alkalmazással szemben, miután a hatóságok szerint több ezer csalási ügy kapcsolódik hozzá...

MA 13:33

A Cloudflare újraélesztette az internetet a globális leállás után

Világszerte ismét elérhetővé váltak a népszerű weboldalak, miután a Cloudflare gyors javítást adott ki egy, az irányítópultját és kapcsolódó alkalmazásait érintő hibára...

MA 13:17

A Futtatás ablak végre normális dizájnt kapott Windows 11-en

🚀 Több mint harminc év után a Microsoft végre megújítja a Windows egyik legrégebbi eszközét: a Futtatás (Run) ablakot...

MA 13:04

Az ész ára: miért lettünk tudatosak?

🧠 Az emberi tudat kialakulásának okait vizsgálva hamar szembetűnnek a hiányzó mozaikdarabok...

MA 12:50

A Binance új titánja: Yi He, a háttérből irányító társigazgató

🛡 A Binance, a világ legnagyobb kriptovaluta-tőzsdéje jelentős átalakuláson megy keresztül: Yi He, a társalapító mostantól társigazgatóként áll a cég élén Richard Teng mellett...

MA 12:35

A legújabb Öt éjszaka Freddyéknél-film belegabalyodik a saját rémtörténetébe

A játékadaptációk aranykorát éljük, ahol olyan sorozatok, mint az Az utolsók közülünk (The Last of Us), vagy akciódús filmek, például a Sonic, a sündisznó (Sonic the Hedgehog) nemcsak tiszteletben tartják az eredeti anyagot, hanem új rajongókat is vonzanak...

MA 12:17

Az óceánok kiürülnek: csúfosan elbukott a halászati szabályozás

🐟 Fontos kérdés, miként lehetne megvédeni a világ óceánjainak élővilágát, amikor az ipari halászat továbbra is túlhasználja ezeket a vizeket...

MA 11:49

A rejtélyes vulkán, amely kirobbantotta a Fekete Halált?

A 14. század közepén történt titokzatos vulkánkitörés alaposan felforgatta Európa középkori történelmét...

MA 11:34

A Netflix bekebelezi az HBO-t és a Warner Bróst? Jöhet a gigadeal

💸 A Netflix jelenleg kizárólagos tárgyalásokat folytat a Warner Bros. Discovery filmes és tévés stúdióinak, valamint az HBO Max streamingszolgáltatásának megvásárlásáról...