2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 18:37

A mesterséges lélek kézikönyve: Claude 80 oldalas személyisége

Claude, az Anthropic által fejlesztett MI-chatbot, egy különleges, 80 oldalas „lélekkel” rendelkezik, amely meghatározza a személyiségét és alapvető szabályait...

MA 18:03

Az európai MI már a GitHub Copilot trónjára pályázik

Kezdetben az amerikai technológiai óriások játszották a főszerepet a mesterséges intelligencia által támogatott kódolás piacán, de most új európai rivális lépett színre...

MA 17:55

A legendás Számítógép-történeti Múzeum beköltözött az online térbe

A kaliforniai Mountain View-ban található Számítógép-történeti Múzeum mostantól virtuálisan is látogatható, így már nem kell Amerikáig utazni ahhoz, hogy valaki belemerüljön a digitális kor legfontosabb ereklyéi közé...

MA 17:37

Az Uber beszáll a robotaxi-versenybe: 25 ezer önvezető autót ígér

A torontói Waabi eddig önvezető kamionokra specializálódott, most azonban a robotaxi-piacra lép be, méghozzá az Uberrel közösen...

MA 17:19

Az MI-forradalom: ingyenes képzés minden brit dolgozónak

Az Egyesült Királyság kormánya ingyenes online MI-képzéseket indított, hogy felkészítse a munkavállalókat az MI használatára a munkahelyeken...

MA 16:57

Az új GnuPG-frissítés kritikus biztonsági rést tár fel

⚠ Érdemes megvizsgálni, milyen veszélyeket rejt a GnuPG legújabb hibája, amelyhez frissítés is érkezett...

MA 16:37

Az új WhatsApp‑zár páncélként védi a veszélyeztetetteket

A Meta elindította a WhatsApp teljesen új védelmi funkcióját, amely mostantól fokozott biztonságot kínál újságírók, közszereplők és más, komoly fenyegetettségnek kitett felhasználók számára...

MA 16:19

A mesterséges intelligencia 800 rejtélyes kozmikus anomáliát fedezett fel

A Hubble-űrteleszkóp több mint százmillió képének gyors elemzésére vetették be az Európai Űrügynökség (ESA) tudósai által fejlesztett MI-t, amely két és fél nap alatt 800 korábban ismeretlen kozmikus anomáliát fedezett fel...

MA 16:02

Az iPhone 18 Pro lenyomhatja a Galaxy-t a zoomcsatában

Egyre biztosabbnak tűnik, hogy az Apple rövid időn belül különleges teleobjektív-előtétet tesztel az iPhone 18 Pro modelleken...

MA 15:38

A világ első robotarca, amely úgy mozgatja ajkát, mint egy ember

😃 Felmerül a kérdés, hogy vajon meg tudod-e különböztetni a robotot az embertől beszéd közben — lehet, hogy hamarosan már nem lesz ilyen egyszerű...

MA 15:19

Az MI feltárta a Hubble rejtélyeit: 1400 új objektum

Két európai csillagász, David O’Ryan és Pablo Gómez, az Európai Űrügynökség kutatói, közel 800 eddig ismeretlen asztrofizikai anomáliát bányásztak elő a Hubble-űrtávcső harmincöt éves adatgyűjteményéből...

MA 15:01

A japán óriás betörne az amerikai kriptobankok elit klubjába

A japán Nomura pénzügyi csoport digitális leányvállalata, a Laser Digital engedélyért folyamodott az Egyesült Államokban, hogy létrehozzon egy nemzeti trustbankot, amely intézményi ügyfeleknek nyújtana kriptovaluták kezelésével kapcsolatos szolgáltatásokat...

MA 14:55

Az első NVIDIA H200 MI-chipek végre megérkezhetnek Kínába

🚀 Kína hosszú huzavona után jóváhagyta az NVIDIA H200 MI-GPU-k első nagyobb szállítmányának importját, miután a kormány korábban elutasította azt...

MA 14:37

A WhatsApp szuperbiztonsági módja végre egy kattintással bekapcsolható

🔒 A WhatsApp mostantól egyetlen gombnyomással bekapcsolható szigorú adatvédelmi módot kínál, amellyel mindenki gyorsan fokozhatja a saját védelmét...

MA 14:19

Újabb leépítés: az Amazon 16 ezer embert bocsát el

🙁 Az Amazon újabb 16 000 munkavállalót bocsát el világszerte, hogy átalakítsa és egyszerűsítse működését...

MA 14:02

Az áttörés előtt áll Ázsiában a zöld repülőüzemanyag

🛫 Szingapúr Tuas ipari negyedében található a világ legnagyobb fenntartható repülőüzemanyag (SAF) finomítója, ahol használt étolajból és állati zsírból állítanak elő repülőgépeket hajtó üzemanyagot...

MA 13:55

Az ősi marsi tengerpart végre kiteregeti a titkait

A NASA Perseverance marsjárójának friss felfedezései gyökeresen megváltoztatják, mit gondolunk a Mars múltbeli lakhatóságáról...

MA 13:38

Az iskolai étkeztetés lehet a gyermekszegénység elleni áttörés

🍳 A 2026-os év rögtön az elején komoly kihívásokat hozott a globális éhezés kezelése terén...

MA 13:20

Az amerikai dollár zuhan: újra négyéves mélyponton

Az amerikai dollár 2022 februárja óta nem látott mélypontra zuhant, miután Donald Trump elnök ismét nyíltan elbagatellizálta a valuta gyengülése miatti aggodalmakat...

MA 13:01

A barlangi medve visszavág: véres véget ér az ősi vadászat

Egy 27 000 évvel ezelőtt élt tinédzser csontvázának vizsgálata ritka bepillantást enged az őskori mindennapok brutalitásába...

MA 12:56

A homárok MI-asszisztense: minden, amit a Moltbotról tudni kell

Az internet új kedvence nem más, mint egy digitális homár: a Moltbot, a személyi MI-asszisztens, amelynek fő attrakciója, hogy ténylegesen elvégzi helyettünk a feladatokat...

MA 12:37

Az SK Hynix beszáll az amerikai MI-lázba

🚀 Dél-koreai memóriagyártó óriás, az SK Hynix legalább 3 700 milliárd forintot fordít egy új, mesterséges intelligenciára specializálódó amerikai vállalat létrehozására...

MA 12:21

Az Android-frissítések dzsungele: így találsz ki a verziók útvesztőjéből

Az Android világában a frissítések sosem haladnak egyenes úton. Mindenki hallott már arról, hogy új funkciók jelentek meg, amelyeket a telefonján még nem talál, vagy éppen azt látja, hogy hónapokkal a hivatalos bejelentés előtt már valakik beszélnek róluk...

MA 12:02

Az élő gyöngysor réme: új pókparazita Brazíliában

Egy apró pók furcsa gyöngysorral a testén igazi tudományos szenzációvá vált a São Pauló-i Butantan Intézet Zoológiai Gyűjteményében...

MA 11:56

Az ökogazdaságban most a profit írja a szabályokat

Évtizedeken át az organikus gazdálkodás témája elsősorban a fenntarthatóságról, a környezeti egészségről és az állatjólétről szólt...

MA 11:37

Az MI-láz megduplázta az SK Hynix nyereségét

A dél-koreai SK Hynix történelmi rekordokat döntött 2025-ben: a vállalat éves árbevétele közel 50%-kal, üzemi nyeresége pedig több mint duplájára nőtt az előző évhez képest...

MA 11:19

A vadáfonya, a szupersztár: a szív és az agy őre

🍒 Különösen igaz ez akkor, ha valaki egészségesebb keringést, jobb anyagcserét vagy erősebb memóriát szeretne: egyre több tudományos bizonyíték utal arra, hogy a vadáfonya fogyasztása valódi csodafegyver lehet a szív, az emésztőrendszer és az agy védelmében...

MA 11:02

A Holdba csapódhat egy aszteroida – aranybánya vagy katasztrófa?

🌕 2032 végén egy 60 méter átmérőjű aszteroida, a 2024 YR4 nevű kisbolygó akár a Holdba is csapódhat...

MA 10:57

Az Adobe Photoshop MI-újításokkal hódítja meg a kreatívokat

Az Adobe Photoshop ma jelentős frissítéseket kapott, amelyek a Firefly generatív MI-technológiájára épülnek...