2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 17:56

A kínai ingatlanválság mélyül: jöhet a következő nagy zuhanás

A kínai ingatlanpiac összeomlása a vártnál is súlyosabb lesz idén – figyelmeztet az S&P Global Ratings friss előrejelzése...

MA 17:39

Az okoseszközök új királya a Wiim Sound: tényleg mindenkit lemos?

Az utóbbi években az okoshangszórók főként azzal próbálták elnyerni a tetszésünket, hogy 360 fokban szórják a hangot, így töltve meg zenével a teljes szobát...

MA 17:19

A Galaxy S25 legújabb frissítése meghozta a Direct Voicemailt

📱 A Samsung elérhetővé tette a negyedik One UI 8.5 bétaverziót a Galaxy S25 készülékekre, amely már a 2026...

MA 17:01

A mobilhack az EU-t is elérte: kiszivárogtak dolgozói adatok

A brüsszeli Európai Bizottság vizsgálatot indított, miután kibertámadás nyomait észlelték azon a rendszeren, amely a bizottsági munkatársak mobiltelefonjait kezeli...

MA 16:55

Az HBO Max végre elrajtol Angliában is

🎥 Hat évvel az amerikai indulás után március 26-án az HBO Max végre elérhetővé válik az Egyesült Királyságban és Írországban is...

MA 16:38

Az újabb bitcoin-zuhanás megrázta a piacot, de érkeznek a vevők

💸 Egy lényeges szempont, hogy a Bitcoin árfolyama az elmúlt 24 órában újabb 2,5%-os visszaesést produkált, miután az előző hetet egy visszapattanással zárta, amely egészen 71 000 dollárig (kb...

MA 16:21

A Föld alvilágának titka: elpusztíthatatlan élet az üledék mélyén?

Mélyen a Föld felszíne alatt egy ismeretlen világ rejtőzik, ahol mikroszkopikus lények, az úgynevezett „intraterrestrialok” akár több millió évig is szunnyadnak...

MA 15:57

Az új Ferrari Luce utastere: Jony Ive varázsa négy keréken

🚗 Ferrari történelmet ír: bemutatkozik az első tisztán elektromos modell, a Luce...

MA 15:37

Az új BeyondTrust-baki: a támadók álma lett a távoli hozzáférés

🔒 A BeyondTrust biztonsági szakértői kritikus sebezhetőséget fedeztek fel a Remote Support (RS) és a Privileged Remote Access (PRA) szoftverekben, amelyek világszerte több mint 11 000 rendszert érintenek...

MA 15:19

Az AI által írt szerelmeslevelek tényleg beválnak Valentin-napon?

💗 A Valentin-nap közeledtével sokaknak gondot okoz, hogyan fejezzék ki érzéseiket szavakkal...

MA 15:01

Az adataid veszélyben: szivárognak a népszerű fotóazonosító appok

Több közkedvelt fotóazonosító alkalmazás súlyos adatvédelmi hibát vétett: mintegy 152 000 felhasználó érzékeny adatai szivárogtak ki egy nyilvánosan elérhető adatbázison keresztül...

MA 14:21

A Google Pixel titkos laborja: így születnek a legendás mobilok

🔬 Titkos laborok, világszintű fejlesztés, saját gyártású robotkarok és horrorisztikus strapatesztek – így születik meg a Google Pixel, amely milliók zsebébe költözik...

MA 13:55

Az AI.com csillagászati áron kelt el, kriptómilliárdosé lett

🚀 A Crypto.com alapítója, Kris Marszalek 70 millió dollárt, vagyis körülbelül 25,5 milliárd forintot fizetett az AI...

MA 13:01

Az első nagy korrekció: beszakadt a bitcoin bányászati nehézsége

Az elmúlt hetekben nagyot zuhant a bitcoin bányászati nehézsége, 11%-os visszaesése pedig a legnagyobb ilyen mértékű csökkenés Kína 2021-es kriptoszabályozási szigorítása óta...

MA 12:55

Az NFL végre megóvná a játékosok fejét?

A Super Bowl lezárultával az NFL új pályázatot hirdet: a fejlesztőket arra ösztönzi, hogy továbbfejlesszék az amerikaifutball-sisakok rácsát, és ezzel csökkentsék az agyrázkódások számát...

MA 12:38

Az északi úttörők: 4500 év a jég birodalmában

Közel 4500 évvel ezelőtt a paleoinuitok merész tengerészekként hódították meg Grönland távoli szigeteit...

MA 12:02

A jövő erdei veszélyben: gyors növekedés, ingatag alapok

🌲 A világ erdői gyors ütemben változnak, ám a fejlődés csalóka: az erdők uniformizálódnak, elveszítik sokszínűségüket és egyre sérülékenyebbé válnak...

MA 11:55

Az olcsó Wegovy-utánzat visszavonása után szárnyal a Novo Nordisk

📈 A Novo Nordisk részvényei hétfő reggel közel 8%-kal emelkedtek, miután a Hims & Hers nevű telemedicina-szolgáltató visszavonta a Wegovy nevű fogyókúrás tabletta másolatának forgalmazását...

MA 11:37

Az iPhone 17 felforgat mindent: új chip és MagSafe érkezik

Az Apple hamarosan bemutathatja az új iPhone 17e-t, amely az iPhone 17 szériából ismert A19 chipet kap, és támogatja a MagSafe vezeték nélküli töltést is...

MA 11:19

A hatalmas Bithumb-botrány után bekeményít Korea

Dél-Korea pénzügyi felügyelete szigorú lépéseket készít elő, miután a Bithumb nevű kriptotőzsde súlyos hibát vétett: egyes felhasználókat véletlenül fejenként 2 000 bitcoinnal jutalmazott, ami akkoriban mintegy 44 milliárd dollárnak, vagyis csaknem 16 000 milliárd forintnak felelt meg...

MA 11:01

Az iPhone 17 lepipálja a Pixel 10a-t?

A Google február 18-án mutatja be a Pixel 10a-t, ám az Apple sem tétlenkedik: kiszivárgott, hogy hamarosan érkezik egy jóval olcsóbb iPhone, a 17e is, amely komoly riválisa lehet a Pixelnek...

MA 10:57

Az AT&T olcsó gyerekmobilja, amit teljesen te irányítasz

Az okostelefon ma már a legtöbb gyerek életének része, de sok szülő szeretné korlátozni a használatát...

MA 10:49

Az elveszett aranyszövet – visszatér a tengerek legendája

Egy ritka, luxusnak számító aranyszövetet, amelyet kétezer évig csak császárok és pápák viselhettek, sikerült újraalkotni dél-koreai tudósoknak...

MA 10:41

Az új NotebookLM-funkció turbófokozatba kapcsolja a jegyzetelést

A Google legújabb fejlesztése, a Personal Intelligence, hamarosan a NotebookLM-ben is megjelenhet...

MA 10:33

Az AirFish, a tenger felett repülő hajó forradalma

Szingapúrban hamarosan teljesen új élmény vár a nyaralókra: a tenger felett, nem pedig a vízben száguldhatnak céljuk felé...

MA 10:26

Az amerikai makroadatok padlóra küldhetik a Bitcoint

Többek között négy jelentős amerikai gazdasági esemény mozgathatja meg e héten a Bitcoin árfolyamát...

MA 10:04

Az első brit klímamenekültek: végre maguk mögött hagyják otthonaikat és traumáikat

Negyven környékbeli lakó évekig rettegtek a walesi Clydach Terrace utcájában az áradásoktól és a természeti csapásoktól, míg végül a helyi önkormányzat úgy döntött, 2,6 millió fontért (~1,14 milliárd forintért) felvásárolja az ingatlanokat...

MA 09:49

Az aloe vera rejtett hatóanyaga áttörést hozhat az Alzheimer-kór ellen

🌿 Fontos kérdés, hogy lehet-e természetes anyagokkal felvenni a harcot az Alzheimer-kór ellen...

MA 09:41

Az anyag különleges fázisai: szuperfolyadékból szuperszilárd – és vissza

A kutatók először figyelték meg, hogy egy szuperfolyadék visszafordítható módon alakul át szuperszilárddá – ezzel új lehetőségeket nyitva az extrém anyagállapotok vizsgálatában...