2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 09:47

Megtalálták az első idegen asztroszférát egy Nap-szerű csillag körül

🚀 Egy közeli, fiatal csillagot sikerült megfigyelni, amint egy gázbuborék, az úgynevezett asztroszféra veszi körül – ilyen jelenséget eddig még nem sikerült lencsevégre kapni a Naprendszeren kívül, Naphoz hasonló csillag esetében...

MA 09:37

Az összecsukható mobilok új királya: megérkezett a Motorola Razr Fold

📱 A várva várt Motorola Razr Fold végre bemutatkozott az MWC-n: a gyártó első, könyvszerűen hajtogatható prémium telefonja az üzleti és kreatív felhasználókat célozza meg...

MA 09:29

A zseni mítosza miért dühíti a matematikusokat?

🧠 Mindenki emlékszik arra a jelenetre, amikor Matt Damon MIT-es takarítóként egy bonyolultnak tűnő matematikai feladvánnyal szembesül A zseniben (Good Will Hunting)...

MA 09:21

Az MI olvas a fejünkben: félelmetes vagy korszakalkotó?

Agyunk elektromos működése, amely hosszú időn át túl komplexnek tűnt a dekódoláshoz, most új dimenzióba lépett...

MA 09:10

A bubble tea tényleg veszélyes, vagy csak túltoljuk a parát?

🍵 A színes, fotóbarát bubble tea italok már lassan minden utcasarkon feltűnnek, és a fiatalok mellett egyre több felnőtt is beáll a sorba...

MA 08:55

A nagy intézményi pénz kifelé tart? 3000 milliárd forint tűnt el

💸 Most őszintén, könyörgöm, észrevetted már, hogy menekül a pénz a kripto-ETF-ekből?..

MA 08:47

Az emelkedő liftben tényleg nehezebbnek érzed magad?

A lift mozgása minden alkalommal megbolygatja a testérzeteket. Ahogy a füledben felkúszik a nyomás, a talpad alatt a padló keményebben feszül alád, vagy épp ellenkezőleg: hirtelen könnyebbnek érzed magad...

MA 08:38

Az északi fény márciusban: jön a nagy dobás?

A március elképesztő lehetőséget tartogat az északi fény megfigyelésére, hiszen évtizedek óta nem volt ilyen kedvező egybeesés a csillagászati körülmények és a naptevékenység szempontjából...

MA 08:19

Az MI az asztalodon: tarol a Lenovo robotkarja?

A Lenovo idei újdonságai között feltűnt egy különös robotkar, amely kiskutyaszemeket villogtat, és közben a munkahelyi hangulatot próbálja feldobni...

MA 07:55

A valódi MI-veszély nem a deepfake, hanem a hétköznapi suttogás

A társadalom többsége még mindig alábecsüli azt a komoly fenyegetést, amit az MI a közeljövőben jelent majd a mindennapokban...

MA 07:47

Az irodát forradalmasító Lenovo robot és a jövő munkahelyi kütyüi

A Lenovo idén több izgalmas prototípust is bemutatott, amelyek teljesen újragondolják az irodai munkát...

MA 07:30

A GameSir G7 Pro a játékélmény új királya

🎮 A GameSir G7 Pro új szintre emeli a kontrollerekről alkotott elképzeléseidet...

MA 07:19

A súlyos OpenClaw-hiba: bárki átvehette a weboldalak feletti irányítást

Egy friss sebezhetőség tette lehetővé, hogy rosszindulatú weboldalak teljesen átvegyék az irányítást az OpenClaw nevű, önállóan futtatható MI-platform fölött...

APP
MA 07:12

APPok, Amik Ingyenesek MA, 3/2

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Four Last Things (iPhone/iPad)A Four Last Things egy egyedülálló point-and-click kalandjáték, amelynek különleges hangulatát a reneszánsz mesterművekből összeállított látványvilág adja...

MA 07:11

Az új csokis méz: bűntudatmentes élvezet, bolygóbarát csavarral

Érdekes felvetés, hogy a kutatók a csokoládégyártás során keletkező kakaóbabhéjat és a brazil őshonos méhek mézét úgy keverték össze, hogy a végeredmény egy csokoládés, antioxidánsban gazdag szuperméz lett...

MA 06:46

Az Alzheimer-kór titkos kémiai forradalma: meglepő felfedezés az egész agyban

Az Alzheimer-kór évről évre több áldozatot szed, mint a mell- és prosztatarák együttvéve, ezért a kutatók egyre intenzívebben keresik a betegség valódi okait...

MA 06:38

A Lenovo mindent bedob: itt a hajlítható Legion Go Fold

A Lenovo bemutatta a Legion Go Fold nevű hibrid játékkonzol- és laptopkoncepcióját, amely merészen ötvözi a kézi konzolok és a hordozható számítógépek előnyeit...

MA 06:28

A Samsung meghátrál: vége a titkos texasi adatgyűjtésnek

Különösen igaz ez akkor, ha otthonunkban egyre több digitális eszköz vesz körül minket: most a Samsung okostévéi kerültek a figyelem középpontjába Texas államban...

MA 06:06

Történelmi események a mai napon (Március 2.)

Röviden: ezen a napon felszállt a Concorde első tesztje, Wilt Chamberlain 100 pontot dobott, és Nelson Mandela az ANC alelnöke lett...

vasárnap 18:02

A Soundcore Space 2 drágább lett – megéri az árát?

Az Anker végre bemutatta a közkedvelt Soundcore Space fejhallgatók új generációját a barcelonai MWC-n...

vasárnap 17:59

A HONOR új, hajlítható mobilja átírja a játékszabályokat

🦅 A Magic V6 a hajlítható telefonok új sztárja: 8,75 mm vastagságával összehajtott állapotban a legvékonyabb a népszerű gyártók könyvszerű modelljei között...

vasárnap 17:02

Az MI már lángokban, mi meg bámulunk – hol a vészterv?

Felpörögtek az MI-videók, a Seedance 2.0-nak (csináld ránk, TikTok, Kína!) hála már mindenféle Instagram-posztok, TikTokok és YouTube-shortok ultrarealisztikus kamukkal bombáznak, és úgy fulladunk bele az alternatív valóságba, mint a legkínosabb internetes összeesküvés-hívők...

vasárnap 16:58

Az új Leica-mobil: a Xiaomi brutális kamerával hódít

Többek között elképesztő kameratechnológiát, látványos dizájnt és remek processzort kínál a Xiaomi új Leitzphone készüléke, amely látványosan összeforrt a legendás német Leica fotómárkával...

vasárnap 16:20

Az óraátállítás sokkja: így mentsd meg az alvásod

Vasárnap hajnalban előre kell állítani az órát, vagyis eljön a tavaszi óraátállítás ideje...

vasárnap 14:01

Az álmatlanság és az alvási apnoé együtt durván terheli a szívet

Majdnem egymillió amerikai veterán adatai alapján világosan látszik, hogy ha valaki egyszerre küzd álmatlansággal és alvási apnoéval, sokkal nagyobb eséllyel alakul ki nála magas vérnyomás és szívbetegség, mintha csak az egyik problémával élne...

vasárnap 13:58

A vikingek nyomában: elérték-e valaha Maine-t?

🔭 1957-ben egy amatőr régész egy ezeréves norvég ezüstpénzre bukkant egy őslakos indián lelőhelyen, Maine államban...

vasárnap 13:20

A graffitisek álma: színkeverés egyetlen spray-vel

A graffiti készítése eddig rengeteg különböző színű festékes dobozt igényelt, ami nemcsak kényelmetlen, de egyúttal korlátozza is a művészek kreativitását...

vasárnap 12:01

Az időskori szuperemlékezet titka: fiatalon maradó agysejtek

Többek között az idős emberek közötti nagy különbségek okaira világít rá egy új kutatás, amely meglepő felfedezést tett: azok, akik idősebb korukban is kivételes memóriával rendelkeznek, lényegesen több fiatal idegsejttel rendelkeznek, mint hasonló korú társaik...

vasárnap 11:58

Az iráni háború berobbantotta a Polymarketet: rekorddöntés a fogadási piacon

💰 Fontos kérdés, hogy mennyit ér ma az információ, amikor a háború kitörésekor másodperceken belül elözönlik a prognózisok a kriptopénzek világát, és a geopolitikai eseményekre tett fogadások szinte azonnal rekordokat döntenek...