2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 18:34

Az okostávcső, amely 10 ezer madárfajt ismer fel, 4K videóval, 30x zoommal

Kezdetben a távcsövek világa szinte változatlan maradt: megszokhattuk a súlyos, de nagy nagyítást kínáló készülékeket, amelyekhez, ha fényképezni is akartunk, bonyolult adapterre és külön kamerára volt szükség...

MA 18:02

A néhány napja felfedezett aszteroida hajszál híján elkerüli a Földet

Április 13-án egy nagyjából 15–30 méter átmérőjű aszteroida száguld el a Föld mellett, alig 91 593 kilométeres távolságra...

MA 17:56

A kullancscsípések berobbantak: megteltek a sürgősségi osztályok – térképen a gócpontok

Az idei tavasz szokatlanul meleg időjárása miatt soha nem látott mértékben ugrott meg a kullancscsípések száma, főként az USA északkeleti és középnyugati régióiban...

MA 17:23

Az egész ország egy évig ingyen kapja a ChatGPT Plust

Ez azt jelenti, hogy a Földközi-tenger közepén fekvő máltai sziget minden lakója egy évig ingyen használhatja a ChatGPT Plus-t...

MA 16:56

A kimchi segíthet kiüríteni a mikroműanyagokat a szervezetből

🥒 Jellemző példa erre, hogy a mindennapi étrend részeként fogyasztott fermentált ételek meglepő szerephez juthatnak a mikroműanyagok szervezetből való eltávolításában...

MA 16:34

A GTA V elsöprő sikerének titka: a közösségi élmény ereje

🔥 Több mint egy évtized telt el a Grand Theft Auto V (Grand Theft Auto V) megjelenése óta, de a játék népszerűsége továbbra is töretlen...

MA 16:23

A Standard Chartered felvásárolja a Zodia Custody megmaradt részesedését

💰 A Standard Chartered döntése értelmében teljes egészében megszerzi kriptovaluta-megőrzéssel foglalkozó leányvállalatát, a Zodia Custody-t...

MA 16:12

Az Ebola visszatért: világméretű versenyfutás, az USA hazatelepít néhány állampolgárt

😷 Ekkor derült fény arra, ami addig rejtve maradt: az Ebola-járvány ismét felütötte a fejét a Kongói Demokratikus Köztársaságban (KDK) és Ugandában, ahol már több száz embert fertőzött meg, és száznál is több gyanús halálesethez vezetett...

MA 15:45

Az álörökösnő visszatér: Anna Delvey memoárt és dokumentumfilmet forgat

Anna Delvey, polgári nevén Anna Sorokin, most először saját szemszögéből meséli el életét, hiszen memoárt és a hozzá kapcsolódó dokumentumfilmet készít...

MA 15:24

A Keychron K2 HE Concrete Edition: látványos dizájn, prémium ár – megéri?

💪 Különösen említést érdemel, hogy a Keychron K2 HE Concrete Edition egyszerre impozáns, extravagáns és erőteljes gaming billentyűzet, amely azonnal magára vonja a figyelmet...

MA 15:12

A Lego Batman: A Sötét Lovag öröksége legókockák közt

👑 A Lego Batman: Legacy of the Dark Knight a DC-univerzum rajongóit igyekszik elcsábítani egy olyan kalanddal, amely egyszerre nosztalgikus és friss...

MA 15:02

A Windows 11 Start menüje, tálcája végre fejlődik, de nem erre vágyom

😐 A Windows 11 mostantól régóta várt funkciókkal bővül, amelyek jelentősen javítják a felhasználói élményt...

MA 14:56

Az ex-Google-vezért kifütyülték: stadionnyi diák az MI-beszéd ellen

Több ezer diák gyűlt össze a Casino Del Sol Stadionban, ahol Eric Schmidt, a Google egykori vezérigazgatója tartott beszédet a technológia világhódításáról...

MA 14:34

Az AMD technológiája eltünteti az első indítási akadásokat – csak néhány játékban

Érdemes megvizsgálni, mennyit változott a játékélmény azzal, hogy az Advanced Shader Delivery technológia megérkezett az AMD legújabb videokártyáira...

MA 14:23

A Schrödinger-óra: az idő egyszerre gyorsul és lassul?

Kevés fogalom olyan rejtélyes és sokat vitatott, mint maga az idő...

MA 14:01

A dauniai kyathos: pancsolás, mámor és egy kigúvadt szemű fickó

Dél-Olaszországban, évszázadokkal a római hódítás előtt, a daunok különleges kerámiákat és sírköveket alkottak, melyek máig őrzik misztikus kultúrájuk emlékét...

MA 13:56

A tudósok szerint végre megfejtették az emberi jobbkezesség rejtélyét

Az emberiség egyik legizgalmasabb evolúciós rejtélye kapott új magyarázatot: miért használják az emberek ilyen elsöprő többségben a jobb kezüket?..

MA 13:45

Az audiofil álom: egyedi, kilenc meghajtós, karbon fülmonitorok hárommillióért

🎧 Felmerül a kérdés, hogy mennyi pénzt hajlandó fizetni valaki a lehető legjobb zenei élményért...

MA 13:34

A Google I/O előtt a Wear OS 7-nek öt ütős újítás kell

👍 Az okosórák világa folyamatosan fejlődik, és a Google nem dőlhet hátra: a Wear OS 7 már a küszöbön áll, miközben a Garmin és az Apple Watch is minden eddiginél erősebb versenytársak...

MA 13:01

A hatvan éve kihaltnak hitt ausztrál növény váratlanul visszatért

Egy véletlen, a vadonban készült fotó egészen új fejezetet nyitott a természetkutatásban: Ausztrália eldugott északi részén újra előkerült egy olyan növény, amelyet 1967 óta mindenki kihaltnak hitt...

MA 12:57

Az igazi Disco Elysium-utód, amely magasra teszi a lécet

Zero Parades: For Dead Spies képes arra, amire nagyon kevés kortárs szerepjáték mer vállalkozni: finom részletességgel vizsgálja az emberi természetet és a politikai filozófiát, miközben bátran feszegeti a klasszikus CRPG-formulát...

MA 12:45

A James Webb megrajzolta az univerzum rejtett megaszerkezeteinek eddigi legnagyobb térképét

👀 Az elképzelhetetlenül távoli múltba pillanthattak bele a csillagászok, amikor a James Webb űrtávcső segítségével minden eddiginél részletesebben térképezték fel az univerzum kozmikus hálóját...

MA 12:23

A kísérleti zsákutcából a skálázásig: az ügynökalapú MI stratégiái

🚀 A Davosban megrendezett Világgazdasági Fórum óta észrevehetően átalakult az MI-ről szóló párbeszéd: a jóslatok és áttörések helyett egyre inkább arra koncentrálnak a vállalatok, hogyan lehet az MI-t valóban a szervezet mindennapjaiba beépíteni – ráadásul biztonságosan és nagy léptékben...

MA 11:56

Az infláció és a kötvénypánik újabb kriptokrachot robbantott ki

💸 Az elmúlt 24 órában a kriptokereskedők hatalmas, 563 millió dolláros (közel 206 milliárd forintos) veszteséget könyvelhettek el a tőkeáttételes határidős ügyleteken, miután a piacvezető bitcoin és ether jelentős áresésen ment keresztül...

MA 11:44

Az ebolajárvány miatt amerikaiakat menekítenek ki Kongóból

😷 Az elmúlt napokban a Kongói Demokratikus Köztársaságban, ahol újabb Ebola-járvány ütötte fel a fejét, több amerikai állampolgár is közvetlen kapcsolatba kerülhetett feltételezett esetekkel...

MA 11:23

A vállalati biztonság Achilles-sarka: hiányzik a valós idejű reagálás

🛡 Az utóbbi években a vállalati technológiai rendszerek elképesztő fejlődésen mentek keresztül...

MA 11:12

Az MI-fegyverkezési verseny bedarálja a kriptó megfelelési csapatait

A kriptovaluták biztonsága előtt álló legnagyobb új kihívás nem feltétlenül a nagyobb hackertámadásokban rejlik, hanem abban, hogy az MI által vezérelt pénzügyi tranzakciók olyan tempót diktálnak, és olyan mennyiségben zajlanak, hogy azt az emberek már nem tudják követni...

MA 10:37

Az Aave visszaállítja az etherhitel-kereteket a 230 millió dolláros hackertámadás után

🔒 Amikor áprilisban hackerek megtámadták az egyik legnagyobb decentralizált hitelezési platformot, az Aave-t, több mint 90 milliárd forintnak (kb...

MA 09:55

Itt a tiszta hidrogén áttörése: olcsóbban, platina nélkül

Sikerült áttörést elérni a megújuló forrásból előállított hidrogénüzemanyag gyártásában, ami eddig szinte elképzelhetetlen volt a drága platinafémek nélkül...