2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

MA 06:30

Az Anthropic újítása: álmodó MI-ügynökök, akik hibáikból tanulnak

San Franciscóban zajló második Anthropic-konferencián látványos eredményekkel mutatkozott be a Claude platform legnagyszabásúbb frissítése, amelynek középpontjában egy új, „álmodás” (dreaming) nevű fejlesztés áll...

MA 06:22

A lehetetlen bolygópár, amely mégis létezik

A Tejútrendszer egyik távoli pontján, mintegy 190 fényévre a Földtől, kutatók egy különleges bolygópárosra bukkantak...

MA 06:06

Történelmi események a mai napon (Május 8.)

Ma olyan nap, amikor fordult a történelem kereke: Jeanne d’Arc áttörte Orléans ostromát, véget ért az európai háborúskodás a V-E Day napján, és az Egészségügyi Világszervezet megerősítette a himlő felszámolását...

csütörtök 21:58

A Forza Horizon 6 eddig megerősített autófelhozatala – íme!

🚗 Idén ősszel minden eddiginél nagyobb durranásnak ígérkezik a Forza Horizon 6, amelyben ezúttal Japán vadregényes vidékein, városaiban, hegyeiben és tengerpartjain száguldozhatunk, méghozzá a valaha volt legnagyobb választékkal...

csütörtök 21:46

A Yakuza-sorozat eredettörténete: ilyen lesz a Stranger Than Heaven

🗿 Az RGG Studio legújabb játéka, a Különösebb a mennyországnál (Stranger Than Heaven) a 20...

csütörtök 21:34

A kontextus nélkül könnyen összeomlik az MI – így orvosolható

Ilyen eset például, amikor a vállalat abban reménykedik, hogy a legmodernebb MI-modell végre áttörést hoz: precíz, személyre szabott eredményeket vár tőle – de ehelyett egységes, sablonos vagy akár teljesen irreleváns válaszokat kap...

csütörtök 21:01

Az XRP 1,42 dollár alá csúszott: kitörést lesnek a kereskedők

Miután több napon át próbált 1,45 USD (kb. 535 HUF) felett maradni, az XRP elbukott, és hirtelen, 25%-os visszaeséssel 1,42 USD (kb...

csütörtök 20:57

Az iráni hekkerek zsarolóvírus-kampánnyal adatokat lopnak a Microsoft Teamsen

Érdekes fejlemény, hogy államilag támogatott iráni hekkerek egyre kifinomultabb módszerekkel támadnak, és közben mindent megtesznek azért, hogy álcázzák valódi szándékaikat...

csütörtök 20:46

Az Anthropic szkennerei mindent átengedtek: a kártékony kód tesztfájllal jutott be

⚠ Hétköznapi helyzet fejlesztőknél: fut egy Anthropic Skill-szkenner, amely átvizsgálja a ClawHubról vagy a skills...

csütörtök 20:23

A 700 millió dolláros migráció: a Solv Protocol Chainlinkre vált LayerZeróról

Erre utal többek között az, hogy a Solv Protocol több mint 700 millió dollár, vagyis mintegy 255 milliárd forint értékű tokenizált bitcoint (SolvBTC, xSolvBTC) visz át a Chainlink CCIP-jére, miután komoly biztonsági problémák merültek fel a LayerZero hídjával kapcsolatban...

csütörtök 20:13

A fertőzött hajó közeleg: patkányvírus-pánik Tenerifén

🚜 Jól mutatja a helyzetet, hogy a Kanári-szigeteken élők pánikban várják a patkányvírussal fertőzött óceánjárót, amely vasárnap hajnalban érkezik Tenerife partjaihoz...

csütörtök 20:01

A szomszéd pár porrá égette a betévedt drónt

Egy floridai házaspár igazán sajátos módon oldotta meg az udvarukra tévedt drón ügyét: egyszerűen bedobták a tűzrakóba, és elégették a 440 ezer forintot érő szerkezetet...

csütörtök 19:45

Az arany kardhüvely Norvégiában: egy elit harcos 1500 éves áldozata?

Vizsgálják, hogyan kerülhetett egy 1500 éves, aranyból készült kardhüvelydísz egy kidőlt fa alá Norvégia délnyugati részén...

csütörtök 19:34

Már készül a Star Fox 64 újabb remake-je Nintendo Switch 2-re

🚀 A Nintendo idén nyáron újabb bőrt húz le a legendás Star Fox 64-ről: a Star Fox legújabb verziója a Switch 2 exkluzív játékaként érkezik, teljesen újratervezett látványvilággal és karakterdizájnnal, azonban a pályák felépítése változatlan marad...

csütörtök 19:25

A kripto mélyén: ásít a piac, épít az okospénz

A kriptovalutapiac jelenleg nyugalmasnak tűnik, nagyobb emelkedések nélkül, de a felszín alatt jelentős átalakulás zajlik...

csütörtök 19:13

A hantavírus tombol: halálesetek és pánik a luxushajón

😷 Különösen igaz ez akkor, ha egy egzotikus hajóút váratlanul vírusveszélyes rémálommá válik...

csütörtök 18:56

Az elveszett Franklin-expedíció újabb áldozatait azonosították: hogyan kerestek menedéket

180 év telt el a Franklin-expedíció tragédiája óta, de a kanadai sarkvidéken kihűlésben és éhezésben elhunyt tengerészek közül most újabb négyet sikerült azonosítani genetikai elemzések révén...

csütörtök 18:45

A Kalshi 1 milliárdot húzott be, 22 milliárdot ér?

💰 A befektetési világ fenekestül felfordult, mióta a Kalshi bejelentette, hogy 1 milliárd dollárnyi friss tőkét vont be, így a céget 22 milliárd dollárra értékelték...

csütörtök 18:34

Az igazi csavar: a „negatív” finanszírozás bikás a bitcoinnak

💸 Erősen megoszlanak a vélemények a bitcoin négyéves ciklusainak jelentőségéről, miközben az év végi árfolyam-becslések is igen széles sávban mozognak – van, aki nem vár új csúcsot, mások akár 54–90 millió forintot is elképzelhetőnek tartanak...

csütörtök 17:46

A kerozinhiány árnyéka vetül Európára a nyári szezon előtt

⛽ Európa repterei egyre nagyobb kihívások elé néznek, ahogy közeledik a nyári vakáció időszaka...

csütörtök 16:56

Az MI-re vált a Core Scientific: 208 millió dollárnyi bitcoint eladott

Az egykori bitcoinbányász-óriás Core Scientific már nem a kriptapiacon látja a jövőjét...

csütörtök 16:45

Az MI DJ végre jön: a Spotify Európában is elindítja

Évekig tartó várakozás után a Spotify-használók végre megszabadulnak az egyik legbosszantóbb hiányosságtól: az MI DJ mostantól újabb országokban is elérhető...

csütörtök 16:35

A Google új AI-ja Redditről és közösségi médiából gyűjt szakértői tippeket?

🔍 A Google új keresőeszköze röviden összefoglalja a Redditről és más közösségi médiából származó tanácsokat: az úgynevezett „Szakértői tanácsok” (Expert Advice) panel előnézetben mutatja a nyilvános online beszélgetések és egyéb források nézőpontjait...

csütörtök 16:23

A nagy bitcoin-kitörés elmaradt – a történelem óvatosságra int

Az elmúlt napokban a bitcoin árfolyama közel járt ahhoz, hogy áttörje a régóta figyelt 200 napos egyszerű mozgóátlag szintjét, de végül 81 000 dollár környékére húzódott vissza...

csütörtök 16:13

Az Andes-vírus, az egyetlen emberről emberre terjedő hantavírus, lecsapott az óceánjárón

Az Atlanti-óceánon haladó MV Hondius nevű luxushajón nyolc ember fertőződött meg hantavírussal, közülük három meghalt, és többen továbbra is orvosi kezelésre szorulnak...

csütörtök 16:02

Az amerikai részvénypiaci rali a mánia küszöbén?

A tőzsde történetének egyik legsodróbb árfolyam-emelkedése új csúcsokra repítette a részvényeket...

csütörtök 15:56

A Bitcoin nyeri az intézményi befektetőkért vívott háborút

Ebből következően érdemes megérteni, hogy a befektetési szféra szemében egyre fontosabbá válik a biztonság...

csütörtök 15:45

Az új hormonterápia megálljt parancsol a veszélyes, korral gyűlő hasi zsírnak

Az életkor előrehaladtával a test zsíreloszlása jelentősen átalakul. A bőr alatti, úgynevezett szubkután zsír önmagában még hasznos is, viszont a zsigeri zsír már komoly egészségügyi kockázatot jelent...

csütörtök 15:34

Az altcoinok szárnyalnak, a bitcoin és az ether lejön a heti csúcsról

A hét derekán alaposan átrendeződött a kriptovaluta-piac, amikor az alternatív tokenek (altcoinok) váratlanul túlszárnyalták a vezető szereplőket...