2024. 12. 22., 18:58

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ

Az OpenAI O3 és O3-mini Modelljei Átgondolnak Minden Választ
Pénteken, az "OpenAI-val töltött 12 nap" nevet viselő programsorozat utolsó napján Sam Altman, az OpenAI vezérigazgatója bejelentette legújabb mesterséges intelligencia "érvelési" modelljeit, az o3-at és az o3-mini-t. Ezek az év elején indított o1 modellek továbbfejlesztett változatai. A vállalat egyelőre nem tervezi azonnali kiadásukat, de már most elérhetővé teszi a modelleket biztonsági tesztelésre és kutatási célokra.
Az új modellek az OpenAI által "private chain of thought"-nak (privát gondolatmenet-lánc) nevezett technológiát használják, amelyben a modell megáll, átgondolja belső folyamatait és előre tervez, mielőtt válaszolna. Ezt "simulated reasoning"-nek (szimulált érvelés, SR) nevezzük, ami az MI egy olyan formája, amely túlmutat az alapszintű nagy nyelvi modelleken (LLM).

Új név és rekordteljesítmény

Az információk alapján az OpenAI az “o3” nevet választotta a modellcsaládnak az “o2” helyett, hogy elkerülje a potenciális védjegyjogi konfliktusokat a brit távközlési szolgáltatóval, az O2-vel. A pénteki élő közvetítés során Altman elismerte cégének névadási hibáit, és így fogalmazott: “Az OpenAI valóban nagyon rossz a névadásban, ezért o3-nak nevezzük.”

Az OpenAI szerint az o3 modell rekordot döntött az ARC-AGI mércén, egy vizuális érvelési teszten, amely 2019-es létrehozása óta veretlen volt. Alacsony számítási kapacitású forgatókönyvekben az o3 75,7%-ot ért el, míg magas számítási kapacitás mellett 87,5%-ot – ezzel elérve az emberi teljesítményhez közeli 85%-os küszöböt.

Kiemelkedő eredmények különböző teszteken

Az OpenAI arról is beszámolt, hogy az o3 96,7%-ot ért el a 2024-es American Invitational Mathematics Examinationon (Amerikai Meghívásos Matematikai Vizsgán), mindössze egy kérdést hibázva el. A modell emellett 87,7%-ot ért el a GPQA Diamond teszten, amely posztgraduális szintű biológia, fizika és kémia kérdéseket tartalmaz. Az EpochAI által készített Frontier Math mércén az o3 a feladatok 25,2%-át oldotta meg, míg más modellek nem haladták meg a 2%-ot.

Az élő közvetítés során az ARC Prize Foundation elnöke így nyilatkozott: “Amikor látom ezeket az eredményeket, át kell értékelnem a világképemet arról, hogy mire képes az MI.”

Az o3-mini változatot, amelyet szintén pénteken jelentettek be, adaptív gondolkodási idő funkcióval látták el, amely alacsony, közepes és magas feldolgozási sebességet kínál. A vállalat szerint a magasabb számítási beállítások jobb eredményeket hoznak. Az OpenAI beszámolt arról, hogy az o3-mini felülmúlja elődjét, az o1-et a Codeforces teszten.

A „simulated reasoning” térnyerése

Az OpenAI bejelentése akkor érkezett, amikor más vállalatok is kifejlesztik saját SR modelljeiket. Ilyen például a Google, amely csütörtökön bejelentette a Gemini 2.0 Flash Thinking Experimental-t (Villám Gondolkodás Kísérleti Verzió). Novemberben a DeepSeek elindította a DeepSeek-R1-et, míg az Alibaba Qwen csapata kiadta a QwQ-t, amit az első “nyílt” alternatívának neveztek az o1-hez képest.

Ezek az új MI modellek a hagyományos LLM-eken alapulnak, de egy csavarral: finomhangolták őket, hogy egyfajta iteratív gondolatmenet-láncot hozzanak létre, ami szinte brutális erővel, futásidőben skálázható módon szimulálja az érvelést. Nem a mesterséges intelligencia modell képzése során próbálnak fejlesztéseket elérni – amelyek az utóbbi időben csökkenő hozamokat mutattak –, hanem a futásidőben alkalmazott technikákkal érnek el jobb teljesítményt.

Az OpenAI először biztonsági kutatók számára teszi elérhetővé az új SR modelleket tesztelési célból. Altman elmondta, hogy a vállalat az o3-mini-t január végén tervezi elindítani, és nem sokkal később követi majd az o3 is.

Legfrissebb posztok

vasárnap 20:56

A gigászi Schrödinger-macska: minden eddiginél nagyobb kvantumállapot

🐈 A kvantumfizika egészen elképesztő kísérlettel bővült: Bécsben kutatóknak sikerült többezeres nátriumatom-klasztert úgy „megosztaniuk”, hogy ez a csoport egyszerre több helyen is tartózkodott – vagyis hatalmas szuperpozícióba került...

vasárnap 20:37

A NAV lecsap a kriptóra – így jelentsd be!

Amikor megjelent a kriptovaluta, sokaknak tetszett az ötlet, hogy nincs mögötte kormány vagy jegybank...

vasárnap 20:19

A legújabb Windows 11-frissítés kék halált hoz?

💻 A Microsoft vizsgálja, miért omlanak össze egyes Windows 11-es gépek a januári biztonsági frissítés telepítése után...

vasárnap 20:01

A mindennapi apróságokkal éveket nyerhetsz az életedhez

Valóban szükség van radikális diétára, napi több óra edzésre és végeláthatatlan zöldségzabálásra, hogy tovább éljünk?..

vasárnap 19:55

Az amerikai Délnyugatot meghódító ősi vadburgonya

Több mint tízezer évvel ezelőtt az amerikai Délnyugat lakói egy kis vadburgonyát, a Four Corners-burgonyát (Four Corners potato, Solanum jamesii) vitték magukkal hosszú vándorlásaik során...

vasárnap 19:38

Az AmpereOne-t is megizzasztó Dynatron W23 hűtő nagytesztje

Míg az Ampere Altra Max processzorhoz számos hűtőopció létezett, az új AmpereOne-hoz már jóval kevesebb az elérhető megoldás...

vasárnap 19:19

Az orosz hackerek új vírusától rettegett a lengyel energiahálózat

⚠ Lengyelország elektromos hálózatát tavaly év végén eddig ismeretlen törlővírus támadta meg, amely valószínűleg orosz állami hackerekhez köthető...

vasárnap 18:57

Az ausztrál emlősök végzete: kóbor macskák és rókák?

🐱 Ausztrália emlősfaunája a világon egyedülálló: a hosszú elszigeteltség olyan fajokat eredményezett, mint a kacsacsőrű emlős, a koala vagy a vombat...

vasárnap 18:37

Az Outlook megint lefagy – a Microsoft villámgyorsan lépett

💥 A Microsoft villámgyors, rendkívüli frissítéseket adott ki szombaton Windows 10, Windows 11 és Windows Server rendszerekhez, miután sokaknál egyszerűen nem indult el a klasszikus Outlook, ha a PST-fájlokat felhőben tárolták, például a OneDrive-on vagy a Dropboxon...

vasárnap 18:20

Az Edison-izzó és a grafén véletlen születésének titkos története

A grafén a jelenleg ismert legvékonyabb anyag: egyrétegű szénatomokból épül fel, hatszögletű rácsban...

vasárnap 18:02

Az a telefon, amelyért Amerika könyörögne: Fairphone 6

Az amerikai okostelefon-piacot szinte teljes egészében az Apple és a Samsung uralja...

vasárnap 17:55

Kitört az e-bike-háború New Jerseyben

New Jersey-ben mostantól minden elektromos kerékpár-tulajdonos a legszigorúbb szabályozással szembesül. Legyen szó akár egy 20 km/h-s, pedálrásegítéses kerékpárról vagy egy motorkerékpár-teljesítményű e-bike-ról, mindenkire ugyanazok a szigorú előírások vonatkoznak: kötelező a regisztráció, a jogosítvány és a biztosítás...

vasárnap 17:37

Az adatvédelem vége? A Microsoft kiadta a titkosítási kulcsokat

Az FBI tavaly bírósági végzéssel kérte a Microsofttól, hogy adja át három laptop titkosítási kulcsait egy olyan csalási ügy vizsgálata miatt, amely a Guam szigetén folyósított COVID–19-munkanélküli-támogatásokat érintette...

vasárnap 17:20

Az MI-óriások davosi összecsapása: egymásnak estek a csúcson

Davos idén alaposan átalakult: a Világgazdasági Fórum korábbi, komoly hangvételű tanácskozását techcégek színesítették meg az MI-forradalom jegyében...

vasárnap 17:02

A mesterséges intelligencia terjed az iskolákban – megéri az árát?

Az MI térhódítása az oktatásban komoly aggodalmakat kelt világszerte. Egy friss, 50 országot és több mint 500 tanárt, diákot, szülőt, oktatási vezetőt és szakértőt bevonó, egy évig tartó globális kutatás eredményei szerint az MI alkalmazásának kockázatai jelenleg felülmúlják az esetleges előnyöket...

vasárnap 16:55

Az aszály soha nem látott ütemben feszíti szét Kelet-Afrikát

Kelet-Afrika éghajlata az elmúlt 5 000 évben jelentősen kiszáradt, és ez a változás arra utal, hogy a kontinens a vártnál gyorsabban szakad szét...

vasárnap 16:37

Vége az ingyenes WhatsAppnak? Jön a fizetős reklámmentesség

💳 Sokan egyetértenek abban, hogy a hirdetések idegesítőek, és a WhatsApp sem kerülte el ezt a sorsot...

vasárnap 16:02

Kudarcot vallott az orosz kibertámadás a lengyel áramhálózat ellen

⚡ Lengyelország villamosenergia-hálózata elleni kibertámadást hiúsítottak meg 2025. december végén. A támadás mögött az orosz állam által támogatott, hírhedt Sandworm nevű hackercsoport állt, amely egy új, pusztító törlővírust, a DynoWipert próbálta bevetni...

vasárnap 15:56

A Sparkli MI-alkalmazás játékosan turbózza fel a gyerekek tanulását

Nemrég komoly figyelmet kapott a Sparkli nevű, MI-alapú oktatási alkalmazás, amelynek három egykori Google-alkalmazott áll a hátterében...

vasárnap 15:38

Az optikai tranzisztorok feltámaszthatják a Moore-törvényt

💡 Neurophos, a texasi MI-chipcég új mércét akar állítani a szuperszámítástechnikában azzal, hogy optikai processzorokat fejleszt, amelyek teljesítménye többszöröse a mai legmodernebb grafikus kártyák teljesítményének – mindezt jóval kisebb energiafelhasználás mellett...

vasárnap 15:19

Az észak-koreai hackerek MI-vel vadásznak a blokklánc-fejlesztőkre

Az észak-koreai Konni (Opal Sleet, TA406) hackercsoport MI által generált, erősen titkosított PowerShell-kártevővel célozza meg a blokklánc-szektor mérnökeit és fejlesztőit...

vasárnap 15:02

Miért nem hódította meg a QD‑OLED már minden nappalit?

Az OLED-technológia az utóbbi években teljesen átalakította a tévépiacot. Az önállóan világító OLED-pixeleknek köszönhetően tökéletes feketét, élénk színeket és erős kontrasztot kapunk...

vasárnap 14:40

A vegán házhozszállítás titkos receptje: 2026 legjobbjai

Vegánként vagy növényi étrendet követőként óriási kihívást jelenthet ízletes, változatos és egészséges készételeket vagy főzős csomagokat találni...

vasárnap 14:19

Az új génkincs lehet a szója túlélésének kulcsa

🥑 A világ szójatermelőit csendes, de komoly ellenség tizedeli: a szója-cisztaképző fonálféreg, amely a gyökereket támadva rontja a terméshozamot, évente komoly veszteséget okozva a gazdáknak...

vasárnap 14:01

A Gmail spamszűrője bedőlt: elárasztanak a promóciók

Az elmúlt napokban jelentősen megnőtt a promóciós e-mailek száma a Gmail-felhasználók beérkező levelei között...

vasárnap 13:55

Tényleg veszélyesek a gyerekekre az önvezető taxik?

Austinban ismét botrányt kavartak a Waymo önvezető autói: a robotaxik többször szabálytalanul előzték meg a diákokat szállító iskolabuszokat...

vasárnap 13:37

Az agyevő amőbák: a következő globális rémálom

Világszerte egyre nagyobb aggodalmat keltenek a szabadon élő amőbák, amelyek a kutatók szerint egyre komolyabb egészségügyi kockázatot jelentenek...

vasárnap 13:20

Az MI-óriás, amelyik még az igazán nagy áttörés előtt áll

🤖 Felmerül a kérdés, hogy kinek érdemes most a technológiai tőzsdéken kutakodnia, amikor a kvantumszámítógépek és a mesterséges intelligencia versenye kiélezettebb, mint valaha...

vasárnap 12:55

A szenzáció: az első európai őselefántcsont-szerszám

🔨 Egy körülbelül 480 ezer éves, háromszögletű eszközre bukkantak az Egyesült Királyság területén, amelyet egy ismeretlen archaikus emberfajta őselefánt csontjából készített...