2025. 03. 18., 19:05

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót
Megjelent egy új Google MI modell, amely képes szöveges utasítások alapján könnyedén képeket készíteni vagy szerkeszteni – mindezt egy csevegőrobot-beszélgetés részeként. Az eredmények ugyan nem tökéletesek, de valószínű, hogy a közeljövőben mindenki képes lesz ilyen módon manipulálni a képeket.

Nem csak vízjelek eltávolítására alkalmas

A múlt szerdán a Google elérhetővé tette a Gemini 2.0 Flash natív képgeneráló képességet. Az új kísérleti funkciót most már bárki használhatja a Google Chat GPT-ben. A korábban csak tesztelők számára elérhető, múlt december óta fejlesztett technológia egyetlen MI modellben egyesíti mind a szöveg-, mind a képfeldolgozási képességeket. Az új modell, a „Gemini 2.0 Flash (Képgenerálás) Kísérleti” kezdetben nem keltett nagy figyelmet, ám az elmúlt napokban egyre több visszhangot kapott, mivel például vízjelek eltávolítására is alkalmas – bár nem hibátlanul, és némi képminőség-romlás kíséretében.

A Gemini 2.0 Flash képes tárgyakat hozzáadni vagy eltávolítani, megváltoztatni a hátteret, a megvilágítást, a képszöget, valamint képeket nagyítani vagy kicsinyíteni. Emellett számos más átalakítást is végezhet – az eredmények sikere azonban nagymértékben függ a témától, a stílustól és az adott képtől.

Érdekes módon az OpenAI GPT-4 képes lenne natív képkimenetek generálására is (Greg Brockman, az OpenAI elnöke utalt erre tavaly a Twitteren), de a cég még nem tette elérhetővé a valódi többmodális képkimeneti képességet. Ennek oka valószínűleg az, hogy a valódi többmodális képkimenet rendkívül számításigényes. Minden egyes bevitt vagy generált kép tokenekből áll, amelyek adatként futnak át a képmodellen újra és újra minden egymást követő utasításkor. A szükséges számítási kapacitás és a képzési adatkészletek mérete miatt a képek kimeneti minősége jelenleg nem vetekszik a diffúziós modellekével.

Biztonsági kockázatok

Az OpenAI visszafogottságának másik oka a biztonsági kockázatokban keresendő: ahogyan a hangalapú többmodális modellek képesek egy rövid hangmintából valakinek a beszédét szintetizálni, a többmodális képkimeneti modellek hasonló módon képesek meggyőzően meghamisítani a vizuális médiát. Megfelelő képzési adatokkal és számítási erőforrásokkal a káros deepfake-ek és képmanipulációk gyártása is könnyebbé válhat.

A társalgó képszerkesztési támogatás lehetővé teszi a felhasználók számára, hogy természetes nyelvi párbeszéd révén, egymást követő utasításokat adva finomítsák a képeket. Mondhatod neki, mit szeretnél eltávolítani, hozzáadni vagy megváltoztatni, és ő megpróbálja elvégezni a kért módosításokat. Bár messze nem tökéletes, ez egy ígéretes lépés a natív képszerkesztési képességek fejlesztésében.


Kísérleti eredmények

A Gemini Flash 2.0-t egy sor nem hivatalos MI képszerkesztési tesztnek vetettük alá. Például eltüntettünk egy nyulat egy füves udvar képéről. Eltávolítottunk egy csirkét is egy rendetlen garázsból. A Gemini magától kitölti a hiányzó háttérélemet a legjobb tippje alapján. Itt már nincs szükség manuális klónecsetekre – vigyázz, Photoshop!

Ezen túlmenően megpróbáltunk szintetizált objektumokat is hozzáadni képekhez. Például egy UFO-t helyeztünk egy fotóra, amelyet a szerző készített egy repülőgép ablakából. Aztán megpróbáltunk hozzáadni egy Sasquatch-ot és egy kísértetet is. Bár az eredmények nem voltak valószerűek, figyelembe kell venni, hogy a modell képzéséhez viszonylag korlátozott képadatkészletet használtak.

Ezután egy videojáték-karaktert adtunk egy Atari 800 képernyője fotójához (például a Wizard of Wor játékból), amely talán a legrealisztikusabb eredményt produkálta. A Gemini hozzáadott CRT képernyővonalakat, amelyek megdöbbentően jól illeszkedtek a monitor jellemzőihez.

Vízjelek eltávolítása és egyéb kreatív lehetőségek

A Gemini képes torzítani egy képet különböző módon, például “kizoomolni” egy képből egy fiktív környezetbe, vagy egy régi EGA-palettás karaktertestbe helyezni azt. És igen, vízjeleket is eltávolíthatsz vele. Kipróbáltuk egy Getty Images vízjel eltávolítását, és bár sikerült, az eredeti képhez viszonyítva az eredmény elmaradt a részletesség és felbontás tekintetében. Ha azonban vizuálisan el tudod képzelni, hogyan nézne ki a kép vízjel nélkül, az MI modell is képes valamilyen szinten rekonstruálni azt.

Végül teszteltük a Gemini-t azzal, hogy egy barbár karakter melletti tévékészüléket generáltattunk. Eredetileg hiányzott a CRT tévé a képből, mi pedig kértünk egyet – és nem álltunk meg itt, még fel is gyújtottuk a tévét a kedvünk szerint.

Jövőbeli lehetőségek

A Gemini 2.0 Flash ugyan nem nyújt kifogástalan minőségű képeket, de a használatához semmilyen szerkesztési tudás nem szükséges, csak annyi, hogy begépeld a kéréseidet. Az Adobe Photoshop már most lehetőséget biztosít az MI-alapú képmanipulációra a DALL-E segítségével, de az élmény nem annyira természetes, mint a Gemini esetében. Az Adobe a jövőben talán integrál egy ennél beszédesebb, MI-alapú képszerkesztési eszközt is.

A többmodális kimenetek új lehetőségeket nyitnak meg. Például a Gemini 2.0 Flash alkalmas lehet interaktív grafikus játékokra vagy koherensen illusztrált történetek generálására, melyeknél az egyes képek fenntartják a karakterek és környezetük folytonosságát. Habár a technológia távol áll a tökéletestől, az ilyesmi új dimenziókat nyit az MI asszisztensek terén.

Kezdeti korlátok

Minden hiányossága ellenére a Gemini 2.0 Flash áttörést jelent a többmodális képkimenetek történetében, és megmutatja, mi válhat lehetségessé a technológia fejlődésével. Képzeljük el 10 év múlva azt a világot, ahol egy kifinomult MI egyetlen rendszerként képes szövegeket, képeket, hangot, videót, 3D grafikát és interaktív élményeket létrehozni – gyakorlatilag egy Star Trek-szerű holofedélzetet anyagreplikáció nélkül.

Persze még mindig gyerekcipőben járnak ezek a többmodális képkimenetek vagy szerkesztések. A Gemini 2.0 Flash egy kisebb MI modell, amely gyorsabban és olcsóbban futtatható, mivel nem használta fel az internet teljes adatkészletét. A Google a Gemini-t válogatott és részben szintetikus adatok alapján képezte ki, így a modell tudása korlátozott, és maga a Google is elismeri, hogy adatkészletük „széles, de nem teljes”.

Ez egy udvarias megfogalmazása annak, hogy a kimenet jelenleg nem tökéletes – de rengeteg lehetőség van a további fejlődésre. Ha a folyamat akár csak részben hasonlít a diffúzióalapú MI képgenerátorok, mint a Stable Diffusion vagy a Midjourney fejlődésére, akkor a többmodális képkimenet minősége hamarosan ugrásszerűen javulhat. Ideje felkészülni egy teljesen átalakult, folyamatosan formálódó médiarealitásra.

2025, adminboss, arstechnica.com alapján

Legfrissebb posztok

MA 09:49

A MI-vezérelt műkar csak akkor a tiéd, ha emberi tempóra lassít

Jellemző példa erre, hogy egy MI-vezérelt robotkar, amely túl gyorsan mozog, kifejezetten nyugtalanító lehet, míg a túl lassú mozgás esetlennek és haszontalannak tűnik...

MA 09:42

A HIV legyőzhető-e mesterséges intelligenciával és DNS-origamival?

🧠 Egy új típusú védőoltás, amelyet precízen hajtogatott DNS-ből készítettek – amelyet „DNS-origaminak” hívnak –, egereken végzett kísérletek szerint sokkal erősebb immunválaszt váltott ki a HIV ellen, mint a hagyományos, fehérjealapú oltások...

MA 09:33

Az óriási adatlopás megbénította Románia olajvezeték-hálózatát

⚠ Románia olajvezeték-hálózatát üzemeltető Conpet S.A.-t múlt héten kibertámadás érte: a Qilin nevű zsarolóvírus-csoport közel 1 TB bizalmas adatot lopott el a cégtől...

MA 09:25

A filléres 10G-s hálózati kártya, ami nagyot szól

A YuanLey AQC113-X1 10GBASE-T PCIe hálózati kártya azok számára ideális választás, akik gyors, mégis pénztárcabarát megoldást keresnek PC-jük vagy szerverük bővítéséhez...

MA 09:19

Az új Chrome-korszak: MI-asszisztensek lepik el a webet

A Google és a Microsoft közös fejlesztése, a Web Model Context Protocol (WebMCP) mostantól elérhető a Chrome 146 Canary fejlesztői változatában, új korszakot nyitva a mesterséges intelligencia (MI) ügynökök és a weboldalak kapcsolatában...

MA 09:09

Az elefántok rejtett szuperérzéke: a rugalmas, tapintó bajszuk

Lényeges, hogy az elefánt ormánya egyszerre dönti fel a fákat, majd pár mozdulattal képes összegyűjteni a lehullott ágakat...

MA 09:03

Az MI forradalmasítja a matematikát – vagy mégsem?

Ebből következően érdemes megérteni, hogy az utóbbi időszakban az MI-alapú nagy nyelvi modellek (LLM-ek) hogyan kezdik átalakítani a matematikai problémamegoldást...

MA 08:57

A világ új pénze lehet az arany?

Az arany ára az elmúlt hónapban unciánként 5300 dollárt (közel 1,9 millió forint) is elérte, miután Donald Trump elnök szigorú külpolitikája és vámfenyegetései bizonytalanságot keltettek, a befektetők pedig menedékeszközökbe menekültek...

MA 08:50

Az OpenAI új MI-je száguld a kódírásban – Nvidia nélkül

Az OpenAI most először hozott forgalomba olyan MI-modellt, amely nem Nvidia-hardveren fut...

MA 08:34

Az Achilles-ín fájdalmának rejtett oka végre leleplezve

Az Achilles-ín fájdalma, a teniszkönyök, az úszóváll és az ugrótérd nemcsak a fiatal sportolókat, hanem az idősebbeket is érinti...

MA 08:18

A 60 ezer éves vadásztrükk: az első mérgezett nyílhegyek

Hatvanezer évvel ezelőtt az afrikai emberek már mesterien alkalmazták a természet vegyületeit...

MA 08:02

Egy üstökösről szabadultak el az élet építőkövei

🚀 Első pillantásra úgy tűnt, hogy egy újabb titokzatos üstökös húz el Földünk mellett, azonban a NASA SPHEREx-űrtávcsöve meglepő felfedezést tett...

MA 07:58

Az aszteroida, ami átírhatja az élet születésének történetét

A NASA OSIRIS-REx missziója 2023-ban ért földet a Bennuról származó mintákkal, és a kutatók megerősítették, hogy a 4,6 milliárd éves kövek aminosavakat tartalmaznak...

MA 07:49

Az oroszok lelövik a WhatsAppot és a Telegramot: jön a MAX kora?

💥 Oroszország újabb szintre emelte az internetes cenzúrát: napok alatt blokkolta a WhatsAppot és a Telegramot...

MA 07:41

Az öregedő agy ellenszere: egy fehérje visszatekerheti az idő kerekét

Az agy öregedése eddig visszafordíthatatlannak tűnt, most azonban egy új felfedezés reményt hozhat a memória és a tanulás megőrzésére...

MA 07:34

Az új God of War-előzmény megérkezett PS5-ön

A Sony meglepetésként jelentette be februári State of Play bemutatóján a God of War: Sons of Sparta-t, amely már most játszható PlayStation 5-ön...

APP
MA 07:11

APPok, Amik Ingyenesek MA, 2/13

Fizetős iOS appok és játékok, amik ingyenesek a mai napon...

MA 07:09

Az önvezető autók Achilles-sarka: a kézzel csukódó ajtó

🚗 Miközben a Waymo önvezető autói már hat amerikai nagyvárosban szállítanak utasokat, a jövő még mindig komikus problémákkal küzd...

MA 07:02

Az űr törvényeit felrúgó bolygótánc egy törpecsillag körül

🚀 A LHS 1903 nevű hűvös, elhalványult törpecsillag körül négy bolygó kering, amelyek látszólag fejre állítják a bolygórendszerek kialakulásáról alkotott hagyományos elméleteket...

MA 06:57

Az űr számkivetettje: kívül rekedt sziklás bolygót találtak

A csillagászok most egy különös, „fordított” bolygórendszert fedeztek fel, ahol egy sziklás bolygó a szokottnál jóval távolabb kering a csillagtól – ott, ahol egyébként a gázóriások laknának...

MA 06:49

Az Amazon kihátrál: vége a Ring–Flock szövetségnek

Az Amazon tulajdonában lévő Ring kénytelen volt megszüntetni az együttműködését a Flock Safety-vel, miután felháborodást váltott ki a lakók és a felhasználók körében...

MA 06:41

A Figma már a Google Chatben – kattints, és tervezz azonnal!

A Google Chat-felhasználók számára mostantól elérhető a Figma-integráció, amellyel könnyedén előnézhetik a Figma-fájlokat, kezelhetik a meghívókat és válaszolhatnak a hozzászólásokra közvetlenül az üzenetküldő alkalmazásban...

MA 06:34

Jön az Android 17: ezek a legnagyobb újdonságok

Hamarosan érkezik az Android 17, bár az első béta megjelenése váratlanul csúszott...

MA 06:26

Az Nvidia nagy dobása: nyolcszor olcsóbb LLM-inferencia

Az Nvidia kutatói forradalmian új eljárást dolgoztak ki, amely akár nyolcszorosára csökkenti a nagy nyelvi modellek (LLM) memóriaköltségeit anélkül, hogy az algoritmus pontossága romlana...

MA 06:17

A Marvel’s Spider-Man 2 végre megérkezett a PS Plusra

A februári PS Plus Game Catalog legnagyobb dobása a Marvel’s Spider-Man 2, amely végre elérhető lesz a szolgáltatásban február 17-től...

MA 06:06

Történelmi események a mai napon (Február 13.)

Február 13-a tele van sorsfordító pillanatokkal: véget ért Budapest ostroma, Franciaország nukleáris hatalommá vált, Tibet függetlenséget hirdetett, az égbolton pedig “gyémántot” találtak Lucy néven...

MA 06:01

Itt a YouTube az Apple Vision Pro-n – Jönnek a Google-appok?

Két év várakozás után végre megjelent a YouTube hivatalos alkalmazása az Apple Vision Pro-n...

csütörtök 21:37

Milliók adatai veszélyben: súlyos hiba egy népszerű WordPress-bővítményben

A WPvivid Backup & Migration WordPress-bővítmény, amelyet több mint 900 000 weboldalon használnak, súlyos biztonsági hibával küzd...

APP
csütörtök 07:11

APPok, Amik Ingyenesek MA, 2/12

Fizetős iOS appok és játékok, amik ingyenesek a mai napon...