A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót
Megjelent egy új Google MI modell, amely képes szöveges utasítások alapján könnyedén képeket készíteni vagy szerkeszteni – mindezt egy csevegőrobot-beszélgetés részeként. Az eredmények ugyan nem tökéletesek, de valószínű, hogy a közeljövőben mindenki képes lesz ilyen módon manipulálni a képeket.

Nem csak vízjelek eltávolítására alkalmas

A múlt szerdán a Google elérhetővé tette a Gemini 2.0 Flash natív képgeneráló képességet. Az új kísérleti funkciót most már bárki használhatja a Google Chat GPT-ben. A korábban csak tesztelők számára elérhető, múlt december óta fejlesztett technológia egyetlen MI modellben egyesíti mind a szöveg-, mind a képfeldolgozási képességeket. Az új modell, a „Gemini 2.0 Flash (Képgenerálás) Kísérleti” kezdetben nem keltett nagy figyelmet, ám az elmúlt napokban egyre több visszhangot kapott, mivel például vízjelek eltávolítására is alkalmas – bár nem hibátlanul, és némi képminőség-romlás kíséretében.

A Gemini 2.0 Flash képes tárgyakat hozzáadni vagy eltávolítani, megváltoztatni a hátteret, a megvilágítást, a képszöget, valamint képeket nagyítani vagy kicsinyíteni. Emellett számos más átalakítást is végezhet – az eredmények sikere azonban nagymértékben függ a témától, a stílustól és az adott képtől.

Érdekes módon az OpenAI GPT-4 képes lenne natív képkimenetek generálására is (Greg Brockman, az OpenAI elnöke utalt erre tavaly a Twitteren), de a cég még nem tette elérhetővé a valódi többmodális képkimeneti képességet. Ennek oka valószínűleg az, hogy a valódi többmodális képkimenet rendkívül számításigényes. Minden egyes bevitt vagy generált kép tokenekből áll, amelyek adatként futnak át a képmodellen újra és újra minden egymást követő utasításkor. A szükséges számítási kapacitás és a képzési adatkészletek mérete miatt a képek kimeneti minősége jelenleg nem vetekszik a diffúziós modellekével.

Biztonsági kockázatok

Az OpenAI visszafogottságának másik oka a biztonsági kockázatokban keresendő: ahogyan a hangalapú többmodális modellek képesek egy rövid hangmintából valakinek a beszédét szintetizálni, a többmodális képkimeneti modellek hasonló módon képesek meggyőzően meghamisítani a vizuális médiát. Megfelelő képzési adatokkal és számítási erőforrásokkal a káros deepfake-ek és képmanipulációk gyártása is könnyebbé válhat.

A társalgó képszerkesztési támogatás lehetővé teszi a felhasználók számára, hogy természetes nyelvi párbeszéd révén, egymást követő utasításokat adva finomítsák a képeket. Mondhatod neki, mit szeretnél eltávolítani, hozzáadni vagy megváltoztatni, és ő megpróbálja elvégezni a kért módosításokat. Bár messze nem tökéletes, ez egy ígéretes lépés a natív képszerkesztési képességek fejlesztésében.


Kísérleti eredmények

A Gemini Flash 2.0-t egy sor nem hivatalos MI képszerkesztési tesztnek vetettük alá. Például eltüntettünk egy nyulat egy füves udvar képéről. Eltávolítottunk egy csirkét is egy rendetlen garázsból. A Gemini magától kitölti a hiányzó háttérélemet a legjobb tippje alapján. Itt már nincs szükség manuális klónecsetekre – vigyázz, Photoshop!

Ezen túlmenően megpróbáltunk szintetizált objektumokat is hozzáadni képekhez. Például egy UFO-t helyeztünk egy fotóra, amelyet a szerző készített egy repülőgép ablakából. Aztán megpróbáltunk hozzáadni egy Sasquatch-ot és egy kísértetet is. Bár az eredmények nem voltak valószerűek, figyelembe kell venni, hogy a modell képzéséhez viszonylag korlátozott képadatkészletet használtak.

Ezután egy videojáték-karaktert adtunk egy Atari 800 képernyője fotójához (például a Wizard of Wor játékból), amely talán a legrealisztikusabb eredményt produkálta. A Gemini hozzáadott CRT képernyővonalakat, amelyek megdöbbentően jól illeszkedtek a monitor jellemzőihez.

Vízjelek eltávolítása és egyéb kreatív lehetőségek

A Gemini képes torzítani egy képet különböző módon, például “kizoomolni” egy képből egy fiktív környezetbe, vagy egy régi EGA-palettás karaktertestbe helyezni azt. És igen, vízjeleket is eltávolíthatsz vele. Kipróbáltuk egy Getty Images vízjel eltávolítását, és bár sikerült, az eredeti képhez viszonyítva az eredmény elmaradt a részletesség és felbontás tekintetében. Ha azonban vizuálisan el tudod képzelni, hogyan nézne ki a kép vízjel nélkül, az MI modell is képes valamilyen szinten rekonstruálni azt.

Végül teszteltük a Gemini-t azzal, hogy egy barbár karakter melletti tévékészüléket generáltattunk. Eredetileg hiányzott a CRT tévé a képből, mi pedig kértünk egyet – és nem álltunk meg itt, még fel is gyújtottuk a tévét a kedvünk szerint.

Jövőbeli lehetőségek

A Gemini 2.0 Flash ugyan nem nyújt kifogástalan minőségű képeket, de a használatához semmilyen szerkesztési tudás nem szükséges, csak annyi, hogy begépeld a kéréseidet. Az Adobe Photoshop már most lehetőséget biztosít az MI-alapú képmanipulációra a DALL-E segítségével, de az élmény nem annyira természetes, mint a Gemini esetében. Az Adobe a jövőben talán integrál egy ennél beszédesebb, MI-alapú képszerkesztési eszközt is.

A többmodális kimenetek új lehetőségeket nyitnak meg. Például a Gemini 2.0 Flash alkalmas lehet interaktív grafikus játékokra vagy koherensen illusztrált történetek generálására, melyeknél az egyes képek fenntartják a karakterek és környezetük folytonosságát. Habár a technológia távol áll a tökéletestől, az ilyesmi új dimenziókat nyit az MI asszisztensek terén.

Kezdeti korlátok

Minden hiányossága ellenére a Gemini 2.0 Flash áttörést jelent a többmodális képkimenetek történetében, és megmutatja, mi válhat lehetségessé a technológia fejlődésével. Képzeljük el 10 év múlva azt a világot, ahol egy kifinomult MI egyetlen rendszerként képes szövegeket, képeket, hangot, videót, 3D grafikát és interaktív élményeket létrehozni – gyakorlatilag egy Star Trek-szerű holofedélzetet anyagreplikáció nélkül.

Persze még mindig gyerekcipőben járnak ezek a többmodális képkimenetek vagy szerkesztések. A Gemini 2.0 Flash egy kisebb MI modell, amely gyorsabban és olcsóbban futtatható, mivel nem használta fel az internet teljes adatkészletét. A Google a Gemini-t válogatott és részben szintetikus adatok alapján képezte ki, így a modell tudása korlátozott, és maga a Google is elismeri, hogy adatkészletük „széles, de nem teljes”.

Ez egy udvarias megfogalmazása annak, hogy a kimenet jelenleg nem tökéletes – de rengeteg lehetőség van a további fejlődésre. Ha a folyamat akár csak részben hasonlít a diffúzióalapú MI képgenerátorok, mint a Stable Diffusion vagy a Midjourney fejlődésére, akkor a többmodális képkimenet minősége hamarosan ugrásszerűen javulhat. Ideje felkészülni egy teljesen átalakult, folyamatosan formálódó médiarealitásra.

2025, adminboss, arstechnica.com alapján

Legfrissebb posztok

MA 07:50

Az újabb Balti-tengeri kábelvágás után finn kommandósok szálltak hajóra

Finnországban eddig példátlan akció zajlott le, miután a hatóságok letartóztatták és kihallgatják egy orosz kikötőből érkezett teherhajó két tagját – a gyanú szerint szándékosan megrongáltak egy víz alatti adatátviteli kábelt a Balti-tengeren, és ezzel egész Európát felbolygatták...

MA 07:43

A Broadcom újabb zuhanása: most jött el a beszállás ideje?

Ez a jelenség jól illusztrálható azzal, hogy a félvezetőóriás Broadcom három év alatt 350 százalékot emelkedett az MI-őrületnek köszönhetően, de az utóbbi időszakban a részvény árfolyama visszacsúszott az eddigi csúcsról...

MA 07:36

A BYD veszi át a trónt, zuhanórepülésben a Tesla eladásai

🚩 2025-ben a Tesla globális eladásai 1,63 millió autóra estek vissza, ami 9 százalékos csökkenést jelent az előző évi 1,79 millióhoz képest...

MA 07:29

A gyerekeknek szánt MI-játékok tiltólistára kerülhetnek Kaliforniában

🚫 A kaliforniai szenátusban előterjesztett, országos szinten is úttörő törvényjavaslat megtiltaná, hogy a cégek mesterséges intelligenciával működő chatbotokat építsenek a 12 év alatti gyerekeknek készült játékokba...

MA 07:22

A kiszivárgott jelszavak többmilliárdos kriptólopások lavináját indították el

Tipikus eset, amikor egyetlen biztonsági rés darázsfészket bolygat fel a digitális világban...

MA 07:15

Az okoshűtő, ami helyetted vásárol: megérkezett a GE csodagépe

🧳 A GE legújabb okoshűtője beépített vonalkód-leolvasóval forradalmasítja az élelmiszer-vásárlást. Elég leolvasni a kiürülő termékek vonalkódját, és máris a GE SmartHQ alkalmazás bevásárlólistájára kerülnek, amelyet megoszthatsz családtagjaiddal, vagy szinkronizálhatod az Instacarttal, és házhoz érkezik minden, amire szükséged van...

APP
MA 07:12

APPok, Amik Ingyenesek MA, 1/3

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     NiN10: Nintendo Emulator (iPhone/iPad)A NiN10 egy emulátor alkalmazás, amely iOS eszközökön (iPhone, iPad, Apple Watch) teszi lehetővé klasszikus NES, Famicom Disk System, SuperNES, Game Boy, Game Boy Color és Game Boy Advance játékok futtatását...

MA 07:08

Az LG 2026-os újdonságai a CES-en – nézd élőben!

A koreai óriásvállalat, az LG idén is a megszokott módon indítja a CES 2026 rendezvényt Las Vegasban, és várhatóan nem kíméli a közönséget a vadonatúj, MI-alapú fejlesztésekkel és lenyűgöző televíziókkal...

MA 07:01

A nagy vita: miben más a kereskedés és a befektetés?

📈 A kereskedés és a befektetés közötti legnagyobb különbség első pillantásra az időtáv – a kereskedő gyors haszonszerzésben gondolkodik, míg a befektető évekre, akár évtizedekre tervez...

MA 06:57

Az antibiotikumokon is kifog a baktériumok új túlélési trükkje

💉 Újabb áttörés született a baktériumok antibiotikumokkal szembeni ellenállásának megértésében: kiderült, hogy az eddig ismert „alvó” állapoton túl egy másik, eddig rejtett túlélési módot is képesek aktiválni...

MA 06:50

Az amerikai áramszolgáltatókra vadásznak a kibertámadók

⚡ Egy magát hackernek valló bűnöző azt állítja, hogy feltörte a floridai Pickett and Associates mérnöki céget, amely három nagy amerikai áramszolgáltatót is kiszolgál...

MA 06:43

A Seagate óriásmerevlemeze váratlanul Japánban bukkant fel

Japánban először jelent meg bolti forgalomban a Seagate eddigi legnagyobb kapacitású, 32 TB-os merevlemeze, mindenféle hivatalos bejelentés nélkül...

MA 06:36

A legendásan vékony Pebble Round 2 okosóra visszatér

🕑 A Pebble ismét nagy dobásra készül: nemrég visszahozta kultikus okosóráját, elindította olcsó MI-gyűrűjét, most pedig érkezik a Pebble Round 2...

MA 06:29

Az MI-szemét helyett itt a Microsoft új víziója

🧠 Satya Nadella, a Microsoft vezérigazgatója újabban blogírásba kezdett, hogy megossza gondolatait a cég idei terveiről, és arról, miért érdemes túllépni az MI-szerencsétlenkedés és zsenialitás közötti vitákon...

MA 06:22

Az új PS5-feltörés aranyat érővé teszi a Star Wars: Racer Revenge-et

🔮 A Star Wars Racer Revenge nevű, korábban kevéssé ismert Star Wars-játék ára az egekbe szökött, miután kulcsszerepet kapott a legújabb PlayStation 5 jailbreakben...

MA 06:15

Az év első zombifilmje: tarol a Csendes hullám

💀 Január hagyományosan az a hónap, amikor a mozik üresebbek, a nagy sikerfilmek háttérbe húzódnak...

MA 06:05

Történelmi események a mai napon (Január 3.)

Erős nap a történelemben: Washington győzelme Princetonban, Mussolini diktatúrájának bejelentése és Alaska állammá válása emelkedik ki...

MA 06:02

A kriptósok rémálma: 3 milliárd forint tűnt el a Trust Walletből

🚫 Több mint 2500 Trust Wallet-felhasználó összesen 3 milliárd forint (8,5 millió USD) értékű kriptovalutáját lopták el, miután a böngésző-kiterjesztést novemberben iparági szinten is komoly, Shai-Hulud néven ismert támadás érte...

péntek 20:50

A lázadó ízlelőbimbók: így alakul át az ízlelésed évről évre

Ki ne harapott volna már forró pitébe, majd egy hétig panaszkodott volna a leégetett ízlelőbimbók miatt?..