2025. 03. 18., 19:05

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót
Megjelent egy új Google MI modell, amely képes szöveges utasítások alapján könnyedén képeket készíteni vagy szerkeszteni – mindezt egy csevegőrobot-beszélgetés részeként. Az eredmények ugyan nem tökéletesek, de valószínű, hogy a közeljövőben mindenki képes lesz ilyen módon manipulálni a képeket.

Nem csak vízjelek eltávolítására alkalmas

A múlt szerdán a Google elérhetővé tette a Gemini 2.0 Flash natív képgeneráló képességet. Az új kísérleti funkciót most már bárki használhatja a Google Chat GPT-ben. A korábban csak tesztelők számára elérhető, múlt december óta fejlesztett technológia egyetlen MI modellben egyesíti mind a szöveg-, mind a képfeldolgozási képességeket. Az új modell, a „Gemini 2.0 Flash (Képgenerálás) Kísérleti” kezdetben nem keltett nagy figyelmet, ám az elmúlt napokban egyre több visszhangot kapott, mivel például vízjelek eltávolítására is alkalmas – bár nem hibátlanul, és némi képminőség-romlás kíséretében.

A Gemini 2.0 Flash képes tárgyakat hozzáadni vagy eltávolítani, megváltoztatni a hátteret, a megvilágítást, a képszöget, valamint képeket nagyítani vagy kicsinyíteni. Emellett számos más átalakítást is végezhet – az eredmények sikere azonban nagymértékben függ a témától, a stílustól és az adott képtől.

Érdekes módon az OpenAI GPT-4 képes lenne natív képkimenetek generálására is (Greg Brockman, az OpenAI elnöke utalt erre tavaly a Twitteren), de a cég még nem tette elérhetővé a valódi többmodális képkimeneti képességet. Ennek oka valószínűleg az, hogy a valódi többmodális képkimenet rendkívül számításigényes. Minden egyes bevitt vagy generált kép tokenekből áll, amelyek adatként futnak át a képmodellen újra és újra minden egymást követő utasításkor. A szükséges számítási kapacitás és a képzési adatkészletek mérete miatt a képek kimeneti minősége jelenleg nem vetekszik a diffúziós modellekével.

Biztonsági kockázatok

Az OpenAI visszafogottságának másik oka a biztonsági kockázatokban keresendő: ahogyan a hangalapú többmodális modellek képesek egy rövid hangmintából valakinek a beszédét szintetizálni, a többmodális képkimeneti modellek hasonló módon képesek meggyőzően meghamisítani a vizuális médiát. Megfelelő képzési adatokkal és számítási erőforrásokkal a káros deepfake-ek és képmanipulációk gyártása is könnyebbé válhat.

A társalgó képszerkesztési támogatás lehetővé teszi a felhasználók számára, hogy természetes nyelvi párbeszéd révén, egymást követő utasításokat adva finomítsák a képeket. Mondhatod neki, mit szeretnél eltávolítani, hozzáadni vagy megváltoztatni, és ő megpróbálja elvégezni a kért módosításokat. Bár messze nem tökéletes, ez egy ígéretes lépés a natív képszerkesztési képességek fejlesztésében.


Kísérleti eredmények

A Gemini Flash 2.0-t egy sor nem hivatalos MI képszerkesztési tesztnek vetettük alá. Például eltüntettünk egy nyulat egy füves udvar képéről. Eltávolítottunk egy csirkét is egy rendetlen garázsból. A Gemini magától kitölti a hiányzó háttérélemet a legjobb tippje alapján. Itt már nincs szükség manuális klónecsetekre – vigyázz, Photoshop!

Ezen túlmenően megpróbáltunk szintetizált objektumokat is hozzáadni képekhez. Például egy UFO-t helyeztünk egy fotóra, amelyet a szerző készített egy repülőgép ablakából. Aztán megpróbáltunk hozzáadni egy Sasquatch-ot és egy kísértetet is. Bár az eredmények nem voltak valószerűek, figyelembe kell venni, hogy a modell képzéséhez viszonylag korlátozott képadatkészletet használtak.

Ezután egy videojáték-karaktert adtunk egy Atari 800 képernyője fotójához (például a Wizard of Wor játékból), amely talán a legrealisztikusabb eredményt produkálta. A Gemini hozzáadott CRT képernyővonalakat, amelyek megdöbbentően jól illeszkedtek a monitor jellemzőihez.

Vízjelek eltávolítása és egyéb kreatív lehetőségek

A Gemini képes torzítani egy képet különböző módon, például “kizoomolni” egy képből egy fiktív környezetbe, vagy egy régi EGA-palettás karaktertestbe helyezni azt. És igen, vízjeleket is eltávolíthatsz vele. Kipróbáltuk egy Getty Images vízjel eltávolítását, és bár sikerült, az eredeti képhez viszonyítva az eredmény elmaradt a részletesség és felbontás tekintetében. Ha azonban vizuálisan el tudod képzelni, hogyan nézne ki a kép vízjel nélkül, az MI modell is képes valamilyen szinten rekonstruálni azt.

Végül teszteltük a Gemini-t azzal, hogy egy barbár karakter melletti tévékészüléket generáltattunk. Eredetileg hiányzott a CRT tévé a képből, mi pedig kértünk egyet – és nem álltunk meg itt, még fel is gyújtottuk a tévét a kedvünk szerint.

Jövőbeli lehetőségek

A Gemini 2.0 Flash ugyan nem nyújt kifogástalan minőségű képeket, de a használatához semmilyen szerkesztési tudás nem szükséges, csak annyi, hogy begépeld a kéréseidet. Az Adobe Photoshop már most lehetőséget biztosít az MI-alapú képmanipulációra a DALL-E segítségével, de az élmény nem annyira természetes, mint a Gemini esetében. Az Adobe a jövőben talán integrál egy ennél beszédesebb, MI-alapú képszerkesztési eszközt is.

A többmodális kimenetek új lehetőségeket nyitnak meg. Például a Gemini 2.0 Flash alkalmas lehet interaktív grafikus játékokra vagy koherensen illusztrált történetek generálására, melyeknél az egyes képek fenntartják a karakterek és környezetük folytonosságát. Habár a technológia távol áll a tökéletestől, az ilyesmi új dimenziókat nyit az MI asszisztensek terén.

Kezdeti korlátok

Minden hiányossága ellenére a Gemini 2.0 Flash áttörést jelent a többmodális képkimenetek történetében, és megmutatja, mi válhat lehetségessé a technológia fejlődésével. Képzeljük el 10 év múlva azt a világot, ahol egy kifinomult MI egyetlen rendszerként képes szövegeket, képeket, hangot, videót, 3D grafikát és interaktív élményeket létrehozni – gyakorlatilag egy Star Trek-szerű holofedélzetet anyagreplikáció nélkül.

Persze még mindig gyerekcipőben járnak ezek a többmodális képkimenetek vagy szerkesztések. A Gemini 2.0 Flash egy kisebb MI modell, amely gyorsabban és olcsóbban futtatható, mivel nem használta fel az internet teljes adatkészletét. A Google a Gemini-t válogatott és részben szintetikus adatok alapján képezte ki, így a modell tudása korlátozott, és maga a Google is elismeri, hogy adatkészletük „széles, de nem teljes”.

Ez egy udvarias megfogalmazása annak, hogy a kimenet jelenleg nem tökéletes – de rengeteg lehetőség van a további fejlődésre. Ha a folyamat akár csak részben hasonlít a diffúzióalapú MI képgenerátorok, mint a Stable Diffusion vagy a Midjourney fejlődésére, akkor a többmodális képkimenet minősége hamarosan ugrásszerűen javulhat. Ideje felkészülni egy teljesen átalakult, folyamatosan formálódó médiarealitásra.

2025, adminboss, arstechnica.com alapján

Legfrissebb posztok

APP
MA 09:12

APPok, Amik Ingyenesek MA, 5/11

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Crazy Caps (iPhone/iPad)Ez a fizika alapú match-3 kirakós játék üdítően új színt visz a műfajba: célunk, hogy három vagy több azonos elemet helyezzünk egymás mellé, miközben a pályák változatos kihívásaival és a szokatlan, kreatív dizájnnal találkozunk...

MA 07:50

A NYT Connections ma is próbára teszi a szókincsedet

💡 Minden hétfőn új kihívást jelent a Connections nevű szókirakó, ahol a feladat négyes csoportokat alkotni közös jellemzők szerint...

MA 07:43

Az amerikai kriptopiac fordulóponton: Miami után új szabályok jönnek

Idén Miamiban, a Consensus 2026 konferencia zárása után minden a digitális eszközök új szabályozási hulláma körül forgott...

MA 07:29

A Team Fortress 2 zombimód, amit elsőre hivatalosnak néznél

Ha gimnazista koromban jelent volna meg a Mann Versus Zombies, valószínűleg sosem érettségiztem volna le...

MA 07:22

Az MI-eszközök mérgezése súlyos vállalati biztonsági rést leplez le

Érdemes megvizsgálni, hogy a vállalati környezetben használt MI-alapú ügynökök hogyan választják ki eszközeiket, és hol rejtőznek a legnagyobb veszélyek...

MA 07:15

A PC Gamer miatt lopják a cipődet a Kingdom Come: Deliverance 2-ben

Mindenki ismeri azt az érzést, amikor egy szerepjátékban furcsa dolgokat produkál a játékvilág, de kevesen gondolták volna, hogy a cipőlopás valaha komoly téma lesz egy fejlesztőcsapat életében...

MA 07:08

Az új őrület: a Hazárdjáték a barátokkal egymilliót fogyott egy hét alatt

Felmerül a kérdés, hogy mi teszi ennyire népszerűvé azokat a játékokat, amelyek lehetőséget adnak arra, hogy közösen bolondozzunk a barátainkkal, anélkül, hogy kimozdulnánk otthonról...

MA 07:01

Az NYT Strands mai feladványa: totális káoszparádé

😵 Megvizsgáljuk, mennyire állítja próbára a játékosokat az NYT Strands mai, 799-es számú kihívása...

MA 06:57

A Roblox AI-val erőltetné a fotórealizmust, a fejlesztők kétkednek

A Roblox az egyszerű grafika világában vált népszerűvé a fiatalabb játékosok körében...

MA 06:51

Az Edifier M90: hangfal, ami kiváltja a komplett hifi-rendszert, mindennel csatlakozik

🎧 Érdekes felvetés, hogy kell-e egy egész arzenál különféle hangfalból, ha létezik egyetlen pár, amely egyszerre képes kiszolgálni a nappali, a tévé, az asztali gép vagy akár a lemezjátszó igényeit...

MA 06:43

Az agyrobbantó mai Quordle: csak a szerencsések boldogultak

Ma reggel sem volt könnyű dolgom a Quordle napi kihívásával: a négy szó együtt mind az öt különböző magánhangzót tartalmazta, ráadásul egyik válaszban sem volt ismétlődő betű, és nem is szerepelt bennük olyan ritka betű, mint a Q, Z, X vagy a J...

MA 06:35

A 2013 óta néma bitcoin-bálna megmozgatott 40 millió dollárnyi BTC-t

Vasárnap egy régóta néma bitcoin-bálna ismét felébredt, és 40 millió dollárnak megfelelő bitcoint utalt át (kb...

MA 06:29

Az utolsó igazán mainstream multiplatform autóverseny-sorozat: tarol a Forza Horizon 6

A Forza Horizon 6 elképesztő sikert aratott már jóval a megjelenés előtt: április elejétől már több mint 500 000 elővásárlásnál tartott, és ez azóta várhatóan duplájára nőtt...

MA 06:22

A Riválisok 2: Forró botrányok, mégis fojtogató az első három rész

🔥 Rutshire mesés és botrányokkal átszőtt világa ismét visszatért, hogy újra elénk tárja a szokásos csábítást, intrikát és könnyed erotikát...

MA 06:05

Történelmi események a mai napon (Május 11.)

Röviden: ezen a napon Kolumbusz Kristóf negyedszer és utoljára útnak indult az Újvilág felé, Spencer Perceval brit miniszterelnököt meggyilkolták, Luxemburg függetlenné vált, az izraeli Mossad ügynökei elfogták Adolf Eichmannt, miközben katasztrófák és háborús lépések rázták meg a világot...

vasárnap 20:46

A kígyók titka: így veszítették el lábaikat az evolúció során

🐍 Hatalmas és egészen apró, mérges és óriáskígyók, surranók és úszók élnek a Föld legkülönbözőbb zugaiban – a kígyók eredetének története ma izgalmasabb, mint valaha...

vasárnap 20:35

A QWOP tervezője nem fejezi be, mégsem törli a Baldur’s Gate 3-at

🎮 Bennett Foddy neve sokaknak ismerősen csenghet: olyan játékok kötődnek a nevéhez, mint a QWOP vagy a Getting Over It, amelyek előszeretettel kínozzák a játékosok türelmét különleges irányításukkal és nehézségükkel...

vasárnap 20:24

A The Sims 3: éld meg a saját történeted!

Fontos kérdés, hogy mit tud nyújtani a The Sims 3 egy évtizeddel az első rész óta: vajon valami forradalmit, vagy csupán csiszoltabb változatot kapunk?..

vasárnap 20:13

Az amerikai FIFA-vb meccseit az iráni konfliktus miatti terrorkockázat fenyegeti

Fontos kérdés, hogy mennyire sikerül biztonságban lebonyolítani azt a 78 mérkőzést, amelyet a tervek szerint az Egyesült Államok 11 nagyvárosában rendeznek majd...

vasárnap 20:01

Az MI-vezérelt kereskedelem kriptóra épül – mondja a PayPal és a Google

A digitális kereskedelem új korszakának hajnalán a legnagyobb technológiai szereplők szerint a kriptovaluta-alapú fizetések jelentik a jövőt...

vasárnap 19:56

A Bored Ape NFT-k visszatérnek: újra kockáztat a kriptópiac

Sokan már temették az NFT-piacot, de a Bored Ape Yacht Club (BAYC) gyűjtemény árfolyama gyors ütemben, egy hónap alatt a duplájára nőtt...

vasárnap 19:45

Az El Clásico, ahol a bajnoki cím a tét

A vasárnapi El Clásico izgalmai ezúttal a Camp Nou stadionjában bontakoznak ki, ahol a Barcelona mindössze egyetlen pontra van attól, hogy bebiztosítsa egymás után a második La Liga-címét...

vasárnap 19:34

A melegedés egyre több jegesmedvét vonz az emberekhez – nem csak a soványakat

Ahogy az Északi-sark egyre gyorsabban melegszik, a jégtakaró korábban olvad el tavasszal, és később képződik újra ősszel...

vasárnap 19:13

Az MI rohadtul nem tudatos, Dawkins

Az utóbbi időben komoly hullámokat keltett Richard Dawkins világhírű biológus kijelentése, miszerint szerinte a mai mesterséges intelligenciák, például Claude vagy ChatGPT, valójában tudatosak...

vasárnap 19:02

Az összehajtható iPhone Ultra keltheti életre a MagSafe-et?

A MagSafe technológiát szinte minden iPhone-tulajdonos szereti, és okkal: kényelmesen rögzítheted vele a telefonodat, vezeték nélkül töltheted, sőt autós tartókhoz és egyéb kiegészítőkhöz csatlakoztathatod...

vasárnap 18:56

Az okostelefont imádjuk, a biztonságra alig költünk

Az amerikaiak ma már jóval többször használják az okostelefonjukat, mint a számítógépüket, mégiscsak kevesen áldoznak pénzt a mobilok védelmére...

vasárnap 18:45

Az új Britney Spears: spirituális út ittas vezetési vádalku után, kígyós fotó

Britney Spears az utóbbi időben egy lelki utazásról számol be, pozitívabb szemlélettel fordulva az élete felé...

vasárnap 18:34

Az élet korán indul: Erika Kirk a korai házasságot hirdeti

💍 Erika Kirk szenvedélyes beszédet mondott a Hillsdale College diplomaosztóján, ahol mintegy ötezer hallgató előtt szólalt fel...

vasárnap 18:23

A parókák hátán festett videojáték-jelenetek életre kelnek

Amikor az ember hajáról van szó, a legtöbben csak a szín vagy a frizura változtatásán gondolkodnak...