2025. 03. 18., 19:05

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót

A Google új AI-ja egy dörzsölésre varázsol: amatőrből Photoshop varázslót
Megjelent egy új Google MI modell, amely képes szöveges utasítások alapján könnyedén képeket készíteni vagy szerkeszteni – mindezt egy csevegőrobot-beszélgetés részeként. Az eredmények ugyan nem tökéletesek, de valószínű, hogy a közeljövőben mindenki képes lesz ilyen módon manipulálni a képeket.

Nem csak vízjelek eltávolítására alkalmas

A múlt szerdán a Google elérhetővé tette a Gemini 2.0 Flash natív képgeneráló képességet. Az új kísérleti funkciót most már bárki használhatja a Google Chat GPT-ben. A korábban csak tesztelők számára elérhető, múlt december óta fejlesztett technológia egyetlen MI modellben egyesíti mind a szöveg-, mind a képfeldolgozási képességeket. Az új modell, a „Gemini 2.0 Flash (Képgenerálás) Kísérleti” kezdetben nem keltett nagy figyelmet, ám az elmúlt napokban egyre több visszhangot kapott, mivel például vízjelek eltávolítására is alkalmas – bár nem hibátlanul, és némi képminőség-romlás kíséretében.

A Gemini 2.0 Flash képes tárgyakat hozzáadni vagy eltávolítani, megváltoztatni a hátteret, a megvilágítást, a képszöget, valamint képeket nagyítani vagy kicsinyíteni. Emellett számos más átalakítást is végezhet – az eredmények sikere azonban nagymértékben függ a témától, a stílustól és az adott képtől.

Érdekes módon az OpenAI GPT-4 képes lenne natív képkimenetek generálására is (Greg Brockman, az OpenAI elnöke utalt erre tavaly a Twitteren), de a cég még nem tette elérhetővé a valódi többmodális képkimeneti képességet. Ennek oka valószínűleg az, hogy a valódi többmodális képkimenet rendkívül számításigényes. Minden egyes bevitt vagy generált kép tokenekből áll, amelyek adatként futnak át a képmodellen újra és újra minden egymást követő utasításkor. A szükséges számítási kapacitás és a képzési adatkészletek mérete miatt a képek kimeneti minősége jelenleg nem vetekszik a diffúziós modellekével.

Biztonsági kockázatok

Az OpenAI visszafogottságának másik oka a biztonsági kockázatokban keresendő: ahogyan a hangalapú többmodális modellek képesek egy rövid hangmintából valakinek a beszédét szintetizálni, a többmodális képkimeneti modellek hasonló módon képesek meggyőzően meghamisítani a vizuális médiát. Megfelelő képzési adatokkal és számítási erőforrásokkal a káros deepfake-ek és képmanipulációk gyártása is könnyebbé válhat.

A társalgó képszerkesztési támogatás lehetővé teszi a felhasználók számára, hogy természetes nyelvi párbeszéd révén, egymást követő utasításokat adva finomítsák a képeket. Mondhatod neki, mit szeretnél eltávolítani, hozzáadni vagy megváltoztatni, és ő megpróbálja elvégezni a kért módosításokat. Bár messze nem tökéletes, ez egy ígéretes lépés a natív képszerkesztési képességek fejlesztésében.


Kísérleti eredmények

A Gemini Flash 2.0-t egy sor nem hivatalos MI képszerkesztési tesztnek vetettük alá. Például eltüntettünk egy nyulat egy füves udvar képéről. Eltávolítottunk egy csirkét is egy rendetlen garázsból. A Gemini magától kitölti a hiányzó háttérélemet a legjobb tippje alapján. Itt már nincs szükség manuális klónecsetekre – vigyázz, Photoshop!

Ezen túlmenően megpróbáltunk szintetizált objektumokat is hozzáadni képekhez. Például egy UFO-t helyeztünk egy fotóra, amelyet a szerző készített egy repülőgép ablakából. Aztán megpróbáltunk hozzáadni egy Sasquatch-ot és egy kísértetet is. Bár az eredmények nem voltak valószerűek, figyelembe kell venni, hogy a modell képzéséhez viszonylag korlátozott képadatkészletet használtak.

Ezután egy videojáték-karaktert adtunk egy Atari 800 képernyője fotójához (például a Wizard of Wor játékból), amely talán a legrealisztikusabb eredményt produkálta. A Gemini hozzáadott CRT képernyővonalakat, amelyek megdöbbentően jól illeszkedtek a monitor jellemzőihez.

Vízjelek eltávolítása és egyéb kreatív lehetőségek

A Gemini képes torzítani egy képet különböző módon, például “kizoomolni” egy képből egy fiktív környezetbe, vagy egy régi EGA-palettás karaktertestbe helyezni azt. És igen, vízjeleket is eltávolíthatsz vele. Kipróbáltuk egy Getty Images vízjel eltávolítását, és bár sikerült, az eredeti képhez viszonyítva az eredmény elmaradt a részletesség és felbontás tekintetében. Ha azonban vizuálisan el tudod képzelni, hogyan nézne ki a kép vízjel nélkül, az MI modell is képes valamilyen szinten rekonstruálni azt.

Végül teszteltük a Gemini-t azzal, hogy egy barbár karakter melletti tévékészüléket generáltattunk. Eredetileg hiányzott a CRT tévé a képből, mi pedig kértünk egyet – és nem álltunk meg itt, még fel is gyújtottuk a tévét a kedvünk szerint.

Jövőbeli lehetőségek

A Gemini 2.0 Flash ugyan nem nyújt kifogástalan minőségű képeket, de a használatához semmilyen szerkesztési tudás nem szükséges, csak annyi, hogy begépeld a kéréseidet. Az Adobe Photoshop már most lehetőséget biztosít az MI-alapú képmanipulációra a DALL-E segítségével, de az élmény nem annyira természetes, mint a Gemini esetében. Az Adobe a jövőben talán integrál egy ennél beszédesebb, MI-alapú képszerkesztési eszközt is.

A többmodális kimenetek új lehetőségeket nyitnak meg. Például a Gemini 2.0 Flash alkalmas lehet interaktív grafikus játékokra vagy koherensen illusztrált történetek generálására, melyeknél az egyes képek fenntartják a karakterek és környezetük folytonosságát. Habár a technológia távol áll a tökéletestől, az ilyesmi új dimenziókat nyit az MI asszisztensek terén.

Kezdeti korlátok

Minden hiányossága ellenére a Gemini 2.0 Flash áttörést jelent a többmodális képkimenetek történetében, és megmutatja, mi válhat lehetségessé a technológia fejlődésével. Képzeljük el 10 év múlva azt a világot, ahol egy kifinomult MI egyetlen rendszerként képes szövegeket, képeket, hangot, videót, 3D grafikát és interaktív élményeket létrehozni – gyakorlatilag egy Star Trek-szerű holofedélzetet anyagreplikáció nélkül.

Persze még mindig gyerekcipőben járnak ezek a többmodális képkimenetek vagy szerkesztések. A Gemini 2.0 Flash egy kisebb MI modell, amely gyorsabban és olcsóbban futtatható, mivel nem használta fel az internet teljes adatkészletét. A Google a Gemini-t válogatott és részben szintetikus adatok alapján képezte ki, így a modell tudása korlátozott, és maga a Google is elismeri, hogy adatkészletük „széles, de nem teljes”.

Ez egy udvarias megfogalmazása annak, hogy a kimenet jelenleg nem tökéletes – de rengeteg lehetőség van a további fejlődésre. Ha a folyamat akár csak részben hasonlít a diffúzióalapú MI képgenerátorok, mint a Stable Diffusion vagy a Midjourney fejlődésére, akkor a többmodális képkimenet minősége hamarosan ugrásszerűen javulhat. Ideje felkészülni egy teljesen átalakult, folyamatosan formálódó médiarealitásra.

2025, adminboss, arstechnica.com alapján

Legfrissebb posztok

MA 16:34

A csillogás és égés: te döntesz!

💫 Bámulatos részletek derültek ki a közelgő sztáresküvőről, amely már most mindenkit lázba hoz...

MA 16:23

A meggyilkolt James Handy utolsó filmje határozatlan időre dobozban

🕑 A veterán színész, James Handy számos filmben és sorozatban szerepelt pályafutása során, és egészen idén nyárig még egy utolsó projekten dolgozott volna, mielőtt barátnője otthonában meggyilkolták...

MA 16:12

Az olasz tinik római villát találnak, a Google szúnyoginváziót indít

🏠 Megemlíthető továbbá, hogy a tudományos világ a héten igazán meglepő, évezredek óta rejtőző titkokra bukkant...

MA 15:12

A világ legbájosabb hűtőmágnese: ez a mini E Ink képkeret

📷 Nem mindennapi látvány, amikor a jól megszokott hűtőmágnesek mellé valami igazán újszerű csatlakozik...

MA 15:01

A 60 Minutes újabb botránya: bizonytalan a legendás műsor jövője

📺 Az amerikai televíziózás egyik legtöbbet díjazott műsora, a 60 Minutes az elmúlt napokban példátlan felforduláson ment keresztül...

MA 14:57

A Bloodlines 2 záró DLC-je hozza, ami alapból hiányzott: kardpárbaj, kétpisztolyos harc

🗡 Vámpír: A Maszkabál – Vérvonalak 2 (Vampire: The Masquerade – Bloodlines 2) hosszú és zűrzavaros fejlesztési ciklusának végére ért...

MA 14:45

A stabil VPN-t találni egyre nehezebb: Kína fokozza a szigort

Habár korábban a VPN-használat egyfajta bűvészmutatványnak számított Kínában, mára a helyzet még szigorúbbá vált...

MA 14:35

Az Nvidia új chipje és a hét legnagyobb techhírei

Közeledik az év egyik legjobban várt eseménye, az Apple fejlesztői konferenciája, ahol komoly szoftverfrissítéseket és a teljesen megújult Sirit várhatjuk...

MA 14:23

A kisbefektetők eladják a bitcoint a SpaceX részvénykibocsátásáért?

💰 Erre utal többek között az, hogy a SpaceX rekordösszegű, 27 500 milliárd forintos (75 milliárd USD) tőzsdére lépésekor a szokásosnál jóval nagyobb szeletet, akár a részvények 30 százalékát kínálják fel kisbefektetőknek – például a Robinhood, a Fidelity vagy a Charles Schwab platformján keresztül...

MA 13:55

A Zcash-hibát MI-vel leleplező kutató auditlistájára tette a Monerót

Fontos kérdés, hogy mennyire bízhatunk a magánéletet védő kriptovaluták biztonságában. Egy népszerű anonim coin, a Zcash nemrég komoly sebezhetőségen esett át, amit egy tapasztalt biztonsági mérnök MI-modellel fedezett fel...

MA 13:45

A gravitáció erejének rejtélye: miért nem tudjuk pontosan megmérni?

A gravitáció mindennapi tapasztalatunk szerves része – nélküle nem tudnánk a Földön járni, és a Nap sem tartaná pályán a bolygókat...

MA 13:23

A Roland Garros szenzációja: Andreeva–Chwalińska döntő Párizsban

🎾 Párizsban a Roland-Garros vörös salakján két igazi meglepetésember játszik egymás ellen a 2026-os női döntőben: a 19 éves orosz Mirra Andreeva és a lengyel selejtezős, a 24 éves Maja Chwaliska...

MA 13:11

Az újabb 20%-os WLD-zuhanás: Hayes másnap kiszórta a tokent

Különösen igaz ez akkor, ha a kriptovilágban egyetlen tweet is képes felforgatni az árfolyamokat...

MA 13:01

A ’66-os vb-döntő színesben – így nézheted ingyen

Idén igazán felejthetetlen futballünnep vár Angliára: most először teljes hosszában, színesben is visszanézhető lesz a legendás 1966-os világbajnoki döntő...

MA 12:46

A hálószoba új kedvence: ébresztő és légtisztító egyben – Blueair Mini Restful teszt

🛏 Különleges újdonság bukkant fel az éjjeliszekrényeken: a Blueair Mini Restful Sunrise ébresztőóra és légtisztító egyben, ráadásul ébredőfénnyel, így három eszköz helyett csak egynek kell helyet szorítani az ágy mellett...

MA 12:34

A névtelen alak Csillagváros legnagyobb rejtélye

A Csillagváros (Star City) új tudományos-fantasztikus sorozata elrugaszkodik a megszokott űrversenyes tematikától, és egészen sötét, feszültséggel teli irányba halad...

MA 11:02

A LaCie 8big Pro5: 256 TB 8K-hoz, ára is óriási.

Amikor a LaCie 8big Pro5 256 TB-os DAS-t először csatlakoztattam, szinte letaglózott a döbbenetes tárhely: egyetlen egységből hirtelen 256 terabájtnyi közvetlen elérésű tárhely állt rendelkezésre...

MA 10:55

A robotok az ajtóban: Dyson főmérnöke három évet ad

🤖 Érdemes megvizsgálni, milyen áttörések várhatók a háztartási robotok és a mesterséges intelligencia fejlődésében...

MA 10:46

A Bitcoin újra 61 ezer dollár fölé kapaszkodott, $1,6 milliárdos likvidálások után

📈 Péntek éjjel a Bitcoin árfolyama egészen 59 227 dollárig, azaz mintegy 22,2 millió forintig esett vissza, mielőtt ismét emelkedni kezdett, és szombat reggelre az ázsiai piacokon már 61 000 dollár (körülbelül 22,8 millió forint) körül stabilizálódott...

MA 10:37

A kábellopások árát a brit közösségek fizetik meg

🔋 Az egyre növekvő kábel- és fémlopás már súlyos, 220 milliárd forintos veszteséget okoz évente az Egyesült Királyságnak...

MA 10:19

Az indie fejlesztők az algoritmusok helyett 1500 órát vadásztak Bandcampen

🎵 Egy lényeges szempont, hogy a játékzene már régóta nem számít puszta háttérzajnak: sokan már az egyedi hangzásvilág miatt is várnak egy-egy új címet...

APP
MA 09:11

APPok, Amik Ingyenesek MA, 6/6

Fizetős iOS appok és játékok, amik ingyenesek a mai napon.     Risp: Budget & Savings (iPhone/iPad)A Risp egy modern pénzügyi alkalmazás, amely segít rendszerezni és átláthatóvá tenni saját pénzügyeidet...

MA 09:02

Az MI‑ügynökök kora: Copilottal tarol a Microsoft?

A Microsoft legújabb fejlesztései új szintre emelik az MI-ügynökök vállalati felhasználását...

MA 08:54

A Star Trek-ikon Nichelle Nichols családja 4,7 milliárdos kártérítést nyert haláleseti perben

⭐ Nichelle Nichols családja 13 millió dollár (kb. 4,7 milliárd forint) kártérítést nyert jogellenes halál miatti perben, miután a színésznő 2022-ben a New Mexico-i Gila Orvosi Központban elhunyt...

MA 08:46

A 20 cent alá zuhanó ADA mellett forr a Cardano-közösség

Majdnem négy éve nem látott mélységbe zuhant a Cardano natív tokenje, az ADA, miközben a közösség aktivitása szokatlanul magasra hágott...

MA 08:37

A Meta MI-je bárkinek hozzákötötte a helyreállító e‑mailt, a SOC vakon maradt

👁 Ebből következően érdemes megérteni, milyen korszakos problémát okozhat egy rosszul felügyelt MI-alapú ügyfélszolgálat...

MA 08:19

A Hasbro MI-hangja kinyírja a nosztalgiát: Optimus Prime és Mr. Krumplifej

A Hasbro újabb lendülettel lépett be a digitális korszakba: a játékgyártó mostantól interaktív MI-élményekkel ruházza fel legismertebb karaktereit...

MA 08:01

A mesterséges intelligencia leleplezte a vezető kriptóhálózat óriási hibáját – bankok a következők?

Többek között a Zcash hálózatán talált, négy éve meglévő kritikus hiba kavarta fel a kriptovilág állóvizét...

MA 07:55

Az eddigi legerősebb El Niño jön idén, friss előrejelzés szerint

Az év végére példátlan erejű El Niño-jelenség várható – legalábbis az Európai Középtávú Időjárás-előrejelzési Központ friss jelentése szerint...