Generativní AI pro obrázky, video a kreativní média — Sora, DALL·E, Midjourney, Stable Diffusion a další.
971 článků
Důležitost:Spuštěníon-device multimodal models
EmbeddingGemma 2 sjednocuje text, kód, obrázky, zvuk a video přímo v zařízení
Otevřený model EmbeddingGemma 2 od Googlu mapuje text, kód, obrázky, zvuk i video do jednoho embedding prostoru přímo na zařízení. Vychází pod licencí Apache 2.0 a pro text na telefonu Pixel potřebuje zhruba 191 MB RAM. Zdroj: thenextweb.com
Důležitost:Spuštěnímultimodal embeddings
EmbeddingGemma 2 přináší multimodální embeddingy přímo do zařízení
EmbeddingGemma 2 je označován za nejschopnější model pro multimodální embeddingy přímo na zařízení. Nativně mapuje kombinace textu, obrázků, zvuku a videa do jednoho společného prostoru. Zdroj: blog.google
Důležitost:Zprávamultimodal models
Google rozšiřuje EmbeddingGemma z textu na obrázky, zvuk i video
Google dnes vydal EmbeddingGemma 2, otevřený multimodální embedding model, který je dost malý na to, aby běžel na chytrém telefonu. Navazuje na původní EmbeddingGemma, který uměl pouze text. Zdroj: siliconangle.com
Důležitost:Výzkummultimodal embedding
DeepMind vydal EmbeddingGemma 2, 740M multimodální embedding model na Gemma 4
EmbeddingGemma 2 od Google DeepMind vektorizuje text, kód, obrázky, video i zvuk v jediném modelu o 740 milionech parametrů. Míří na RAG aplikace běžící přímo na zařízení. Zdroj: marktechpost.com
Důležitost:Spuštěnímultimodal search
Google DeepMind uvádí multimodální AI model pro vyhledávání přímo v zařízení
Google DeepMind v úterý spustil EmbeddingGemma 2, open-weight AI model určený k vyhledávání a organizaci textu, obrázků, videa a dalších dat. Je navržen tak, aby běžel přímo na zařízeních. Zdroj: tradingview.com
Důležitost:Zprávaimage generation
Nano Banana 2.1 vychází za poloviční cenu obrázků oproti předchůdci
Google 6. října 2026 uvedl Nano Banana 2.1, model pro generování a úpravu obrázků postavený na Gemini 3.6 Flash. Je dostupný napříč ekosystémem Gemini. Zdroj: unite.ai
Důležitost:Zprávamodel performance
Google: EmbeddingGemma 2 překonává konkurenční modely dvojnásobné velikosti
Google vydal EmbeddingGemma 2, otevřený model se 740 miliony parametrů. Převádí text, obrázky, video, zvuk i kód na vektory a podle Googlu překonává konkurenční embedding modely, které jsou dvakrát větší. Zdroj: the-decoder.com
Důležitost:Výzkummultimodal applications
EmbeddingGemma 2: průvodce pro vývojáře multimodálním vyhledáváním a RAG
Průvodce ukazuje, jak s EmbeddingGemma 2 stavět multimodální vyhledávání a RAG aplikace. Jde o kompaktní otevřený model, který zpracovává text, kód, obrázky, video i zvuk. Zdroj: developers.googleblog.com
Důležitost:ZprávaContent Creation Evolution
Generativní AI přechází od statických obrazů k pohyblivým příběhům
Generativní AI mění způsob, jakým vzniká digitální obsah. Úkoly, které dříve vyžadovaly samostatné nástroje pro generování obrazu, animaci, střih a produkci, se stále častěji slučují do jednotných pracovních postupů. Zdroj: dailyiowan.com
Důležitost:ZprávaMultimodal AI Models
Rho-1 od Reka AI zvládá text, obraz, video i ovládání robotů v jednom modelu
Reka AI představila Rho-1, omni-model s 19 miliardami parametrů. Jediná neuronová síť zpracovává i generuje text, obrázky, video a řídicí povely pro roboty. Zdroj: the-decoder.com
Důležitost:ZprávaAnime Art Creation
Jak postavit AI workflow pro anime: generování, úpravy i animace na jednom místě
PixAI Studio propojuje generování anime obrázků, jejich úpravy, referenční postavy i video animaci v jediném pracovním prostředí. Článek ukazuje, jak tyto kroky spojit do jednoho workflow. Zdroj: worldbusinessoutlook.com
Důležitost:NázorAI Video Challenges
AI video se zlepšuje, ale výběr správného modelu je čím dál těžší
S přibývajícími modely AI videa se těžiště posouvá od kvality k výběru toho pravého. Tvůrci potřebují model, díky němuž zvládnou druhou povedenou verzi, pátou revizi i dvacátý podklad, aniž by ztratili původní myšlenku. Zdroj: techbullion.com
Důležitost:ZprávaFilm Production
Previs za ppár drobných: nezávislí režiséři testují scény s AI videem před natáčením
Začínající režiséři celovečerních filmů často nejvíc peněz nespálí za kamery, ale za ztracené natáčecí dny, třeba kvůli nevhodné lokaci. Nezávislí filmaři proto používají AI video k vizualizaci scén ještě před prvním klapkou. Zdroj: filmthreat.com
Důležitost:ZprávaVideo Manipulation
AI výměna postav: nahraďte kohokoli ve videu libovolnou postavou
Článek vysvětluje, jak funguje AI výměna postav ve videu, při níž nová postava zachová každý pohyb původního herce. Postup předvádí na nástroji YouCam Character Motion. Zdroj: perfectcorp.com
Důležitost:ZprávaAI video verification
World přináší do Zooma ověření lidskosti, AI video oklamalo 48 % volajících
World rozšiřuje své ověřování lidskosti na hovory v aplikaci Zoom i na AI agenty poté, co videomodel považovalo za skutečného člověka 48 % volajících. Systém využívá World ID, aby potvrdil, že na druhé straně opravdu sedí člověk. Zdroj: hackernoon.com
Důležitost:ZprávaAdobe Firefly AI
Adobe ukázal koncept AI generování 3D světů z textu, naznačuje směr Firefly
Adobe v posledních letech chrlí jeden AI nástroj za druhým, od obrazových a video modelů Firefly až po další hojně diskutované novinky. Nový koncept generování 3D světů z textu naznačuje, kam by se Firefly mohl vydat dál. Zdroj: creativebloq.com
Důležitost:ZprávaAI dance video tools
Šest AI nástrojů pro taneční videa určených tvůrcům elektronické hudby
Ne všechny AI nástroje pro taneční videa dělají totéž. Některé vytvářejí pohyb přímo k hudební stopě, jiné budují její vizuální svět nebo přetvářejí existující záběry, takže výběr záleží na potřebách tvůrce. Zdroj: side-line.com
Důležitost:ZprávaAI image generation technical
Limity GPT Image 2: proč další opakování požadavků frontu jen zhoršují
Fronta pro generování obrázků může vypadat zdravě, dokud se několik úloh nedokončí v plánování najednou a neodešle své požadavky současně. Pár jich projde, ostatní skončí chybou a agresivní opakování zahlcení ještě prohlubuje. Zdroj: techbullion.com
Důležitost:ZprávaAI sign language videos
AI převádí maráthský text na realistická videa indického znakového jazyka
Více než 70 milionů neslyšících a nedoslýchavých lidí v Indii je při získávání běžných informací často odkázáno na to, zda je poblíž někdo, kdo umí znakovat. Nový AI systém převádí text v maráthštině na realistická videa v indickém znakovém jazyce. Zdroj: bioengineer.org
Důležitost:Spuštěnícreative workspace
MixVio AI představuje jednotný kreativní prostor s 26 generativními cestami
MixVio AI spustilo jednotné pracovní prostředí, které sdružuje 26 generativních AI cest. Vybrané workflow zvládnou až 50 multimodálních referenčních souborů a vytvoří 30sekundové video v rozlišení 1080p s nativně synchronizovaným zvukem. Zdroj: manilatimes.net