AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/generování obrazu a videa

🎨 Generování obrazu a videa

Generativní AI pro obrázky, video a kreativní média — Sora, DALL·E, Midjourney, Stable Diffusion a další.

971 článků

Důležitost:Spuštěníon-device multimodal models

EmbeddingGemma 2 sjednocuje text, kód, obrázky, zvuk a video přímo v zařízení

Otevřený model EmbeddingGemma 2 od Googlu mapuje text, kód, obrázky, zvuk i video do jednoho embedding prostoru přímo na zařízení. Vychází pod licencí Apache 2.0 a pro text na telefonu Pixel potřebuje zhruba 191 MB RAM. Zdroj: thenextweb.com

Důležitost:Spuštěnímultimodal embeddings

EmbeddingGemma 2 přináší multimodální embeddingy přímo do zařízení

EmbeddingGemma 2 je označován za nejschopnější model pro multimodální embeddingy přímo na zařízení. Nativně mapuje kombinace textu, obrázků, zvuku a videa do jednoho společného prostoru. Zdroj: blog.google

Důležitost:Zprávamultimodal models

Google rozšiřuje EmbeddingGemma z textu na obrázky, zvuk i video

Google dnes vydal EmbeddingGemma 2, otevřený multimodální embedding model, který je dost malý na to, aby běžel na chytrém telefonu. Navazuje na původní EmbeddingGemma, který uměl pouze text. Zdroj: siliconangle.com

Důležitost:Výzkummultimodal embedding

DeepMind vydal EmbeddingGemma 2, 740M multimodální embedding model na Gemma 4

EmbeddingGemma 2 od Google DeepMind vektorizuje text, kód, obrázky, video i zvuk v jediném modelu o 740 milionech parametrů. Míří na RAG aplikace běžící přímo na zařízení. Zdroj: marktechpost.com

Důležitost:Spuštěnímultimodal search

Google DeepMind uvádí multimodální AI model pro vyhledávání přímo v zařízení

Google DeepMind v úterý spustil EmbeddingGemma 2, open-weight AI model určený k vyhledávání a organizaci textu, obrázků, videa a dalších dat. Je navržen tak, aby běžel přímo na zařízeních. Zdroj: tradingview.com

Důležitost:Zprávaimage generation

Nano Banana 2.1 vychází za poloviční cenu obrázků oproti předchůdci

Google 6. října 2026 uvedl Nano Banana 2.1, model pro generování a úpravu obrázků postavený na Gemini 3.6 Flash. Je dostupný napříč ekosystémem Gemini. Zdroj: unite.ai

Důležitost:Zprávamodel performance

Google: EmbeddingGemma 2 překonává konkurenční modely dvojnásobné velikosti

Google vydal EmbeddingGemma 2, otevřený model se 740 miliony parametrů. Převádí text, obrázky, video, zvuk i kód na vektory a podle Googlu překonává konkurenční embedding modely, které jsou dvakrát větší. Zdroj: the-decoder.com

Důležitost:Výzkummultimodal applications

EmbeddingGemma 2: průvodce pro vývojáře multimodálním vyhledáváním a RAG

Průvodce ukazuje, jak s EmbeddingGemma 2 stavět multimodální vyhledávání a RAG aplikace. Jde o kompaktní otevřený model, který zpracovává text, kód, obrázky, video i zvuk. Zdroj: developers.googleblog.com

Důležitost:ZprávaContent Creation Evolution

Generativní AI přechází od statických obrazů k pohyblivým příběhům

Generativní AI mění způsob, jakým vzniká digitální obsah. Úkoly, které dříve vyžadovaly samostatné nástroje pro generování obrazu, animaci, střih a produkci, se stále častěji slučují do jednotných pracovních postupů. Zdroj: dailyiowan.com

Důležitost:ZprávaMultimodal AI Models

Rho-1 od Reka AI zvládá text, obraz, video i ovládání robotů v jednom modelu

Reka AI představila Rho-1, omni-model s 19 miliardami parametrů. Jediná neuronová síť zpracovává i generuje text, obrázky, video a řídicí povely pro roboty. Zdroj: the-decoder.com

Důležitost:ZprávaAnime Art Creation

Jak postavit AI workflow pro anime: generování, úpravy i animace na jednom místě

PixAI Studio propojuje generování anime obrázků, jejich úpravy, referenční postavy i video animaci v jediném pracovním prostředí. Článek ukazuje, jak tyto kroky spojit do jednoho workflow. Zdroj: worldbusinessoutlook.com

Důležitost:NázorAI Video Challenges

AI video se zlepšuje, ale výběr správného modelu je čím dál těžší

S přibývajícími modely AI videa se těžiště posouvá od kvality k výběru toho pravého. Tvůrci potřebují model, díky němuž zvládnou druhou povedenou verzi, pátou revizi i dvacátý podklad, aniž by ztratili původní myšlenku. Zdroj: techbullion.com

Důležitost:ZprávaFilm Production

Previs za ppár drobných: nezávislí režiséři testují scény s AI videem před natáčením

Začínající režiséři celovečerních filmů často nejvíc peněz nespálí za kamery, ale za ztracené natáčecí dny, třeba kvůli nevhodné lokaci. Nezávislí filmaři proto používají AI video k vizualizaci scén ještě před prvním klapkou. Zdroj: filmthreat.com

Důležitost:ZprávaVideo Manipulation

AI výměna postav: nahraďte kohokoli ve videu libovolnou postavou

Článek vysvětluje, jak funguje AI výměna postav ve videu, při níž nová postava zachová každý pohyb původního herce. Postup předvádí na nástroji YouCam Character Motion. Zdroj: perfectcorp.com

Důležitost:ZprávaAI video verification

World přináší do Zooma ověření lidskosti, AI video oklamalo 48 % volajících

World rozšiřuje své ověřování lidskosti na hovory v aplikaci Zoom i na AI agenty poté, co videomodel považovalo za skutečného člověka 48 % volajících. Systém využívá World ID, aby potvrdil, že na druhé straně opravdu sedí člověk. Zdroj: hackernoon.com

Důležitost:ZprávaAdobe Firefly AI

Adobe ukázal koncept AI generování 3D světů z textu, naznačuje směr Firefly

Adobe v posledních letech chrlí jeden AI nástroj za druhým, od obrazových a video modelů Firefly až po další hojně diskutované novinky. Nový koncept generování 3D světů z textu naznačuje, kam by se Firefly mohl vydat dál. Zdroj: creativebloq.com

Důležitost:ZprávaAI dance video tools

Šest AI nástrojů pro taneční videa určených tvůrcům elektronické hudby

Ne všechny AI nástroje pro taneční videa dělají totéž. Některé vytvářejí pohyb přímo k hudební stopě, jiné budují její vizuální svět nebo přetvářejí existující záběry, takže výběr záleží na potřebách tvůrce. Zdroj: side-line.com

Důležitost:ZprávaAI image generation technical

Limity GPT Image 2: proč další opakování požadavků frontu jen zhoršují

Fronta pro generování obrázků může vypadat zdravě, dokud se několik úloh nedokončí v plánování najednou a neodešle své požadavky současně. Pár jich projde, ostatní skončí chybou a agresivní opakování zahlcení ještě prohlubuje. Zdroj: techbullion.com

Důležitost:ZprávaAI sign language videos

AI převádí maráthský text na realistická videa indického znakového jazyka

Více než 70 milionů neslyšících a nedoslýchavých lidí v Indii je při získávání běžných informací často odkázáno na to, zda je poblíž někdo, kdo umí znakovat. Nový AI systém převádí text v maráthštině na realistická videa v indickém znakovém jazyce. Zdroj: bioengineer.org

Důležitost:Spuštěnícreative workspace

MixVio AI představuje jednotný kreativní prostor s 26 generativními cestami

MixVio AI spustilo jednotné pracovní prostředí, které sdružuje 26 generativních AI cest. Vybrané workflow zvládnou až 50 multimodálních referenčních souborů a vytvoří 30sekundové video v rozlišení 1080p s nativně synchronizovaným zvukem. Zdroj: manilatimes.net