Google míří na AI agenty i generování videa s Gemini 3.5 Flash a Omni
Google představil dva nové generativní AI modely, které posouvají řadu Gemini dále do oblasti agentických systémů a multimodální tvorby obsahu. Gemini 3.5 Flash a Omni rozšiřují možnosti automatizace i kreativní produkce. Zdroj: siliconangle.com
Důležitost:ZprávaGemini Omni and 3.5 Flash launch
Google targets AI agents and video generation with Gemini 3.5 Flash and Omni
Google LLC today introduced two new generative artificial intelligence models that push its Gemini family further into AI agents and multimodal creation:... Zdroj: siliconangle.com
Důležitost:ZprávaGemini Omni enterprise implications
Google unveils Gemini Omni 'any-to-any' AI model: what enterprises should know
The model marks Google's bid to collapse the multimodal generative stack — text-to-image, image-to-video, video-to-video, audio generation — into a single... Zdroj: venturebeat.com
Důležitost:ZprávaGemini Omni rollout details
Google rolls out Gemini Omni AI for video generation and editing
Google has officially introduced Gemini Omni, a multimodal AI model that integrates reasoning abilities with creative generation across video, image, audio,... Zdroj: testingcatalog.com
Důležitost:Spuštěníopen-source multimodal image/video model
ByteDance's Lance Puts Open, Efficient Multimodal AI Within Reach
ByteDance released Lance, a 3B-parameter multimodal model under Apache 2.0, offering open, commercially usable image and video generation and editing. Zdroj: startupfortune.com
Důležitost:ZprávaAI training data / creator economy
Wirestock získal 23 milionů dolarů na rozšíření AI datové platformy
Wirestock uzavřel Series A financování ve výši 23 milionů dolarů. Společnost chce urychlit svůj růst a stát se předním dodavatelem eticky získaných multimodálních dat pro trénink AI modelů. Zdroj: citybiz.co
SenseTime Releases SenseNova U1: Native Unified Architecture Marks End of 'Stitching' Era
SenseTime's open-source SenseNova U1 model represents a paradigm shift in multimodal architecture — unifying understanding and generation in a single... Zdroj: pandaily.com
Důležitost:SpuštěníSeedance 2.0 integration
DeepBrain AI přidává Seedance 2.0 do AI STUDIOS
DeepBrain AI oznámil integraci modelu Seedance 2.0 od ByteDance do své platformy AI STUDIOS. Přestože jde o stejný model, firma slibuje výrazně odlišné výsledky díky vlastnímu přístupu k jeho nasazení. Zdroj: markets.businessinsider.com
Důležitost:Spuštěnímultimodal embeddings
Elastic uvádí Jina v5 Omni: multimodální vyhledávání textu, obrázků, videa i zvuku
Elastic představil novou rodinu multimodálních embedding modelů jina-embeddings-v5-omni. Modely jsou navrženy pro vyhledávání napříč textem, obrázky, videem a zvukem v rámci platformy Search AI. Zdroj: businesswire.com
Důležitost:Zprávavideo training data
Shofo: Něco jako Common Crawl pro video, prodáváno AI laboratořím
Přední AI laboratoře závodí ve vývoji multimodálních modelů a všechny narážejí na stejný problém – nedostatek kvalitních videodát. Textová i obrazová data jsou do značné míry vyčerpána, video se tak stává novým klíčovým zdrojem pro trénink modelů. Zdroj: startuphub.ai
Důležitost:Spuštěnímultimodal embeddings
Gemini Embedding 2: multimodální RAG a další možnosti pro vývojáře
Google zpřístupnil Gemini Embedding 2, unifikovaný multimodální model, který převádí text, obrázky, video i audio do jednotného vektorového prostoru. Příspěvek na blogu ukazuje, jak model využít při budování agentních multimodálních RAG systémů. Zdroj: developers.googleblog.com
Důležitost:Spuštěnímultimodal AI model with video understanding
NVIDIA Nemotron 3 Nano Omni: multimodální agent v jediném efektivním modelu
Agentní systémy dnes musí zpracovávat obrazovky, dokumenty, audio, video i text v rámci jediné smyčky od vnímání k akci. NVIDIA Nemotron 3 Nano Omni je otevřený multimodální model navržený právě pro tyto scénáře, který zvládá komplexní uvažování bez nutnosti kombinovat více specializovaných modelů. Zdroj: developer.nvidia.com
Důležitost:Zprávamultimodal AI model with video understanding
Nvidia odhaluje zákulisí moderního multimodálního modelu s Nemotron 3 Nano Omni
Nvidia vydala otevřený multimodální model Nemotron 3 Nano Omni podporující text, obraz, video i zvuk. Zajímavý je nejen jeho výkon, ale také pohled do architektury a přístupů, které stojí za moderními multimodálními systémy. Zdroj: the-decoder.com
Důležitost:Zpráva
Multimodální velký jazykový model pro materiálové vědy
Porozumění vlastnostem anorganických materiálů a jejich předvídání je klíčové pro urychlení pokroku v materiálových vědách. Nový multimodální LLM si klade za cíl tento proces zásadně zefektivnit a otevřít nové aplikační možnosti. Zdroj: nature.com
Důležitost:Zpráva
Multimodální biologické modely mění péči o pacienty
Rozhodování v oblasti zdravotnictví a věd o živé přírodě se stále více opírá o multimodální data při diagnostice nemocí, předepisování léků i předpovídání výsledků léčby. Nové biologické foundation modely umožňují propojit různé typy dat a zlepšit tak péči o pacienty napříč celým spektrem terapeutických oblastí. Zdroj: aws.amazon.com
Důležitost:Zpráva
Moonshot AI Releases Kimi K2.6 with Long-Horizon Coding, Agent Swarm Scaling to 300 Sub-Agents and 4,000 Coordinated Steps
Moonshot AI, the Chinese AI lab behind the Kimi assistant, today open-sourced Kimi K2.6 — a native multimodal agentic model that pushes the boundaries of... Zdroj: marktechpost.com
Důležitost:Zpráva
Amazon Nova Multimodal Embeddings pohání sémantické vyhledávání ve videu
Sémantické vyhledávání ve videu přináší novou hodnotu napříč odvětvími a mění způsob, jakým organizace doručují obsah. Amazon Nova Multimodal Embeddings nabízejí výkonný základ pro aplikace zaměřené primárně na video. Zdroj: aws.amazon.com
Důležitost:Zpráva
Happy Horse 1.0 vs Seedance 2.0: Praktické srovnání dvou rozdílných přístupů k AI videu
Srovnání modelů Happy Horse 1.0 a Seedance 2.0 se zaměřuje na vyprávění příběhů, multimodální ovládání, podporu audia a výkon při převodu obrázků na video. Oba nástroje představují odlišné filozofie ve vývoji AI videa. Zdroj: natlawreview.com
Důležitost:Zpráva
Extracting Insights from Video using OCI Generative AI
What if you could query a video the same way you query text? With recent advances in multimodal large language models (LLMs), we are moving beyond text-only... Zdroj: blogs.oracle.com
Důležitost:Zpráva
Eluvio představuje na NAB 2026 AI editor EVIE s přesností na snímek
Eluvio uvádí novou architekturu pro video intelligence s přesností na jednotlivý snímek a představuje generaci editoru EVIE s pokročilými AI nástroji. Řešení cílí na agentic orchestraci filmových knihoven i přenosů živého sportu. Zdroj: prnewswire.com