AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/multimodal

Štítek: Multimodal

66 článků

Důležitost:Spuštěníagentic models

Google míří na AI agenty i generování videa s Gemini 3.5 Flash a Omni

Google představil dva nové generativní AI modely, které posouvají řadu Gemini dále do oblasti agentických systémů a multimodální tvorby obsahu. Gemini 3.5 Flash a Omni rozšiřují možnosti automatizace i kreativní produkce. Zdroj: siliconangle.com

Důležitost:ZprávaGemini Omni and 3.5 Flash launch

Google targets AI agents and video generation with Gemini 3.5 Flash and Omni

Google LLC today introduced two new generative artificial intelligence models that push its Gemini family further into AI agents and multimodal creation:... Zdroj: siliconangle.com

Důležitost:ZprávaGemini Omni enterprise implications

Google unveils Gemini Omni 'any-to-any' AI model: what enterprises should know

The model marks Google's bid to collapse the multimodal generative stack — text-to-image, image-to-video, video-to-video, audio generation — into a single... Zdroj: venturebeat.com

Důležitost:ZprávaGemini Omni rollout details

Google rolls out Gemini Omni AI for video generation and editing

Google has officially introduced Gemini Omni, a multimodal AI model that integrates reasoning abilities with creative generation across video, image, audio,... Zdroj: testingcatalog.com

Důležitost:Spuštěníopen-source multimodal image/video model

ByteDance's Lance Puts Open, Efficient Multimodal AI Within Reach

ByteDance released Lance, a 3B-parameter multimodal model under Apache 2.0, offering open, commercially usable image and video generation and editing. Zdroj: startupfortune.com

Důležitost:ZprávaAI training data / creator economy

Wirestock získal 23 milionů dolarů na rozšíření AI datové platformy

Wirestock uzavřel Series A financování ve výši 23 milionů dolarů. Společnost chce urychlit svůj růst a stát se předním dodavatelem eticky získaných multimodálních dat pro trénink AI modelů. Zdroj: citybiz.co

Důležitost:Zprávamultimodal generation architecture

SenseTime Releases SenseNova U1: Native Unified Architecture Marks End of 'Stitching' Era

SenseTime's open-source SenseNova U1 model represents a paradigm shift in multimodal architecture — unifying understanding and generation in a single... Zdroj: pandaily.com

Důležitost:SpuštěníSeedance 2.0 integration

DeepBrain AI přidává Seedance 2.0 do AI STUDIOS

DeepBrain AI oznámil integraci modelu Seedance 2.0 od ByteDance do své platformy AI STUDIOS. Přestože jde o stejný model, firma slibuje výrazně odlišné výsledky díky vlastnímu přístupu k jeho nasazení. Zdroj: markets.businessinsider.com

Důležitost:Spuštěnímultimodal embeddings

Elastic uvádí Jina v5 Omni: multimodální vyhledávání textu, obrázků, videa i zvuku

Elastic představil novou rodinu multimodálních embedding modelů jina-embeddings-v5-omni. Modely jsou navrženy pro vyhledávání napříč textem, obrázky, videem a zvukem v rámci platformy Search AI. Zdroj: businesswire.com

Důležitost:Zprávavideo training data

Shofo: Něco jako Common Crawl pro video, prodáváno AI laboratořím

Přední AI laboratoře závodí ve vývoji multimodálních modelů a všechny narážejí na stejný problém – nedostatek kvalitních videodát. Textová i obrazová data jsou do značné míry vyčerpána, video se tak stává novým klíčovým zdrojem pro trénink modelů. Zdroj: startuphub.ai

Důležitost:Spuštěnímultimodal embeddings

Gemini Embedding 2: multimodální RAG a další možnosti pro vývojáře

Google zpřístupnil Gemini Embedding 2, unifikovaný multimodální model, který převádí text, obrázky, video i audio do jednotného vektorového prostoru. Příspěvek na blogu ukazuje, jak model využít při budování agentních multimodálních RAG systémů. Zdroj: developers.googleblog.com

Důležitost:Spuštěnímultimodal AI model with video understanding

NVIDIA Nemotron 3 Nano Omni: multimodální agent v jediném efektivním modelu

Agentní systémy dnes musí zpracovávat obrazovky, dokumenty, audio, video i text v rámci jediné smyčky od vnímání k akci. NVIDIA Nemotron 3 Nano Omni je otevřený multimodální model navržený právě pro tyto scénáře, který zvládá komplexní uvažování bez nutnosti kombinovat více specializovaných modelů. Zdroj: developer.nvidia.com

Důležitost:Zprávamultimodal AI model with video understanding

Nvidia odhaluje zákulisí moderního multimodálního modelu s Nemotron 3 Nano Omni

Nvidia vydala otevřený multimodální model Nemotron 3 Nano Omni podporující text, obraz, video i zvuk. Zajímavý je nejen jeho výkon, ale také pohled do architektury a přístupů, které stojí za moderními multimodálními systémy. Zdroj: the-decoder.com

Důležitost:Zpráva

Multimodální velký jazykový model pro materiálové vědy

Porozumění vlastnostem anorganických materiálů a jejich předvídání je klíčové pro urychlení pokroku v materiálových vědách. Nový multimodální LLM si klade za cíl tento proces zásadně zefektivnit a otevřít nové aplikační možnosti. Zdroj: nature.com

Důležitost:Zpráva

Multimodální biologické modely mění péči o pacienty

Rozhodování v oblasti zdravotnictví a věd o živé přírodě se stále více opírá o multimodální data při diagnostice nemocí, předepisování léků i předpovídání výsledků léčby. Nové biologické foundation modely umožňují propojit různé typy dat a zlepšit tak péči o pacienty napříč celým spektrem terapeutických oblastí. Zdroj: aws.amazon.com

Důležitost:Zpráva

Moonshot AI Releases Kimi K2.6 with Long-Horizon Coding, Agent Swarm Scaling to 300 Sub-Agents and 4,000 Coordinated Steps

Moonshot AI, the Chinese AI lab behind the Kimi assistant, today open-sourced Kimi K2.6 — a native multimodal agentic model that pushes the boundaries of... Zdroj: marktechpost.com

Důležitost:Zpráva

Amazon Nova Multimodal Embeddings pohání sémantické vyhledávání ve videu

Sémantické vyhledávání ve videu přináší novou hodnotu napříč odvětvími a mění způsob, jakým organizace doručují obsah. Amazon Nova Multimodal Embeddings nabízejí výkonný základ pro aplikace zaměřené primárně na video. Zdroj: aws.amazon.com

Důležitost:Zpráva

Happy Horse 1.0 vs Seedance 2.0: Praktické srovnání dvou rozdílných přístupů k AI videu

Srovnání modelů Happy Horse 1.0 a Seedance 2.0 se zaměřuje na vyprávění příběhů, multimodální ovládání, podporu audia a výkon při převodu obrázků na video. Oba nástroje představují odlišné filozofie ve vývoji AI videa. Zdroj: natlawreview.com

Důležitost:Zpráva

Extracting Insights from Video using OCI Generative AI

What if you could query a video the same way you query text? With recent advances in multimodal large language models (LLMs), we are moving beyond text-only... Zdroj: blogs.oracle.com

Důležitost:Zpráva

Eluvio představuje na NAB 2026 AI editor EVIE s přesností na snímek

Eluvio uvádí novou architekturu pro video intelligence s přesností na jednotlivý snímek a představuje generaci editoru EVIE s pokročilými AI nástroji. Řešení cílí na agentic orchestraci filmových knihoven i přenosů živého sportu. Zdroj: prnewswire.com