SenseTime Releases SenseNova U1: Native Unified Architecture Marks End of 'Stitching' Era
SenseTime's open-source SenseNova U1 model represents a paradigm shift in multimodal architecture — unifying understanding and generation in a single... Zdroj: pandaily.com
Důležitost:SpuštěníSeedance 2.0 integration
DeepBrain AI přidává Seedance 2.0 do AI STUDIOS
DeepBrain AI oznámil integraci modelu Seedance 2.0 od ByteDance do své platformy AI STUDIOS. Přestože jde o stejný model, firma slibuje výrazně odlišné výsledky díky vlastnímu přístupu k jeho nasazení. Zdroj: markets.businessinsider.com
Důležitost:Spuštěnímultimodal embeddings
Elastic uvádí Jina v5 Omni: multimodální vyhledávání textu, obrázků, videa i zvuku
Elastic představil novou rodinu multimodálních embedding modelů jina-embeddings-v5-omni. Modely jsou navrženy pro vyhledávání napříč textem, obrázky, videem a zvukem v rámci platformy Search AI. Zdroj: businesswire.com
Důležitost:Zprávavideo training data
Shofo: Něco jako Common Crawl pro video, prodáváno AI laboratořím
Přední AI laboratoře závodí ve vývoji multimodálních modelů a všechny narážejí na stejný problém – nedostatek kvalitních videodát. Textová i obrazová data jsou do značné míry vyčerpána, video se tak stává novým klíčovým zdrojem pro trénink modelů. Zdroj: startuphub.ai
Důležitost:Spuštěnímultimodal embeddings
Gemini Embedding 2: multimodální RAG a další možnosti pro vývojáře
Google zpřístupnil Gemini Embedding 2, unifikovaný multimodální model, který převádí text, obrázky, video i audio do jednotného vektorového prostoru. Příspěvek na blogu ukazuje, jak model využít při budování agentních multimodálních RAG systémů. Zdroj: developers.googleblog.com
Důležitost:Spuštěnímultimodal AI model with video understanding
NVIDIA Nemotron 3 Nano Omni: multimodální agent v jediném efektivním modelu
Agentní systémy dnes musí zpracovávat obrazovky, dokumenty, audio, video i text v rámci jediné smyčky od vnímání k akci. NVIDIA Nemotron 3 Nano Omni je otevřený multimodální model navržený právě pro tyto scénáře, který zvládá komplexní uvažování bez nutnosti kombinovat více specializovaných modelů. Zdroj: developer.nvidia.com
Důležitost:Zprávamultimodal AI model with video understanding
Nvidia odhaluje zákulisí moderního multimodálního modelu s Nemotron 3 Nano Omni
Nvidia vydala otevřený multimodální model Nemotron 3 Nano Omni podporující text, obraz, video i zvuk. Zajímavý je nejen jeho výkon, ale také pohled do architektury a přístupů, které stojí za moderními multimodálními systémy. Zdroj: the-decoder.com
Důležitost:Zpráva
Multimodální velký jazykový model pro materiálové vědy
Porozumění vlastnostem anorganických materiálů a jejich předvídání je klíčové pro urychlení pokroku v materiálových vědách. Nový multimodální LLM si klade za cíl tento proces zásadně zefektivnit a otevřít nové aplikační možnosti. Zdroj: nature.com
Důležitost:Zpráva
Multimodální biologické modely mění péči o pacienty
Rozhodování v oblasti zdravotnictví a věd o živé přírodě se stále více opírá o multimodální data při diagnostice nemocí, předepisování léků i předpovídání výsledků léčby. Nové biologické foundation modely umožňují propojit různé typy dat a zlepšit tak péči o pacienty napříč celým spektrem terapeutických oblastí. Zdroj: aws.amazon.com
Důležitost:Zpráva
Moonshot AI Releases Kimi K2.6 with Long-Horizon Coding, Agent Swarm Scaling to 300 Sub-Agents and 4,000 Coordinated Steps
Moonshot AI, the Chinese AI lab behind the Kimi assistant, today open-sourced Kimi K2.6 — a native multimodal agentic model that pushes the boundaries of... Zdroj: marktechpost.com
Důležitost:Zpráva
Amazon Nova Multimodal Embeddings pohání sémantické vyhledávání ve videu
Sémantické vyhledávání ve videu přináší novou hodnotu napříč odvětvími a mění způsob, jakým organizace doručují obsah. Amazon Nova Multimodal Embeddings nabízejí výkonný základ pro aplikace zaměřené primárně na video. Zdroj: aws.amazon.com
Důležitost:Zpráva
Happy Horse 1.0 vs Seedance 2.0: Praktické srovnání dvou rozdílných přístupů k AI videu
Srovnání modelů Happy Horse 1.0 a Seedance 2.0 se zaměřuje na vyprávění příběhů, multimodální ovládání, podporu audia a výkon při převodu obrázků na video. Oba nástroje představují odlišné filozofie ve vývoji AI videa. Zdroj: natlawreview.com
Důležitost:Zpráva
Extracting Insights from Video using OCI Generative AI
What if you could query a video the same way you query text? With recent advances in multimodal large language models (LLMs), we are moving beyond text-only... Zdroj: blogs.oracle.com
Důležitost:Zpráva
Eluvio představuje na NAB 2026 AI editor EVIE s přesností na snímek
Eluvio uvádí novou architekturu pro video intelligence s přesností na jednotlivý snímek a představuje generaci editoru EVIE s pokročilými AI nástroji. Řešení cílí na agentic orchestraci filmových knihoven i přenosů živého sportu. Zdroj: prnewswire.com
Důležitost:ZprávaGoogle Gemma 4 multimodal model
Google Gemma 4: multimodální AI model pro agenty a různé úkoly
Google představil nový AI model Gemma 4, který umí vytvářet AI agenty a zpracovávat text, obrázky i audio. Nový nástroj rozšiřuje Googleův portfolio multimodálních AI řešení. Zdroj: msn.com
Důležitost:ZprávaMicrosoft multimodal AI models
Microsoft představil tři nové AI modely
Microsoft spustil tři nové multimodální AI modely určené pro přepis zvuku, generování hlasu a tvorbu obrázků a videí. Jedná se o významné rozšíření portfolia společnosti v oblasti umělé inteligence. Zdroj: msn.com
Důležitost:VýzkumML applications
FuXi-Air: předpověď kvality vzduchu pomocí multimodálního strojového učení
Znečištění ovzduší se stalo celosvětovou zdravotní hrozbou. Nový přístup kombinující emise, meteorologické údaje a znečišťující látky pomocí strojového učení překonává tradiční numerické simulace a jednolocíraké modely. Zdroj: nature.com
Důležitost:SpuštěníNVIDIA Gemma 4 acceleration
NVIDIA zrychluje Gemmu 4 pro místní agentní AI
Gemma 4 přináší výkonné uvažování, kódování a multimodální AI přímo na NVIDIA RTX počítače, DGX Spark a hraniční zařízení. Zdroj: blogs.nvidia.com
Důležitost:ZprávaAI in healthcare/medical devices
Oční AI asistent se vyvíjí pro čínskou populaci
Rozhodovací systém založený na AI, trénovaný na multimodálních oftalmologických datech, bude pomáhat s diagnostikou, plánováním léčby a sledováním onemocnění. Zdroj: mobihealthnews.com
Důležitost:ZprávaMicrosoft and xAI compete in image generation
Microsoft a xAI útočí na generování obrázků, ohrožují OpenAI
Globální AI krajina se rychle mění. Microsoft představuje svůj vlastní model pro generování obrázků, což signalizuje zásadnější posun v jeho strategii. Zdroj: kmjournal.net