AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/multimodal

Štítek: Multimodal

66 článků

Důležitost:NázorAI Data Licensing

Shutterstock: Je multimodální AI především otázkou licencování dat?

AI Magazine hovořil s Danem Mandellem, SVP pro licencování dat a AI služby ve Shutterstocku, o multimodálních datech, kreativitě a firemním úsilí v oblasti AI. Zdroj: aimagazine.com

Důležitost:Výzkummultimodal models

Multimodální LLM se samostatně naučil lékařské znalosti pro diagnostiku a reporting EGD

Nová studie v Nature Communications popisuje multimodální velký jazykový model (MLLM) navržený jako pomoc při esofagogastroduodenoskopii (EGD). Model dokáže analyzovat obrazová data z vyšetření a automaticky generovat diagnostické zprávy. Zdroj: bioengineer.org

Důležitost:VýzkumEmbodied AI

Xiaomi představuje model U0 pro robotiku a embodied AI

Xiaomi ve středu odhalilo Xiaomi-Robotics-U0, multimodální autoregresivní základní model s 38 miliardami parametrů určený pro embodied AI. Firma uvedla, že model má sloužit k pokročilejšímu ovládání a generování chování robotů. Zdroj: technode.com

Důležitost:ZprávaAurora Mobile enterprise AI

Aurora Mobile rozšiřuje multimodální AI nástroje GPTBots.ai o generování obrázků a videí pomocí Modellix

Aurora Mobile Limited (NASDAQ: JG), přední poskytovatel firemních AI řešení, oznámila rozšíření platformy GPTBots.ai. Nová sada nástrojů poháněných Modellix umožňuje firmám generovat obrázky a videa přímo v platformě. Zdroj: markets.businessinsider.com

Důležitost:Výzkumquantum-llm-multimodal

MIT a IBM promítají kvantové unitární operátory do latentního prostoru jazykových modelů

Výzkumníci z MIT-IBM Computing Research Lab a IBM Quantum vyvinuli multimodální rámec, který mapuje kvantové unitární operátory do latentního prostoru jazykových modelů pro syntézu obvodů. Zdroj: quantumcomputingreport.com

Důležitost:Výzkumprecision nutrition

AI a strojové učení míří do přesné výživy

Klíčovou vlastností přístupu Precision Nutrition and Health je schopnost přizpůsobit intervence individuální variabilitě pomocí multimodálních dat. Zdroj: nature.com

Důležitost:Spuštění

Naver přetavil 27 let vyhledávání do AI: vlastní LLM, SLM i multimodální modely

Jihokorejský technologický gigant Naver zúročil 27 let zkušeností s vyhledáváním při vývoji vlastního LLM a SLM modelů. Součástí strategie jsou i multimodální schopnosti postavené na hluboce zakořeněné vyhledávací infrastruktuře. Zdroj: biz.chosun.com

Důležitost:Zprávamultimodal AI models

5 open source omni AI modelů pro text, obrázky, zvuk i video

Multimodální systémy typu any-to-any zvládají rozpoznávání obrazu i jazyka, hlasovou interakci, práci s dokumenty nebo funkci asistenta v reálném čase. Praktický přehled ukazuje, co jednotlivé open source modely umí a kde najdou uplatnění. Zdroj: KDnuggets

Důležitost:ZprávaGemini video generation benchmark

Gemini Flash Omni vede žebříček Video Arena

Google Gemini Flash Omni obsadil první místo v žebříčku Video Arena pro generování videa z textu i obrázků. Předstihl konkurenci díky pokročilým multimodálním editačním schopnostem. Zdroj: cryptobriefing.com

Důležitost:Výzkummultimodal LLM applications

Doladěný multimodální LLM řídí autonomní rozpoznávání tvarů u tensegrity robota

Výzkumníci integrovali fine-tuned multimodální LLM do šestičlánkové tensegrity struktury vybavené flexibilními senzory pro autonomní rozpoznávání stavu a tvarů. Systém ukazuje potenciál pro průzkum náročných prostředí, včetně vesmírných misí. Zdroj: nature.com

Důležitost:Spuštěnímultimodal autonomous agent

Qwen3.7-Plus: Alibaba chce proměnit multimodální AI v autonomního agenta

Tým Qwen od Alibaby vydal model Qwen3.7-Plus, multimodálního agenta kombinujícího vizuální vnímání, ovládání GUI a psaní kódu v jediné smyčce. Cílem je vytvořit plnohodnotného autonomního agenta schopného samostatně plnit složité úkoly. Zdroj: the-decoder.com

Důležitost:Zprávaphysical AI world model

How Cosmos 3 Helps Physical AI Think Before It Acts

The new, open NVIDIA world foundation model brings vision reasoning, multimodal generation and action prediction together to help robots,... Zdroj: blogs.nvidia.com

Důležitost:ZprávaGemini Omni multimodal video creation

Google představil Gemini Omni – multimodální AI model pro tvorbu a střih videa

Nový model Gemini Omni od Googlu umožňuje generovat a upravovat videa na základě textových promptů, ručně kreslených skic, ilustrací nebo existujících videí jako stylistických referencí. Model podporuje i strukturované skripty pro přesnější kontrolu nad výsledným obsahem. Zdroj: adgully.com

Důležitost:ZprávaGoogle Gemini Omni multimodal video generation

Google unveils Gemini Omni, a multimodal AI model that generates video from text, images, and audio

Google DeepMind unveiled Gemini Omni at Google I/O, a multimodal AI model family for video generation with implications for decentralized compute and Web3... Zdroj: cryptobriefing.com

Důležitost:ZprávaByteDance Lance multimodal model

ByteDance vydal multimodální model Lance jako open source

ByteDance zveřejnil multimodální model Lance, nativně jednotný systém zvládající porozumění, generování i editaci obrázků a videí. Model je dostupný jako open source a představuje ByteDance jako vážného hráče v oblasti unifikovaných multimodálních AI systémů. Zdroj: letsdatascience.com

Důležitost:Názormultimodal LLMs overview

Vzestup multimodálních LLM mění podobu AI

Přední odborníci na AI diskutovali o multimodálních systémech, senzorickém počítání a rizicích pro soukromí. Téma budoucí spolupráce člověka se strojem a využití robotiky patřilo k hlavním bodům debaty. Zdroj: forbes.com

Důležitost:VýzkumByteDance Lance unified image/video model

ByteDance vydal Lance: jeden model pro obrázky i video

ByteDance představil Lance, nativně unifikovaný multimodální model s 3 miliardami parametrů určený pro porozumění, generování a editaci obrázků i videí. Jde o jeden model pokrývající tři klíčové modality najednou. Zdroj: marktechpost.com

Důležitost:ZprávaGemini Omni multimodal video generation

Google představil Gemini Omni: obraz, text, video i zvuk v jednom výstupu

Na Google I/O 2026 představil technologický gigant nový multimodální AI model Gemini Omni, který dokáže vytvářet a upravovat videa pomocí textu, obrázků, zvuku i videa. Model spojuje všechny čtyři modality do jediného výstupu, což výrazně rozšiřuje možnosti generativní AI. Zdroj: ndtvprofit.com

Důležitost:ZprávaGoogle Gemini Omni multimodal

Gemini Omni Flash přidává multimodální tvorbu videí do ekosystému Googlu

Google odhalil Gemini Omni, nový multimodální AI model určený ke generování a editaci videí. Model pracuje s kombinací textu, obrázků, zvuku a videa jako vstupních podnětů. Zdroj: indianexpress.com

Důležitost:ZprávaGemini Omni multimodal video generation

Google’s Gemini Omni turns images, audio, and text into video — and that’s just the start

Google's Gemini Omni is a new multimodal model that reasons across text, images, audio, and video to generate and edit videos through simple conversation... Zdroj: techcrunch.com