Shutterstock: Je multimodální AI především otázkou licencování dat?
AI Magazine hovořil s Danem Mandellem, SVP pro licencování dat a AI služby ve Shutterstocku, o multimodálních datech, kreativitě a firemním úsilí v oblasti AI. Zdroj: aimagazine.com
66 článků
AI Magazine hovořil s Danem Mandellem, SVP pro licencování dat a AI služby ve Shutterstocku, o multimodálních datech, kreativitě a firemním úsilí v oblasti AI. Zdroj: aimagazine.com
Nová studie v Nature Communications popisuje multimodální velký jazykový model (MLLM) navržený jako pomoc při esofagogastroduodenoskopii (EGD). Model dokáže analyzovat obrazová data z vyšetření a automaticky generovat diagnostické zprávy. Zdroj: bioengineer.org
Xiaomi ve středu odhalilo Xiaomi-Robotics-U0, multimodální autoregresivní základní model s 38 miliardami parametrů určený pro embodied AI. Firma uvedla, že model má sloužit k pokročilejšímu ovládání a generování chování robotů. Zdroj: technode.com
Aurora Mobile Limited (NASDAQ: JG), přední poskytovatel firemních AI řešení, oznámila rozšíření platformy GPTBots.ai. Nová sada nástrojů poháněných Modellix umožňuje firmám generovat obrázky a videa přímo v platformě. Zdroj: markets.businessinsider.com
Výzkumníci z MIT-IBM Computing Research Lab a IBM Quantum vyvinuli multimodální rámec, který mapuje kvantové unitární operátory do latentního prostoru jazykových modelů pro syntézu obvodů. Zdroj: quantumcomputingreport.com
Klíčovou vlastností přístupu Precision Nutrition and Health je schopnost přizpůsobit intervence individuální variabilitě pomocí multimodálních dat. Zdroj: nature.com
Jihokorejský technologický gigant Naver zúročil 27 let zkušeností s vyhledáváním při vývoji vlastního LLM a SLM modelů. Součástí strategie jsou i multimodální schopnosti postavené na hluboce zakořeněné vyhledávací infrastruktuře. Zdroj: biz.chosun.com
Multimodální systémy typu any-to-any zvládají rozpoznávání obrazu i jazyka, hlasovou interakci, práci s dokumenty nebo funkci asistenta v reálném čase. Praktický přehled ukazuje, co jednotlivé open source modely umí a kde najdou uplatnění. Zdroj: KDnuggets
Google Gemini Flash Omni obsadil první místo v žebříčku Video Arena pro generování videa z textu i obrázků. Předstihl konkurenci díky pokročilým multimodálním editačním schopnostem. Zdroj: cryptobriefing.com
Výzkumníci integrovali fine-tuned multimodální LLM do šestičlánkové tensegrity struktury vybavené flexibilními senzory pro autonomní rozpoznávání stavu a tvarů. Systém ukazuje potenciál pro průzkum náročných prostředí, včetně vesmírných misí. Zdroj: nature.com
Tým Qwen od Alibaby vydal model Qwen3.7-Plus, multimodálního agenta kombinujícího vizuální vnímání, ovládání GUI a psaní kódu v jediné smyčce. Cílem je vytvořit plnohodnotného autonomního agenta schopného samostatně plnit složité úkoly. Zdroj: the-decoder.com
The new, open NVIDIA world foundation model brings vision reasoning, multimodal generation and action prediction together to help robots,... Zdroj: blogs.nvidia.com
Nový model Gemini Omni od Googlu umožňuje generovat a upravovat videa na základě textových promptů, ručně kreslených skic, ilustrací nebo existujících videí jako stylistických referencí. Model podporuje i strukturované skripty pro přesnější kontrolu nad výsledným obsahem. Zdroj: adgully.com
Google DeepMind unveiled Gemini Omni at Google I/O, a multimodal AI model family for video generation with implications for decentralized compute and Web3... Zdroj: cryptobriefing.com
ByteDance zveřejnil multimodální model Lance, nativně jednotný systém zvládající porozumění, generování i editaci obrázků a videí. Model je dostupný jako open source a představuje ByteDance jako vážného hráče v oblasti unifikovaných multimodálních AI systémů. Zdroj: letsdatascience.com
Přední odborníci na AI diskutovali o multimodálních systémech, senzorickém počítání a rizicích pro soukromí. Téma budoucí spolupráce člověka se strojem a využití robotiky patřilo k hlavním bodům debaty. Zdroj: forbes.com
ByteDance představil Lance, nativně unifikovaný multimodální model s 3 miliardami parametrů určený pro porozumění, generování a editaci obrázků i videí. Jde o jeden model pokrývající tři klíčové modality najednou. Zdroj: marktechpost.com
Na Google I/O 2026 představil technologický gigant nový multimodální AI model Gemini Omni, který dokáže vytvářet a upravovat videa pomocí textu, obrázků, zvuku i videa. Model spojuje všechny čtyři modality do jediného výstupu, což výrazně rozšiřuje možnosti generativní AI. Zdroj: ndtvprofit.com
Google odhalil Gemini Omni, nový multimodální AI model určený ke generování a editaci videí. Model pracuje s kombinací textu, obrázků, zvuku a videa jako vstupních podnětů. Zdroj: indianexpress.com
Google's Gemini Omni is a new multimodal model that reasons across text, images, audio, and video to generate and edit videos through simple conversation... Zdroj: techcrunch.com