Studie zkoumá, jak preferenční ladění ovlivňuje multimodální LLM
Nová rozsáhlá studie se zaměřuje na preferenční ladění, techniku běžně používanou ke zlepšení výkonu LLM, a zkoumá její konkrétní dopad na multimodální modely. Výzkum popisuje jak přínosy, tak omezení této metody při rozšíření za rámec čistě textových systémů. Zdroj: google.com
Důležitost:ZprávaAI Video Models
MiniMax H3: co byste měli vědět o novém AI modelu pro video
MiniMax H3 je open-weight model pro generování videa, který využívá multimodální uvažování, kontextovou regeneraci a pokročilou architekturu. Zdroj: ca.news.yahoo.com
Důležitost:VýzkumLLM alignment
Studie zkoumá, jak funguje alignment u multimodálních LLM
Ladění na základě preferencí (preference alignment) se stalo klíčovým nástrojem pro zlepšování výkonu velkých jazykových modelů, jeho dopad u multimodálních systémů je ale méně prozkoumaný. Nová rozsáhlá studie se zaměřuje na to, jak se tyto techniky projevují napříč různými modalitami. Zdroj: machinelearning.apple.com
Důležitost:ZprávaAI model comparison
FLUX 3 spojuje obrázky, video i další úlohy do jednoho modelu a předčí Seedance 2.0 i Grok
Nový model FLUX 3 od Black Forest Labs nahrazuje dosavadní skládačku samostatných nástrojů pro generování obrázků, videa a dalších úloh jediným multimodálním systémem. Podle prvních srovnání překonává konkurenty jako Seedance 2.0 nebo Grok hned v několika testech. Zdroj: sitepoint.com
Důležitost:Zprávamodel releases
MiniMax spouští video model H3, provází ho spor o autorská práva
MiniMax uvedl nový multimodální model H3, který podle nezávislých benchmarků vede v kategorii úprav videa. Uvedení modelu ale stíní žaloba kvůli porušování autorských práv spojená s firemní technologií pro generování videa. Zdroj: techtimes.com
Důležitost:ZprávaVisual prompt engineering
Konec textového promptování? DeepMind představuje vizuální přístup, který funguje lépe
Výzkumníci z Google DeepMind přišli s novým způsobem zadávání instrukcí AI modelům, který místo textu využívá vizuální podněty. Podle nich tento přístup přináší lepší výsledky než klasické textové promptování a spojuje zpracování přirozeného jazyka s vizuální inteligencí v rámci multimodálních systémů. Zdroj: eu.36kr.com
Důležitost:Zprávamultimodal AI breakthroughs
Multimodální AI nabírá na síle, Anduril získává investici za 100 miliard dolarů
Pokrok v multimodální AI se objevuje ve stejné době, kdy firma Anduril údajně získala financování ve výši 100 miliard dolarů. Přehled zmiňuje také politiky přednášející projevy napsané AI a další novinky, které mění podobu odvětví. Zdroj: theneurondaily.com
Důležitost:SpuštěníVideo Generation Models
Black Forest Labs představuje FLUX 3, multimodální model pro video, zvuk i akce robotů
Black Forest Labs uvedla model FLUX 3, multimodální flow model schopný vytvářet až 20sekundová videa s nativním zvukem a akčními sekvencemi. Model tak jde nad rámec generování obrázků a zvládá i video, zvuk a predikce spojené s robotikou. Zdroj: marktechpost.com
Důležitost:Spuštěnímulti-modal model
FLUX 3 je tu: Black Forest Labs rozšiřuje model o video a zvuk
Německá společnost Black Forest Labs představila 23. července 2026 model FLUX 3, který kombinuje generování obrazu, videa, zvuku a prvky takzvané fyzické AI v jednom systému. Jde o výrazný krok od čistě obrazového modelu k plně multimodálnímu řešení. Zdroj: techtimes.com
Důležitost:ZprávaAPI integration
Jak spojit textové, obrazové i video modely do jedné aplikace přes GPTProto API
Aplikace často postupně začnou kombinovat několik různých AI dodavatelů pro text, obraz a video, což komplikuje vývoj. Platforma GPTProto nabízí jednotné API, díky kterému lze všechny tyto typy modelů integrovat do jedné aplikace bez nutnosti spravovat více poskytovatelů zvlášť. Zdroj: concept-phones.com
Důležitost:Zprávaindustry updates
Přehled týdne v AI: nové modely od Anthropicu, Googlu, OpenAI a dalších
Týdenní souhrn přináší přehled nově vydaných AI modelů, mezi nimi Claude Opus 5, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Qwen 3.8 Max, OpenAI Presence, FLUX 3 a MAI Image 2.5 Pro. Nabídka ukazuje, jak intenzivně si velké AI laboratoře konkurují v textových, obrazových i multimodálních modelech. Zdroj: patmcguinness.substack.com
Důležitost:Spuštěnímultimodal AI models
Black Forest Labs představuje FLUX 3, multimodální model pro obrázky i krátká AI videa se zvukem
Black Forest Labs uvedla model FLUX 3, který rozšiřuje rodinu FLUX z generování statických obrázků i na tvorbu až 20sekundových videí se zvukem. Model zatím startuje jen v omezeném přístupu, ne jako plné veřejné vydání. Zdroj: venturebeat.com
Důležitost:ZprávaVideo generation models
Flux 3 umí generovat až 20sekundová videa s nativním zvukem, což je pro firmu novinka
Black Forest Labs vydala Flux 3, multimodální základní model trénovaný na obrázcích, videu i zvuku, který dokáže vytvářet videoklipy rovnou se synchronizovaným zvukem. Zdroj: the-decoder.com
Důležitost:ZprávaVideo generation models
Black Forest Labs spouští multimodální FLUX 3 s podporou videa i robotiky
Startup s valuací 3,25 miliardy dolarů představil nový model, který vytváří 20sekundová videa se synchronizovaným zvukem a už se testuje na výrobních linkách Audi. Zdroj: cryptobriefing.com
Důležitost:NázorAI Data Licensing
Shutterstock: Je multimodální AI především otázkou licencování dat?
AI Magazine hovořil s Danem Mandellem, SVP pro licencování dat a AI služby ve Shutterstocku, o multimodálních datech, kreativitě a firemním úsilí v oblasti AI. Zdroj: aimagazine.com
Důležitost:Výzkummultimodal models
Multimodální LLM se samostatně naučil lékařské znalosti pro diagnostiku a reporting EGD
Nová studie v Nature Communications popisuje multimodální velký jazykový model (MLLM) navržený jako pomoc při esofagogastroduodenoskopii (EGD). Model dokáže analyzovat obrazová data z vyšetření a automaticky generovat diagnostické zprávy. Zdroj: bioengineer.org
Důležitost:VýzkumEmbodied AI
Xiaomi představuje model U0 pro robotiku a embodied AI
Xiaomi ve středu odhalilo Xiaomi-Robotics-U0, multimodální autoregresivní základní model s 38 miliardami parametrů určený pro embodied AI. Firma uvedla, že model má sloužit k pokročilejšímu ovládání a generování chování robotů. Zdroj: technode.com
Důležitost:ZprávaAurora Mobile enterprise AI
Aurora Mobile rozšiřuje multimodální AI nástroje GPTBots.ai o generování obrázků a videí pomocí Modellix
Aurora Mobile Limited (NASDAQ: JG), přední poskytovatel firemních AI řešení, oznámila rozšíření platformy GPTBots.ai. Nová sada nástrojů poháněných Modellix umožňuje firmám generovat obrázky a videa přímo v platformě. Zdroj: markets.businessinsider.com
Důležitost:Výzkumquantum-llm-multimodal
MIT a IBM promítají kvantové unitární operátory do latentního prostoru jazykových modelů
Výzkumníci z MIT-IBM Computing Research Lab a IBM Quantum vyvinuli multimodální rámec, který mapuje kvantové unitární operátory do latentního prostoru jazykových modelů pro syntézu obvodů. Zdroj: quantumcomputingreport.com
Důležitost:Výzkumprecision nutrition
AI a strojové učení míří do přesné výživy
Klíčovou vlastností přístupu Precision Nutrition and Health je schopnost přizpůsobit intervence individuální variabilitě pomocí multimodálních dat. Zdroj: nature.com