Nový AI model pro medicínské snímky umí vysvětlit své diagnózy
Výzkumníci vyvinuli biomedicínský základní model, který kombinuje předtrénování na obrazu a textu s explicitními medicínskými koncepty, aby byly diagnózy AI srozumitelnější pro lékaře. Řeší tak jeden z hlavních nedostatků současných multimodálních medicínských AI systémů, kterým často chybí transparentnost. Zdroj: nature.com
Důležitost:Spuštěnívideo generation tool
Seedance 2.5 dorazil na AI Inspo, umí 30sekundová videa se zvukem
Platforma AI Inspo zpřístupnila model Seedance 2.5, který dokáže vygenerovat 30sekundová videa z různých typů vstupů a rovnou s vloženým zvukem. Nová verze tak posouvá možnosti tvorby delšího a komplexnějšího AI obsahu. Zdroj: somdnews.com
Důležitost:SpuštěníAI video tools
Seedance 2.5 na platformě AI Inspo umí 30sekundová videa s multimodálním vstupem a zvukem
AI Inspo přidalo do své tvůrčí platformy model Seedance 2.5, který dokáže generovat AI videa dlouhá až 30 sekund. Model podporuje multimodální vstupy a má integrované generování zvuku. Zdroj: streetinsider.com
Multimodální LLM sleduje vývoj orálního lichen planus v nové studii
Longitudinální studie testovala schopnost multimodálního LLM klasifikovat vývoj nemoci a odhadovat riziko u pacientů s orálním lichen planus. Výzkum hodnotil, jak přesně model dokáže sledovat změny v čase ve srovnání s tradičními diagnostickými postupy. Zdroj: nature.com
Důležitost:ZprávaMiniMax model performance
MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5
Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org
Důležitost:SpuštěníAI video generation tool
Pippit představil Seedance 2.5: AI video ve 4K až na 30 sekund s jemnější kontrolou
Nová verze Seedance 2.5 od Pippitu umožňuje generovat 4K video v délce až 30 sekund s přesným řízením na úrovni sekund. Přibyly také multimodální reference, možnost zadání pouze zvukem, řízení pomocí 3D drátěného modelu a vylepšené nástroje pro tvorbu vyprávěcích sekvencí. Zdroj: manilatimes.net
Důležitost:VýzkumAI alignment
Studie zkoumá, jak preferenční ladění ovlivňuje multimodální LLM
Nová rozsáhlá studie se zaměřuje na preferenční ladění, techniku běžně používanou ke zlepšení výkonu LLM, a zkoumá její konkrétní dopad na multimodální modely. Výzkum popisuje jak přínosy, tak omezení této metody při rozšíření za rámec čistě textových systémů. Zdroj: google.com
Důležitost:VýzkumLLM alignment
Studie zkoumá, jak funguje alignment u multimodálních LLM
Ladění na základě preferencí (preference alignment) se stalo klíčovým nástrojem pro zlepšování výkonu velkých jazykových modelů, jeho dopad u multimodálních systémů je ale méně prozkoumaný. Nová rozsáhlá studie se zaměřuje na to, jak se tyto techniky projevují napříč různými modalitami. Zdroj: machinelearning.apple.com
Důležitost:ZprávaAI Video Models
MiniMax H3: co byste měli vědět o novém AI modelu pro video
MiniMax H3 je open-weight model pro generování videa, který využívá multimodální uvažování, kontextovou regeneraci a pokročilou architekturu. Zdroj: ca.news.yahoo.com
Důležitost:ZprávaAI model comparison
FLUX 3 spojuje obrázky, video i další úlohy do jednoho modelu a předčí Seedance 2.0 i Grok
Nový model FLUX 3 od Black Forest Labs nahrazuje dosavadní skládačku samostatných nástrojů pro generování obrázků, videa a dalších úloh jediným multimodálním systémem. Podle prvních srovnání překonává konkurenty jako Seedance 2.0 nebo Grok hned v několika testech. Zdroj: sitepoint.com
Důležitost:Zprávamodel releases
MiniMax spouští video model H3, provází ho spor o autorská práva
MiniMax uvedl nový multimodální model H3, který podle nezávislých benchmarků vede v kategorii úprav videa. Uvedení modelu ale stíní žaloba kvůli porušování autorských práv spojená s firemní technologií pro generování videa. Zdroj: techtimes.com
Důležitost:ZprávaVisual prompt engineering
Konec textového promptování? DeepMind představuje vizuální přístup, který funguje lépe
Výzkumníci z Google DeepMind přišli s novým způsobem zadávání instrukcí AI modelům, který místo textu využívá vizuální podněty. Podle nich tento přístup přináší lepší výsledky než klasické textové promptování a spojuje zpracování přirozeného jazyka s vizuální inteligencí v rámci multimodálních systémů. Zdroj: eu.36kr.com
Důležitost:Zprávamultimodal AI breakthroughs
Multimodální AI nabírá na síle, Anduril získává investici za 100 miliard dolarů
Pokrok v multimodální AI se objevuje ve stejné době, kdy firma Anduril údajně získala financování ve výši 100 miliard dolarů. Přehled zmiňuje také politiky přednášející projevy napsané AI a další novinky, které mění podobu odvětví. Zdroj: theneurondaily.com
Důležitost:SpuštěníVideo Generation Models
Black Forest Labs představuje FLUX 3, multimodální model pro video, zvuk i akce robotů
Black Forest Labs uvedla model FLUX 3, multimodální flow model schopný vytvářet až 20sekundová videa s nativním zvukem a akčními sekvencemi. Model tak jde nad rámec generování obrázků a zvládá i video, zvuk a predikce spojené s robotikou. Zdroj: marktechpost.com
Důležitost:Spuštěnímulti-modal model
FLUX 3 je tu: Black Forest Labs rozšiřuje model o video a zvuk
Německá společnost Black Forest Labs představila 23. července 2026 model FLUX 3, který kombinuje generování obrazu, videa, zvuku a prvky takzvané fyzické AI v jednom systému. Jde o výrazný krok od čistě obrazového modelu k plně multimodálnímu řešení. Zdroj: techtimes.com
Důležitost:ZprávaAPI integration
Jak spojit textové, obrazové i video modely do jedné aplikace přes GPTProto API
Aplikace často postupně začnou kombinovat několik různých AI dodavatelů pro text, obraz a video, což komplikuje vývoj. Platforma GPTProto nabízí jednotné API, díky kterému lze všechny tyto typy modelů integrovat do jedné aplikace bez nutnosti spravovat více poskytovatelů zvlášť. Zdroj: concept-phones.com
Důležitost:Zprávaindustry updates
Přehled týdne v AI: nové modely od Anthropicu, Googlu, OpenAI a dalších
Týdenní souhrn přináší přehled nově vydaných AI modelů, mezi nimi Claude Opus 5, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Qwen 3.8 Max, OpenAI Presence, FLUX 3 a MAI Image 2.5 Pro. Nabídka ukazuje, jak intenzivně si velké AI laboratoře konkurují v textových, obrazových i multimodálních modelech. Zdroj: patmcguinness.substack.com
Důležitost:Spuštěnímultimodal AI models
Black Forest Labs představuje FLUX 3, multimodální model pro obrázky i krátká AI videa se zvukem
Black Forest Labs uvedla model FLUX 3, který rozšiřuje rodinu FLUX z generování statických obrázků i na tvorbu až 20sekundových videí se zvukem. Model zatím startuje jen v omezeném přístupu, ne jako plné veřejné vydání. Zdroj: venturebeat.com
Důležitost:ZprávaVideo generation models
Flux 3 umí generovat až 20sekundová videa s nativním zvukem, což je pro firmu novinka
Black Forest Labs vydala Flux 3, multimodální základní model trénovaný na obrázcích, videu i zvuku, který dokáže vytvářet videoklipy rovnou se synchronizovaným zvukem. Zdroj: the-decoder.com
Důležitost:ZprávaVideo generation models
Black Forest Labs spouští multimodální FLUX 3 s podporou videa i robotiky
Startup s valuací 3,25 miliardy dolarů představil nový model, který vytváří 20sekundová videa se synchronizovaným zvukem a už se testuje na výrobních linkách Audi. Zdroj: cryptobriefing.com