AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/multimodal

Štítek: Multimodal

66 článků

Důležitost:VýzkumBiomedical foundation models

Nový AI model pro medicínské snímky umí vysvětlit své diagnózy

Výzkumníci vyvinuli biomedicínský základní model, který kombinuje předtrénování na obrazu a textu s explicitními medicínskými koncepty, aby byly diagnózy AI srozumitelnější pro lékaře. Řeší tak jeden z hlavních nedostatků současných multimodálních medicínských AI systémů, kterým často chybí transparentnost. Zdroj: nature.com

Důležitost:Spuštěnívideo generation tool

Seedance 2.5 dorazil na AI Inspo, umí 30sekundová videa se zvukem

Platforma AI Inspo zpřístupnila model Seedance 2.5, který dokáže vygenerovat 30sekundová videa z různých typů vstupů a rovnou s vloženým zvukem. Nová verze tak posouvá možnosti tvorby delšího a komplexnějšího AI obsahu. Zdroj: somdnews.com

Důležitost:SpuštěníAI video tools

Seedance 2.5 na platformě AI Inspo umí 30sekundová videa s multimodálním vstupem a zvukem

AI Inspo přidalo do své tvůrčí platformy model Seedance 2.5, který dokáže generovat AI videa dlouhá až 30 sekund. Model podporuje multimodální vstupy a má integrované generování zvuku. Zdroj: streetinsider.com

Důležitost:Výzkummultimodal healthcare applications

Multimodální LLM sleduje vývoj orálního lichen planus v nové studii

Longitudinální studie testovala schopnost multimodálního LLM klasifikovat vývoj nemoci a odhadovat riziko u pacientů s orálním lichen planus. Výzkum hodnotil, jak přesně model dokáže sledovat změny v čase ve srovnání s tradičními diagnostickými postupy. Zdroj: nature.com

Důležitost:ZprávaMiniMax model performance

MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5

Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org

Důležitost:SpuštěníAI video generation tool

Pippit představil Seedance 2.5: AI video ve 4K až na 30 sekund s jemnější kontrolou

Nová verze Seedance 2.5 od Pippitu umožňuje generovat 4K video v délce až 30 sekund s přesným řízením na úrovni sekund. Přibyly také multimodální reference, možnost zadání pouze zvukem, řízení pomocí 3D drátěného modelu a vylepšené nástroje pro tvorbu vyprávěcích sekvencí. Zdroj: manilatimes.net

Důležitost:VýzkumAI alignment

Studie zkoumá, jak preferenční ladění ovlivňuje multimodální LLM

Nová rozsáhlá studie se zaměřuje na preferenční ladění, techniku běžně používanou ke zlepšení výkonu LLM, a zkoumá její konkrétní dopad na multimodální modely. Výzkum popisuje jak přínosy, tak omezení této metody při rozšíření za rámec čistě textových systémů. Zdroj: google.com

Důležitost:VýzkumLLM alignment

Studie zkoumá, jak funguje alignment u multimodálních LLM

Ladění na základě preferencí (preference alignment) se stalo klíčovým nástrojem pro zlepšování výkonu velkých jazykových modelů, jeho dopad u multimodálních systémů je ale méně prozkoumaný. Nová rozsáhlá studie se zaměřuje na to, jak se tyto techniky projevují napříč různými modalitami. Zdroj: machinelearning.apple.com

Důležitost:ZprávaAI Video Models

MiniMax H3: co byste měli vědět o novém AI modelu pro video

MiniMax H3 je open-weight model pro generování videa, který využívá multimodální uvažování, kontextovou regeneraci a pokročilou architekturu. Zdroj: ca.news.yahoo.com

Důležitost:ZprávaAI model comparison

FLUX 3 spojuje obrázky, video i další úlohy do jednoho modelu a předčí Seedance 2.0 i Grok

Nový model FLUX 3 od Black Forest Labs nahrazuje dosavadní skládačku samostatných nástrojů pro generování obrázků, videa a dalších úloh jediným multimodálním systémem. Podle prvních srovnání překonává konkurenty jako Seedance 2.0 nebo Grok hned v několika testech. Zdroj: sitepoint.com

Důležitost:Zprávamodel releases

MiniMax spouští video model H3, provází ho spor o autorská práva

MiniMax uvedl nový multimodální model H3, který podle nezávislých benchmarků vede v kategorii úprav videa. Uvedení modelu ale stíní žaloba kvůli porušování autorských práv spojená s firemní technologií pro generování videa. Zdroj: techtimes.com

Důležitost:ZprávaVisual prompt engineering

Konec textového promptování? DeepMind představuje vizuální přístup, který funguje lépe

Výzkumníci z Google DeepMind přišli s novým způsobem zadávání instrukcí AI modelům, který místo textu využívá vizuální podněty. Podle nich tento přístup přináší lepší výsledky než klasické textové promptování a spojuje zpracování přirozeného jazyka s vizuální inteligencí v rámci multimodálních systémů. Zdroj: eu.36kr.com

Důležitost:Zprávamultimodal AI breakthroughs

Multimodální AI nabírá na síle, Anduril získává investici za 100 miliard dolarů

Pokrok v multimodální AI se objevuje ve stejné době, kdy firma Anduril údajně získala financování ve výši 100 miliard dolarů. Přehled zmiňuje také politiky přednášející projevy napsané AI a další novinky, které mění podobu odvětví. Zdroj: theneurondaily.com

Důležitost:SpuštěníVideo Generation Models

Black Forest Labs představuje FLUX 3, multimodální model pro video, zvuk i akce robotů

Black Forest Labs uvedla model FLUX 3, multimodální flow model schopný vytvářet až 20sekundová videa s nativním zvukem a akčními sekvencemi. Model tak jde nad rámec generování obrázků a zvládá i video, zvuk a predikce spojené s robotikou. Zdroj: marktechpost.com

Důležitost:Spuštěnímulti-modal model

FLUX 3 je tu: Black Forest Labs rozšiřuje model o video a zvuk

Německá společnost Black Forest Labs představila 23. července 2026 model FLUX 3, který kombinuje generování obrazu, videa, zvuku a prvky takzvané fyzické AI v jednom systému. Jde o výrazný krok od čistě obrazového modelu k plně multimodálnímu řešení. Zdroj: techtimes.com

Důležitost:ZprávaAPI integration

Jak spojit textové, obrazové i video modely do jedné aplikace přes GPTProto API

Aplikace často postupně začnou kombinovat několik různých AI dodavatelů pro text, obraz a video, což komplikuje vývoj. Platforma GPTProto nabízí jednotné API, díky kterému lze všechny tyto typy modelů integrovat do jedné aplikace bez nutnosti spravovat více poskytovatelů zvlášť. Zdroj: concept-phones.com

Důležitost:Zprávaindustry updates

Přehled týdne v AI: nové modely od Anthropicu, Googlu, OpenAI a dalších

Týdenní souhrn přináší přehled nově vydaných AI modelů, mezi nimi Claude Opus 5, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Qwen 3.8 Max, OpenAI Presence, FLUX 3 a MAI Image 2.5 Pro. Nabídka ukazuje, jak intenzivně si velké AI laboratoře konkurují v textových, obrazových i multimodálních modelech. Zdroj: patmcguinness.substack.com

Důležitost:Spuštěnímultimodal AI models

Black Forest Labs představuje FLUX 3, multimodální model pro obrázky i krátká AI videa se zvukem

Black Forest Labs uvedla model FLUX 3, který rozšiřuje rodinu FLUX z generování statických obrázků i na tvorbu až 20sekundových videí se zvukem. Model zatím startuje jen v omezeném přístupu, ne jako plné veřejné vydání. Zdroj: venturebeat.com

Důležitost:ZprávaVideo generation models

Flux 3 umí generovat až 20sekundová videa s nativním zvukem, což je pro firmu novinka

Black Forest Labs vydala Flux 3, multimodální základní model trénovaný na obrázcích, videu i zvuku, který dokáže vytvářet videoklipy rovnou se synchronizovaným zvukem. Zdroj: the-decoder.com

Důležitost:ZprávaVideo generation models

Black Forest Labs spouští multimodální FLUX 3 s podporou videa i robotiky

Startup s valuací 3,25 miliardy dolarů představil nový model, který vytváří 20sekundová videa se synchronizovaným zvukem a už se testuje na výrobních linkách Audi. Zdroj: cryptobriefing.com