MixVio AI představuje jednotný kreativní prostor s 26 generativními cestami
MixVio AI spustilo jednotné pracovní prostředí, které sdružuje 26 generativních AI cest. Vybrané workflow zvládnou až 50 multimodálních referenčních souborů a vytvoří 30sekundové video v rozlišení 1080p s nativně synchronizovaným zvukem. Zdroj: manilatimes.net
Důležitost:SpuštěníMultimodal video creation workspace
HeyVigo spouští Infinite Canvas pro multimodální tvorbu AI videí
Nový nástroj spojuje obrázky, video, text, zvuk a opakovaně použitelné prvky do jednoho propojeného vizuálního prostoru s podporou AI při tvorbě. Zdroj: einnews.com
Důležitost:ZprávaAI video creation
Kling 4.0 posouvá multimodální AI generování videa a propojené vyprávění
Kling 4.0 přináší další fázi AI tvorby videa se zaměřením na propojení různých modalit do souvislého příběhu. Informace pocházejí z oznámení z 27. září 2026 z Albany v Alabamě. Zdroj: wboc.com
Důležitost:Spuštěnímultimodal models
Čína představila první vícejazyčnou multimodální AI klávesnici pro tibetštinu
Čína uvedla, co označuje za první vícejazyčnou a plně multimodální AI metodu vstupu textu pro tibetský jazyk v zemi. Systém byl představen v neděli ve městě Xining. Zdroj: globaltimes.cn
Důležitost:ZprávaFree LLM APIs
5 poskytovatelů zdarma nabízejících LLM API, které stojí za vyzkoušení v roce 2026
Přehled představuje pět poskytovatelů, kteří nabízejí bezplatný přístup k LLM API, včetně rychlé inference, multimodálních schopností a agentických AI aplikací. Seznam je určen vývojářům, kteří chtějí experimentovat bez placení za využití API. Zdroj: kdnuggets.com
Důležitost:ZprávaAI Agent Architecture
MiniMax: AI agenti potřebují miliony tokenů kontextu, ne jen větší textové modely
Technická ředitelka MiniMaxu Olive Song tvrdí, že příští generace AI agentů se nemůže opírat o čistě textové modely, ke kterým se dodatečně přilepí vidění. Podle ní je klíčové skutečně multimodální uvažování s obřím kontextovým oknem. Zdroj: finance.biggo.com
Nová metoda rekalibrace má menším AI modelům umožnit dosáhnout výkonu srovnatelného s GPT-4V. Mohla by tak zpřístupnit pokročilé multimodální schopnosti bez nutnosti provozovat výpočetně náročné obří modely. Zdroj: quantumzeitgeist.com
Důležitost:SpuštěníGemini video generation
Google představil Gemini Omni 1.1 Flash: AI videa ve 4K až na 40 sekund
Google vydal novou verzi svého multimodálního modelu, který dokáže generovat delší AI videa ve 4K rozlišení. Aktualizace posouvá limity délky videa výrazně nad předchozí verze Gemini. Zdroj: neowin.net
Důležitost:Zprávamultimodal AI
Co je multimodální AI a co se změní, když jeden model umí číst, vidět i slyšet
Multimodální AI označuje systémy, které v jednom modelu spojují porozumění textu, obrazu i zvuku místo používání samostatných nástrojů. Tento přístup umožňuje přirozenější interakci a širší využití – od analýzy fotografií po zpracování mluveného slova. Zdroj: sqmagazine.co.uk
Důležitost:Výzkummultimodal generation
STARFlow2 spojuje jazykové modely a normalizační toky pro multimodální generování
Výzkumníci představili STARFlow2, nový přístup kombinující velké jazykové modely s technikou normalizačních toků pro jednotné generování napříč různými typy dat. Metoda má přinést konzistentnější a flexibilnější tvorbu multimodálního obsahu. Zdroj: machinelearning.apple.com
Důležitost:Výzkummultimodal models
STARFlow2 spojuje jazykové modely a normalizující toky pro multimodální generování
STARFlow2 je nová architektura, která kombinuje jazykové modely s normalizujícími toky (normalizing flows) pro jednotné generování napříč více modalitami dat. Přístup má propojit text a další typy obsahu v rámci jednoho generativního rámce. Zdroj: machinelearning.apple.com
Důležitost:Spuštěnímultimodal AI video generation
Seedance 2.0 přináší AI video pro mapy, urbanismus a lokální obsah
Tvorba videa z prostorových dat dřív vyžadovala drony, 3D rendering nebo grafická studia. Přepracovaný AI model od ByteDance má tento proces zautomatizovat pro geoprostorové vizualizace i obsah spojený s konkrétními místy. Zdroj: gisuser.com
Důležitost:Spuštěnímultimodal AI models
Black Forest Labs představuje FLUX 3 pro multimodální generování videa
FLUX 3 je nový základní model od Black Forest Labs, který má společně zpracovávat obrázky, video a zvuk, přičemž v budoucnu má přibýt i textová predikce akcí. Zdroj: dynamicbusiness.com
Důležitost:Spuštěnímultimodal models
DeepSeek představil multimodální model konkurující Opusu 4.8
Nový model V4 Flash Vision Exp je zatím dostupný pouze přes placenou vývojářskou platformu čínského startupu. Firma naznačila, že později by mohla vydat i bezplatnou verzi. Zdroj: siliconangle.com
Důležitost:VýzkumBiomedical foundation models
Nový AI model pro medicínské snímky umí vysvětlit své diagnózy
Výzkumníci vyvinuli biomedicínský základní model, který kombinuje předtrénování na obrazu a textu s explicitními medicínskými koncepty, aby byly diagnózy AI srozumitelnější pro lékaře. Řeší tak jeden z hlavních nedostatků současných multimodálních medicínských AI systémů, kterým často chybí transparentnost. Zdroj: nature.com
Důležitost:Spuštěnívideo generation tool
Seedance 2.5 dorazil na AI Inspo, umí 30sekundová videa se zvukem
Platforma AI Inspo zpřístupnila model Seedance 2.5, který dokáže vygenerovat 30sekundová videa z různých typů vstupů a rovnou s vloženým zvukem. Nová verze tak posouvá možnosti tvorby delšího a komplexnějšího AI obsahu. Zdroj: somdnews.com
Důležitost:SpuštěníAI video tools
Seedance 2.5 na platformě AI Inspo umí 30sekundová videa s multimodálním vstupem a zvukem
AI Inspo přidalo do své tvůrčí platformy model Seedance 2.5, který dokáže generovat AI videa dlouhá až 30 sekund. Model podporuje multimodální vstupy a má integrované generování zvuku. Zdroj: streetinsider.com
Multimodální LLM sleduje vývoj orálního lichen planus v nové studii
Longitudinální studie testovala schopnost multimodálního LLM klasifikovat vývoj nemoci a odhadovat riziko u pacientů s orálním lichen planus. Výzkum hodnotil, jak přesně model dokáže sledovat změny v čase ve srovnání s tradičními diagnostickými postupy. Zdroj: nature.com
Důležitost:ZprávaMiniMax model performance
MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5
Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org
Důležitost:SpuštěníAI video generation tool
Pippit představil Seedance 2.5: AI video ve 4K až na 30 sekund s jemnější kontrolou
Nová verze Seedance 2.5 od Pippitu umožňuje generovat 4K video v délce až 30 sekund s přesným řízením na úrovni sekund. Přibyly také multimodální reference, možnost zadání pouze zvukem, řízení pomocí 3D drátěného modelu a vylepšené nástroje pro tvorbu vyprávěcích sekvencí. Zdroj: manilatimes.net