AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/multimodal

Štítek: Multimodal

80 článků

Důležitost:Spuštěnícreative workspace

MixVio AI představuje jednotný kreativní prostor s 26 generativními cestami

MixVio AI spustilo jednotné pracovní prostředí, které sdružuje 26 generativních AI cest. Vybrané workflow zvládnou až 50 multimodálních referenčních souborů a vytvoří 30sekundové video v rozlišení 1080p s nativně synchronizovaným zvukem. Zdroj: manilatimes.net

Důležitost:SpuštěníMultimodal video creation workspace

HeyVigo spouští Infinite Canvas pro multimodální tvorbu AI videí

Nový nástroj spojuje obrázky, video, text, zvuk a opakovaně použitelné prvky do jednoho propojeného vizuálního prostoru s podporou AI při tvorbě. Zdroj: einnews.com

Důležitost:ZprávaAI video creation

Kling 4.0 posouvá multimodální AI generování videa a propojené vyprávění

Kling 4.0 přináší další fázi AI tvorby videa se zaměřením na propojení různých modalit do souvislého příběhu. Informace pocházejí z oznámení z 27. září 2026 z Albany v Alabamě. Zdroj: wboc.com

Důležitost:Spuštěnímultimodal models

Čína představila první vícejazyčnou multimodální AI klávesnici pro tibetštinu

Čína uvedla, co označuje za první vícejazyčnou a plně multimodální AI metodu vstupu textu pro tibetský jazyk v zemi. Systém byl představen v neděli ve městě Xining. Zdroj: globaltimes.cn

Důležitost:ZprávaFree LLM APIs

5 poskytovatelů zdarma nabízejících LLM API, které stojí za vyzkoušení v roce 2026

Přehled představuje pět poskytovatelů, kteří nabízejí bezplatný přístup k LLM API, včetně rychlé inference, multimodálních schopností a agentických AI aplikací. Seznam je určen vývojářům, kteří chtějí experimentovat bez placení za využití API. Zdroj: kdnuggets.com

Důležitost:ZprávaAI Agent Architecture

MiniMax: AI agenti potřebují miliony tokenů kontextu, ne jen větší textové modely

Technická ředitelka MiniMaxu Olive Song tvrdí, že příští generace AI agentů se nemůže opírat o čistě textové modely, ke kterým se dodatečně přilepí vidění. Podle ní je klíčové skutečně multimodální uvažování s obřím kontextovým oknem. Zdroj: finance.biggo.com

Důležitost:Zprávaefficiency

Technika „rekalibrace“ dovoluje malým modelům konkurovat GPT-4V

Nová metoda rekalibrace má menším AI modelům umožnit dosáhnout výkonu srovnatelného s GPT-4V. Mohla by tak zpřístupnit pokročilé multimodální schopnosti bez nutnosti provozovat výpočetně náročné obří modely. Zdroj: quantumzeitgeist.com

Důležitost:SpuštěníGemini video generation

Google představil Gemini Omni 1.1 Flash: AI videa ve 4K až na 40 sekund

Google vydal novou verzi svého multimodálního modelu, který dokáže generovat delší AI videa ve 4K rozlišení. Aktualizace posouvá limity délky videa výrazně nad předchozí verze Gemini. Zdroj: neowin.net

Důležitost:Zprávamultimodal AI

Co je multimodální AI a co se změní, když jeden model umí číst, vidět i slyšet

Multimodální AI označuje systémy, které v jednom modelu spojují porozumění textu, obrazu i zvuku místo používání samostatných nástrojů. Tento přístup umožňuje přirozenější interakci a širší využití – od analýzy fotografií po zpracování mluveného slova. Zdroj: sqmagazine.co.uk

Důležitost:Výzkummultimodal generation

STARFlow2 spojuje jazykové modely a normalizační toky pro multimodální generování

Výzkumníci představili STARFlow2, nový přístup kombinující velké jazykové modely s technikou normalizačních toků pro jednotné generování napříč různými typy dat. Metoda má přinést konzistentnější a flexibilnější tvorbu multimodálního obsahu. Zdroj: machinelearning.apple.com

Důležitost:Výzkummultimodal models

STARFlow2 spojuje jazykové modely a normalizující toky pro multimodální generování

STARFlow2 je nová architektura, která kombinuje jazykové modely s normalizujícími toky (normalizing flows) pro jednotné generování napříč více modalitami dat. Přístup má propojit text a další typy obsahu v rámci jednoho generativního rámce. Zdroj: machinelearning.apple.com

Důležitost:Spuštěnímultimodal AI video generation

Seedance 2.0 přináší AI video pro mapy, urbanismus a lokální obsah

Tvorba videa z prostorových dat dřív vyžadovala drony, 3D rendering nebo grafická studia. Přepracovaný AI model od ByteDance má tento proces zautomatizovat pro geoprostorové vizualizace i obsah spojený s konkrétními místy. Zdroj: gisuser.com

Důležitost:Spuštěnímultimodal AI models

Black Forest Labs představuje FLUX 3 pro multimodální generování videa

FLUX 3 je nový základní model od Black Forest Labs, který má společně zpracovávat obrázky, video a zvuk, přičemž v budoucnu má přibýt i textová predikce akcí. Zdroj: dynamicbusiness.com

Důležitost:Spuštěnímultimodal models

DeepSeek představil multimodální model konkurující Opusu 4.8

Nový model V4 Flash Vision Exp je zatím dostupný pouze přes placenou vývojářskou platformu čínského startupu. Firma naznačila, že později by mohla vydat i bezplatnou verzi. Zdroj: siliconangle.com

Důležitost:VýzkumBiomedical foundation models

Nový AI model pro medicínské snímky umí vysvětlit své diagnózy

Výzkumníci vyvinuli biomedicínský základní model, který kombinuje předtrénování na obrazu a textu s explicitními medicínskými koncepty, aby byly diagnózy AI srozumitelnější pro lékaře. Řeší tak jeden z hlavních nedostatků současných multimodálních medicínských AI systémů, kterým často chybí transparentnost. Zdroj: nature.com

Důležitost:Spuštěnívideo generation tool

Seedance 2.5 dorazil na AI Inspo, umí 30sekundová videa se zvukem

Platforma AI Inspo zpřístupnila model Seedance 2.5, který dokáže vygenerovat 30sekundová videa z různých typů vstupů a rovnou s vloženým zvukem. Nová verze tak posouvá možnosti tvorby delšího a komplexnějšího AI obsahu. Zdroj: somdnews.com

Důležitost:SpuštěníAI video tools

Seedance 2.5 na platformě AI Inspo umí 30sekundová videa s multimodálním vstupem a zvukem

AI Inspo přidalo do své tvůrčí platformy model Seedance 2.5, který dokáže generovat AI videa dlouhá až 30 sekund. Model podporuje multimodální vstupy a má integrované generování zvuku. Zdroj: streetinsider.com

Důležitost:Výzkummultimodal healthcare applications

Multimodální LLM sleduje vývoj orálního lichen planus v nové studii

Longitudinální studie testovala schopnost multimodálního LLM klasifikovat vývoj nemoci a odhadovat riziko u pacientů s orálním lichen planus. Výzkum hodnotil, jak přesně model dokáže sledovat změny v čase ve srovnání s tradičními diagnostickými postupy. Zdroj: nature.com

Důležitost:ZprávaMiniMax model performance

MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5

Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org

Důležitost:SpuštěníAI video generation tool

Pippit představil Seedance 2.5: AI video ve 4K až na 30 sekund s jemnější kontrolou

Nová verze Seedance 2.5 od Pippitu umožňuje generovat 4K video v délce až 30 sekund s přesným řízením na úrovni sekund. Přibyly také multimodální reference, možnost zadání pouze zvukem, řízení pomocí 3D drátěného modelu a vylepšené nástroje pro tvorbu vyprávěcích sekvencí. Zdroj: manilatimes.net