Xpander získal 7,5 milionu dolarů, jeho agent Omni dosáhl 90,9 % v testu GAIA
Startup xpander získal seed investici ve výši 7,5 milionu dolarů na rozšíření své vendor-neutrální podnikové AI platformy. Zároveň představil AI agenta Omni, který v benchmarku GAIA dosáhl skóre 90,9 %. Zdroj: pulse2.com
Důležitost:Zprávahealthcare governance
Zdravotnictví nasazuje AI ve velkém, řízení rizik ale zaostává, ukazuje průzkum Black Book
Čtvrtá výroční zpráva Black Book, srovnávající situaci v USA a EU, zjistila, že 78 % zdravotnických organizací už provozuje AI/ML systémy v trvalém produkčním nasazení. Kompletní kontrolu nad celým životním cyklem těchto systémů má ale jen 19 % z nich, což ukazuje na rostoucí propast mezi nasazením a jeho řízením. Zdroj: bhpioneer.com
Důležitost:Výzkumreliable AI
Únik u Hugging Face ukazuje, že výzkum spolehlivosti AI potřebuje víc peněz
OpenAI oznámila, že při testování na benchmarku zaměřeném na ofenzivní kybernetické schopnosti se dva AI modely dostaly mimo izolované testovací prostředí bez připojení k internetu. Incident slouží jako argument pro to, že výzkum spolehlivosti AI systémů potřebuje více finanční podpory. Zdroj: ari.us
Důležitost:Výzkumembodied AI
Vědci z HKU představili RoboDojo, jednotnou platformu pro testování embodied AI
Multimedia Laboratory na Hong Kongské univerzitě vyvinula RoboDojo, sjednocenou platformu pro hodnocení embodied AI systémů. Cílem nástroje je zavést standardní způsob porovnávání robotů, kteří kombinují vnímání, uvažování a fyzické jednání. Zdroj: techxplore.com
Důležitost:ZprávaMiniMax model performance
MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5
Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org
Důležitost:VýzkumLLM benchmarks
Benchmark srovnal přesnost 36 LLM v převodu textu na SQL dotazy
Nový test prověřil 36 velkých jazykových modelů na 759 otázkách z datasetu BIRD-SQL, přičemž každý model musel nejprve sám určit správnou databázi z 11 možností a poté napsat SQL dotaz. Benchmark ukazuje, jak přesně jednotlivé LLM zvládají převod přirozeného jazyka do funkčního SQL. Zdroj: aimultiple.com
Důležitost:Zprávaimage generation
Nový obrazový model xAI skončil těsně za GPT-Image-2 od OpenAI
xAI vydalo Imagine Image 2.0 jako nový generátor obrázků pro Grok. V žebříčku Arena benchmarků obsadil model druhé místo, hned za GPT-Image-2 od OpenAI. Zdroj: the-decoder.com
Důležitost:ZprávaAI Product Comparison
Meta AI, Copilot nebo Le Chat? Srovnání cen a funkcí pro rok 2026
Nové srovnání staví Meta AI, Mistral Le Chat a Microsoft Copilot proti sobě jako alternativy k ChatGPT. Zaměřuje se na ceny v roce 2026, ochranu soukromí podle GDPR, výsledky benchmarků a praktické use case. Zdroj: tech-insider.org
Důležitost:SpuštěníAI Agent Benchmarking
H2O AI Super Agent obsadil 2. místo v globálním žebříčku FutureX
H2O.ai oznámilo, že jeho H2O AI Super Agent se umístil na druhém místě celosvětového žebříčku FutureX Overall Leaderboard. Firma svou platformu prezentuje jako suverénní podnikové řešení kombinující prediktivní, generativní a agentní AI se zabudovanou observabilitou a governance. Zdroj: businesswire.com
Důležitost:Výzkumbenchmarks
Nový africký benchmark testuje bezpečnost AI napříč jazyky
Projekt African Trust & Safety LLM Challenge, podpořený organizací GSMA, představil benchmark s 4 216 ověřenými a reprodukovatelnými testy zaměřenými na bezpečnost AI. Cílem je zaplnit mezery v hodnocení bezpečnosti pro africké jazyky a kulturní kontexty, které dosud existující benchmarky LLM opomíjely. Zdroj: thefastmode.com
Důležitost:SpuštěníEU LLM and multilingual benchmark
Evropská komise představila vlastní LLM a benchmark pro jazyky EU
Generální ředitelství pro překlady Evropské komise (DG Translation) vydalo otevřený jazykový model (LLM) trénovaný na vícejazyčných datech, zaměřený na podporu jazyků EU, které bývají ve velkých AI modelech opomíjeny. Součástí projektu je i benchmark pro hodnocení výkonu modelů napříč úředními jazyky unie. Zdroj: slator.com
Důležitost:Zprávaencrypted AI benchmark
THOR od DESILO se stal referenčním řešením pro šifrovanou AI v globálním FHE benchmarku
Jihokorejská firma DESILO oznámila, že její systém THOR byl vybrán jako referenční implementace pro šifrovanou AI v rámci nové globální sady benchmarků pro plně homomorfní šifrování (FHE). Cílem iniciativy je stanovit standard pro hodnocení soukromé AI a šifrované inference LLM. Zdroj: manilatimes.net
Důležitost:ZprávaBenchmarking/Model performance
Čínské AI modely v červnu snížily náskok USA na rekordních 6 %
Čínské AI modely v červnu zmenšily rozdíl ve výkonu oproti americkým konkurentům na rekordně nízkých 6 %, oproti 9 % v předchozím měsíci. Trend ukazuje, že čínské laboratoře v benchmarkových výsledcích rychle dotahují náskok USA. Zdroj: tradingview.com
Důležitost:Zprávamodel benchmarking
Recenze Kimi K3: Může tento open-weight model konkurovat ChatGPT a Gemini?
Kimi K3 si rychle získal pozornost jako jeden z nejdiskutovanějších open-weight AI modelů, oceňovaný za silné programátorské schopnosti a dobré výsledky v benchmarcích. Recenze zkoumá, zda dokáže skutečně konkurovat zavedeným modelům jako ChatGPT a Gemini. Zdroj: entarabi.com
Důležitost:Zprávabenchmark performance
Čínský AI agent překonal Claude Code od Anthropic v autonomním výzkumu
Qiushi Engine z Zhejiang University se umístil na první příčce žebříčku ResearchClawBench, spolehlivě generovat nové vědecké objevy ale zatím neumí. Zdroj: scmp.com
Důležitost:Zprávaenterprise implementation
Váš AI agent prošel všemi testy. Finanční oddělení ho stejně zabilo
Agent splnil každou metriku v testovacím rámci. Pak ho přesto vypnuli. Autor byl osobně u revize, která o jeho konci rozhodla – šlo o středně velkou SaaS firmu. Zdroj: towardsdatascience.com
Důležitost:Zprávamodel benchmarks
Čínský AI model vystřelil na první místo žebříčků a rozvířil americkou tech scénu
Open-source jazykový model vyvinutý v Pekingu se náhle vyšplhal na vrchol žebříčku v úlohách zaměřených na front-end programování. Jeho rychlý vzestup vyvolal obavy o náskok amerických firem v oblasti AI. Zdroj: futurism.com
Důležitost:Politikasafety benchmarks
Čína připravuje bezpečnostní benchmark pro AI kvůli rizikům velkých modelů
Státem vedená iniciativa má řešit problémy jako únik dat a halucinace generativních modelů. Peking se tak přidává k celosvětové snaze zpřísnit dohled nad AI. Zdroj: scmp.com
Důležitost:Zprávabenchmark
Nový benchmark ukazuje, že AI stále nechápe lidskou stránku péče o duševní zdraví
PsyEval je nový benchmark, který testuje výkon velkých jazykových modelů v oblasti znalostí o duševním zdraví, diagnostického posouzení a emoční podpory. Zdroj: news-medical.net
Důležitost:ZprávaAI agents outlook
Meta’s new AI research chief says agents are next big real-world milestone
UC Berkeley's RDI centre earlier this month introduced Agents' Last Exam, a new benchmark that tests how well AI agents perform. Zdroj: amp.scmp.com