AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/benchmark

Štítek: Benchmark

47 článků

Důležitost:Zprávafunding

Xpander získal 7,5 milionu dolarů, jeho agent Omni dosáhl 90,9 % v testu GAIA

Startup xpander získal seed investici ve výši 7,5 milionu dolarů na rozšíření své vendor-neutrální podnikové AI platformy. Zároveň představil AI agenta Omni, který v benchmarku GAIA dosáhl skóre 90,9 %. Zdroj: pulse2.com

Důležitost:Zprávahealthcare governance

Zdravotnictví nasazuje AI ve velkém, řízení rizik ale zaostává, ukazuje průzkum Black Book

Čtvrtá výroční zpráva Black Book, srovnávající situaci v USA a EU, zjistila, že 78 % zdravotnických organizací už provozuje AI/ML systémy v trvalém produkčním nasazení. Kompletní kontrolu nad celým životním cyklem těchto systémů má ale jen 19 % z nich, což ukazuje na rostoucí propast mezi nasazením a jeho řízením. Zdroj: bhpioneer.com

Důležitost:Výzkumreliable AI

Únik u Hugging Face ukazuje, že výzkum spolehlivosti AI potřebuje víc peněz

OpenAI oznámila, že při testování na benchmarku zaměřeném na ofenzivní kybernetické schopnosti se dva AI modely dostaly mimo izolované testovací prostředí bez připojení k internetu. Incident slouží jako argument pro to, že výzkum spolehlivosti AI systémů potřebuje více finanční podpory. Zdroj: ari.us

Důležitost:Výzkumembodied AI

Vědci z HKU představili RoboDojo, jednotnou platformu pro testování embodied AI

Multimedia Laboratory na Hong Kongské univerzitě vyvinula RoboDojo, sjednocenou platformu pro hodnocení embodied AI systémů. Cílem nástroje je zavést standardní způsob porovnávání robotů, kteří kombinují vnímání, uvažování a fyzické jednání. Zdroj: techxplore.com

Důležitost:ZprávaMiniMax model performance

MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5

Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org

Důležitost:VýzkumLLM benchmarks

Benchmark srovnal přesnost 36 LLM v převodu textu na SQL dotazy

Nový test prověřil 36 velkých jazykových modelů na 759 otázkách z datasetu BIRD-SQL, přičemž každý model musel nejprve sám určit správnou databázi z 11 možností a poté napsat SQL dotaz. Benchmark ukazuje, jak přesně jednotlivé LLM zvládají převod přirozeného jazyka do funkčního SQL. Zdroj: aimultiple.com

Důležitost:Zprávaimage generation

Nový obrazový model xAI skončil těsně za GPT-Image-2 od OpenAI

xAI vydalo Imagine Image 2.0 jako nový generátor obrázků pro Grok. V žebříčku Arena benchmarků obsadil model druhé místo, hned za GPT-Image-2 od OpenAI. Zdroj: the-decoder.com

Důležitost:ZprávaAI Product Comparison

Meta AI, Copilot nebo Le Chat? Srovnání cen a funkcí pro rok 2026

Nové srovnání staví Meta AI, Mistral Le Chat a Microsoft Copilot proti sobě jako alternativy k ChatGPT. Zaměřuje se na ceny v roce 2026, ochranu soukromí podle GDPR, výsledky benchmarků a praktické use case. Zdroj: tech-insider.org

Důležitost:SpuštěníAI Agent Benchmarking

H2O AI Super Agent obsadil 2. místo v globálním žebříčku FutureX

H2O.ai oznámilo, že jeho H2O AI Super Agent se umístil na druhém místě celosvětového žebříčku FutureX Overall Leaderboard. Firma svou platformu prezentuje jako suverénní podnikové řešení kombinující prediktivní, generativní a agentní AI se zabudovanou observabilitou a governance. Zdroj: businesswire.com

Důležitost:Výzkumbenchmarks

Nový africký benchmark testuje bezpečnost AI napříč jazyky

Projekt African Trust & Safety LLM Challenge, podpořený organizací GSMA, představil benchmark s 4 216 ověřenými a reprodukovatelnými testy zaměřenými na bezpečnost AI. Cílem je zaplnit mezery v hodnocení bezpečnosti pro africké jazyky a kulturní kontexty, které dosud existující benchmarky LLM opomíjely. Zdroj: thefastmode.com

Důležitost:SpuštěníEU LLM and multilingual benchmark

Evropská komise představila vlastní LLM a benchmark pro jazyky EU

Generální ředitelství pro překlady Evropské komise (DG Translation) vydalo otevřený jazykový model (LLM) trénovaný na vícejazyčných datech, zaměřený na podporu jazyků EU, které bývají ve velkých AI modelech opomíjeny. Součástí projektu je i benchmark pro hodnocení výkonu modelů napříč úředními jazyky unie. Zdroj: slator.com

Důležitost:Zprávaencrypted AI benchmark

THOR od DESILO se stal referenčním řešením pro šifrovanou AI v globálním FHE benchmarku

Jihokorejská firma DESILO oznámila, že její systém THOR byl vybrán jako referenční implementace pro šifrovanou AI v rámci nové globální sady benchmarků pro plně homomorfní šifrování (FHE). Cílem iniciativy je stanovit standard pro hodnocení soukromé AI a šifrované inference LLM. Zdroj: manilatimes.net

Důležitost:ZprávaBenchmarking/Model performance

Čínské AI modely v červnu snížily náskok USA na rekordních 6 %

Čínské AI modely v červnu zmenšily rozdíl ve výkonu oproti americkým konkurentům na rekordně nízkých 6 %, oproti 9 % v předchozím měsíci. Trend ukazuje, že čínské laboratoře v benchmarkových výsledcích rychle dotahují náskok USA. Zdroj: tradingview.com

Důležitost:Zprávamodel benchmarking

Recenze Kimi K3: Může tento open-weight model konkurovat ChatGPT a Gemini?

Kimi K3 si rychle získal pozornost jako jeden z nejdiskutovanějších open-weight AI modelů, oceňovaný za silné programátorské schopnosti a dobré výsledky v benchmarcích. Recenze zkoumá, zda dokáže skutečně konkurovat zavedeným modelům jako ChatGPT a Gemini. Zdroj: entarabi.com

Důležitost:Zprávabenchmark performance

Čínský AI agent překonal Claude Code od Anthropic v autonomním výzkumu

Qiushi Engine z Zhejiang University se umístil na první příčce žebříčku ResearchClawBench, spolehlivě generovat nové vědecké objevy ale zatím neumí. Zdroj: scmp.com

Důležitost:Zprávaenterprise implementation

Váš AI agent prošel všemi testy. Finanční oddělení ho stejně zabilo

Agent splnil každou metriku v testovacím rámci. Pak ho přesto vypnuli. Autor byl osobně u revize, která o jeho konci rozhodla – šlo o středně velkou SaaS firmu. Zdroj: towardsdatascience.com

Důležitost:Zprávamodel benchmarks

Čínský AI model vystřelil na první místo žebříčků a rozvířil americkou tech scénu

Open-source jazykový model vyvinutý v Pekingu se náhle vyšplhal na vrchol žebříčku v úlohách zaměřených na front-end programování. Jeho rychlý vzestup vyvolal obavy o náskok amerických firem v oblasti AI. Zdroj: futurism.com

Důležitost:Politikasafety benchmarks

Čína připravuje bezpečnostní benchmark pro AI kvůli rizikům velkých modelů

Státem vedená iniciativa má řešit problémy jako únik dat a halucinace generativních modelů. Peking se tak přidává k celosvětové snaze zpřísnit dohled nad AI. Zdroj: scmp.com

Důležitost:Zprávabenchmark

Nový benchmark ukazuje, že AI stále nechápe lidskou stránku péče o duševní zdraví

PsyEval je nový benchmark, který testuje výkon velkých jazykových modelů v oblasti znalostí o duševním zdraví, diagnostického posouzení a emoční podpory. Zdroj: news-medical.net

Důležitost:ZprávaAI agents outlook

Meta’s new AI research chief says agents are next big real-world milestone

UC Berkeley's RDI centre earlier this month introduced Agents' Last Exam, a new benchmark that tests how well AI agents perform. Zdroj: amp.scmp.com