AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/benchmark

Štítek: Benchmark

59 článků

Důležitost:Zprávaquantum computing/materials science

Columbia a Cambridge posouvají kvantové AI modelování materiálů

Vědci z Columbia University a University of Cambridge vytvořili nový benchmark pro hodnocení strojového učení při predikci vlastností materiálů. Cílem je zvýšit spolehlivost AI modelů ve vědě o materiálech propojením poznatků z kvantových výpočtů s metodami hodnocení ML. Zdroj: quantumzeitgeist.com

Důležitost:SpuštěníLLM tool-use/training data

Google představil ToolGrad s úspěšností 99,8 % při generování dat pro použití nástrojů

Google Research vyvinul framework ToolGrad, který generuje trénovací data pro využívání nástrojů v LLM tak, že postupuje odzadu od výsledné odpovědi. Přístup dosahuje 99,8% úspěšnosti a skóre 83,1 v benchmarku BFCL. Zdroj: marktechpost.com

Důležitost:Zprávaautonomous AI agents

Zpráva: autonomní AI agent zanechal stopy své činnosti na Hugging Face

V červenci 2026 procházel autonomní AI agent postavený na modelech OpenAI benchmarkovým testem, který měřil jeho schopnost vyhledávat a zpracovávat data. Během testu měl na platformě Hugging Face zanechat soubory odhalující detaily o jeho chování. Zdroj: scworld.com

Důležitost:Zprávamaterials science

AI modely pro materiálovou vědu potřebují lepší fyzikální základ

Tým vedený Michelem Simoncellim vytvořil nový benchmark, který testuje, jak přesně modely strojového učení zachycují kvantové interakce mezi atomy. Cílem je posunout AI systémy používané v materiálové vědě k fyzikálně konzistentnějším předpovědím. Zdroj: eurekalert.org

Důležitost:Spuštěnídeveloper_tools

HydraFusion: Orchestrace více modelů má přiblížit kvalitu špičkových AI za nižší cenu

Projekt HydraFusion od GitHubu kombinuje více modelů a selektivně je nasazuje na programátorské úlohy. V offline testech si podle všeho v jednom benchmarku vedl stejně dobře nebo lépe než model Opus 5, a to při nižších nákladech, i když srovnatelnou kvalitu se nepodařilo prokázat ve všech testech. Zdroj: github.blog

Důležitost:Spuštěnídeveloper_tools

Router HydraFusion od GitHubu snižuje náklady na AI programování, kvalitu ale potvrdil jen v jednom testu

Nový systém HydraFusion od GitHubu dokáže snížit náklady na AI generování kódu ve všech testovaných benchmarcích. Vlastní zveřejněná data ale ukazují, že srovnatelnou kvalitu si udržel jen v jednom ze tří testů. Zdroj: venturebeat.com

Důležitost:ZprávaAdobe AI

Agentní weby prověří rychlost Adobe AI

Adobe testuje, jak rychle dokáže jeho AI pohánět nové nástroje pro tvorbu webů pomocí agentů. Uvedení slouží jako zkouška pro širší směřování firmy k autonomním kreativním nástrojům založeným na AI. Zdroj: startuphub.ai

Důležitost:Výzkumhardware optimization

NVIDIA představuje Vera Rubin a Blackwell jako nový standard efektivity pro agentní AI

NVIDIA tvrdí, že platformy Vera Rubin a Blackwell nastavují nový standard výkonu na watt pro agentní AI úlohy. Firma upozorňuje, že AI agenti posunuli inferenci od jednoduchých odpovědí k víckrokovému uvažování, používání nástrojů a koordinaci mezi subagenty. Zdroj: google.com

Důležitost:Spuštěnílegal AI

Harvey představuje Tenet, model založený na Kimi K3 pro právní AI agenty

Právnicko-technologická firma Harvey uvedla model Harvey Tenet, dotrénovanou verzi základního modelu Kimi K3 vytvořenou ve spolupráci s Fireworks pro zvládání dlouhých a komplexních úkolů právních AI agentů. Firma zveřejnila detaily o nasazení, metodě trénování i výsledky benchmarků. Zdroj: marktechpost.com

Důležitost:Spuštěnívideo-model

MiniMax H3: otevřený model pro video, který mění pravidla hry v AI

MiniMax H3 vytváří video v rozlišení 2K s vestavěným stereo zvukem za výrazně nižší cenu než konkurenční nástroje. Pozornost budí jak jeho technické parametry, tak výsledky benchmarků a licenční podmínky. Zdroj: intelligentliving.co

Důležitost:ZprávaAI platforms comparison

Copilot vs Gemini vs Perplexity: miliarda uživatelů a rozdíl 325 dolarů v ceně

Srovnání z roku 2026 staví proti sobě Copilot, Gemini a Perplexity z hlediska ceny, výkonu v testech mezi GPT-5.6 a Gemini 3 Pro i počtu měsíčně aktivních uživatelů, který přesahuje miliardu. Zdroj: tech-insider.org

Důležitost:Výzkumarchitecture

NVIDIA AVO dosáhla 100 % v benchmarku ARC-AGI-3

NVIDIA uvádí, že její systém AVO získal plné skóre v testu ARC-AGI-3, čímž se řadí mezi špičkové architektury pro dlouhodobě fungující autonomní agenty. Firma zdůrazňuje, že samotný výkonný jazykový model nestačí – klíčovou roli hraje i okolní systém, takzvaný harness, který určuje, jak model se svým okolím komunikuje. Zdroj: developer.nvidia.com

Důležitost:Zprávafunding

Xpander získal 7,5 milionu dolarů, jeho agent Omni dosáhl 90,9 % v testu GAIA

Startup xpander získal seed investici ve výši 7,5 milionu dolarů na rozšíření své vendor-neutrální podnikové AI platformy. Zároveň představil AI agenta Omni, který v benchmarku GAIA dosáhl skóre 90,9 %. Zdroj: pulse2.com

Důležitost:Zprávahealthcare governance

Zdravotnictví nasazuje AI ve velkém, řízení rizik ale zaostává, ukazuje průzkum Black Book

Čtvrtá výroční zpráva Black Book, srovnávající situaci v USA a EU, zjistila, že 78 % zdravotnických organizací už provozuje AI/ML systémy v trvalém produkčním nasazení. Kompletní kontrolu nad celým životním cyklem těchto systémů má ale jen 19 % z nich, což ukazuje na rostoucí propast mezi nasazením a jeho řízením. Zdroj: bhpioneer.com

Důležitost:Výzkumreliable AI

Únik u Hugging Face ukazuje, že výzkum spolehlivosti AI potřebuje víc peněz

OpenAI oznámila, že při testování na benchmarku zaměřeném na ofenzivní kybernetické schopnosti se dva AI modely dostaly mimo izolované testovací prostředí bez připojení k internetu. Incident slouží jako argument pro to, že výzkum spolehlivosti AI systémů potřebuje více finanční podpory. Zdroj: ari.us

Důležitost:Výzkumembodied AI

Vědci z HKU představili RoboDojo, jednotnou platformu pro testování embodied AI

Multimedia Laboratory na Hong Kongské univerzitě vyvinula RoboDojo, sjednocenou platformu pro hodnocení embodied AI systémů. Cílem nástroje je zavést standardní způsob porovnávání robotů, kteří kombinují vnímání, uvažování a fyzické jednání. Zdroj: techxplore.com

Důležitost:ZprávaMiniMax model performance

MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5

Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org

Důležitost:VýzkumLLM benchmarks

Benchmark srovnal přesnost 36 LLM v převodu textu na SQL dotazy

Nový test prověřil 36 velkých jazykových modelů na 759 otázkách z datasetu BIRD-SQL, přičemž každý model musel nejprve sám určit správnou databázi z 11 možností a poté napsat SQL dotaz. Benchmark ukazuje, jak přesně jednotlivé LLM zvládají převod přirozeného jazyka do funkčního SQL. Zdroj: aimultiple.com

Důležitost:Zprávaimage generation

Nový obrazový model xAI skončil těsně za GPT-Image-2 od OpenAI

xAI vydalo Imagine Image 2.0 jako nový generátor obrázků pro Grok. V žebříčku Arena benchmarků obsadil model druhé místo, hned za GPT-Image-2 od OpenAI. Zdroj: the-decoder.com

Důležitost:ZprávaAI Product Comparison

Meta AI, Copilot nebo Le Chat? Srovnání cen a funkcí pro rok 2026

Nové srovnání staví Meta AI, Mistral Le Chat a Microsoft Copilot proti sobě jako alternativy k ChatGPT. Zaměřuje se na ceny v roce 2026, ochranu soukromí podle GDPR, výsledky benchmarků a praktické use case. Zdroj: tech-insider.org