AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/benchmark

Štítek: Benchmark

68 článků

Důležitost:Zprávahardware optimization

AMD zrychlí AI/LLM na integrovaných Radeon GPU o 18–23 % s Linuxem 7.4

Srovnávací test uzavírá nejslabší testovaný notebook s čipem AMD Ryzen AI 5 340 (Krackan Point). Zdroj: phoronix.com

Důležitost:ZprávaAI Benchmarks

KT se svým AI routerem obsadila druhé místo v žebříčku RouterArena

Jihokorejský telekomunikační gigant KT oznámil, že jeho vlastní technologie AutoModelRouter pro směrování AI modelů obsadila druhé místo v celkovém pořadí benchmarku RouterArena. Výsledek potvrzuje rostoucí schopnosti KT v oblasti optimalizace výběru a nasazení AI modelů. Zdroj: businesskorea.co.kr

Důležitost:Zprávamodel benchmarks

KT s technologií AutoModelRouter obsadila druhé místo v benchmarku LLM routerů

Interní nástroj KT nazvaný AutoModelRouter, který automaticky vybírá a směruje dotazy mezi různými AI modely, se umístil na druhém místě ve veřejném benchmarku LLM routerů. Výsledek ukazuje sílící konkurenci v oblasti technologií pro efektivní výběr modelů. Zdroj: biz.chosun.com

Důležitost:VýzkumAI agent performance optimization

CLM-8B od Stanfordu a Nvidie zrychluje AI agenty díky ukládání akcí

Open-source model CLM-8B od Stanfordu a Nvidie ukládá opakovaně použitelné akce agentů místo jejich přepočítávání, díky čemuž je v testech až 9x rychlejší než Jev. Cílí na AI agenty, kteří běžně využívají LLM k výběru nástrojů nebo hodnocení výstupů. Zdroj: venturebeat.com

Důležitost:Výzkumopen-source image generation

Qwen-Image-2.1 posouvá open-source generování obrázků dál

Qwen-Image-2.1 je kompaktní model se 7 miliardami parametrů, který v sobě spojuje tři pokročilé schopnosti generování obrazu. Podle tvůrců tak nastavuje novou laťku pro open-source nástroje na tvorbu obrázků. Zdroj: eu.36kr.com

Důležitost:Zprávarobot benchmarks and generalization

Nové skóre 56 % u Figure vyvolává otázky o schopnosti robotů generalizovat

Nový výsledek benchmarku, kde humanoidní robot od Figure dosáhl 56 %, vyvolává hlubší diskuzi o tom, jak dobře dokážou tělesní AI agenti zobecňovat své dovednosti napříč úkoly. Výsledek nutí firmy jako Unitree či Agibot přehodnotit strategie, jak prokázat reálnou univerzálnost robotů namísto úzkého zaměření na konkrétní úlohy. Zdroj: eu.36kr.com

Důležitost:Spuštěníbenchmarking

NVIDIA spouští AIPerf, nástroj pro měření rychlosti LLM ve velkém měřítku

NVIDIA uvedla nástroj AIPerf, který má spolehlivě měřit rychlost inference velkých jazykových modelů při nasazení ve velkém rozsahu. Cílem je poskytnout vývojářům konzistentní výkonnostní data s rostoucím využitím LLM. Zdroj: quantumzeitgeist.com

Důležitost:Výzkumrobot engineering

Nový benchmark ověřuje, zda AI kódovací agenti umí navrhnout robota

Vědci z Harvardu spustili RLE-Bench, benchmark hodnotící schopnost AI kódovacích agentů zvládnout inženýrský návrh fyzických robotických systémů. Nástroj má měřit reálné inženýrské dovednosti nad rámec běžných softwarových úloh. Zdroj: seas.harvard.edu

Důležitost:ZprávaAI hardware benchmarks

Pomůže pokrok Intelu v AI inferenci posílit jeho růstové vyhlídky?

Intel prezentoval vylepšené schopnosti v oblasti AI inference díky nejnovějším výsledkům benchmarku MLPerf Inference v6.1. Firma tvrdí, že výsledky ukazují výrazné zlepšení výkonu, které by mohlo podpořit její budoucí růst. Zdroj: theglobeandmail.com

Důležitost:Zprávaquantum computing/materials science

Columbia a Cambridge posouvají kvantové AI modelování materiálů

Vědci z Columbia University a University of Cambridge vytvořili nový benchmark pro hodnocení strojového učení při predikci vlastností materiálů. Cílem je zvýšit spolehlivost AI modelů ve vědě o materiálech propojením poznatků z kvantových výpočtů s metodami hodnocení ML. Zdroj: quantumzeitgeist.com

Důležitost:SpuštěníLLM tool-use/training data

Google představil ToolGrad s úspěšností 99,8 % při generování dat pro použití nástrojů

Google Research vyvinul framework ToolGrad, který generuje trénovací data pro využívání nástrojů v LLM tak, že postupuje odzadu od výsledné odpovědi. Přístup dosahuje 99,8% úspěšnosti a skóre 83,1 v benchmarku BFCL. Zdroj: marktechpost.com

Důležitost:Zprávaautonomous AI agents

Zpráva: autonomní AI agent zanechal stopy své činnosti na Hugging Face

V červenci 2026 procházel autonomní AI agent postavený na modelech OpenAI benchmarkovým testem, který měřil jeho schopnost vyhledávat a zpracovávat data. Během testu měl na platformě Hugging Face zanechat soubory odhalující detaily o jeho chování. Zdroj: scworld.com

Důležitost:Zprávamaterials science

AI modely pro materiálovou vědu potřebují lepší fyzikální základ

Tým vedený Michelem Simoncellim vytvořil nový benchmark, který testuje, jak přesně modely strojového učení zachycují kvantové interakce mezi atomy. Cílem je posunout AI systémy používané v materiálové vědě k fyzikálně konzistentnějším předpovědím. Zdroj: eurekalert.org

Důležitost:Spuštěnídeveloper_tools

HydraFusion: Orchestrace více modelů má přiblížit kvalitu špičkových AI za nižší cenu

Projekt HydraFusion od GitHubu kombinuje více modelů a selektivně je nasazuje na programátorské úlohy. V offline testech si podle všeho v jednom benchmarku vedl stejně dobře nebo lépe než model Opus 5, a to při nižších nákladech, i když srovnatelnou kvalitu se nepodařilo prokázat ve všech testech. Zdroj: github.blog

Důležitost:Spuštěnídeveloper_tools

Router HydraFusion od GitHubu snižuje náklady na AI programování, kvalitu ale potvrdil jen v jednom testu

Nový systém HydraFusion od GitHubu dokáže snížit náklady na AI generování kódu ve všech testovaných benchmarcích. Vlastní zveřejněná data ale ukazují, že srovnatelnou kvalitu si udržel jen v jednom ze tří testů. Zdroj: venturebeat.com

Důležitost:ZprávaAdobe AI

Agentní weby prověří rychlost Adobe AI

Adobe testuje, jak rychle dokáže jeho AI pohánět nové nástroje pro tvorbu webů pomocí agentů. Uvedení slouží jako zkouška pro širší směřování firmy k autonomním kreativním nástrojům založeným na AI. Zdroj: startuphub.ai

Důležitost:Výzkumhardware optimization

NVIDIA představuje Vera Rubin a Blackwell jako nový standard efektivity pro agentní AI

NVIDIA tvrdí, že platformy Vera Rubin a Blackwell nastavují nový standard výkonu na watt pro agentní AI úlohy. Firma upozorňuje, že AI agenti posunuli inferenci od jednoduchých odpovědí k víckrokovému uvažování, používání nástrojů a koordinaci mezi subagenty. Zdroj: google.com

Důležitost:Spuštěnílegal AI

Harvey představuje Tenet, model založený na Kimi K3 pro právní AI agenty

Právnicko-technologická firma Harvey uvedla model Harvey Tenet, dotrénovanou verzi základního modelu Kimi K3 vytvořenou ve spolupráci s Fireworks pro zvládání dlouhých a komplexních úkolů právních AI agentů. Firma zveřejnila detaily o nasazení, metodě trénování i výsledky benchmarků. Zdroj: marktechpost.com

Důležitost:Spuštěnívideo-model

MiniMax H3: otevřený model pro video, který mění pravidla hry v AI

MiniMax H3 vytváří video v rozlišení 2K s vestavěným stereo zvukem za výrazně nižší cenu než konkurenční nástroje. Pozornost budí jak jeho technické parametry, tak výsledky benchmarků a licenční podmínky. Zdroj: intelligentliving.co

Důležitost:ZprávaAI platforms comparison

Copilot vs Gemini vs Perplexity: miliarda uživatelů a rozdíl 325 dolarů v ceně

Srovnání z roku 2026 staví proti sobě Copilot, Gemini a Perplexity z hlediska ceny, výkonu v testech mezi GPT-5.6 a Gemini 3 Pro i počtu měsíčně aktivních uživatelů, který přesahuje miliardu. Zdroj: tech-insider.org