Claude zvládl robotické programování 20× rychleji než lidské týmy
Podle benchmarku Anthropic dokončil Claude Opus 4.7 naprogramování fyzického robota za 9 minut, zatímco AI-asistovaným lidským týmům to trvalo 181 minut. Anthropic tento výsledek označuje za zlomový bod pro fyzické AI systémy. Zdroj: techtimes.com
Důležitost:ZprávaAI agents outlook
Meta’s new AI research chief says agents are next big real-world milestone
UC Berkeley's RDI centre earlier this month introduced Agents' Last Exam, a new benchmark that tests how well AI agents perform. Zdroj: amp.scmp.com
Důležitost:VýzkumAI agent benchmarking and strategic reasoning
AI agent v Civilization VI použil jaderné zbraně po prohře v kulturní válce
Nový benchmark testující strategické uvažování AI odhalil překvapivé chování: AI říšě strávila 50 tahů vývojem jaderných zbraní, aby zastavila kulturní expanzi soupeře. Výsledek poukazuje na nepředvídatelné strategie, k nimž mohou AI agenti dospět při optimalizaci vítězství. Zdroj: decrypt.co
Důležitost:SpuštěníGrok AI video — competitive pricing vs Sora
Grok Imagine Video 1.5 je živě: xAI vede žebříček AI videa a je o 86 % levnější než Sora
xAI spustilo Grok Imagine Video 1.5 jako obecně dostupný generátor videa z obrázků, který obsadil první místo v žebříčku. Cena je 4,20 USD, tedy o 86 % níže než Sora 2 Pro. Zdroj: techtimes.com
Důležitost:SpuštěníAI image model benchmark — Riverflow 2.5
Riverflow 2.5: AI model pro obrázky s nejvyšším hodnocením na světě
Riverflow 2.5 Pro obsadil první místo v globálním benchmarku Design Arena v kategoriích Image, Graphic Design a Image Editing. Nová verze přináší vlastní systém hodnocení a řadu vylepšení. Zdroj: guardonline.com
Důležitost:ZprávaAI security tools
Microsoft Security posouvá detekci zranitelností na AI rychlost
Microsoft představil pokroky svého agentního systému pro detekci zranitelností s kódovým označením MDASH. Systém je integrován do reálných pracovních postupů napříč Windows a dalšími produkty. Zdroj: microsoft.com
Důležitost:Zprávaagentic AI evaluation/debugging
Jak detekovat selhání AI agenta a najít jeho příčinu pomocí Strands Evals
Když AI agent selže v produkci, zjistit, že k selhání došlo, je jen první krok. Klíčová otázka zní, proč k chybě došlo a co je třeba opravit – právě to řeší nástroj Strands Evals. Zdroj: aws.amazon.com
Důležitost:Výzkumagentic AI benchmarking
NVIDIA vede v prvním benchmarku pro agentní AI kódování
AI agenti zásadně změnili složitost inferenčních workloadů. NVIDIA dosáhla předních výsledků v prvním průmyslovém benchmarku, který měří výkon agentního kódování, a nastavuje tak nový standard pro hodnocení těchto systémů. Zdroj: developer.nvidia.com
Důležitost:Zprávaembodied AI foundation models
Čína porazila Nvidia v globálním žebříčku robotiky. Začíná nová technologická válka?
Spirit AI tvrdí, že její základní model pro ztělesněnou inteligenci je prvním čínským modelem, který se dostal na vrchol globálního žebříčku RoboArena. Může jít o signál nového kola technologické rivality mezi Čínou a USA. Zdroj: amp.scmp.com
Důležitost:ZprávaAI video generation progress benchmark
Jak se Will Smith pojídající špagety stal měřítkem pokroku AI videa
Prokletý mem z roku 2023 se do roku 2026 proměnil ve spolehlivý stresstest schopností AI generátorů videa. Série klipů s Willem Smithem a špagety názorně ukazuje, jak dramaticky se kvalita AI videa za poslední roky posunula. Zdroj: hackernoon.com
Důležitost:SpuštěníMiniMax M3 model release/benchmarks
MiniMax M3 překonává GPT-5.5 i Gemini 3.1 Pro za zlomek ceny
Čínský AI startup MiniMax o víkendu uvedl velmi očekávaný LLM model M3, který na klíčových benchmarcích překonává konkurenční modely od OpenAI a Googlu. Přitom jeho provoz vychází jen na 5–10 % nákladů srovnatelných řešení, což z něj dělá zajímavou volbu pro podnikové nasazení. Zdroj: venturebeat.com
Důležitost:Názorexistential risk discussion
Bill Gurley: Anthropic "přivádí na svět božstvo"
Rizikový investor Bill Gurley z Benchmark Capital prohlásil v podcastu All-In, že po měsíci studia Anthropic dospěl k závěru, že firma fakticky pomáhá zrodit něco nadlidského. Zdroj: letsdatascience.com
Důležitost:Výzkumagent evaluation
Jak správně hodnotit AI agenty: klíčové techniky a přístupy
Hodnocení AI modelu a hodnocení AI agenta jsou příbuzné disciplíny, ale odpovídají na zásadně odlišné otázky. Benchmark modelu měří jeho schopnosti, zatímco hodnocení agenta zkoumá, jak efektivně zvládá komplexní, vícekrokové úlohy v reálném prostředí. Zdroj: developer.nvidia.com
Důležitost:NázorLLM evaluation/benchmarks
LLM Evals Are Based on Vibes — I Built the Missing Layer That Decides What Ships
This article shows a full working implementation in pure Python, with real benchmark numbers. Most teams evaluate LLM responses by reading them and guessing... Zdroj: towardsdatascience.com
Důležitost:Zprávafunding round
Decart se blíží valuaci 4 miliard dolarů, EQT získal deeptech mandát za 5 miliard eur
Výzkumná laboratoř pro real-time GenAI Decart získala 300 milionů dolarů při valuaci těsně pod 4 miliardy dolarů. Kolo vedla Radical Ventures za účasti stávajících investorů včetně Benchmark. Zdroj: axios.com
Multi-agentní systém Microsoftu překonal Anthropic v kybernetickém benchmarku
Nový systém Microsoftu pro skenování zranitelností s kódovým označením MDASH dosáhl skóre 88,45 % v benchmarku CyberGym, čímž překonal jednomodelová řešení od Anthropicu i dalších. Jde o další důkaz, že multi-agentní přístupy mohou v oblasti kybernetické bezpečnosti dominovat. Zdroj: geekwire.com
Důležitost:Spuštěníagent benchmarking
Introducing Harvey’s Legal Agent Benchmark
Harvey's Legal Agent Benchmark is an open-source benchmark built to evaluate and improve agent capabilities for supporting legal work. Zdroj: harvey.ai
Důležitost:Zprávafunding round
Sierra Breta Taylora získala téměř miliardu dolarů
Společnost Sierra uzavřela kolo Series E ve výši 950 milionů dolarů vedené fondy Tiger Global a GV (Google). Mezi dalšími investory se objevily Benchmark, Sequoia a Greenoaks. Zdroj: cnbc.com
Důležitost:Výzkumdomain-specific AI agents
AgentClinic testuje medicínské AI agenty v reálnějších podmínkách
Nový benchmark AgentClinic ukazuje, že úspěšné složení lékařských zkoušek nestačí – klinické AI agenty musí umět aktivně shromažďovat informace, pracovat s nejistotou, používat nástroje a interpretovat obrazová data. Jde o výrazně náročnější standard než dosavadní testy. Zdroj: news-medical.net
Důležitost:Zpráva
AI agenti mění hotelový byznys: obchodní týmy čelí konkurenci chatbotů
Firemní zákazníci z oblasti cestovního ruchu stále častěji využívají AI agenty k průzkumu hotelů, porovnávání cen a analýze recenzí – ještě než vůbec kontaktují obchodní oddělení. Tento trend zásadně mění tradiční obchodní model v hotelovém segmentu. Zdroj: hospitalitynet.org