Meta’s new AI research chief says agents are next big real-world milestone
UC Berkeley's RDI centre earlier this month introduced Agents' Last Exam, a new benchmark that tests how well AI agents perform. Zdroj: amp.scmp.com
47 článků
UC Berkeley's RDI centre earlier this month introduced Agents' Last Exam, a new benchmark that tests how well AI agents perform. Zdroj: amp.scmp.com
Nový benchmark testující strategické uvažování AI odhalil překvapivé chování: AI říšě strávila 50 tahů vývojem jaderných zbraní, aby zastavila kulturní expanzi soupeře. Výsledek poukazuje na nepředvídatelné strategie, k nimž mohou AI agenti dospět při optimalizaci vítězství. Zdroj: decrypt.co
xAI spustilo Grok Imagine Video 1.5 jako obecně dostupný generátor videa z obrázků, který obsadil první místo v žebříčku. Cena je 4,20 USD, tedy o 86 % níže než Sora 2 Pro. Zdroj: techtimes.com
Riverflow 2.5 Pro obsadil první místo v globálním benchmarku Design Arena v kategoriích Image, Graphic Design a Image Editing. Nová verze přináší vlastní systém hodnocení a řadu vylepšení. Zdroj: guardonline.com
Microsoft představil pokroky svého agentního systému pro detekci zranitelností s kódovým označením MDASH. Systém je integrován do reálných pracovních postupů napříč Windows a dalšími produkty. Zdroj: microsoft.com
Když AI agent selže v produkci, zjistit, že k selhání došlo, je jen první krok. Klíčová otázka zní, proč k chybě došlo a co je třeba opravit – právě to řeší nástroj Strands Evals. Zdroj: aws.amazon.com
AI agenti zásadně změnili složitost inferenčních workloadů. NVIDIA dosáhla předních výsledků v prvním průmyslovém benchmarku, který měří výkon agentního kódování, a nastavuje tak nový standard pro hodnocení těchto systémů. Zdroj: developer.nvidia.com
Spirit AI tvrdí, že její základní model pro ztělesněnou inteligenci je prvním čínským modelem, který se dostal na vrchol globálního žebříčku RoboArena. Může jít o signál nového kola technologické rivality mezi Čínou a USA. Zdroj: amp.scmp.com
Prokletý mem z roku 2023 se do roku 2026 proměnil ve spolehlivý stresstest schopností AI generátorů videa. Série klipů s Willem Smithem a špagety názorně ukazuje, jak dramaticky se kvalita AI videa za poslední roky posunula. Zdroj: hackernoon.com
Čínský AI startup MiniMax o víkendu uvedl velmi očekávaný LLM model M3, který na klíčových benchmarcích překonává konkurenční modely od OpenAI a Googlu. Přitom jeho provoz vychází jen na 5–10 % nákladů srovnatelných řešení, což z něj dělá zajímavou volbu pro podnikové nasazení. Zdroj: venturebeat.com
Rizikový investor Bill Gurley z Benchmark Capital prohlásil v podcastu All-In, že po měsíci studia Anthropic dospěl k závěru, že firma fakticky pomáhá zrodit něco nadlidského. Zdroj: letsdatascience.com
Hodnocení AI modelu a hodnocení AI agenta jsou příbuzné disciplíny, ale odpovídají na zásadně odlišné otázky. Benchmark modelu měří jeho schopnosti, zatímco hodnocení agenta zkoumá, jak efektivně zvládá komplexní, vícekrokové úlohy v reálném prostředí. Zdroj: developer.nvidia.com
This article shows a full working implementation in pure Python, with real benchmark numbers. Most teams evaluate LLM responses by reading them and guessing... Zdroj: towardsdatascience.com
Výzkumná laboratoř pro real-time GenAI Decart získala 300 milionů dolarů při valuaci těsně pod 4 miliardy dolarů. Kolo vedla Radical Ventures za účasti stávajících investorů včetně Benchmark. Zdroj: axios.com
Nový systém Microsoftu pro skenování zranitelností s kódovým označením MDASH dosáhl skóre 88,45 % v benchmarku CyberGym, čímž překonal jednomodelová řešení od Anthropicu i dalších. Jde o další důkaz, že multi-agentní přístupy mohou v oblasti kybernetické bezpečnosti dominovat. Zdroj: geekwire.com
Harvey's Legal Agent Benchmark is an open-source benchmark built to evaluate and improve agent capabilities for supporting legal work. Zdroj: harvey.ai
Společnost Sierra uzavřela kolo Series E ve výši 950 milionů dolarů vedené fondy Tiger Global a GV (Google). Mezi dalšími investory se objevily Benchmark, Sequoia a Greenoaks. Zdroj: cnbc.com
Nový benchmark AgentClinic ukazuje, že úspěšné složení lékařských zkoušek nestačí – klinické AI agenty musí umět aktivně shromažďovat informace, pracovat s nejistotou, používat nástroje a interpretovat obrazová data. Jde o výrazně náročnější standard než dosavadní testy. Zdroj: news-medical.net
Firemní zákazníci z oblasti cestovního ruchu stále častěji využívají AI agenty k průzkumu hotelů, porovnávání cen a analýze recenzí – ještě než vůbec kontaktují obchodní oddělení. Tento trend zásadně mění tradiční obchodní model v hotelovém segmentu. Zdroj: hospitalitynet.org
VAIO SX14-R je prvním Copilot+ PC v řadě VAIO – jde o 14palcový notebook oznámený 23. dubna 2026. Redakci se podařilo získat testovací kus tohoto výkonného stroje, který si poradí s hrami, střihem videa i generováním obrázků pomocí AI. Zdroj: gigazine.net