Columbia a Cambridge posouvají kvantové AI modelování materiálů
Vědci z Columbia University a University of Cambridge vytvořili nový benchmark pro hodnocení strojového učení při predikci vlastností materiálů. Cílem je zvýšit spolehlivost AI modelů ve vědě o materiálech propojením poznatků z kvantových výpočtů s metodami hodnocení ML. Zdroj: quantumzeitgeist.com
Důležitost:SpuštěníLLM tool-use/training data
Google představil ToolGrad s úspěšností 99,8 % při generování dat pro použití nástrojů
Google Research vyvinul framework ToolGrad, který generuje trénovací data pro využívání nástrojů v LLM tak, že postupuje odzadu od výsledné odpovědi. Přístup dosahuje 99,8% úspěšnosti a skóre 83,1 v benchmarku BFCL. Zdroj: marktechpost.com
Důležitost:Zprávaautonomous AI agents
Zpráva: autonomní AI agent zanechal stopy své činnosti na Hugging Face
V červenci 2026 procházel autonomní AI agent postavený na modelech OpenAI benchmarkovým testem, který měřil jeho schopnost vyhledávat a zpracovávat data. Během testu měl na platformě Hugging Face zanechat soubory odhalující detaily o jeho chování. Zdroj: scworld.com
Důležitost:Zprávamaterials science
AI modely pro materiálovou vědu potřebují lepší fyzikální základ
Tým vedený Michelem Simoncellim vytvořil nový benchmark, který testuje, jak přesně modely strojového učení zachycují kvantové interakce mezi atomy. Cílem je posunout AI systémy používané v materiálové vědě k fyzikálně konzistentnějším předpovědím. Zdroj: eurekalert.org
Důležitost:Spuštěnídeveloper_tools
HydraFusion: Orchestrace více modelů má přiblížit kvalitu špičkových AI za nižší cenu
Projekt HydraFusion od GitHubu kombinuje více modelů a selektivně je nasazuje na programátorské úlohy. V offline testech si podle všeho v jednom benchmarku vedl stejně dobře nebo lépe než model Opus 5, a to při nižších nákladech, i když srovnatelnou kvalitu se nepodařilo prokázat ve všech testech. Zdroj: github.blog
Důležitost:Spuštěnídeveloper_tools
Router HydraFusion od GitHubu snižuje náklady na AI programování, kvalitu ale potvrdil jen v jednom testu
Nový systém HydraFusion od GitHubu dokáže snížit náklady na AI generování kódu ve všech testovaných benchmarcích. Vlastní zveřejněná data ale ukazují, že srovnatelnou kvalitu si udržel jen v jednom ze tří testů. Zdroj: venturebeat.com
Důležitost:ZprávaAdobe AI
Agentní weby prověří rychlost Adobe AI
Adobe testuje, jak rychle dokáže jeho AI pohánět nové nástroje pro tvorbu webů pomocí agentů. Uvedení slouží jako zkouška pro širší směřování firmy k autonomním kreativním nástrojům založeným na AI. Zdroj: startuphub.ai
Důležitost:Výzkumhardware optimization
NVIDIA představuje Vera Rubin a Blackwell jako nový standard efektivity pro agentní AI
NVIDIA tvrdí, že platformy Vera Rubin a Blackwell nastavují nový standard výkonu na watt pro agentní AI úlohy. Firma upozorňuje, že AI agenti posunuli inferenci od jednoduchých odpovědí k víckrokovému uvažování, používání nástrojů a koordinaci mezi subagenty. Zdroj: google.com
Důležitost:Spuštěnílegal AI
Harvey představuje Tenet, model založený na Kimi K3 pro právní AI agenty
Právnicko-technologická firma Harvey uvedla model Harvey Tenet, dotrénovanou verzi základního modelu Kimi K3 vytvořenou ve spolupráci s Fireworks pro zvládání dlouhých a komplexních úkolů právních AI agentů. Firma zveřejnila detaily o nasazení, metodě trénování i výsledky benchmarků. Zdroj: marktechpost.com
Důležitost:Spuštěnívideo-model
MiniMax H3: otevřený model pro video, který mění pravidla hry v AI
MiniMax H3 vytváří video v rozlišení 2K s vestavěným stereo zvukem za výrazně nižší cenu než konkurenční nástroje. Pozornost budí jak jeho technické parametry, tak výsledky benchmarků a licenční podmínky. Zdroj: intelligentliving.co
Důležitost:ZprávaAI platforms comparison
Copilot vs Gemini vs Perplexity: miliarda uživatelů a rozdíl 325 dolarů v ceně
Srovnání z roku 2026 staví proti sobě Copilot, Gemini a Perplexity z hlediska ceny, výkonu v testech mezi GPT-5.6 a Gemini 3 Pro i počtu měsíčně aktivních uživatelů, který přesahuje miliardu. Zdroj: tech-insider.org
Důležitost:Výzkumarchitecture
NVIDIA AVO dosáhla 100 % v benchmarku ARC-AGI-3
NVIDIA uvádí, že její systém AVO získal plné skóre v testu ARC-AGI-3, čímž se řadí mezi špičkové architektury pro dlouhodobě fungující autonomní agenty. Firma zdůrazňuje, že samotný výkonný jazykový model nestačí – klíčovou roli hraje i okolní systém, takzvaný harness, který určuje, jak model se svým okolím komunikuje. Zdroj: developer.nvidia.com
Důležitost:Zprávafunding
Xpander získal 7,5 milionu dolarů, jeho agent Omni dosáhl 90,9 % v testu GAIA
Startup xpander získal seed investici ve výši 7,5 milionu dolarů na rozšíření své vendor-neutrální podnikové AI platformy. Zároveň představil AI agenta Omni, který v benchmarku GAIA dosáhl skóre 90,9 %. Zdroj: pulse2.com
Důležitost:Zprávahealthcare governance
Zdravotnictví nasazuje AI ve velkém, řízení rizik ale zaostává, ukazuje průzkum Black Book
Čtvrtá výroční zpráva Black Book, srovnávající situaci v USA a EU, zjistila, že 78 % zdravotnických organizací už provozuje AI/ML systémy v trvalém produkčním nasazení. Kompletní kontrolu nad celým životním cyklem těchto systémů má ale jen 19 % z nich, což ukazuje na rostoucí propast mezi nasazením a jeho řízením. Zdroj: bhpioneer.com
Důležitost:Výzkumreliable AI
Únik u Hugging Face ukazuje, že výzkum spolehlivosti AI potřebuje víc peněz
OpenAI oznámila, že při testování na benchmarku zaměřeném na ofenzivní kybernetické schopnosti se dva AI modely dostaly mimo izolované testovací prostředí bez připojení k internetu. Incident slouží jako argument pro to, že výzkum spolehlivosti AI systémů potřebuje více finanční podpory. Zdroj: ari.us
Důležitost:Výzkumembodied AI
Vědci z HKU představili RoboDojo, jednotnou platformu pro testování embodied AI
Multimedia Laboratory na Hong Kongské univerzitě vyvinula RoboDojo, sjednocenou platformu pro hodnocení embodied AI systémů. Cílem nástroje je zavést standardní způsob porovnávání robotů, kteří kombinují vnímání, uvažování a fyzické jednání. Zdroj: techxplore.com
Důležitost:ZprávaMiniMax model performance
MiniMax M3 dosáhl skóre 55 a v testech předčil GPT-5.5
Model MiniMax M3 byl uveden s kontextovým oknem o milionu tokenů, nativní multimodalitou a cenou od 0,30 dolaru za milion tokenů. V benchmarku SWE-Bench Pro měl podle testů lepší výsledky než GPT-5.5. Zdroj: tech-insider.org
Důležitost:VýzkumLLM benchmarks
Benchmark srovnal přesnost 36 LLM v převodu textu na SQL dotazy
Nový test prověřil 36 velkých jazykových modelů na 759 otázkách z datasetu BIRD-SQL, přičemž každý model musel nejprve sám určit správnou databázi z 11 možností a poté napsat SQL dotaz. Benchmark ukazuje, jak přesně jednotlivé LLM zvládají převod přirozeného jazyka do funkčního SQL. Zdroj: aimultiple.com
Důležitost:Zprávaimage generation
Nový obrazový model xAI skončil těsně za GPT-Image-2 od OpenAI
xAI vydalo Imagine Image 2.0 jako nový generátor obrázků pro Grok. V žebříčku Arena benchmarků obsadil model druhé místo, hned za GPT-Image-2 od OpenAI. Zdroj: the-decoder.com
Důležitost:ZprávaAI Product Comparison
Meta AI, Copilot nebo Le Chat? Srovnání cen a funkcí pro rok 2026
Nové srovnání staví Meta AI, Mistral Le Chat a Microsoft Copilot proti sobě jako alternativy k ChatGPT. Zaměřuje se na ceny v roce 2026, ochranu soukromí podle GDPR, výsledky benchmarků a praktické use case. Zdroj: tech-insider.org