AIskimIQ

Denní přehled zpráv z AI & technologií

Archiv/benchmark

Štítek: Benchmark

47 článků

Důležitost:Zpráva

Mysterious AI Video Model 'Happy Horse 1.0' Dominates Leaderboard

A previously unknown AI video model called 'Happy Horse 1.0' has suddenly risen to the top of the Artificial Analysis Video Arena leaderboard,... Zdroj: nationaltoday.com

Důležitost:Zpráva

Claude’s 20-Hour Psych Eval Fuels Model Ethics Debate

Anthropic's 20-hour AI psychiatry evaluation ignites vital Model Ethics debate, guiding cybersecurity strategy and governance decisions. Zdroj: aicerts.ai

Důležitost:Zpráva

Záhadný AI generátor videa Happy Horse 1.0 předstihl Soru i Veo

Anonymní model pro převod textu na video se vyšplhal na první místo slepého benchmarku Artificial Analysis, kde získal o 101 Elo bodů více než nejbližší konkurence — na základě téměř 8 000 uživatelských porovnání. Identita tvůrců modelu zatím zůstává neznámá. Zdroj: usatoday.com

Důležitost:Zpráva

Nový AI video model Alibaby ovládl globální žebříček

Nejnovější nástroj pro generování videa pomocí umělé inteligence od Alibaba Group se po svém uvedení dostal na první místo globálního žebříčku sledujícího schopnosti AI modelů. Výsledek potvrzuje rostoucí sílu čínských technologických gigantů v oblasti generativní AI. Zdroj: msn.com

Důležitost:ZprávaLLM evaluation tools

Jak vybrat nejlepší LLM s R a balíčkem vitals

Pomocí balíčku vitals s ellmer můžete vyhodnocovat a porovnávat přesnost velkých jazykových modelů, včetně testování lokálních modelů vlastními evaluacemi. Nástroj se zaměřuje na měření výkonu LLM v praxi. Zdroj: infoworld.com

Důležitost:Spuštěníefficient LLM model release

PrismML vydává 1bitový model Bonsai 8B

Startup ze Caltechů 4. dubna 2026 vydal Bonsai 8B, 1bitový jazykový model, který se vejde do 1,15 GB paměti a dosahuje srovnatelných výsledků v benchmarcích. Zdroj: letsdatascience.com

Důležitost:Zprávabenchmarking

Nebius a Positronic spouštějí Physical AI Leaderboard

Physical AI se přesouvá z kontrolovaných démí do reálného nasazení, což vyžaduje benchmarky založené na skutečných operacích mimo laboratoř. Nová platforma PhAIL má vyplnit tuto mezeru v měření výkonu robotických systémů. Zdroj: nebius.com