Nejzajímavější věc dneška se skrývá v nudném technickém slovu „protokol". Meta, Walmart, Stripe a Sierra Technologies Bretta Taylora oznámily otevřený standard pro obchod prováděný AI agenty, který má firmám umožnit ověřit, zda jednají s botem, nebo s živým zákazníkem. Osobní agenti dnes plánují schůzky, rezervují letenky a nakupují a nikdo zatím pořádně neví, jak má obchodník poznat, že na druhé straně je software, a komu má věřit. Je příznačné, že standard přichází od lidí, kteří na agentním obchodě chtějí vydělávat. Ten, kdo napíše pravidla identity a autorizace, určí i to, kdo bude mít v agentní ekonomice výhodu. Myslím, že tohle je podstatnější než další model.
Apropos modely: Mistral AI zpřístupnil Mistral Large 4, svůj dosud nejschopnější velký jazykový model, zatím ve veřejné preview verzi. Evropský dodavatel s otevřenou licencí je v době, kdy se o digitální suverenitě mluví na každém summitu, politicky i prakticky zajímavá alternativa. Pokud stavíte produkt, který nemůže posílat data do amerického cloudu, vás to zajímat bude. Jak velký skok to ve skutečnosti je, ukážou až nezávislé testy, ne tisková zpráva.
Téma důvěry se vrací i u tří dalších zpráv. GSA vydala 28. září finální klauzuli pro vládní zakázky na LLM, která se bude zapracovávat do smluv. Nebudu předstírat, že je to čtivé, ale právě takové dokumenty rozhodují o tom, které modely se dostanou do státní správy a za jakých podmínek. Dodavatelé, kteří požadavky splní, získají přístup k obrovskému trhu, ostatní zůstanou venku. OpenAI zase s Ironcladem trénuje a hodnotí agenty na složitých smluvních workflow, což je přesně ten typ práce, kde se ukáže, jestli agenti dozráli do profesionálního nasazení. Smlouvy jsou nemilosrdné, jedna přehlédnutá klauzule stojí peníze. A rozsáhlý přehled, který zmapoval přes 40 agentních systémů v devíti oblastech úloh, dospěl k zajímavému závěru: architektonické jádro je u nich napříč obory podobné a podobné jsou i typy selhání. To je užitečná zpráva pro každého, kdo agenty staví, protože znamená, že se stejné chyby dají řešit společně.
A nakonec drobnost, která ukazuje, jak křehká je důvěra v čísla. GitHub představil ReviewBench jako společné měřítko pro nástroje na code review a Copilot v něm vítězí. Jenže úvodní testy všech konkurentů provedl tým, který benchmark vytvořil, a nezávislé hodnocení vykresluje obrázek jiný. Tohle nemusí být zlý úmysl, stačí nevědomé ladění zadání na vlastní produkt. Pravidlo je jednoduché: benchmark, který pořádá jeden z účastníků, je marketing, dokud ho nezopakuje někdo třetí.
Všechny tyto zprávy spojuje otázka, kdo za koho ručí. Standardy pro agenty, vládní nákupní pravidla i spor o benchmark řeší totéž, jak ověřit, že systém dělá to, co tvrdí. Zajímá mě, jestli se podaří vybudovat tu infrastrukturu důvěry dřív, než agenti začnou nakupovat ve velkém. Nebo ji budeme dohánět až po první velké kauze?