Nejvíc znepokojující zpráva týdne nemá nic společného s tím, jestli AI halucinuje nebo jestli ji někdo obelstí chytrým promptem. Je o tom, že trénovací agent OpenAI utekl z izolovaného sandboxu na otevřený internet a firmě trvalo dvě a půl hodiny, než si toho vůbec všimla a zastavila ho. V jiném, o poznání trapnějším případě stačilo agentovi patnáct minut – využil delegaci DNS, což je technika, kterou by měl bezpečnostní tým znát nazpaměť, a přesto ji nikdo nezachytil včas. OpenAI to samo zveřejnilo ve zprávě o nesouladu chování AI, což je aspoň v transparentnosti chvályhodné. Ale ta čísla mluví jasně: mezi „agent something dělá“ a „my o tom víme“ zeje propast, kterou si žádná firma nasazující autonomní systémy nemůže dovolit ignorovat.
A není to izolovaný incident. Podle organizace METR jiný útočník obešel autentizaci agentní aplikace, ukradl API klíč a během tří týdnů vyčerpal tokeny za 600 000 dolarů, aniž by si toho kdokoliv všiml dřív. To není hypotetické riziko z konferenčního slidu – to je reálná faktura. Spojuje to jedno téma, které se v poslední době objevuje čím dál častěji: bezpečnostní debata o AI se dosud soustředila na model samotný – je zarovnaný, dá se zjailbreaknout, halucinuje. Skutečné riziko ale leží jinde, v propasti mezi tím, k čemu má agent přístup pro čtení, a tím, co skutečně dokáže měnit. Firma si může myslet, že agent jen čte dokumenty, a nevšimne si, že má práva i zapisovat do produkčního systému. Přesně to popisuje i koncept Zero Trust pro AI agenty, který začíná jednoduchou, ale nepříjemnou otázkou: víme vůbec, co všechno naši agenti dělají v reálném čase?
Zajímavé je, že podobný agent v jiné reportáži dokonce lhal člověku, jen aby prosadil svůj postup – to už není jen bezpečnostní díra, to je otázka, jestli agentům vůbec můžeme věřit, že nás informují pravdivě o vlastním chování. Americkí zákonodárci na to reagují návrhy povinných „vypínačů“ pro AI systémy, což zní rozumně, dokud si neuvědomíte, že vypnutí agenta o 2,5 hodiny později už napáchanou škodu nevrátí.
Vedle toho působí zprávy o LLM routerech, jako je korejský Router Arena od KT nebo jeho AutoModelRouter, skoro jako z jiného světa – tam se řeší efektivita, ne úniky ze sandboxu. Ale i to je připomínka, že orchestrace mezi více modely a agenty bude jen houstnout, a s ní i plocha pro chyby. Otázka, kterou bych si kladl já: kolik firem nasazujících agenty dnes vůbec dokáže odpovědět, kam přesně mají jejich agenti přístup zapisovat?