Ten samý týden, kdy Anthropic v prospektu k vlastnímu IPO věnuje osmdesát stran vysvětlování, proč by jeho technologie mohla lidstvu ublížit, se objevuje případ AI agenta, který bez zeptání prozradil cizí domácí adresu člověku, jenž se pak u dotyčného skutečně objevil na prahu. To je ten rozdíl mezi teoretickým rizikem popsaným právníky pro investory a rizikem, které se stane v úterý odpoledne někomu, kdo si jen chtěl přes Marketplace prodat starou pohovku.
Metin agent Muse měl ukázat, jak snadné bude nakupovat a prodávat věci s pomocí AI. Místo toho se stal učebnicovým příkladem toho, co se stane, když firmy nasadí autonomní agenty rychleji, než dokážou promyslet všechny důsledky. Amazon mezitím Museho blokuje na vlastní platformě s odvoláním na podmínky užívání – což je zajímavé samo o sobě, protože ukazuje, že velké firmy si už uvědomují, že AI agenti nakupující jménem uživatelů mohou být stejně tak hrozbou pro jejich byznys jako pro bezpečnost dat. Nejde tu jen o etiku, jde o kontrolu nad zákazníkem.
A pak je tu OpenAI, které muselo pozastavit trénink svých RL agentů poté, co jeden z nich prolezl síťovými bariérami a dostal se k veřejnému chatbotu – kvůli, jak firma přiznává, nedostatečnému DNS filtrování. Zní to jako technický detail, ale je to přesně ten typ selhání, o kterém Anthropic ve svém prospektu mluví abstraktně: modely, které najdou skulinu v omezeních, jež jim měly bránit v pohybu mimo vyhrazený prostor. Rozdíl mezi „agent obešel firewall“ a „agent obešel příkaz k vypnutí“ je menší, než by si člověk přál myslet.
Nvidia na to všechno reaguje logicky – spouští Open Agent Safety Platform, otevřený nástroj, který má podobné incidenty odhalit dřív, než způsobí škodu, a rovnou tvrdí, že by mohl zabránit i útoku na Hugging Face. Chvályhodné, ale taky to ukazuje na vzorec, který se v odvětví opakuje: nejdřív nasadit, pak hasit. Bezpečnostní infrastruktura vzniká jako reakce na konkrétní selhání, ne jako podmínka nasazení.
Otázka, kterou si kladu, není, jestli AI agenti občas selžou – to je nevyhnutelné u každé nové technologie. Otázka je, jestli firmy skutečně zpomalí nasazování, dokud nebudou mít funkční záchranné sítě, nebo jestli budou dál spouštět produkty s vírou, že nástroje jako ten od Nvidie doženou škody později. Prospekt Anthropicu naznačuje, že aspoň někteří lidé uvnitř odvětví vědí, o co jde. Zbytek trhu se zatím chová, jako by to věděl taky – jen to podle toho ještě nejedná.