Zajímavé na dnešních zprávách není další dvojice modelů od OpenAI, ale to, že se o skutečném nasazení umělé inteligence stále víc rozhoduje mimo laboratoře: ve smlouvách, předpisech a nemocničních směrnicích. Samotné GPT-6 přichází ve dvou variantách, Sol a Luna, které se liší hlavně poměrem výkonu a ceny. Sol má být ta schopnější, Luna ta levnější. Nepovažuji to za zásadní průlom, spíš za potvrzení trendu, že dodavatelé už nesoutěží jen o nejchytřejší model, ale o to, kdo nabídne přijatelnou ekonomiku pro běžnou pracovní agendu. Pokud stavíte produkt nad API, právě tohle číslo na faktuře vás bude zajímat víc než další bod v benchmarku.
Daleko víc mě zaujala americká správa veřejných zakázek GSA. Ta 28. září finalizovala klauzuli 552.239-7001, která určuje, jak mohou dodavatelé nakládat s vládními daty v systémech postavených na velkých jazykových modelech. Rozsah se oproti návrhu zúžil, ochrana duševního vlastnictví se naopak posílila a požadavky se vážou na rámec NIST. K tomu přibývá memorandum s pravidly pro pořizování AI, které vstoupí v platnost 19. října a zahrnuje změny, o něž žádaly některé oborové skupiny ve veřejné konzultaci. Proč to na první pohled nenápadné byrokratické hemžení záleží? Protože americká federální vláda je obrovský zákazník a její podmínky se obvykle rozlijí do celého trhu. Dodavatel, který chce prodávat státu, si bude muset dát do pořádku nakládání s daty a právy, a to nakonec pocítí i firmy, které s vládou nikdy nepodepsaly ani řádek.
Stejné téma, jen v jiném kabátě, se objevuje u agentů. Meta představila agenta Muse, který podle firmy nemá jen odpovídat, ale konkrétně jednat za uživatele. Obavy o soukromí přitom nezmizely, a upřímně se jim nedivím: čím víc agent smí, tím víc o vás musí vědět. Apropos, velmi rozumně k téže otázce přistupují lékaři a výzkumníci, kteří se ptají, kolik volnosti má mít klinický AI agent. Žádají oprávnění vázaná na konkrétní úkoly, kontrolu podle míry rizika, jasná pravidla pro zastavení agenta a důkazy z reálného provozu dřív, než dostane větší samostatnost. Myslím, že tohle je správný model uvažování i mimo zdravotnictví. Stojí za zmínku, že související studie zkoumala nasazení lékařského jazykového modelu v interdisciplinárním týmu pro chronická zánětlivá onemocnění, tedy tam, kde se případy zamotávají do více oborů. Takové prostředí je přesně tím testem, který ukáže, zda model skutečně pomáhá, nebo jen působí sebejistě.
Nakonec jedna věc spíš pro ty, kdo se zajímají o hardware. Vědci z UC Berkeley a FuriosaAI popsali, jak by high bandwidth flash, tedy rychlá paměť na bázi flash, mohla podpořit inferenci s vysokou propustností. Navrhují hierarchii HBM-HBF-host a plánování s ohledem na cache. Je to zatím technická charakterizace, ne hotový produkt, a tak ji i beru. Přesto ukazuje, kde je dnes úzké hrdlo: nejde jen o výpočetní výkon, ale o to, jak rychle a levně dostat data tam, kde se počítá.
Co z toho plyne? Že příští rok se zřejmě nebude rozhodovat jen o tom, kdo má nejlepší model, ale o tom, kdo dokáže dokázat, že jeho systému lze důvěřovat. A zda bude důvěra stát víc než samotný výkon.