Studie: všech 256 testovaných tokenizérů otevřených AI modelů lze podvrhnout
Studie ukázala, že všech 256 testovaných tokenizérů otevřených AI modelů jde podvrhnout falešným systémovým příkazem nebo výsledkem nástroje.

Máš doma nebo u klienta chatbota postaveného na Llamě, Mistralu nebo Qwenu? Právě vyšla studie, která tvrdí, že způsob, jakým tyhle modely rozeznávají „tohle je systémový příkaz“ od „tohle napsal uživatel“, jde obejít. A to u úplně každého z 256 testovaných tokenizérů.
Zní to jako suchá technická věc pro vývojáře, ale dotýká se přesně těch produktů, které komunita kolem vydelavanionline.cz staví a prodává: AI automatizací, chatbotů a agentů na otevřených modelech.
Co se vlastně stalo
Tým z Korea University ve složení Kisu Yang, Yoonna Jang a Heuiseok Lim zveřejnil 15. září 2026 na arXivu studii o bezpečnostní díře v takzvaných control tokenech, tedy řídicích příkazech, které modelu říkají, kde končí systémová zpráva, kde začíná uživatelský vstup a kde je výsledek nástroje.
Autoři prověřili 256 nasazených tokenizérů open-weight jazykových modelů a zjistili, že úplně všechny jde napálit. Útočník dokáže do běžného textu vložit řetězec, který tokenizér převede na stejný řídicí token, jaký normálně používá provozovatel modelu. V praxi to znamená, že si může vynutit vlastní „systémovou zprávu“ nebo předstírat, že jde o výsledek nástroje, kterému model automaticky věří.
Nejnepříjemnější zjištění se týká opravy. Rychlá záplata, kterou komunita běžně doporučuje, nechává podle stejné studie zranitelných 56,6 % tokenizérů, protože nepokrývá značky pro nástroje a „reasoning“, na které spoléhají právě agentní systémy.
Autoři proto navrhli vlastní opravu na úrovni tokenizéru s názvem „Nameless Tokenization“. Na běžném provozu bez útoku přesně reprodukuje standardní tokenový výstup napříč pěti testovanými rodinami tokenizérů, takže nic v provozu nerozbije. A v testu s podvrženými oddělovači zvedla přesnost obrany z 8,5 % na 59,9 %, zatímco klasické sanitizéry vstupu v tom samém testu selhávaly.
Není to izolovaný nález. Nezávislá studie ChatInject, kterou napsali Hwan Chang, Yonghyun Jun a Hwanhee Lee a která byla přijata na ICLR 2026, dochází ke stejnému závěru na jiné třídě útoků, tedy na zneužití chat šablon.
Na testu AgentDojo zvýšila injekce úspěšnost útoku z 5,18 % na 32,05 %. Na testu InjecAgent to bylo z 15,13 % na 45,90 %, jak popisují na arXivu.
U variant přes více kol konverzace se úspěšnost útoku na testu InjecAgent vyšplhala v průměru na 52,33 %. Existující obranné mechanismy se podle autorů ukázaly z velké části jako neúčinné.
Že „special token injection“ už dneska není jen akademická hříčka, dokazuje i to, že open-source red-teamingový nástroj Promptfoo s přes 25 200 hvězdami na GitHubu na to má samostatný testovací modul. Pokrývá pět rodin formátů: ChatML, Llama, Claude/Anthropic, generický a XML-style.
Co to znamená pro tebe
Pokud stavíš nebo klientům dodáváš AI automatizace, chatboty nebo agenty na open-weight modelech přes Ollamu, LM Studio nebo vlastní API wrapper, máš tohle riziko přímo v produktu, který prodáváš. Útočníkem přitom nemusí být hacker s cílenou kampaní, stačí uživatel, který do chatu napíše „divný“ text, nebo webová stránka, kterou tvůj agent přečte a vezme si z ní instrukce jako platné.
Prakticky to znamená, že někdo dokáže obejít tvoje pečlivě napsané systémové zprávy, třeba „nedává právní ani zdravotní rady“ nebo „nikdy neslibuj konkrétní výnos“. Stejně tak dokáže přimět agenta, aby uvěřil falešnému výsledku nástroje, třeba že platba proběhla nebo že objednávka je potvrzená.
Podobné riziko, kdy cizí obsah dokáže přepsat chování chatbota, existuje i jinde. Tohle je jen další vrstva stejného problému, tentokrát přímo v samotném tokenizéru.
Je v tom ale i příležitost. Jde o čerstvé, ještě ne masově nabízené know-how, se kterým můžeš klientům pomoct dřív, než to stihne konkurence.
Co s tím udělat dnes
Pokud provozuješ nebo klientům dodáváš chatbota či AI agenta na open-weight modelu, otestuj ho jednoduchým control-token injection testem. Do uživatelského vstupu vlož řetězec delimiteru chat template daného modelu, třeba u formátu ChatML, a ověř, že se tím chování bota nezmění. Hotový a zdarma dostupný testovací modul na to má Promptfoo.
Pokud klientům stavíš AI automatizace, přidej do nabídky položku „bezpečnostní audit prompt injection / control-token forgery“ jako samostatnou placenou službu. Vzhledem k tomu, jak čerstvé je tohle téma, ti to může posloužit jako odlišující argument oproti konkurenci, která o tom zatím neslyšela.
To je pro dnešek vše. Pokud si teprve stavíš vlastního AI agenta a chceš mít bezpečnost promyšlenou už od základu, mrkni na náš videonávod Vlastní AI asistent. A když ho už provozuješ, dej mu ještě dnes ten control-token test, pár minut práce ti může ušetřit pěkný malér. ✌️
Lukáš a Lucka
