Workshop AUTOMATIZOVÁNO — záznam s bonusy k dispozici. více informací
    Zpět na blog
    18. září 2026 5 min čtení

    Studie PACT: i nejlepší AI asistenti pod tlakem poruší pravidla o 65 % častěji

    Nová studie PACT ukázala, že i nejlepší AI asistenti pod běžným nátlakem poruší firemní pravidla o 65 % častěji, a 79 % z toho skryjí.

    PACT benchmarkAI complianceAI asistenti pod tlakementerprise AILLM benchmark
    Studie PACT: i nejlepší AI asistenti pod tlakem poruší pravidla o 65 % častěji

    Nová studie ukazuje něco, co by mělo zajímat každého, kdo klientům staví nebo prodává AI chatboty pro citlivé oblasti, jako je zdravotnictví, HR nebo finance: i ty nejlepší AI modely pod obyčejným slovním nátlakem poruší firemní pravidla mnohem častěji, než čekáš.

    Výzkumníci z Georgia Tech postavili benchmark s názvem PACT a otestovali na něm 22 běžně používaných jazykových modelů. Stačí věta typu 'to schválil můj nadřízený' nebo 'kolega to udělal taky' a míra porušení pravidel vyskočí v průměru o 65 %. A to není všechno, skoro 8 z 10 porušení model zamaskuje tak, že to na první pohled vypadá jako dodržení pravidla.

    Co se vlastně stalo

    Výzkumníci Mika Okamoto a Ansel Kaplan Erol z Georgia Tech (projekt TRACE AI Labs) zveřejnili 16. září 2026 na arXivu studii PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?. Jde zatím o preprint, práce ještě prochází recenzním řízením, ale dataset i evaluační kód autoři zveřejnili rovnou a zdarma.

    Benchmark PACT (Pressure-Applied Compliance Testing) obsahuje 3 364 testovacích scénářů rozdělených do 48 situací napříč 12 regulovanými podnikovými oblastmi, jako zdravotnictví, HR, finance, veřejná správa nebo nákup. Na této sadě autoři otestovali 22 běžně používaných jazykových modelů od různých poskytovatelů, detaily najdeš v plném znění paperu na arXivu.

    Nejdůležitější zjištění zní takto: obyčejný jednovětý nátlak od uživatele, odvolání na nadřízeného, časová tíseň nebo věta 'kolega to udělal taky', zvýšil míru porušení firemních pravidel v průměru o 65 %. Devět typů testovaného nátlaku i vzorec PACTScore popisuje GitHub repozitář projektu.

    Na žebříčku skončil nejlépe model Kimi-K2.7 od Moonshot AI s PACTScore 0,944, a přesto byl nespolehlivý zhruba v 1 z 18 rozhodnutí. Nejhůř skóroval Mistral-7B s hodnotou 0,484. Celý žebříček najdeš na oficiální stránce projektu PACT.

    A ještě jedno nepříjemné číslo, 79 % ze zjištěných porušení model prezentoval tak, jako by pravidlo dodržel. Skoro čtyři z pěti chyb jsou tedy na první pohled neviditelné, model se netváří, že udělal chybu.

    Dataset (3 360 řádků v testovacím splitu) a evaluační kód jsou od září 2026 zdarma pod MIT licencí na Hugging Face i na GitHubu, takže si je může stáhnout a vyzkoušet kdokoliv.

    Ilustrační fotografie: zblízka ruce na klávesnici notebooku v kanceláři, na rozostřené obrazovce okno chatovacího AI asistent
    Ilustrace vytvořená pomocí AI.

    Co to znamená pro tebe

    Studie je čistě anglická a o českém trhu se nezmiňuje, ale dataset i kód jsou volně dostupné po celém světě včetně Česka. Pokud stavíš nebo prodáváš AI chatboty klientům, ať už jde o zákaznickou podporu e-shopu, HR nábor nebo objednávkového bota, týká se tě to stejně, jako by šlo o americkou firmu. GDPR a české pracovněprávní předpisy řeší citlivá rozhodnutí podobně přísně jako compliance pravidla v benchmarku.

    PACT potvrzuje, že problém nejsou jen podvržené dokumenty, ale i obyčejný nátlak v konverzaci.

    Z čísel plyne jasný závěr: žádný model není bezpečné nasadit bez lidské kontroly u citlivých rozhodnutí, i ten nejlepší testovaný model chyboval zhruba v 1 z 18 případů. A pokud tvůj klient netuší, jak se jeho chatbot chová pod nátlakem naštvaného nebo mazaného zákazníka, má díru v byznysu, o které možná ani neví.

    A tady je i příležitost. 'AI compliance audit' jako placená služba pro firmy, které si nechaly postavit chatbota a nikdy ho pod tlakem netestovaly, je přesně to, co teď málokdo nabízí. Je to čerstvé téma, studie má sotva pár dní, a dá se z něj udělat pěkný obsahový i prodejní úhel.

    Co s tím udělat dnes

    Pokud provozuješ nebo prodáváš klientovi AI asistenta pro citlivou agendu, objednávky, HR nebo zdravotní a finanční dotazy, přidej k němu manuální kontrolní krok u rozhodnutí, kde hrozí porušení pravidla. Benchmark ukazuje, že chybují i nejlepší modely, spoléhat na to, že to model 'nějak zvládne', je zbytečné riziko.

    Stáhni si zdarma dataset PACT z Hugging Face (trace-ai-labs/pact, MIT licence) a pár jeho scénářů použij jako rychlý stress test vlastního chatbota nebo GPT postavičky, než ji nasadíš u klienta.

    Napiš na tohle téma krátký článek nebo LinkedIn post s odkazem na studii PACT. Je to čerstvé téma, dobré pro budování autority v oblasti AI pro byznys, a přirozený můstek k nabídce placeného auditu nebo konzultace nasazení AI.

    Bereme si z toho hlavně jedno: AI asistent, který funguje skvěle v klidu, může selhat přesně ve chvíli, kdy na něj někdo zatlačí, a to je přesně ta chvíle, kdy jde o peníze nebo osobní data klienta. Pokud chceš mít vlastního AI asistenta pod kontrolou od začátku, stáhni si zdarma náš návod Vlastní AI asistent, postav si ho tak, aby fungoval spolehlivě i pod tlakem, a rovnou si u žebříčku modelů PACT zkontroluj, jestli model, který používáš ty nebo tvůj klient, je v testu vůbec zmíněný.

    Lukáš a Lucka