StepGuard: AI agent nesmí jednat bez brzdy
mlj.solutions

mlj.solutions AI agent nesmí bez kontroly odesílat, zapisovat ani mazat. Nová studie ukazuje, že kontrola jednotlivých kroků snížila úspěšnost útoků o 77,3 % při malém poklesu užitečnosti. 📄Paper: https://arxiv.org/abs/2608.24777
Zobrazit na InstagramuO čem studie je
AI agenti používají nástroje a mohou měnit soubory, uvolnit citlivé informace nebo provést neoprávněnou akci. Většina ochran přitom hodnotí až hotový průběh. StepGuard je model, který hlídá každý krok agenta a zastaví rizikovou akci dřív, než se provede.
Statistiky
77,3 %
méně úspěšných útoků
Při ochraně agentů na benchmarcích AgentDojo a AgentDyn klesla průměrná úspěšnost útoků o 77,3 % oproti stavu bez ochrany.
2,8 p. b.
pokles užitečnosti agenta
Za tuto ochranu agent zaplatil jen 2,8 procentního bodu užitečnosti, takže zůstal použitelný.
2
režimy kontroly
StepGuard umí zkontrolovat akci před jejím provedením i zpětně zhodnotit už dokončený průběh agenta.
Co z toho vyplývá
- Kontrolovat je třeba před akcí, ochrana, která hodnotí až hotový průběh, přichází pozdě, protože škoda už mohla nastat.
- Bezpečnost nemusí stát výkon, ochrana snížila úspěšnost útoků výrazně a užitečnost agenta klesla jen mírně.
- Ochrana musí být vyvážená, příliš přísný hlídač blokuje i neškodné akce, příliš volný propustí nebezpečné, a metoda Balance-GRPO se snaží držet rovnováhu.
- Trénovací data lze vytvářet automaticky, nástroj StepGen generuje bezpečné i nebezpečné průběhy se stejným kontextem, které se liší jen v rizikovém kroku.
- Otevřený model se vyrovná špičce, StepGuard dosáhl nejvyšší přesnosti mezi open-weight guard modely a srovnatelné s GPT-5.4.
Náš pohled
Agenta s přístupem k vašim nástrojům nestačí kontrolovat až po akci. Kontrola musí proběhnout dřív, než se akce provede, a nesmí agenta zbytečně brzdit.
Michal Dobrovolný
Zakladatel & CTO
Zdroj
Zheng, Z., Li, Y., Qian, C., Fu, Y., Fu, Y., Sheng, L., Shao, J., & Liu, D. (2026). StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing. arXiv:2608.24777. https://arxiv.org/abs/2608.24777
Nepřehlédněte další příspěvky

Správná odpověď není to samé co ověřená analýza
TrustDABench testuje, zda AI nad tabulkami umí odmítnout odpověď, když data nestačí. Nejlepší model dosáhl jen 24,21 % ve spolehlivosti.

Než budete automatizovat, spočítejte, o co přijdete
Běžný výpočet návratnosti automatizace přehlíží rizika, která se v tabulce neobjeví. Protokol PHP-AIO je vyčísluje u každé role zvlášť.

Umí AI agenti předpovídat budoucnost?
Benchmark FutureSim přehrává skutečné zprávy a testuje, jak se agenti přizpůsobí novým informacím. Nejlepší agent předpověděl správně jen čtvrtinu událostí.
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám