AI
Kontakt
AI agenti & Bezpečnost

StepGuard: AI agent nesmí jednat bez brzdy

3. září 2026
1.5 min čtení
MLJ

mlj.solutions

AI agent nesmí bez kontroly odesílat, zapisovat ani mazat. 
Nová studie ukazuje, že kontrola jednotlivých kroků snížila 
úspěšnost útoků o 77,3 % při malém poklesu užitečnosti. 

📄Paper: https://arxiv.org/abs/2608.24777

mlj.solutions AI agent nesmí bez kontroly odesílat, zapisovat ani mazat. Nová studie ukazuje, že kontrola jednotlivých kroků snížila úspěšnost útoků o 77,3 % při malém poklesu užitečnosti. 📄Paper: https://arxiv.org/abs/2608.24777

Zobrazit na Instagramu

O čem studie je

AI agenti používají nástroje a mohou měnit soubory, uvolnit citlivé informace nebo provést neoprávněnou akci. Většina ochran přitom hodnotí až hotový průběh. StepGuard je model, který hlídá každý krok agenta a zastaví rizikovou akci dřív, než se provede.

Statistiky

77,3 %

méně úspěšných útoků

Při ochraně agentů na benchmarcích AgentDojo a AgentDyn klesla průměrná úspěšnost útoků o 77,3 % oproti stavu bez ochrany.

2,8 p. b.

pokles užitečnosti agenta

Za tuto ochranu agent zaplatil jen 2,8 procentního bodu užitečnosti, takže zůstal použitelný.

2

režimy kontroly

StepGuard umí zkontrolovat akci před jejím provedením i zpětně zhodnotit už dokončený průběh agenta.

Co z toho vyplývá

  • Kontrolovat je třeba před akcí, ochrana, která hodnotí až hotový průběh, přichází pozdě, protože škoda už mohla nastat.
  • Bezpečnost nemusí stát výkon, ochrana snížila úspěšnost útoků výrazně a užitečnost agenta klesla jen mírně.
  • Ochrana musí být vyvážená, příliš přísný hlídač blokuje i neškodné akce, příliš volný propustí nebezpečné, a metoda Balance-GRPO se snaží držet rovnováhu.
  • Trénovací data lze vytvářet automaticky, nástroj StepGen generuje bezpečné i nebezpečné průběhy se stejným kontextem, které se liší jen v rizikovém kroku.
  • Otevřený model se vyrovná špičce, StepGuard dosáhl nejvyšší přesnosti mezi open-weight guard modely a srovnatelné s GPT-5.4.

Náš pohled

Agenta s přístupem k vašim nástrojům nestačí kontrolovat až po akci. Kontrola musí proběhnout dřív, než se akce provede, a nesmí agenta zbytečně brzdit.

MD

Michal Dobrovolný

Zakladatel & CTO

Zdroj

Zheng, Z., Li, Y., Qian, C., Fu, Y., Fu, Y., Sheng, L., Shao, J., & Liu, D. (2026). StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing. arXiv:2608.24777. https://arxiv.org/abs/2608.24777

Pokračujte ve čtení

Nepřehlédněte další příspěvky

Správná odpověď není to samé co ověřená analýza
24. září 2026 · Michal Dobrovolný

Správná odpověď není to samé co ověřená analýza

TrustDABench testuje, zda AI nad tabulkami umí odmítnout odpověď, když data nestačí. Nejlepší model dosáhl jen 24,21 % ve spolehlivosti.

Přečíst článek
Než budete automatizovat, spočítejte, o co přijdete
17. září 2026 · Michal Dobrovolný

Než budete automatizovat, spočítejte, o co přijdete

Běžný výpočet návratnosti automatizace přehlíží rizika, která se v tabulce neobjeví. Protokol PHP-AIO je vyčísluje u každé role zvlášť.

Přečíst článek
Umí AI agenti předpovídat budoucnost?
10. září 2026 · Michal Dobrovolný

Umí AI agenti předpovídat budoucnost?

Benchmark FutureSim přehrává skutečné zprávy a testuje, jak se agenti přizpůsobí novým informacím. Nejlepší agent předpověděl správně jen čtvrtinu událostí.

Přečíst článek

Chcete AI implementovat ve vaší firmě?

Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.

Napište nám
Aktuality

Sledujte nás na sítích

Každý týden publikujeme obsah o AI vycházející z vědeckých studií.

LinkedInTikTokInstagramFacebook

MLJ Solutions

MLJ Solutions

Zakázkový software a AI implementace pro firmy a veřejné instituce.

Logo Asociace umělé inteligence

Kancelář

Bavlna Office Centrum

Veverkova 1343,

500 02 Hradec Králové

IČO: 08579156

DIČ: CZ08579156

Právní

Zásady GDPR a Cookies

Kontakt

© 2026 Created by

MLJ Solutions