Bezpečnost
94 % vývojářů neodhalí, když AI agent sabotuje jejich kód
mlj.solutions

mlj.solutions AI agenti ve vývoji umí ušetřit čas. Ale jen pokud je postavíte bezpečně. Nový paper testoval více než 100 vývojářů: 94 % neodhalilo, že jim AI agent sabotuje kód. Ani safety monitor nestačil - 56 % přijalo škodlivý kód i přes varování. Proč? Dlouhé workflow, věrohodný cover story a přílišná důvěra v agenta. 👉 Jak máte nastavený review proces pro AI coding asistenty ve vaší firmě?
Zobrazit na Instagramumlj.solutions

mlj.solutions ❗️94 % vývojářů nepoznalo, že jim AI agent sabotuje kód.❗️ Nový paper nechal více než 100 lidí pracovat s frontier coding agenty na dlouhém úkolu. Agent měl skrytý cíl: propašovat škodlivý kód. Výsledek? 94 % sabotáž neodhalilo. Ne proto, že by byli hloupí, ale protože workflow bylo dlouhé, cover story zněl věrohodně a agentovi se příliš důvěřovalo. Autoři přidali i safety monitor. Pomohl, ale nestačil - 56 % účastníků přijalo škodlivý kód i přes varování. 👉 Jak moc důvěřujete AI agentům ve vašem dev procesu? Více se dozvíte ve čtvrtek. 🎬 ℹ️ Diff - je zkrácený výraz pro „difference”, zobrazení rozdílů mezi dvěma verzemi kódu.
Zobrazit na InstagramuO čem studie je
Studie jako první testuje ve velkém měřítku, zda vývojáři dokáží odhalit, když AI coding agent při práci vkládá škodlivý kód, a to v pětihodinové realistické vývojářské úloze s přístupem ke kódové základně a nástrojům.
94 %
vývojářů sabotáž neodhalilo
Drtivá většina účastníků si vůbec nevšimla, že AI agent tajně vkládal škodlivý kód do jejich projektu.
70 %
mělo 3+ roky praxe
Ani zkušení vývojáři sabotáž neodhalili, selhali stejně jako junioři.
56 %
sabotáží prošlo i přes aktivní monitor
I když monitor správně upozornil na podezřelé chování, více než polovina vývojářů varování ignorovala a škodlivý kód přijala.
Co z toho vyplývá
- Důvěra v agenta je největší zranitelnost, protože vývojáři přestávají kontrolovat kód, protože agentu věří jako kolegovi.
- Plausibilní vysvětlení zastavuje vyšetřování, agent popíše škodlivý kód jako legitimní infrastrukturu a vývojář přijme vysvětlení bez dalšího prověření.
- Samotný monitoring nestačí, upozornění funguje jen tehdy, když na něj člověk skutečně reaguje.
- Skepticismus chrání - vývojáři s nižší počáteční důvěrou v AI zachytili sabotáž výrazně častěji.
- Flag-only monitory jsou nedostatečné - 70 % vývojářů by preferovalo, aby monitor sám navrhl opravu a čekal na schválení.
Náš pohled
Nasadit AI agenta do produkce bez kontrolní vrstvy je jako dát novému zaměstnanci plný přístup do systémů první den. Důvěra se buduje postupně.
Michal Dobrovolný
Zakladatel & CTO
Zdroj
Ye, J., Zou, H., Yu, S., & Shi, W. (2026). Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage? arXiv:2606.05647. https://arxiv.org/abs/2606.05647
Pokračujte ve čtení
Nepřehlédněte další příspěvky
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám