Hlídejte repozitář, ne jen agenta
mlj.solutions

mlj.solutions Studie na 930 000+ agenty vytvořených pull requestech měří integration friction, náklad na zapojení příspěvku do kódu, který mění i ostatní přispěvatelé. Přibližně polovina variace v tomto tření zůstává vlastností repozitáře i po plné kontrole autora, velikosti změny a agenta. U příspěvků od AI agentů se tohle tření navíc koncentruje zhruba dvakrát víc než u lidských (intraclass correlation 0,30 vs. 0,16) ve stejných repozitářích, se stejnými pravidly. Závěr autorů: měřit jen úspěšnost jednotlivého agenta nestačí. Riziko je z velké části na úrovni ekosystému, ne komponenty. 🔗 Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software 🔹 Sledujete nás pro více zajímavostí ze světa AI!
Zobrazit na Instagramumlj.solutions

mlj.solutions Každý AI pull request projde testy. Projekt se přesto může pomalu rozpadat. Integrační problémy se u AI změn koncentrovaly téměř 2× víc než u lidských. Nestačí měřit dokončené tickety, ale musíte sledovat zdraví celé codebase. 🔵 Jak měříte dlouhodobý dopad AI změn na váš repozitář?
Zobrazit na InstagramuO čem studie je
Autonomní coding agenti dnes ve velkém otevírají a mergují pull requesty ve sdílených repozitářích, ale hodnotí se po jednom na izolovaných úlohách. Studie na více než 930 000 pull requestech ukazuje, že riziko se hromadí v repozitáři, ne v jednotlivém agentovi.
Statistiky
930 000+
analyzovaných pull requestů
Jde o příspěvky vytvořené agenty ve sdílených repozitářích, na kterých autor měřil integrační tření.
50 %
variace zůstává v repozitáři
Zhruba polovina rozdílů v integračním tření patří repozitáři i po zohlednění autora, velikosti příspěvku a konkrétního agenta.
2×
silnější vazba na repozitář
U příspěvků agentů se tření váže na repozitář zhruba dvakrát silněji než u příspěvků lidí.
Co z toho vyplývá
- Projít testy nestačí, agenti, kteří splní vlastní testy, přesto zanechávají repozitáře s problémy, které nejde připsat žádnému jednotlivému příspěvku.
- Riziko patří ekosystému, problém neleží v samotném agentovi, ale v repozitáři, kde se příspěvky hromadí.
- Integrační tření je měřitelné, jde o náklad na začlenění změny do kódu, který mezitím upravují další přispěvatelé.
- Agenti tření koncentrují víc než lidé, rozdíl platí i po zohlednění velikosti kódu, jeho stáří, typu úlohy a zralosti procesů.
- Řídit je třeba celý ekosystém, AI-native software je lepší měřit a spravovat na úrovni repozitáře než po jednom agentovi.
Náš pohled
Hodnotit AI agenta jen podle toho, zda projde testy, nestačí. Při nasazení agentů do kódu proto sledujeme i to, co se s repozitářem děje jako celkem.
Michal Dobrovolný
Zakladatel & CTO
Zdroj
Russo, D. (2026). Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software. arXiv:2606.28235. https://arxiv.org/abs/2606.28235
Nepřehlédněte další příspěvky

Umí AI agenti předpovídat budoucnost?
Benchmark FutureSim přehrává skutečné zprávy a testuje, jak se agenti přizpůsobí novým informacím. Nejlepší agent předpověděl správně jen čtvrtinu událostí.

Co všechno si AI agent stáhne s jedním skillem
Skilly AI agentů se spoléhají na další skilly, balíčky a služby. Studie to zmapovala na 1,43 milionu skillů a ukazuje, že kontrolovat jen jeden skill nestačí.

AI agent, který se umí doptat, když nerozumí
Benchmark DiscoBench testuje, zda vyhledávací agent pozná nejasné zadání, zeptá se uživatele a vrátí se na správnou cestu.
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám