AI agent, který se umí doptat, když nerozumí
mlj.solutions

mlj.solutions AI může hledat rychleji než člověk. Ale pozná, kdy otázce nerozumí? DiscoBench ukazuje: detekovat nejasnost a správně se doptat jsou dvě různé schopnosti. Více hledání bez doptání může dopadnout hůř, než kdyby to AI odhladla. 👉 Kde by se měl váš AI agent povinně zastavit a zeptat?
Zobrazit na Instagramumlj.solutions

mlj.solutions Zadal jsi AI nejasný dotaz. Ona nezaváhala a hledala. Jen bohužel odpověď na špatnou otázku. Model umí poznat, že dotaz není úplně jasný. Ale poznat nejasnost a vědět, kdy se zastavit a zeptat, jsou dvě různé věci. Bez tohoto rozlišení agent hledá dál, dotáhne to do konce a klidně vám sebevědomě dá odpověď, která s vaším skutečným záměrem nemá nic společného. V praxi to znamená jednu klíčovou otázku pro každého, kdo agenty nasazuje: kde přesně by se měl zastavit a doptat, než začne hledat? DiscoBench testuje přesně tuhle rozhodovací hranici a ukazuje, že málokterý agent ji pozná sám. 👉 Kde by se měl váš AI agent povinně zastavit a zeptat?
Zobrazit na InstagramuO čem studie je
Vyhledávací agenti dostávají od uživatelů vágní, neúplné nebo i fakticky nesprávné dotazy, a přesto jedou dál podle odhadu. DiscoBench je benchmark, který testuje, zda agent dokáže nejasnost rozpoznat, zeptat se a díky odpovědi se vrátit na správnou cestu.
Statistiky
211
testovacích scénářů
Scénáře pokrývají 11 reálných oblastí, aby výsledky odrážely skutečné dotazy uživatelů.
463
instancí nejasností
Zadání jsou vágní, neúplná nebo fakticky nesprávná a spadají do čtyř typů nejasností.
4
pohledy na hodnocení
Agenti se posuzují podle užitku úlohy, odhalení nejasnosti, strategie interakce a nákladové efektivity.
Co z toho vyplývá
- Nejasnost se šíří dál, jedna špatně pochopená informace na začátku vede celý vícekrokový proces špatným směrem.
- Odhalit a zeptat se jsou dvě různé schopnosti, agent může nejasnost poznat, a přesto se nedokáže efektivně doptat.
- Hledat místo ptaní se nevyplácí, opakované vyhledávání bez doptání dopadá často hůř než přímé hádání.
- Dnešní benchmarky nesedí na realitu, předpokládají úplná zadání, zatímco skutečné dotazy takové nejsou.
- Zeptat se je součást řešení, interakce s uživatelem není známka slabého agenta, ale nutná část spolehlivého procesu.
Náš pohled
Agent, který si chybějící informaci domyslí, působí sebejistě, ale může celý proces vést špatným směrem. Při návrhu agentních systémů proto počítáme s tím, že se agent v nejasné situaci nejdřív zeptá.
Michal Dobrovolný
Zakladatel & CTO
Zdroj
Tao, Y., Deng, S., Tao, M., Wei, P., Hu, Z., & Zhu, Z. (2026). When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search. arXiv:2606.27669. https://arxiv.org/abs/2606.27669
Nepřehlédněte další příspěvky

Umí AI agenti předpovídat budoucnost?
Benchmark FutureSim přehrává skutečné zprávy a testuje, jak se agenti přizpůsobí novým informacím. Nejlepší agent předpověděl správně jen čtvrtinu událostí.

Hlídejte repozitář, ne jen agenta
Riziko autonomních coding agentů se hromadí v repozitáři, ne v jednotlivém agentovi. Ukazuje to studie na více než 930 000 pull requestech.

Co všechno si AI agent stáhne s jedním skillem
Skilly AI agentů se spoléhají na další skilly, balíčky a služby. Studie to zmapovala na 1,43 milionu skillů a ukazuje, že kontrolovat jen jeden skill nestačí.
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám