Správná odpověď není to samé co ověřená analýza
mlj.solutions

mlj.solutions Odpověď AI nad tabulkou není analýza, dokud neumí ukázat zdroj, filtr a výpočet. I špičkové modely v novém benchmarku často pokračovaly bez opory v datech. 🔗Paper: https://arxiv.org/abs/2608.24145
Zobrazit na InstagramuO čem studie je
Jazykové modely dnes analyzují tabulky a CSV soubory, ale správně vypadající odpověď ještě není důvěryhodná analýza. TrustDABench testuje dvě věci: zda model dokáže odmítnout odpověď nebo se doptat, když data na odpověď nestačí, a zda zachová správný výsledek, když jsou stejná data zapsaná v jiné podobě tabulky.
Statistiky
24,21 %
nejlepší výsledek spolehlivosti
Ani model, GPT-5.5, nedosáhl v testu spolehlivosti ani čtvrtiny. Test měří, zda model odmítne odpovědět nebo se doptá, když data odpověď neumožňují.
9,10 %
nejlepší výsledek odolnosti
Test odolnosti měří, zda model zachová správnou analýzu při jiném zápisu stejných dat. Nejlépe dopadl Claude Sonnet 5, ale ani on nebyl bezchybný.
2 340
lidmi ověřených případů
Benchmark obsahuje 2 340 upravených případů vytvořených z 19 typů úprav dat a hodnotí osm jazykových modelů.
Co z toho vyplývá
- Správně vypadající odpověď nestačí, důvěryhodná analýza musí mít doloženou cestu od otázky k datovému důkazu.
- Modely málokdy odhalí rozpor, v datech s protichůdnými informacemi si jich většinou nevšimnou.
- Pokračují i bez podkladů, často dojdou k výsledku výpočtem, který je proveditelný, ale nemá oporu v datech.
- Záleží na tvaru tabulky, výsledek se mění, když se změní hranice pozorování nebo vazby mezi tabulkami.
- Chybí rozpoznání hranic dat, autoři doporučují posílit rozpoznání hranice důkazů a uvažování, které nezávisí na formě zápisu.
Náš pohled
Správně vypadající výsledek ještě není ověřená analýza. U AI proto nastavujeme, aby agent uměl odmítnout nebo se doptat, když data na odpověď nestačí.
Zdroj
Shi, B., Liu, Y., Zhao, C., Chi, C., Wang, Z., Wang, X., & Feng, J. (2026). TrustDABench: Benchmarking Reliability and Robustness of LLMs for Structured Data Analysis. arXiv:2608.24145. https://arxiv.org/abs/2608.24145
Nepřehlédněte další příspěvky

Než budete automatizovat, spočítejte, o co přijdete
Běžný výpočet návratnosti automatizace přehlíží rizika, která se v tabulce neobjeví. Protokol PHP-AIO je vyčísluje u každé role zvlášť.

Umí AI agenti předpovídat budoucnost?
Benchmark FutureSim přehrává skutečné zprávy a testuje, jak se agenti přizpůsobí novým informacím. Nejlepší agent předpověděl správně jen čtvrtinu událostí.

StepGuard: AI agent nesmí jednat bez brzdy
StepGuard hlídá každý krok AI agenta a zastaví rizikovou akci dřív, než se provede. Úspěšnost útoků klesla v průměru o 77,3 %.
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám