Skutečná inteligence, nebo chytrý vyhledávač?
mlj.solutions

mlj.solutions AI složila testy s 99 % úspěšností. Pak dostala otázku, kterou nikdo nikdy nepublikoval. Projekt First Proof dal AI 10 matematických problémů přímo z aktivního výzkumu - ne školní úlohy, ne veřejné benchmarky. Otázky, které v den testování neexistovaly nikde na internetu. AI dokázala vysvětlit zadání a navrhnout postup. Sestavit nový důkaz od nuly - to je jiná liga. Rozdíl mezi rozpoznáváním vzoru a skutečně novým myšlením je větší, než veřejné žebříčky napovídají. 👉 Testuješ AI na vlastních datech - nebo věříš cizím žebříčkům?
Zobrazit na Instagramumlj.solutions

mlj.solutions AI zvládne každý test. 🧠 Ale co když dostane otázku, kterou nikdo nikdy nepublikoval? Výzkumníci dali AI 10 skutečných matematických problémů - čerstvých, neviděných, nikde na internetu. A výsledek? Ten se dozvíš brzy! 👉 Co si myslíš ty? Celý příběh ve čtvrtek. 🎬
Zobrazit na InstagramuO čem studie je
Přední matematici sestavili 10 nepublikovaných otázek z vlastního výzkumu a předložili je nejlepším AI modelům. Žádná odpověď nebyla dostupná online. Cíl byl jednoduchý, a to zjistit, zda umělá inteligence skutečně umí myslet nebo jen vyhledává.
Klíčová čísla
10
nepublikovaných výzkumných otázek
Každá otázka vznikla přirozeně v rámci výzkumu autora, nebyla nikdy zveřejněna a odpověď byla před testem zašifrována, aby se předešlo úniku dat.
0
otázek vyřešeno autonomně a správně
Ani GPT-5.2 Pro, ani Gemini 3.0 Deep Think nedokázaly autonomně a správně dokázat žádnou z deseti otázek při jednorázovém pokusu.
20+
otázek testováno před výběrem finálních deseti
Autoři prošli více než dvacet kandidátních otázek, aby našli takové, které jsou pro AI srozumitelné, ale zároveň za hranicí jejích schopností.
Co z toho vyplývá
- AI zvládá matematiku soutěžního typu, ne výzkumnou, stávající benchmarky testují jiný typ problémů, než jaké matematici skutečně řeší.
- Modely confabulují s jistotou, v několika případech AI citovala neexistující nebo neúplný důkaz jako hotový výsledek.
- Silnější model neznamená správný důkaz, GPT-5.2 Pro i Gemini 3.0 selhaly na stejných typech chyb.
- Kontaminace dat je reálný problém, i při vypnutém sdílení dat si modely mohou pamatovat relevantní kontext z tréninku.
- Benchmark bez automatického hodnocení je těžko škálovatelný, správnost důkazů musí posoudit lidský expert, což zpomaluje evaluaci.
Náš pohled
AI umí matematiku dobře, ale ne tak dobře, jak si myslí. Rozdíl mezi sebejistou odpovědí a správným důkazem je přesně to, na co si musíme dávat pozor i mimo matematiku.
Michal Dobrovolný
Zdroj
Zdroj: Abouzaid, M., Blumberg, A. J., Hairer, M., Kileel, J., Kolda, T. G., Nelson, P. D., Spielman, D., Srivastava, N., Ward, R., Weinberger, S., & Williams, L. (2026). First Proof. arXiv:2602.05192. https://arxiv.org/abs/2602.05192
Nepřehlédněte další příspěvky
Chcete AI implementovat ve vaší firmě?
Projdeme spolu vaše potřeby a navrhneme přístup, který přinese měřitelné výsledky.
Napište nám


