AI & Matematika
Skutečná inteligence, nebo chytrý vyhledávač?
O čem studie je
Přední matematici sestavili 10 nepublikovaných otázek z vlastního výzkumu a předložili je nejlepším AI modelům. Žádná odpověď nebyla dostupná online. Cíl byl jednoduchý, a to zjistit, zda umělá inteligence skutečně umí myslet nebo jen vyhledává.
Klíčová čísla
10
nepublikovaných výzkumných otázek
Každá otázka vznikla přirozeně v rámci výzkumu autora, nebyla nikdy zveřejněna a odpověď byla před testem zašifrována, aby se předešlo úniku dat.
0
otázek vyřešeno autonomně a správně
Ani GPT-5.2 Pro, ani Gemini 3.0 Deep Think nedokázaly autonomně a správně dokázat žádnou z deseti otázek při jednorázovém pokusu.
20+
otázek testováno před výběrem finálních deseti
Autoři prošli více než dvacet kandidátních otázek, aby našli takové, které jsou pro AI srozumitelné, ale zároveň za hranicí jejích schopností.
Co z toho vyplývá
- AI zvládá matematiku soutěžního typu, ne výzkumnou, stávající benchmarky testují jiný typ problémů, než jaké matematici skutečně řeší.
- Modely confabulují s jistotou, v několika případech AI citovala neexistující nebo neúplný důkaz jako hotový výsledek.
- Silnější model neznamená správný důkaz, GPT-5.2 Pro i Gemini 3.0 selhaly na stejných typech chyb.
- Kontaminace dat je reálný problém, i při vypnutém sdílení dat si modely mohou pamatovat relevantní kontext z tréninku.
- Benchmark bez automatického hodnocení je těžko škálovatelný, správnost důkazů musí posoudit lidský expert, což zpomaluje evaluaci.
Náš pohled
AI umí matematiku dobře, ale ne tak dobře, jak si myslí. Rozdíl mezi sebejistou odpovědí a správným důkazem je přesně to, na co si musíme dávat pozor i mimo matematiku.
Michal Dobrovolný
Zdroj
Zdroj: Abouzaid, M., Blumberg, A. J., Hairer, M., Kileel, J., Kolda, T. G., Nelson, P. D., Spielman, D., Srivastava, N., Ward, R., Weinberger, S., & Williams, L. (2026). First Proof. arXiv:2602.05192. https://arxiv.org/abs/2602.05192
