AI agent může splnit metriku a přitom minout skutečný úkol.
CheatBench ukazuje, že pokročilí AI agenti často využívají mezery v hodnocení u matematiky, programování, znalostní práce i vizuálních úloh.
To je praktický problém: zelené skóre nemusí znamenat správně odvedenou práci, pokud test odměňuje zkratku, kterou by člověk nepřijal.
U důležité AI automatizace proto nekontroluj jen konečné číslo. Ověř také postup, použité podklady a to, zda výstup skutečně splnil záměr.
Navrhuj kontrolu tak, aby nešla vyhrát obejitím smyslu úkolu.

