← KNIHOVNA
AI agenti4 min9. července 2026

OpenAI ukazuje, proč jsou evaluace pro AI agenty pořád slabé místo

OpenAI ukazuje, že vadné evaluace mohou zkreslit pohled na schopnosti coding agentů i rozhodování o nasazení AI v práci.

OpenAI ukazuje, proč jsou evaluace pro AI agenty pořád slabé místo - editorialni ilustrace evaluaci AI agentu

TL;DR:

  • OpenAI 8. července 2026 zveřejnil audit SWE-Bench Pro a odhaduje, že zhruba 30 % úloh v benchmarku je rozbitých nebo zavádějících.
  • Pro AI v práci je to důležitý signál: když špatně měříme schopnosti modelů, můžeme špatně rozhodovat i o nasazení AI agentů.
  • Studie ukazuje, že agenti se dají použít i jako nástroj pro kontrolu kvality dat, promptů, testů a evaluačních sad.
  • Praktické AI workflow má proto obsahovat nejen test finální odpovědi, ale i kontrolu zadání, skrytých testů, trace a lidské validace.
  • Při výběru nástroje nebo modelu sledujte, jak vznikly evaluace, ne jen jedno číslo v žebříčku.

OpenAI zveřejnil audit SWE-Bench Pro, benchmarku pro měření schopností coding agentů. Závěr je nepříjemný: podle OpenAI má přibližně třetina veřejných úloh problémy, které mohou zkreslovat výsledky. Některé testy jsou příliš úzké, jiné kontrolují požadavky, které nejsou v zadání, část úloh má slabé pokrytí a některé prompty vedou model špatným směrem.

Na první pohled je to technická debata pro vývojáře benchmarků. Ve skutečnosti je to dobrá lekce pro každého, kdo chce používat AI agenty v práci. Pokud nevíme, co přesně měříme, může dobře vypadající skóre zakrýt špatné chování v reálném workflow.

Co OpenAI zjistil

SWE-Bench Pro měl být realističtější nástupce starších coding benchmarků. Model dostane úkol z historie softwarového projektu, má upravit kód a uspět v testech. Takový formát se tváří blíž práci skutečného coding agenta než jednoduchá otázka v chatu.

OpenAI ale popisuje, že rychlý růst výsledků frontier modelů vyvolal potřebu benchmark zkontrolovat. Firma použila datovou kontrolní pipeline, která procházela metadata úloh, pokusy modelů a failure traces. Potom problematické úlohy hodnotili investigativní agenti i lidští softwaroví inženýři.

Výsledek: automatická analýza označila 200 z 731 úloh jako rozbitých, lidská anotace 249 úloh. OpenAI proto doporučení používat SWE-Bench Pro stáhl zpět.

Proč to není jen problém benchmarku

U AI agentů se často mluví o tom, který model je nejlepší. Jenže agentský systém není jen model. Je to zadání, nástroje, prostředí, testy, oprávnění, paměť, runtime a lidská kontrola. Když se měří jen finální výsledek a test je sám vadný, tým může odměnit špatné chování.

OpenAI uvádí příklady, kdy skrytý test vyžadoval detail, který v promptu nebyl rozumně odvoditelný, nebo kdy test ověřoval konkrétní implementační styl místo správného výsledku. V reálné práci to má přímý ekvivalent: agent může selhat ne proto, že je slabý, ale proto, že člověk špatně popsal úkol, skryl kritérium kvality nebo nastavil kontrolu, která netestuje podstatu práce.

Pro praktické využití AI je to zdravé varování. Špatná evaluace není jen akademická chyba. Je to provozní riziko.

Agenti jako kontrola kvality

Zajímavá část článku je metoda samotná. OpenAI použil agent-assisted audit: agenti procházeli úlohy, repozitáře, testy, pokusy modelů a failure traces, aby odlišili skutečnou nejednoznačnost od rozbitého zadání. Lidé potom výstupy validovali.

To je přesně typ AI workflow, který se bude hodit i mimo vývoj modelů. Agent může předpřipravit audit dokumentů, testovacích sad, pravidel nebo datových exportů. Člověk ale musí zůstat v rozhodovacím místě: potvrdit závěr, vyřešit sporné případy a rozhodnout, jaká změna se promítne do procesu.

V malém týmu to může vypadat jednoduše. Před nasazením agenta vezmete deset až třicet reálných úkolů, necháte ho pracovat, uložíte mezikroky a zkontrolujete nejen odpověď, ale i to, zda zadání obsahovalo všechno podstatné. Když se chyba opakuje, nedává se automaticky vina modelu. Nejprve se ptáte: je špatný prompt, test, nástroj, vstupní data, nebo skutečně schopnost modelu?

Co si odnést pro AI workflow

Největší chyba je brát benchmark jako objektivní pravdu bez kontextu. Dobré skóre může znamenat schopný model. Může ale také znamenat, že test měří úzký vzor, který se dá obejít, nebo že úlohy neodpovídají vaší práci.

Pokud stavíte automatizaci práce pomocí AI, definujte vlastní evaluační sadu. Nemusí být velká. Měla by ale vycházet z reálných vstupů, mít jasná kritéria, obsahovat hraniční případy a ukládat důvody selhání. Ještě důležitější je oddělit chyby podle typu. Jinak budete ladit prompt tam, kde chybí data, nebo měnit model tam, kde je rozbitý test.

Praktický další krok: vyberte jeden opakovaný agentský úkol a vytvořte malý regresní set. U každého případu napište, co je správný výstup, co nesmí agent domyslet a co musí zkontrolovat člověk. Teprve potom porovnávejte modely, nástroje nebo nové verze workflow.

Zdroj

Zdroj: OpenAI - https://openai.com/index/separating-signal-from-noise-coding-evaluations/

Související z knihovny

Praktická AI jednou týdně.

Jeden plný workflow, důležité novinky a postupy, které se dají použít v práci.

Workflow týdněDůležité novinkyPraktické tipy