Jak poznat, že AI nástroj opravdu funguje, ještě než mu začnete věřit

Málem jsem nasadil nástroj, který, řečeno bez obalu, hádal. Můj test prošel dokonale: každý příklad správně. Pak jsem ho pustil na opravdová, neučesaná, každodenní data a rozsypal se tak ošklivě, že jsem si to číslo musel přečíst dvakrát. Nástroj nebyl rozbitý. Rozbitý byl můj test. A přesně tahle mezera je ta nejdražší chyba, kterou dnes u lidí kolem AI vidím: uvěří demu, nasadí to a po pár týdnech zjistí, že to celou dobu fungovalo jen na těch jednoduchých případech. Tady je návod, jak to odhalit dřív, než vás to bude něco stát.
Ve zkratce
- Chtěl jsem vyměnit drahou AI službu za levnější, která dělá tu samou rutinní práci. V testu, který jsem napsal, dostaly obě 100 %.
- Na mých skutečných datech zůstal dobrý nástroj spolehlivý; levný spadl zhruba na úroveň hodu mincí. Test nebyl špatný, byl snadný: nevědomky jsem mu naservíroval ty samozřejmé případy.
- Náprava nestojí skoro nic: testujte na výseku svých vlastních skutečných, neučesaných dat, ne na demu.

Výchozí situace
Jeden malý, nudný úkol v jednom vedlejším projektu, který provozuji: vzít kus příchozího textu a zařadit ho do kategorie, a to tisíckrát denně. Nepotřebuje to za sebou žádného génia, takže by to měl zvládnout i levný nástroj. Vyměnit dražší službu, udržet stejnou kvalitu a rozdíl si nechat. Než jsem to přepnul, udělal jsem zodpovědnou věc a postavil si malý test.
Test, který mi řekl, co jsem chtěl slyšet
Ručně jsem sepsal pár desítek příkladů, ke každému správnou odpověď, a ověřil, jak často je každý nástroj trefí. Levný nástroj dostal 100 %, stejně jako ten drahý, který jsem nahrazoval. Něco mě ale hlodalo. Plný počet bodů na reálné práci obvykle znamená jediné: test byl moc snadný. Tak jsem ho ještě před nasazením prohnal jednou další zkouškou.
Test, který mi řekl pravdu
Místo svých ručně vybraných příkladů jsem vytáhl výsek skutečných dat, těch opravdových, která systémem protékají každý den. Oba nástroje na nich proběhly potichu, na pozadí. Tady je, co se vrátilo.
| Nástroj | Můj ručně psaný test | Má skutečná, neučesaná data |
|---|---|---|
| Ten, který jsem si nechal (dražší) | 100 % | ~85 % |
| Levnější náhrada | 100 % | ~52 % |
Padesát dva procent u volby mezi dvěma možnostmi je hod mincí. Nástroj, který v mém testu zazářil, na reálných datech sotva překonával hádání.
Nenasadil jsem ho. Nechal jsem si spolehlivý nástroj a později našel levnější variantu, která skutečný test prošla. Ale to je už na jiný článek.
Proč test lhal
Test nebyl rozbitý. Byl nereprezentativní, což je horší, protože to vypadá v pořádku.
Test, který si napíšete sami, měří, jak dobře rozumíte snadným případům. Nic víc.
Důvod je prostý: když píšete testovací případy ručně, píšete ty jasné, aniž si to uvědomujete. Skončíte u toho, že testujete, jestli nástroj zvládne snadnou verzi práce, a snadnou verzi zvládne skoro cokoli. Vaše skutečná práce ale není ta snadná verze. Je to nedokončená věta, zpráva, která je o dvou tématech najednou, ta odkapávající sarkasmem, formulář, který někdo vyplnil špatně. A přesně tam se slabý nástroj hroutí a dobrý si zaslouží svou cenu. Můj ručně psaný test nic z toho neobsahoval, takže ty dva nástroje nedokázal rozeznat.
Návyk, kterého se teď držím
Demům ani ručně psaným testům už v tomhle nevěřím. Pravidlo je krátké: než svěříte AI nástroji skutečnou práci, otestujte ho na výseku svých vlastních skutečných dat, ne na příkladech, které vybral dodavatel, a ne na příkladech, které jste vybrali vy. V praxi jde o čtyři kroky, žádný z nich technický:
- Vezměte vzorek své skutečné práce. Pár desítek reálných případů z minulého měsíce, těch běžných, ne těch učesaných. Zapište si, jaká měla být správná odpověď.
- Nechte nástroj na tom vzorku proběhnout potichu, stranou, kde jeho odpovědi zatím nic nedělají.
- Porovnejte ho s tím, co děláte dnes: s vaším současným nástrojem nebo s vaším týmem, který to dělá ručně.
- Nasaďte ho jen tehdy, když obstojí na těžkých případech, ne na demu.
Skutečný test stojí hodinu. Jeho vynechání stojí týdny úklidu.
Co to znamená, když to podepisujete vy
Nemusíte rozumět modelu. Stačí, když odmítnete jednu větu: „V demu si vedl skvěle." Samozřejmě že ano: demo bylo postavené tak, aby si vedlo skvěle. Jediná otázka, která vás ochrání, zní: jak si vede na našich datech, na případech, se kterými se opravdu pereme? Pokud dodavatel takový test spustit nemůže nebo nechce, je to samo o sobě vaše odpověď. A jediné číslo, o které si stojí za to říct: přesnost na vašich vlastních datech proti přesnosti na demu. Pokud jsou ta dvě čísla daleko od sebe, našli jste riziko dřív, než ono našlo vás.
Těžké případy jsou celým důvodem, proč vůbec za dobrý nástroj platíte. Takže než svěříte jakémukoli AI nástroji skutečnou práci: kdy jste ho naposledy prověřili proti té neučesané, skutečné věci, místo proti verzi postavené tak, aby na vás udělala dojem?
Stack: Python · Claude API · Ollama
Potřebujete něco podobného pro svou vlastní firmu? Podívejte se, jak můžu pomoct →
Získejte checklist AI Audit Kickoff
Patnáct otázek, které si položit o vlastních procesech, než utratíte jediný cent za AI. Přesně ta první hodina, kterou dělám při skutečném auditu, jako jednostránkové PDF. Nechte email a hned ho dostanete, k tomu občas zpráva, když napíšu něco, co stojí za váš čas. Žádný spam, odhlášení jedním kliknutím.