AI QA Engineer: dvě různé práce pod jedním titulem

· autor Marian Kamenistak

Marian Kamenistak vede workshop, uprostřed gesta, před slidem o dodávce roadmapy.

AI QA engineer je jeden titul pro dvě různé práce: testování AI systémů a testování běžného softwaru pomocí AI nástrojů. První ověřuje, jestli model, prompt nebo agent dává odpovědi dost dobré na to, aby šly ven; u druhé dělají část testovací práce AI nástroje.

Obě se inzerují jako „AI QA engineer“. Chtějí jiné dovednosti, sedí v jiných týmech a podle aktivních inzerátů platí hodně rozdílně. A pod příbuznými hledanými výrazy, třeba „AI tester“ nebo „AI test engineer“, se schovává ještě třetí věc, která QA prací vůbec není.

Kterou z těch dvou prací inzerát nabízí

Titul to prozradí málokdy. Slovesa v popisu odpovědností ano.

Testování AI se v inzerátech pozná podle slov jako evaly, golden datasety, rubriky, LLM judge, red-teaming a regrese mezi verzemi modelu. Inzerát Glean na evals engineera popisuje systémy, které rozhodují, jestli jsou nové modely, prompty, retrieval strategie a agentní workflow připravené jít k firemním zákazníkům. Tyhle role se obvykle obsazují jako ML nebo infrastrukturní inženýři a plat tomu odpovídá: role pro evaluace v post-trainingu u Anthropicu uvádí 500 000 až 850 000 USD, tedy úplný horní konec trhu.

Testování s AI se pozná podle generování testů z požadavků, samoopravných skriptů, třídění padajících testů pomocí AI a asistentů pro kód. Inzerát DevRev na quality engineera chce „snížit závislost na ručním psaní testovacích případů“ a zkušenost s validací AI systémů uvádí jen mezi „nice to have“. Seniorní QA role v Perplexity za 140 000 až 160 000 USD chce, aby testeři malé bugy rovnou opravili sami přes nástroje jako Cursor nebo Claude Code.

Marian Kamenistak uprostřed přednášky na tmavém pódiu, za ním promítnuté řádky kódu.
Stejný titul v inzerátu, jiný kód na obrazovce: eval pipeline, nebo sada testů s AI asistentem.

Ani jedna z těch rodin není podvod. Problém začíná, když si inzerát půjčí slovník té první a platí jako za tu druhou, nebo když se připravuješ na jednu a pohovor máš na druhou.

Deterministické testy vs. evaly

Pokud přicházíš z klasického QA, druhá rodina ti bude povědomá. Ta první rozbije pár návyků, na které se nejspíš spoléháš:

Deterministický testEval
Kritérium úspěchuVýstup se rovná očekávané hodnotěVýstup překročí práh ve vlastnostech, které sis definoval (správnost, opora ve zdrojích, bezpečnost, tón)
Kdo zná správnou odpověďZadání, nebo vývojářNa začátku často nikdo; nejdřív vzorek oštítkuje doménový expert
Stejný vstup dvakrátStejný výsledekMůže se lišit, takže vzorkuješ a díváš se na poměry
Regrese jeTest, který zčervenalSkóre, které na pevném datasetu kleslo po změně modelu, promptu nebo retrievalu
Hodnocení ve velkémAserce v kóduKontroly v kódu, kde to jde, model jako soudce, kde ne, lidé na vzorku
Typické nástrojePlaywright, pytest, JUnit, CIEval frameworky, oštítkované datasety, tracing, prompty pro soudce

Nejvíc bolí druhý řádek. Model v roli soudce je užitečný jen tehdy, když se shoduje s člověkem, který doméně rozumí, takže i soudce potřebuje vlastní test. Návod Hamela Husaina k LLM soudcům doporučuje oštítkovat sadu skutečných výstupů s doménovým expertem, měřit shodu soudce zvlášť u úspěchů a zvlášť u selhání a dát přednost binárnímu ano/ne před škálou 1 až 5, protože rozdíl mezi trojkou a čtyřkou se definuje těžko. Dokumentace Anthropicu k evaluacím míří stejným směrem z druhé strany: víc otázek s automatickým hodnocením obvykle porazí pár ručně hodnocených a hodnoticí model má být jiný než ten testovaný. V praxi tak velká část úvodní práce na skutečné AI QA pozici padne na štítkování a dohadování, co znamená „správně“, dřív než vznikne první test. Inzerát Firecrawlu na evals pozici píše, že samotnou metriku je potřeba „vymyslet“.

V Evropě má tahle práce i regulatorní důvod. Článek 15 AI Actu EU požaduje, aby vysoce rizikové AI systémy dosahovaly přiměřené úrovně přesnosti a odolnosti a své metriky přesnosti uváděly. Někdo ta čísla musí vyrobit a obhájit.

AI tester: skutečná QA role, nebo anotační brigáda?

Když do Googlu napíšeš „AI tester“, ukáže ti hlavně detektory textu psaného AI. Když hledáš práci AI testera, výsledky míchají QA inzeráty s něčím jiným: Google k tomu sám nabízí „Outlier AI“, „AI training jobs“, „What is an AI task reviewer job?“ nebo „Does AI task pay real money?“.

To něco jiného je anotace dat. Platformy jako DataAnnotation nebo Outlier platí kontraktory za hodnocení, opravy a psaní odpovědí modelů. Je to skutečná práce a část z ní se platí slušně: FAQ DataAnnotation uvádí u obecných úkolů od 25 do 50+ USD na hodinu a u kódu od 40 do 150+ USD. Podmínky jsou ale brigádnické. TIME psal o lidech, kteří prošli vstupním testem a pak nedostali žádný úkol, a o účtu, který platforma zablokovala s neproplacenou prací za 2 869 USD. Business Insider v reportáži o kontraktorech Scale AI citoval člověka, který za jediný měsíc strávil skoro 40 hodin neplaceným onboardingem a žádnou práci nedostal.

Marian Kamenistak s rukou na čele hledí do notebooku, zamyšlený.
Přečti si inzerát dvakrát. Jednotka platu a zaměstnavatel obvykle řeknou víc než titul.

Jak ty dvě věci rozlišit dřív, než obětuješ večer vstupnímu testu:

SignálAI QA nebo evals roleAnotační brigáda
ZaměstnavatelKonkrétní firma, na vlastní kariérní stránce nebo v ATSPlatforma; klient bývá anonymní
Jednotka platuRoční plat, často s akciemiZa hodinu nebo za úkol, často týdně
Výběrové řízeníPohovory s týmem, do kterého půjdešVstupní test, často neplacený
Co odevzdávášEval sady, hodnoticí skripty, podklady pro rozhodnutí o releasuHodnocení a přepsané odpovědi podle cizí rubriky
KontinuitaPracovní smlouva a výpovědní lhůtaProjekty se otevírají a zavírají, přístup můžeš ztratit
Komu reportuješEngineering nebo AI leadoviFrontě úkolů

Kreslený diagram 2x2: na vodorovné ose Testing with AI a Testing AI (testování s AI a testování AI), na svislé roční plat a platba za úkol; obě AI QA práce s ročním platem zabírají horní polovinu, anotační brigáda leží dole u platby za úkol.

Pro kariéru anotace bezcenná není. Psaní rubrik a hodnocení výstupů modelu je základní dovednost, na které evaly stojí, a Harvey, firma vyvíjející AI pro právníky, nabírá na plný úvazek lidi, kteří řídí kvalitu lidských evaluací. Krok od jednoho k druhému znamená něco postavit, eval sadu nebo hodnoticí skript, a ukázat to.

Skutečné AI QA role nesou tišší riziko. Z deseti aktivních inzerátů na AI QA a evals pozice, které jsme pro tenhle článek prošli, nedával žádný roli výslovnou pravomoc zastavit release. Můžeš vlastnit „laťku kvality“ a přitom rozhodnutí jen podkládat. Na pohovoru se zeptej, kdo rozhoduje, když eval týden před spuštěním neprojde, a co se stalo naposledy.

Pokud zvažuješ přechod z klasického QA do evalů, nebo držíš dvě nabídky, kde obě říkají „AI“ a každá myslí něco jiného, vyplatí se to s někým probrat. Přesně s takovými kariérními otázkami pracuju v 1:1 kariérním mentoringu.

Další AI role na mapě

Časté dotazy

Jak se stát AI testerem?+
Nejdřív si ujasni, kterou ze tří různých prací myslíš slovem AI tester. Testování AI systémů chce Python, statistiku a praxi se stavbou evalů s jasnými kritérii úspěchu. Testování softwaru s AI nástroji chce klasickou QA automatizaci a zkušenost s AI asistenty pro kód. Anotační platformy svou práci taky nazývají testováním, ale jde o úkolovou práci, ne o QA kariéru.
Co je práce AI task reviewer?+
AI task reviewer hodnotí nebo opravuje odpovědi, které vygeneroval AI model, většinou přes kontraktorskou platformu. Podle rubriky boduješ odpovědi a někdy je přepisuješ, a tahle data model trénují nebo hodnotí. Platí se za hodinu nebo za úkol a přístup k projektům může skončit bez upozornění.
Vydělá se na AI úkolech reálně?+
Na AI úkolech se vydělat dá, jen hodinová sazba není celý obrázek. DataAnnotation uvádí u obecných úkolů od 25 do 50+ USD na hodinu a víc za kód nebo odborné znalosti. Háček jsou neplacené vstupní testy, projekty, které vyschnou, a účty, které můžou zavřít. Ber to jako příjem, ne jako kariérní krok.
Jaký AI kurz je nejlepší pro QA engineery?+
Žádný jednotlivý kurz tu mezeru nezavře, protože těžká dovednost je úsudek o tom, jak vypadá dobrý výstup. Vezmi skutečnou funkci, napiš padesát vstupů s očekávanými vlastnostmi, ohodnoť je a pak hodnocení zautomatizuj modelem. Takový malý eval projekt řekne zaměstnavateli víc než certifikát.

Nové články rovnou do mailu.