AI Platform Engineer: co stavíš a za co odpovídáš

· autor Marian Kamenistak

Marian Kamenistak přednáší na akci o engineering leadershipu.

AI platform engineer staví sdílenou vrstvu, přes kterou produktové týmy dostávají velké jazykové modely do produkce. Tu vrstvu tvoří gateway, kterou volání modelů procházejí, evaly, které rozhodují, jestli změna půjde ven, trasování a limity na náklady a data.

Titul je tak nový, že se inzeráty neshodnou, co znamená. Jedenáct z nich, přečtených v říjnu 2026 v USA a v Evropě, spadá do dvou rodin. Jedna staví řídicí vrstvu pro modely, které firma nakupuje: přístupy, směrování, kvóty, náklady, guardraily. Druhá provozuje výpočetní výkon pro modely, které firma hostuje sama: GPU, plánování, inferenční servery. Titul je stejný, ale plat, on-call i kariérní cesta se mezi nimi liší.

AI platform engineer vs. ML platform engineer vs. MLOps: jaký je rozdíl?

AI platform engineer rozšiřuje klasickou platformní práci o přístup k modelům, GPU, řízení nákladů, guardraily a compliance. MLOps automatizuje celý životní cyklus modelů, které si firma trénuje sama, od tréninku přes nasazení po přetrénování, a ML platform engineering staví infrastrukturu, na které to celé běží.

Klasický platform engineering dláždí cestu pro dodávání jakéhokoli kódu: pipeline, runtime, observability. Průvodce AI platform engineeringem od TrueFoundry popisuje AI verzi jako stejný mandát, rozšířený o přístup k modelům, GPU, řízení nákladů, guardraily a compliance.

MLOps je starší a užší. Google Cloud ho definuje jako automatizaci životního cyklu modelů, které si stavíš sám, od tréninku přes nasazení po přetrénování. ML platform engineering staví infrastrukturu pod tím. Inzerát Mistralu na ML platformu se čte jako práce na plánovači v Kubernetes pro výzkumníky: fronty, kvóty, preempce a výslovná on-call rotace přes GPU infrastrukturu.

AI platform engineer obsluhuje hlavně modely, které firma netrénovala. Nejčistší verzi má berlínský Scalable Capital: přístup k modelům přes LiteLLM, trasování v Langfuse, rate limity a přísné řízení nákladů na API, to celé pro tým interních AI softwarových inženýrů.

Ani ti, kdo obor definují, se neshodnou. platformengineering.org na svém tematickém rozcestníku používá „AI platform engineering“ pro vývojářské platformy, které AI využívají, a jeho vlastní průvodce je odlišuje od platforem postavených pro běh AI. Když inzerát píše „AI platforma“, ověř si ještě před prvním hovorem, kterou z těch dvou myslí.

Plat se řídí spíš rodinou než titulem. Code Metal, který provozuje vlastní inferenční servery i gateway, nabízí staff základ 205 000 až 250 000 USD. Staff role v Sysdigu, řídicí vrstva pro byznysové týmy nad AWS Bedrock, nabízí 141 000 až 194 700 USD, takže její horní hranice leží pod spodní hranicí Code Metalu. V Praze nabízí DEK 90 000 až 120 000 Kč měsíčně.

Kdo rozhoduje o čem

Většina tření v téhle roli vzniká tím, že na stejnou funkci sahají tři tituly. Sloupec applied AI engineer vychází z eseje Latent Space o AI inženýrovi, která dává produktová data a evaly AI inženýrovi a práci se základními modely ML inženýrům.

Rozhodnutí nebo aktivumML engineerAI platform engineerApplied AI engineer
Jaký model funkce používáTrénuje nebo dolaďuje kandidátyZpřístupňuje schválené modely, nastavuje výchozíVybírá ze schváleného seznamu
Prompty, retrieval, volání nástrojůNezapojuje seDodává stavební bloky: vektorové úložiště, registr nástrojůVlastní je
EvalyBenchmarky na úrovni modeluProvozuje sadu evalů a release gate v CIPíše testovací případy pro funkci
Gateway, klíče, kvótyPoužívá jiVlastní jiPoužívá ji
GPU a inferenční kapacitaŽádá o niPlánuje a obsluhuje ji, když jsou modely vlastníSkoro ji nevidí
Útrata za tokenyRozpočet na tréninkPřiřazuje ji týmům, hlídá skokyOdpovídá za účet své funkce
PII a guardrailyHygiena trénovacích datVynucuje filtry na gatewayiNavrhuje funkci tak, aby potřebovala méně dat
Výpadek poskytovatele ve dvě ránoNebudí hoBudí hoBudí ho, pokud funkce nemá záložní cestu

Na stránce ta tabulka vypadá samozřejmě. Ve firmě obvykle existuje jen v hlavách lidí, a proto 90denní plán níž začíná tím, že ji sepíšeš.

Pět vrstev, které nakonec provozuješ

Marian Kamenistak ukazuje na slide, který boduje dovednosti v AI-assisted engineeringu (agentic coding, AI code review, MCP integrace) proti platu mid-level vývojáře.
Integrace MCP a AI code review se dnes objevují jako dovednosti na slidech o platech inženýrů a jako vrstvy na platformě.
  1. Výpočetní výkon a servírování modelů. Když jsou modely vlastní, jsou to GPU, inferenční servery a otázka, kdo má přes noc přednost. Pražský inzerát Trezoru popisuje jeden server s několika GPU, na kterém běží vLLM, LiteLLM a Open WebUI a který od začátku do konce vlastní jeden člověk. Když modely přicházejí od poskytovatelů, vrstva se zúží na smlouvy, regiony a rate limity.
  2. Gateway. Jedny dveře pro každé volání modelu. Inzerát Code Metalu vyjmenovává, co musí umět: jednotnou autentizaci, směrování, failover, kvóty a přiřazení nákladů. Když testuju kandidáta na pozici Head of AI, jedna z mých otázek zní, co provozuje jako AI gateway (celý seznam je v mém playbooku AI transformace).
  3. Evaly. Nástroj, který evaly spouští, referenční datové sady pro každou funkci a brána, která zastaví release, když kvalita klesne. Průvodce od TrueFoundry při vší podrobnosti o gatewayích a nákladech evaluaci jako oblast vůbec neuvádí. Moje pravidlo k tomu je ve stejném playbooku: „AI je pravděpodobnostní model, ne binární. Když nejsou validace, garantuju ti, že ti to čas nešetří.“
  4. Observability. Trasování každého požadavku, latence, spotřeba tokenů po týmech, kvalita odpovědí v čase. Sysdig posílá využití Bedrocku do Snowflaku, spárované s identitou, s alerty na prahové hodnoty útraty.
  5. Náklady a guardraily. Rozpočty po týmech, filtry na PII a sandboxy pro neověřené modely (Sysdig to formuluje jako „neověřené modely držet v sandboxu“). V Evropě tahle vrstva vyrábí i důkazy pro audit. Podle článku 12 AI Actu musí vysoce rizikový systém po celou dobu životnosti automaticky zaznamenávat události a článek 26 ukládá provozovatelům ty logy držet aspoň šest měsíců. Nařízení Digital Omnibus posunulo povinnosti pro vysoce rizikové systémy z přílohy III, například pro nábor nebo hodnocení úvěruschopnosti, na 2. prosince 2027 (harmonogram). Gateway s logy spárovanými s identitou je místo, odkud ty důkazy přijdou.

Kreslené schéma: pět sloupů, Compute and serving, The gateway, Evals, Observability a Cost and guardrails (výpočetní výkon a servírování modelů, gateway, evaly, observability, náklady a guardraily), které nesou jeden trám s nápisem AI platform.

Tvých prvních 90 dní

Rizika téhle pozice jsou vidět v inzerátech ještě před podpisem: rozsah větší nebo menší, než slibuje titul, odpovědnost za věci, které řídí jiné týmy, a nový tým, jehož hlavními uživateli jsou pilotní projekty. Plán na první tři měsíce by je měl zneškodnit v tomhle pořadí.

Dny 1 až 30: najdi každé volání modelu. Sepiš poskytovatele, API klíče, kdo platí kterou fakturu a které funkce běží naostro a které jsou jen pilot. Počítej s větším využitím, než kdo přizná. Zpráva MIT NANDA State of AI in Business 2025 zjistila, že zaměstnanci ve více než 90 % zkoumaných firem používají osobní AI nástroje, zatímco oficiální předplatné LLM koupilo jen 40 % firem. Tenhle měsíc ti také řekne, jakou práci jsi doopravdy vzal. Inzerát DEKu na „AI platformu“ má 13 povinností a 11 z nich je přebírání aplikací od dodavatelů, CI/CD a Docker, zkušenost s AI je volitelná. Jestli tvůj týden vypadá takhle, vyjednej rozsah nebo titul znovu, dokud jsi nový.

Marian Kamenistak vede dvoudenní workshop o engineering leadershipu pro malou skupinu manažerů, přednáší u obrazovky.
První měsíc je hlavně poslouchání: kdo používá jaký model a kdo si myslí, že ho vlastní.

Dny 31 až 60: postav gateway před modely a nech podepsat tabulku vlastnictví. Nejdřív přes jednu gateway pusť nejpoužívanější funkce, pak vyplň tabulku výš s IT manažery, jejichž týmy ty funkce staví. Inzerát Sysdigu otevřeně říká proč. Gateway tam role sdílí s DevX leadem a jejím úkolem je přimět další týmy stavět podle sepsaného standardu, aniž by vlastnila jejich roadmapy. Bez podepsané tabulky se ze špatné odpovědi v cizí funkci stane tvůj incident.

Dny 61 až 90: ukaž peníze a jednu záchranu. Přines report nákladů po týmech a měsících a jeden release, který tvoje eval brána zastavila. Gartner čeká, že víc než 40 % projektů agentní AI bude do konce roku 2027 zrušeno, a jako důvody jmenuje rostoucí náklady, nejasnou byznysovou hodnotu a slabou kontrolu rizik. Dvě z těch tří jsou položky na tvé platformě. Žádný z inzerátů riziko rozpočtu nezmiňuje, ale platforma postavená pro pilotní projekty je ohrožená, jakmile ty projekty skončí, pokud neumí ukázat, co ušetřila.

Pokud jsi první AI platform hire nebo Engineering Manager, kterému ten tým reportuje, přesně takový plán procházím v mentoringu pro AI Engineering Managery. Prvních 30 minut je zdarma.

Role kolem AI platformy

Časté dotazy

Co je ML platform engineer?+
ML platform engineer staví infrastrukturu, na které firma trénuje, vyhodnocuje a nasazuje vlastní modely. Jde o plánování GPU, trénovací pipeline, feature store a registry modelů. AI platform engineer je mladší příbuzný. Většina modelů dnes přichází od poskytovatelů přes API, takže práce se přesouvá ke gatewayi, evalům, limitům nákladů a guardrailům.
Jak fungují AI platformy?+
Interní AI platforma vloží jednu sdílenou vrstvu mezi produktové týmy a modely, které volají. Požadavky projdou gatewayí, která ověří přístup, nasměruje volání k poskytovateli nebo k vlastnímu modelu, uplatní kvóty a volání zaloguje. Evaly testují změny před releasem, trasování ukáže, co se stalo v produkci, a reporty nákladů rozpočítají účet po týmech.
Kolik vydělává AI platform engineer?+
Zveřejněná základní pásma pro staff úroveň v USA se v říjnu 2026 pohybovala zhruba od 141 000 do 250 000 USD. Nejvíc s číslem hýbe firma a to, jestli provozuješ GPU. Platové weby zatím mají málo dat, protože titul je nový. Ve střední Evropě je mzda výrazně nižší, jeden pražský inzerát nabízel 90 000 až 120 000 Kč měsíčně.
Je AI platform engineering stresující práce?+
Může být, hlavně kvůli odpovědnosti bez pravomocí. Často odpovídáš za útratu za AI, za data, která opouštějí firmu, a za kvalitu odpovědí ve funkcích, které stavějí jiné týmy. Tlak výrazně klesne, jakmile je vlastnictví sepsané: kdo vybírá model, kdo vlastní prompt, kdo platí účet a koho budí výpadek poskytovatele.

Nové články rovnou do mailu.