1 · Mapa kompetencji 2 · Roadmapa 5 poziomów 3 · Frameworki i stack 4 · Architektura produkcji 5 · Evale i jakość 6 · Koszty i latencja 7 · Bezpieczeństwo i AI Act 8 · Praca w zespole 9 · Case studies 10 · Repozytoria GitHub 11 · Plan 90 dni 12 · Źródła
AI Evolution Polska · platforma edukacyjna

AI Engineerod zera do produkcji

Nie „kurs promptów”. Kompletna ścieżka inżynierska: co realnie trzeba umieć, w jakiej kolejności, jakimi narzędziami się to robi i jak wygląda praca zespołu, który utrzymuje systemy LLM na produkcji. Wszystko oparte na źródłach — link przy każdej tezie.

5
poziomów: fundament → staff
15
repozytoriów GitHub do studiowania
9
wzorców architektury w produkcji
6
case studies z realnych wdrożeń
Maska robota AI Evolution Labs — symbol automatyzacji i systemów
01 — MAPA KOMPETENCJI

Czym różni się „użytkownik promptów” od AI Engineera

Codzienna praca z agentami daje przewagę produktową, ale nie zastępuje inżynierii. Rynek płaci za dowiezienie przewidywalnego systemu: kod, dane, testy, monitoring, bezpieczeństwo i ekonomię jednostkową. W ogłoszeniu OpenAI prompt engineering to jeden element obok system designu, architektury danych, evali, monitoringu, audytowalności i governance.

Porównanie: użytkownik promptów kontra AI Engineer
Prompt userAI Engineer
Ocenia kilka odpowiedzi „na oko”Buduje reprezentatywny dataset, baseline, rubrykę, automatyczne gradery i regresję w CI
Wywołuje model w notebookuProjektuje API, stan, timeout, retry, idempotencję, fallback, auth i rollout
Wrzuca PDF-y do bazy wektorowejProjektuje ingestion, deduplikację, chunking, metadane, hybrid search i reranking; mierzy recall i precision
Patrzy na końcową odpowiedźŚledzi pełny trace: retrieval, prompt, tool calls, wynik, tokeny, koszt, p95 i błędy
Zawsze wybiera najmocniejszy modelRoutuje modele według trudności, cachuje, limituje tokeny i liczy koszt na udane zadanie
Demo uważa za produktUtrzymuje SLO, alerty, bezpieczeństwo, PII, audyt i procedury incydentowe

↔ tabelę można przewijać w poziomie na telefonie

Minimalny dowód kompetencji to nie certyfikat. To publiczne case study z diagramem, kodem, datasetem eval, wynikiem baseline kontra wersja poprawiona, p95, kosztem na 1000 zadań i opisem awarii. Dokładnie taki format odpowiada językowi realnych ofert pracy.

10 kompetencji, które powtarzają się w każdej ofercie

Python i backend / API SQL i data pipelines RAG, hybrid retrieval, reranking Evals i testy regresyjne Observability i tracing System design i reliability Koszt, latency, model routing Bezpieczeństwo, audyt, governance Cloud, Docker, CI/CD Agent orchestration i tool use
TRZY FILARY, KTÓRE ODRÓŻNIAJĄ INŻYNIERA OD UŻYTKOWNIKA 1 · KOD Python produkcyjny, typowanie, pytest, pydantic, asyncio, REST, OAuth2, Docker, CI/CD. Umiesz to odtworzyć na cudzej maszynie. 2 · DANE Ingestion, dedupe, chunking, embeddings, indeks hybrydowy, reranking, ACL, lineage, PII. Śmieci na wejściu = śmieci w odpowiedzi. 3 · SYSTEM Evale, trace, koszt na zadanie, timeouty, retry, idempotencja, SLO, rollout i rollback. Wiesz, kiedy system przestaje działać. Wszystkie trzy filary razem = system, który umiesz odtworzyć z trace’a. Dwa z trzech = demo.

Źródła: oferta OpenAI, Instrumentl, Eigen Labs.

Rynek pracy 2026 — czego naprawdę szukają

Polska (miesięcznie)

Junior AI/ML — UoP / B2B8 300 / 9 750 zł
Mid — UoP / B2B17 400 / 21 750 zł
Senior — UoP / B2B23 500 / 27 000 zł
Senior AI Engineer (Devire, 400 procesów)25 000–35 000 zł
Lead / Principaldo 45 000 zł
Senior LLM Engineerdo 42 000 zł
Stawka B2B senior180–250 zł/h

UoP = brutto, B2B = faktura netto. Źródła: Just Join IT 2026, Devire 2026.

USA / remote (rocznie)

Średnia baza AI Engineer$184 757
Średnia całość$211 243
Mediana ML Engineer (total comp)$278 800
Realne oferty seniorów$170–253k base
Frontier labs$230–385k base

Źródła: Built In, Levels.fyi. Próg wejścia do ról „Senior AI Engineer” to zwykle 4–7+ lat inżynierii, nie staż z LLM.

7 pułapek startujących od zera

🤖

Portfolio z samych chatbotów

Zamiast trzeciego wrappera zbuduj usługę z ingestem, evalami, trace’em i budżetem kosztu.

🧩

Framework-first

Nauka LangChain bez HTTP, SQL, testów i async tworzy zależność od abstrakcji zamiast kompetencji.

🎲

„Vibe evals”

Ręczne oglądanie pięciu odpowiedzi nie wykrywa regresji. Zbuduj 50–100 przypadków na start.

🐝

Multi-agent za wcześnie

Handoffy i stan mnożą niedeterminizm. Decyzja musi wynikać z wyniku evali, nie z mody.

💸

Brak ekonomii

Mierz cost/successful_task, tokeny, cache hit rate, p95 i retry rate — od pierwszego dnia.

🗑️

Brudne dane pod promptem

Bez dedupe, schematów i testów jakości RAG zwróci dobrze napisaną odpowiedź z błędnego kontekstu.

⚠️

Ślepe zaufanie do kodu AI

46% developerów bardziej nie ufa niż ufa poprawności narzędzi AI, a 45% raportuje dłuższe debugowanie wygenerowanego kodu. Testy, review, skan sekretów.

🧪

Brak failure modes

Nie opiszesz pięciu sposobów, w jakie Twój system zawodzi — nie znasz jeszcze własnego systemu.

📝

Brak wersjonowania promptu

Prompt to kod: właściciel, hash, model, parametry, changelog i powiązany dataset.

Statystyki Stack Overflow Developer Survey 2025: 84% używa AI, 46% nie ufa poprawności, 66% wskazuje „prawie dobre” odpowiedzi jako największą frustrację.

02 — ROADMAPA

Pięć poziomów: od pierwszego skryptu do platformy dla wielu zespołów

Kolejność ma znaczenie — każdy poziom ma kryterium wyjścia (exit criteria) oparte na dowodzie, nie na liczbie obejrzanych tutoriali. Kliknij poziom, żeby rozwinąć szczegóły.

1. Python produkcyjny

  • Typowanie, pytest, pydantic, asyncio, obsługa wyjątków, logging, packaging.
  • Do tego Git, Linux, HTTP, REST, JSON, OAuth2, SQL i podstawy struktur danych. Python powtarza się we wszystkich analizowanych ofertach; role wyższego poziomu wymagają też backendu, API i systemów rozproszonych.

2. Podstawy ML

  • train / validation / test, leakage, overfitting, precision, recall, F1, ROC-AUC, embeddings, cosine similarity, regresja i klasyfikacja.
  • NumPy, pandas, scikit-learn. PyTorch dopiero po zbudowaniu intuicji — nie zaczynaj od frameworka deep learningu.

3. API modeli

  • Role wiadomości, tokenizacja, structured outputs / JSON Schema, function calling, streaming, limity, retry z exponential backoff i jitterem.
  • Zbuduj jedną usługę FastAPI z testami, Dockerfilem i CI w GitHub Actions.
✅ Kryterium wyjścia: repozytorium uruchamiane jednym poleceniem, ≥20 testów, walidacja wejścia i wyjścia, README z architekturą oraz zmierzony p50/p95 latency i koszt jednego zadania.

1. RAG od początku do końca

  • Ingestion, czyszczenie, deduplikacja, chunking, embeddings, filtry metadanych, vector search i cytowanie źródeł.
  • PostgreSQL + pgvector na start; porównaj z Qdrant / Pinecone. Mierz Recall@k, Precision@k, MRR oraz jakość odpowiedzi końcowej.
  • Oferty komercyjne wymagają hybrid retrieval, rerankingu, strojenia indeksów i mierzenia jakości wyszukiwania — nie samego „podłączenia bazy wektorowej”.

2. Workflow zamiast autonomii

  • Najpierw deterministyczny pipeline z 2–4 krokami, walidacją Pydantic, timeoutami, retries i fallbackiem.
  • LangGraph lub LlamaIndex poznaj jako narzędzie, nie fundament. OpenAI wprost ostrzega: start od multi-agentów dodaje złożoność i powinien wynikać z evali.

3. Pierwsze evale

  • 50–100 przykładów z oczekiwanym wynikiem, testy exact / regex / schema, test poprawnego wyboru narzędzia, LLM-as-judge z rubryką i ręczną kalibracją próbki.
✅ Kryterium wyjścia: działający produkt z realnymi użytkownikami, dashboard kosztu i błędów, zestaw regresyjny w CI oraz opis pięciu wykrytych failure modes.

1. System design

  • Kolejki, idempotency keys, cache Redis, rate limiting, circuit breakers, dead-letter queue, stan workflow, wersjonowanie promptów i modeli, bezpieczne rollouty.
  • Potrafisz oszacować QPS, tokeny na żądanie, p95 oraz miesięczny koszt — zanim napiszesz kod.

2. Observability

  • Trace całego przebiegu: span dla każdego wywołania modelu i narzędzia, tokeny, czas, status, model, koszt, retrieval score i feedback użytkownika.
  • Stack: OpenTelemetry + Grafana / Prometheus / Sentry oraz Langfuse, LangSmith, Braintrust lub Phoenix. W praktyce 43% twórców agentów używa Grafana + Prometheus, 32% Sentry.

3. Data engineering

  • Airflow / Dagster / Temporal, CDC lub batch ingestion, data contracts, schema evolution, lineage, redakcja PII, quality checks i backfill.

4. Optymalizacja

  • Routing mały/duży model, semantic i prompt cache, batching, równoległe kroki, ograniczanie output tokens.
  • Uwaga na orzekanie o latency: generowanie tokenów zwykle dominuje nad długością wejścia.
✅ Kryterium wyjścia: samodzielnie prowadzisz usługę od danych do on-call i utrzymujesz SLO jakości, dostępności, p95 i kosztu.

1. Architektura wielomodelowa i agentowa

  • Granice autonomii, state machine, human approval, RBAC, audit trail, sandboxing narzędzi, ochrona przed prompt injection i kontrola skutków ubocznych.
  • OpenAI wymaga od inżyniera platformowego: permissions, idempotencji, retries, obsługi rate limitów, audytu i bezpiecznych granic działania.

2. Zaawansowany retrieval i ML

  • Hybrid BM25 + vector, cross-encoder reranking, query rewriting, grafy wiedzy, fine-tuning LoRA/PEFT, serving vLLM / TGI, quantization i podstawy GPU — gdy ekonomia uzasadnia self-hosting.

3. Evale jako system jakości

  • Golden set, replay ruchu produkcyjnego, przypadki adversarialne, A/B, shadow traffic, drift, ocena outcome i trajectory.
  • Anthropic rozdziela evale capability (jak dużo model potrafi) od regresyjnych (czy nie zepsuliśmy tego, co działało). Te drugie powinny dążyć do niemal 100% przejść.

4. Leadership

  • ADR-y, threat modeling, capacity planning, incident review, mentoring i rozmowa z biznesem językiem KPI.
✅ Kryterium wyjścia: wynik biznesowy przypisany do Twojego systemu oraz udokumentowana redukcja kosztu, latency albo liczby błędów.

1. Zakres organizacji

  • Platforma wspólna dla wielu zespołów, standardy eval i telemetrii, model gateway, polityki danych, guardrails, budżety i „paved road” dla wdrożeń.

2. Decyzje build / buy

  • API kontra open source, RAG kontra fine-tuning, workflow kontra agent, managed vector DB kontra Postgres, SLA kontra koszt GPU.
  • Staff ustala mierzalne progi i wymaga benchmarku na danych firmy przed zakupem czegokolwiek.

3. Wpływ

  • Roadmapa techniczna na 12–24 miesiące, standardy bezpieczeństwa i governance, przeglądy architektury, rozwój seniorów, negocjowanie kompromisu jakość–latency–koszt.
  • To poziom mnożnika organizacji, nie „osoby piszącej najtrudniejsze prompty”.
✅ Kryterium wyjścia: inne zespoły dowożą szybciej i taniej, bo korzystają z Twojej platformy i standardów.

Uczciwa uwaga o czasie. Poziomy 4–5 zakładają lata inżynierii, nie tylko pracy z LLM. Najkrótsza realna droga: backend i operowanie jednym produktem AI w produkcji → specjalizacja w evalach, RAG albo niezawodności agentów.

03 — FRAMEWORKI I STACK

Co realnie używa się w produkcji (stan: wrzesień 2026)

Najważniejsza decyzja nie brzmi „który framework wygrywa?”, a „ile niedeterminizmu naprawdę potrzebuję?”. Zwykły pipeline w Pythonie jest lepszy niż agent, jeśli ścieżkę można zapisać jako kod. Agent ma sens, gdy model musi dynamicznie dobierać narzędzia.

FrameworkNajlepszy doKiedy nie używaćGitHub / aktywność
LangChain + LangGraph LangChain: integracje i szybki agent. LangGraph: stanowe, długie workflow, checkpointy, human-in-the-loop. Prosty call API. Nie wybieraj LangGraph bez realnej potrzeby jawnego grafu. 146,3k · 13.09.2026
41,6k · 09.09.2026
LlamaIndex Ingestion, indeksy, retrievery, RAG i agenci nad dokumentami. Gotowy wzorzec retrieve → rerank → synthesize. Aplikacja bez warstwy danych / RAG albo gdy własny pipeline jest krótki. 52,2k · 11.09.2026
DSPy Deklaratywne programy LM z metrykami i automatyczną optymalizacją promptów oraz demonstracji. Bez zbioru przykładów i sensownej metryki. Do prostego ręcznego promptu. 38,0k · 11.09.2026
Pydantic AI Typed Python, structured output, dependency injection, multi-provider i OpenTelemetry. Zespół TypeScript albo gdy potrzebujesz katalogu integracji LangChain. 19,9k · 14.09.2026
OpenAI Agents SDK Lekki Python: tools, handoffs, guardrails, sessions i tracing. Dobry z Responses API. Gdy wymagany pełny vendor-neutral stack albo jawny durable graph. 29,4k · 14.09.2026
Haystack Jawne, modularne pipeline’y wyszukiwania i RAG, branch / loop, komponenty enterprise. Swobodny „autonomiczny” agent bez dominującego retrievalu. 26,5k · 14.09.2026
Mastra TypeScript: workflow + agents + memory i evals w aplikacjach webowych. Zespół Python / data science albo minimalny backend. 28,0k · 14.09.2026
CrewAI Role, crews i automatyzacje biznesowe. W produkcji podejście Flow-first daje stan i kontrolę. Gdy role-play tylko mnoży koszty; system wymagający precyzyjnej semantyki zdarzeń. 58,5k · 14.09.2026
AutoGen Badania i złożone multi-agent, event-driven Core, komunikacja między agentami. Prosty agent; eksperymentalny distributed runtime to za duży ciężar. 61,0k · 06.04.2026
smolagents Małe CodeAgent / ToolCallingAgent, nauka pętli ReAct i eksperymenty HuggingFace. Wykonywanie kodu bez izolowanego sandboxa. Ciężka orkiestracja. 29,3k · 22.08.2026

Gwiazdki zaokrąglone (GitHub API, 14.09.2026). Gwiazdki mierzą zainteresowanie, nie jakość ani adopcję enterprise.

Praktyczny shortlist: Python CRUD i structured outputs → Pydantic AI. Krytyczny, długi agent → LangGraph. RAG-heavy → LlamaIndex lub Haystack. Optymalizacja oparta na danych → DSPy. TypeScript → Mastra. Szybki stack OpenAI → Agents SDK. CrewAI i AutoGen wybierz dopiero, gdy multi-agent daje mierzalną poprawę.

RAG, który działa w produkcji

PIPELINE RAG — KAŻDY ETAP MA WŁASNE METRYKI Parse + chunk nagłówki, tabele, ID Deduplikacja jakość danych Embedding dense + lexical Indeks hybrydowy vector + BM25 Filtr ACL / tenant przed retrievalelem Query rewriting rozpoznanie intencji Retrieval top-k Recall@k · MRR · nDCG Fuzja RRF dense + sparse Cross-encoder rerank precyzja, kontrolowany koszt Kontekst + generacja z cytatami faithfulness · correctness Walidacja odpowiedzi schema · cytaty · odmowa bez dowodu Bez rozdzielenia etapów nie wiesz, czy błędną odpowiedź spowodował brak dokumentu, zły ranking czy model.

Bazy wektorowe — kiedy która

Qdrant (34,5k) — dedykowany vector search, filtry, dense+sparse, RRFself-host
pgvector (23,0k) — dane już w Postgresie, transakcje i ACL ważniejsze od skrajnej skalistart
Milvus (46,1k) — bardzo duża skala, rozproszony, wysoki throughputenterprise
Weaviate (16,8k) — obiekty + wektory, wbudowany hybrid BM25/vectorsystem
Chroma (29,3k) — prototypy i local-first startprototyp

Nie ustawiaj chunków globalnie na „512 tokenów”. Zachowuj nagłówki, akapity, tabele i ID dokumentu; testuj 2–3 warianty rozmiaru i overlap.

Inference — kiedy który silnik

vLLM (91,7k) — domyślny serwer GPU, wysoki throughput, API zgodne z OpenAIprodukcja
Ollama (180,9k) — lokalny development i demo na laptopiedev
llama.cpp (128,2k) — CPU, Apple Silicon, edge, GGUF, agresywna kwantyzacjaedge
SGLang (35,9k) — niski latency, prefix-heavy, structured generationscale
TGI (10,9k) — maintenance mode — nie zaczynaj nowego projektulegacy

Benchmarkuj własny model, długość kontekstu, concurrency i sprzęt. Mierz TTFT, inter-token latency, tokens/s, VRAM oraz stabilność p95/p99.

Prompt, RAG czy fine-tuning? Decyzja w trzech pytaniach

Problem = instrukcja, format albo wybór narzędzia? TAK → PROMPT NIE ↓ PROMPT Zacznij tu zawsze. Najtaniej, najszybciej, zero treningu. Wiedza prywatna / zmienna? potrzebne cytaty, kontrola dostępu, świeże dane TAK → RAG NIE ↓ RAG Wiedza w indeksie, nie w wagach FINE-TUNING (LoRA / QLoRA) Trwała zmiana stylu, formatu, domenowego skrótu Fine-tuning nie jest bazą wiedzy i może pogorszyć zachowania poza rozkładem. Każda zmiana wymaga holdoutu i testów bezpieczeństwa.

Evals i observability

Langfuse (34,6k) — open-source tracing, prompt management, datasets, scoresself-host
LangSmith — trace i evale online/offline, najniższe tarcie z LangChainmanaged
Braintrust — eval-first: datasets, immutable experiments, CI gatemanaged
promptfoo (25,1k) — deklaratywne testy promptów, red teaming, CICI
Ragas (15,7k) — metryki RAG: faithfulness, relevancy, context precisionscoring
OpenTelemetry GenAI — wspólny model spanów inference, retrieval, toolsstandard

Minimum produkcyjne: trace ID przez cały request, wersja promptu i modelu, parametry, tool calls, retrieved document IDs i scores, tokeny, koszt, latency, błędy i feedback użytkownika.

Fine-tuning / PEFT

Unsloth (76,1k) — najszybszy start lokalny, zoptymalizowane LoRA/QLoRAnotebook
Axolotl (12,5k) — konfigurowalne, reprodukowalne treningi 1 → wiele GPUpipeline
TRL (19,3k) — SFT, DPO, GRPO i własne pętle post-trainingubadania

LoRA zamraża bazę i uczy małe macierze adaptera. QLoRA dodatkowo trzyma bazę w 4-bit, radykalnie zmniejszając VRAM. Zacznij od QLoRA, ale zawsze porównuj z bazą na holdoucie i testach bezpieczeństwa.

04 — ARCHITEKTURA PRODUKCJI

Dziewięć wzorców, które oddzielają demo od systemu

Prototyp udowadnia, że model potrafi odpowiedzieć. Produkt musi odpowiadać wystarczająco dobrze przy przewidywalnym koszcie, czasie i ryzyku. Zawodowiec projektuje więc kontrakty danych, ścieżki awarii, ewaluację, telemetrię i możliwość wycofania zmiany.

📚

RAG pipeline

Gdy prawda jest w prywatnych lub zmiennych źródłach i odpowiedź ma wskazywać dowód. Oceniaj oddzielnie ingest, retrieval, reranking i generation.

🧭

Deterministyczny workflow

Gdy kroki, stany i warunek sukcesu są znane; wymagane idempotencja, audyt, ciasne SLA lub skutki finansowe i prawne.

🤖

Agent loop

Gdy nie da się przewidzieć liczby kroków ani narzędzi, środowisko daje feedback, wynik można zweryfikować, a budżet uzasadnia wiele wywołań.

🧑‍⚖️

Human-in-the-loop

Przed zapisem, płatnością, publikacją, usunięciem danych, zmianą uprawnień albo decyzją wysokiego ryzyka.

🔀

Router i model cascade

Ruch ma rozróżnialne klasy trudności: mały model obsługuje prosty przypadek, niski confidence eskaluje do frontier. Router sam potrzebuje golden setu.

Prompt cache

Wiele żądań współdzieli długi, identyczny prefiks (system prompt, narzędzia, dokument). Statyczne bloki zawsze przed dynamicznymi. Typowy TTL: 5 minut.

🧠

Semantic cache

Pytania powtarzalne znaczeniowo. Wymaga progu podobieństwa, TTL i namespace per tenant. Zakaz dla danych osobowych, cen, sald i pytań zależnych od czasu.

📥

Queue i async workers

Długie zadania hurtowe: checkpoint po każdym kroku, idempotency_key, limit prób i dead-letter queue.

🛡️

Retry, fallback, circuit breaker

Dla 429, timeoutów i 5xx: exponential backoff z jitterem i budżetem prób. Circuit breaker chroni przed lawiną retry.

Workflow czy agent? Konkretne kryteria

Wybierz workflow, jeśli…

  • można z góry wyliczyć stany, kolejność i kryterium sukcesu,
  • błąd ma skutek finansowy lub prawny,
  • operacja musi być idempotentna i audytowalna,
  • SLA jest ciasne,
  • istnieje jednoznaczne API do wywołania.

Przykład: klasyfikacja zgłoszenia → sprawdzenie numeru zamówienia → refund według reguł → wygenerowanie potwierdzenia.

Wybierz agenta, jeśli…

  • liczby kroków i potrzebnych narzędzi nie da się przewidzieć,
  • środowisko dostarcza informację zwrotną,
  • wynik można automatycznie zweryfikować,
  • wartość uzasadnia dodatkowe wywołania i koszt.

Przykład: analiza repozytorium, research z wielu źródeł, diagnoza incydentu. Ustal max_steps, budżet tokenów i czasu, dozwolone narzędzia, stan trwały oraz warunki stopu.

AGENT LOOP — ZAWSZE Z BUDŻETEM I WARUNKIEM STOPU 1 · Plan 2 · Tool call 4 · Obserwacja 3 · Weryfikacja stan · wynik · budżet Budżet i limity max_steps · tokeny · czas · koszt Allowlist narzędzi tylko zadeklarowane akcje Akcje zapisu = człowiek płatność · publikacja · usunięcie Stan poza procesem checkpoint po kroku idempotency_key DLQ + retry wersja promptu trace ID Ustalone limity to nie ostrożność, tylko kontrakt: bez nich nie policzysz kosztu ani nie zagwarantujesz SLA.

Praktyki, które ratują produkcję

Retry, fallback, degradacja

  • Dla 429, timeoutów i 5xx: exponential backoff z jitterem. Google SDK domyślnie ponawia błędy przejściowe do 4 razy, od ok. 1 s do maks. 60 s.
  • Nie ponawiaj 4xx związanych z walidacją — to nie błąd przejściowy.
  • Po wyczerpaniu budżetu: drugi region, drugi dostawca lub model, odpowiedź zdegradowana z cache, eskalacja do człowieka.
  • AWS zaleca trwałą warstwę wiadomości i DLQ zamiast bezpośredniego łączenia agentów.

Pięć awarii do przetestowania przed wdrożeniem

  1. timeout providera,
  2. częściowo wykonane narzędzie,
  3. powtórzony webhook,
  4. brak uprawnień do dokumentu,
  5. zerwany stream.

Każdy side effect potrzebuje idempotency key, limitu kosztu i punktu zatwierdzenia, jeśli jest destrukcyjny.

Reguła architektoniczna: wymień model lub bazę wektorową bez przepisywania logiki biznesowej. To znaczy: aplikacja wysyła żądania przez stabilny interfejs (własny adapter lub API zgodne z OpenAI), orchestrator trzyma stan poza procesem, retrieval zwraca dokumenty z wersją, tenantem i ACL, telemetria niesie jeden trace ID, a pipeline evali zna wersję modelu, promptu, indeksu i danych.

05 — EWALE I JAKOŚĆ

Jak wygląda realny proces ewaluacji (i dlaczego to nie „test na oko”)

Ewaluacja nie jest krokiem na końcu projektu. To system, który blokuje regresje i pozwala zmieniać prompt, model albo retriever bez zgadywania. Realny proces zaczyna się przed pierwszą zmianą promptu.

  1. Golden datasetZbierz reprezentatywne logi produkcyjne, ręcznie opisane odpowiedzi i oczekiwane dokumenty oraz narzędzia. Podziel na happy path, long tail, przypadki graniczne i ataki. Część trzymaj jako niewidoczny test, żeby zespół nie „dostroił się” do benchmarku.
  2. RubrykaOceniaj osobno: poprawność zadania, groundedness, kompletność, styl, bezpieczeństwo, koszt, p50/p95 latencji — a w agentach także wybór narzędzia, argumenty, liczbę kroków i końcowy stan.
  3. Scoring warstwowyReguły deterministyczne sprawdzają JSON Schema, cytaty, kwoty i zakazane akcje. LLM-as-judge ocenia kryteria semantyczne. Preferuj pass/fail albo porównanie parami z jasną rubryką; losuj kolejność odpowiedzi i kalibruj judge’a na ocenach ekspertów — modele mają bias pozycji i długości.
  4. Regresja w CIKażdy commit promptu, modelu, retrievera lub narzędzia uruchamia mały, szybki zestaw. Merge blokuje spadek metryki ponad próg, złamanie guardraila, wzrost kosztu albo p95. Pełny zestaw działa nocą. Snapshot modelu, parametry i wersje danych muszą być zapisane.
  5. Canary i A/BOffline eliminuje złe warianty, potem 1–5% ruchu może trafić na canary. Po alarmach automatyczny rollback. A/B mierzy wynik biznesowy — resolution rate, czas obsługi — wraz z complaint rate i eskalacjami. Sama liczba kciuków w górę nie wykrywa cichych błędów.

Halucynacja nie jest jedną metryką

ROZBIJ ODPOWIEDŹ NA TWIERDZENIA I POLICZ OSOBNO faithfulness twierdzenia wsparte kontekstem ÷ wszystkie twierdzenia skala 0–1 (definicja Ragas) · liczony dla RAG, nie dla czatu answer correctness zgodność z gold answer, nie z kontekstem osobno citation precision i citation recall refusal accuracy czy system odmawia, gdy nie ma dowodu w kontekście to metryka bezpieczeństwa, nie „słabości” modelu unverified critical claims odsetek odpowiedzi z krytycznym twierdzeniem bez oparcia raportuj zawsze — to Twój wskaźnik ryzyka prawnego

Gradery: dobierz typ do kryterium

Reguła deterministyczna (schema, cytat, kwota)gdy da się zapisać w kodzie
LLM-as-judge z rubrykągdy kryterium jest semantyczne
Ocena człowieka na próbcekalibracja, audyt judge’a
Test trajektorii (agent)kolejność i wybór kroków

Anthropic rozdziela evale capability (co model potrafi) od regresyjnych (czy nie zepsuliśmy działającego). Regresyjne powinny dążyć do niemal 100% przejść.

Minimum, które warto mieć w tygodniu drugim

  • 50–100 przypadków opisanych oczekiwanym wynikiem,
  • rozdzielone metryki retrievalu i generacji,
  • jeden plik konfiguracyjny evali w CI (np. promptfoo),
  • snapshot wersji promptu, modelu i indeksu przy każdym przebiegu,
  • raport kosztu i p95 obok raportu jakości.

Przykład zamkniętej pętli: DoorDash prowadzi symulator rozmów (ponad 200 rozmów w mniej niż 5 minut, ponad 50 evali) i zamienia każdy incydent produkcyjny w trwały test regresji.

06 — KOSZT I LATENCJA

Ile to naprawdę kosztuje i jak to policzyć przed wdrożeniem

Ceny listowe API za 1 mln tokenów w USD, sprawdzone we wrześniu 2026. Nie obejmują embeddings, wyszukiwania, narzędzi, storage, retry ani marży chmurowej. Wzór: koszt = N × (Tin × Pin + Tout × Pout) / 1 000 000.

Segment i modelInput / 1MCached input / 1MOutput / 1M1000 zapytań: 2k in + 500 out
Frontier: GPT-5.5$5.00$0.50$30.00$25.00
Mid: Claude Sonnet 5$2.00$0.20$10.00$9.00
Mid/small: GPT-5.4 mini$0.75$0.075$4.50$3.75
Small: Claude Haiku 4.5$1.00$0.10$5.00$4.50
Small: Gemini 3.8 Flash$0.75$0.075$3.75$3.38
Open-weight: Llama 3.3 70B (Together)$1.04$1.04$2.60

Źródła cen: OpenAI, Anthropic, Google, Together. Przykład: 1000 × (2000 × 5 + 500 × 30) / 1 000 000 = $25.

🧮 Kalkulator: policz swój przypadek

$270.00
koszt miesięczny (30 dni) przy podanych parametrach
Koszt jednego zadania$0.0090
Koszt na dzień$9.00
Koszt na 1000 zadań$9.00
Koszt na rok$3 285.00
Tokeny miesięcznie (in + out)75 000 000

Kalkulator liczy cenę listową API. Do budżetu produkcyjnego dodaj: retry, tool calls, embeddings, wyszukiwanie, storage, monitoring i p95 długości odpowiedzi — a nie samą średnią.

🔀

Router i kaskada

Proste klasyfikacje do małego modelu, niejednoznaczne do średniego, tylko niski confidence i wysokie ryzyko do frontier. Kaskada oszczędza wyłącznie wtedy, gdy koszt błędów nie zjada różnicy cen.

📦

Batch API −50%

OpenAI i Google dają 50% rabatu dla zadań asynchronicznych. Idealne na masowe podsumowania, embeddingi i ewale.

💾

Prompt cache ~0,1× wejścia

Anthropic wycenia odczyt prompt cache na 0,1 ceny inputu dla większości modeli. Wymaga stałego prefiksu — układaj prompt tak, by statyczne bloki były na początku.

✂️

Skracaj output, nie input

Przewodnik OpenAI: skrócenie outputu o 50% może obniżyć latencję ok. 50%. Skrócenie zwykłego inputu o 50% daje często tylko 1–5%.

⚙️

Quantization FP8/INT8/INT4

Zmniejsza pamięć kosztem precyzji. Po każdej zmianie kwantyzacji ponów eval jakości — to jawny trade-off, nie darmowa optymalizacja.

🧪

Distillation

Duży model generuje dane treningowe, mały je przejmuje — sensowne, gdy zadanie jest wąskie i stabilne. Wymaga własnego eval setu.

Latencja — co naprawdę mierzyć

Śledź osobno: queue time, retrieval, time-to-first-token, tokens/s, tool time i end-to-end p50 / p95 / p99. Streaming poprawia czas odczuwany, ale nie końcowy.

Kluczowy wskaźnik ekonomiczny to nie koszt na zapytanie, tylko cost per successful task — z retry, tool calls i cache hit rate włącznie.

07 — BEZPIECZEŃSTWO I ZGODNOŚĆ

Model traktuj jak niezaufanego użytkownika, a treść z RAG jak niezaufane dane

OWASP zaznacza wprost: RAG i fine-tuning nie usuwają prompt injection. Dane z dokumentów, stron, e-maili i plików mogą zawierać instrukcje — a system, który je bezrefleksyjnie wykona, jest podatny niezależnie od tego, jak dobry ma model.

Minimum wdrożeniowe

  • separacja instrukcji od danych (instrukcje tylko z zaufanego kanału),
  • filtrowanie wejścia i wyjścia, sanitacja HTML / Markdown,
  • allowlist narzędzi + walidacja argumentów i odpowiedzi,
  • least privilege i krótkotrwałe tokeny,
  • limity wydatków na konto i na użytkownika,
  • izolowany sandbox dla kodu wykonywanego przez agenta,
  • audit trail każdej akcji i zatwierdzenie człowieka przed akcją wysokiego ryzyka.

Red team — czego próbować

direct injection indirect injection multilingual encoded multimodal injection data exfiltration memory / RAG poisoning

Narzędzie warte wdrożenia na start: promptfoo — deklaratywne testy bezpieczeństwa i regresji promptów w CI.

Dane osobowe i prywatność — kolejność działań

  1. Wykrywaj PII przed logowaniem i przed wysłaniem do dostawcyRedaguj albo tokenizuj. Log nie może domyślnie zawierać pełnych sekretów ani danych klienta.
  2. Ustal retencję i region przetwarzaniaSzyfrowanie w tranzycie i w spoczynku, RBAC, pisemna procedura usunięcia danych i odpowiedzi na żądanie dostępu (DSAR).
  3. Zapisuj metadane, nie treśćLog powinien nieść identyfikator śladu, wersję promptu i modelu oraz wynik polityki — wystarczy do audytu bez kopiowania danych osobowych.

AI Act w UE — co realnie dotyczy zespołu technicznego

NAJPIERW USTAL SWOJĄ ROLĘ I POZIOM RYZYKA 1 · Rola provider czy deployer? to zmienia cały zakres obowiązków 2 · Przeznaczenie do czego system służy i wobec kogo 3 · Poziom ryzyka chatbot wsparcia ≠ system rekrutacyjny scoring kredytowy lub edukacyjny 4 · Evidence pack model / data cards, changelog, wyniki evali Obowiązki dla systemu wysokiego ryzyka zarządzanie ryzykiem · jakość danych · logi · dokumentacja techniczna · instrukcje dla deployera nadzór człowieka · dokładność · odporność · cyberbezpieczeństwo · monitoring po wdrożeniu · raportowanie incydentów Obowiązki dla modeli GPAI obowiązują od 2 sierpnia 2025. Reguły przejrzystości — informowanie o interakcji z maszyną i oznaczanie określonych treści AI — od sierpnia 2026. Klasyfikację potwierdza prawnik; zespół techniczny dostarcza dowody.

Źródła: Komisja Europejska — ramy regulacyjne AI, wytyczne dla dostawców modeli GPAI, OWASP LLM Prompt Injection Prevention.

Uwaga praktyczna. Zwykły chatbot wsparcia nie staje się automatycznie systemem wysokiego ryzyka, ale system rekrutacyjny, scoring kredytowy lub edukacyjny może nim być. To nie kwestia techniczna — to kwestia przeznaczenia, więc pytanie o klasyfikację zadaj prawnikowi na początku projektu, nie po wdrożeniu.

08 — PRACA W ZESPOLE

Prompt to kod. Release to proces. Dashboard to kontrakt.

Różnica między projektem jednoosobowym a profesjonalnym nie polega na narzędziach, tylko na tym, że każda zmiana ma hipotezę, właściciela, pomiar, limit ryzyka i drogę odwrotu.

Struktura repozytorium (monorepo)

apps/            # aplikacja, API, worker
prompts/         # wersjonowane prompty
evals/           # zestawy i gradery
datasets/        # golden set, fixtures
services/retrieval/  # ingestion + search
infra/           # IaC, deploy, kolejki
docs/adr/        # decyzje architektoniczne

Monorepo działa, gdy aplikacja, schematy narzędzi, prompty, evale i infrastruktura zmieniają się razem. Przy wielu zespołach repo można rozdzielić — ale kontrakty i wersje muszą pozostać jawne.

Co zawiera plik promptu

  • właściciel i semver / hash,
  • model i snapshot, parametry,
  • format wyjścia (schema),
  • changelog zmian,
  • powiązany dataset eval i wyniki bazowe.

PR pokazuje diff promptu oraz raport jakości, kosztu i latencji. Reviewer sprawdza injection, PII, konflikty instrukcji, token bloat i kompatybilność schematu.

Ścieżka wydania — od lokalnego testu do rollbacku

Lokalnyreplay CIeval + gate Stagingdane syntetyczne Shadow trafficbez wpływu na usera Canary1–5% ruchu A/Bwynik biznesowy Rollout + rollbackdo poprzedniego promptu/modelu ŚCIEŻKA WYDANIA Przykładowy pipeline LangSmith łączy testy unit / integration / E2E, offline eval i quality-gated deployment. Merge blokuje: spadek metryki ponad próg, złamanie guardraila, wzrost kosztu lub p95.
📊

Dashboard produkcyjny

Success i error rate, 429/5xx, koszt na request i na tenant, cache hit, tokeny, p95/p99, jakość retrievalu, judge score, safety blocks, eskalacje, drift.

🔎

Trace jako podstawa

Jeden trace łączy wszystkie wywołania modelu, narzędzi i dokumentów. Jeśli nie umiesz odtworzyć zachowania z trace’a, nie masz systemu — masz demo.

📕

Runbook

Właściciel alertu, kill switch, tryb degradacji, procedura eskalacji. Spisany zanim będzie potrzebny — nie w trakcie incydentu.

09 — CASE STUDIES

Sześć opublikowanych lekcji z produkcji

Firmy, które opisały publicznie, jak zbudowały swoje systemy LLM — i co z tego wynika dla kogoś, kto uczy się dopiero. Każda lekcja jest weryfikowalna w źródle.

Uber — Genie

+27% akceptowalnych · −60% błędnych porad

Przejście z klasycznego RAG do query optimizer, source identifier, hybrydy BM25 + vector i post-processora.

Lekcja: najpierw napraw parsowanie dokumentów i retrieval, potem dodawaj agentów.

Źródło →

DoorDash — Support

−90% halucynacji w symulacji

Symulator prowadzi wieloturowe rozmowy, mockuje backend i przepuszcza wynik przez skalibrowane LLM-as-judge. Ponad 200 rozmów trwa mniej niż 5 minut, zestaw przekroczył 50 evali, cykl skrócił się z dni do godzin.

Lekcja: każdy incydent zamień w trwały test regresji.

Źródło →

LinkedIn — produkt GenAI

10% → 0,01% błędnych payloadów YAML

Stały pipeline routing → retrieval → generation: małe modele w dwóch pierwszych etapach, duży w generacji. Defensywny parser i poprawki promptu zamiast kosztownego retry.

Lekcja: format naprawiaj deterministycznym kodem, nie kolejnym wywołaniem modelu.

Źródło →

Notion — Vector Search

10× skala · 90% niższy koszt

Migracja silnika dała 60% oszczędności, a p50 zapytania spadło z 70–100 ms do 50–70 ms.

Lekcja: ekonomia RAG zależy również od indeksu, storage i pipeline’u embeddingów — nie tylko od ceny modelu.

Źródło →

GitHub Copilot — agentic memory

merge rate 83% → 90%

Pamięci przechowują cytowania do kodu i są weryfikowane przy odczycie. W testach precision code review +3%, recall +4%.

Lekcja: pamięć musi mieć dowód, świeżość i mechanizm samonaprawy.

Źródło →

Canva — AI Platform

do 12× szybsza ewaluacja · −50% kosztu chmury

Standaryzacja rozproszonego treningu dała pełne wykorzystanie GPU i niższy koszt chmury przy ponad 100 utrzymywanych modelach.

Lekcja: wspólna platforma i wykorzystanie sprzętu stają się ważniejsze niż eksperymentalny notebook.

Źródło →

Profesjonalizm widać po jednej rzeczy: zespół wie nie tylko, czy system działa, lecz na jakich przypadkach przestaje działać i ile kosztuje każde dodatkowe „dziewięć” jakości.

10 — REPOZYTORIA GITHUB

15 repozytoriów, które warto przeczytać — nie tylko sklonować

Dla każdego: co konkretnie studiować, poziom trudności i aktywność. Gwiazdki zaokrąglone wg GitHub API (14.09.2026) — mierzą zainteresowanie, nie jakość. Filtruj i szukaj poniżej.

langchain-ai/langgraph
★ 41,6kadvanced09.2026

StateGraph, checkpointing, durable execution, interrupts / HITL, retry. Studiuj rozdział kroków deterministycznych od agentowych.

Otwórz repo →
run-llama/llama_index
★ 52,2kstart tutaj09.2026

Ingestion pipeline, node parsers, retrievery, postprocessors / reranking, query engines i workflows RAG.

Otwórz repo →
stanfordnlp/dspy
★ 38,0kadvanced09.2026

Signatures, Modules, metrics, compilation oraz optymalizatory GEPA / MIPROv2. Myślenie jak w ML zamiast ręcznego promptowania.

Otwórz repo →
pydantic/pydantic-ai
★ 19,9kstart tutaj09.2026

Typed dependencies, structured outputs, tool schema, model abstraction, OpenTelemetry i testowanie agentów.

Otwórz repo →
openai/openai-agents-python
★ 29,4kstart tutaj09.2026

Minimalny agent loop, Runner, handoffs, guardrails, sessions i tracing. Czytelny, mały rdzeń — dobry do nauki architektury.

Otwórz repo →
mastra-ai/mastra
★ 28,0kadvanced09.2026

Architektura TypeScript, Zod schemas, workflows suspend / resume, memory, evals i integracja z aplikacją webową.

Otwórz repo →
deepset-ai/haystack
★ 26,5kadvanced09.2026

Komponenty i directed multigraph pipelines, async execution, retrievery, DocumentStore oraz agentic RAG.

Otwórz repo →
vllm-project/vllm
★ 91,7kadvanced09.2026

PagedAttention i KV cache, continuous batching, scheduler, serwer zgodny z OpenAI, tensor parallel, benchmarki servingu.

Otwórz repo →
ggml-org/llama.cpp
★ 128,2kadvanced09.2026

GGUF, kwantyzacja, backendy CPU / GPU, memory mapping, sampling oraz lekki serwer HTTP. Czytaj, gdy chcesz zrozumieć inference od środka.

Otwórz repo →
sgl-project/sglang
★ 35,9kadvanced09.2026

RadixAttention, prefix caching, scheduler, structured generation, speculative decoding i distributed serving.

Otwórz repo →
qdrant/qdrant
★ 34,5kadvanced09.2026

HNSW, payload filters, dense + sparse vectors, Query API, RRF i wieloetapowy reranking.

Otwórz repo →
pgvector/pgvector
★ 23,0kadvanced09.2026

Operatory dystansu, indeksy HNSW / IVFFlat, planner Postgresa, filtrowanie i trade-off recall / latency.

Otwórz repo →
langfuse/langfuse
★ 34,6kadvanced09.2026

Model trace / span, ingestion OpenTelemetry, wersje promptów, scores, datasets i architektura self-hosted.

Otwórz repo →
promptfoo/promptfoo
★ 25,1kstart tutaj09.2026

Deklaratywne konfiguracje evali, asercje, macierze modeli, red teaming, caching i quality gates w CI.

Otwórz repo →
unslothai/unsloth
★ 76,1kadvanced09.2026

LoRA / QLoRA, ładowanie 4-bit, kerneli Triton, formatowanie datasetu, eksport adapterów i integracja z TRL.

Otwórz repo →

Brak wyników — zmień filtr albo frazę.

11 — PLAN 90 DNI

Konkretny plan na pierwsze 90 dni — od zera do pierwszej wersji produkcyjnej

Odhaczaj w trakcie pracy — postęp zapisuje się w Twojej przeglądarce (localStorage, bez wysyłania danych na serwer). Każdy punkt ma kryterium: jeśli nie umiesz go pokazać, nie jest zrobiony.

Twój postęp0 / 18

Dzień 1–30 · fundament

Dzień 31–60 · RAG i pierwsze evale

Dzień 61–90 · produkcja

Test QLoRA: sięgnij po fine-tuning tylko wtedy, gdy evale pokazują powtarzalny problem, którego prompt i RAG nie naprawiają — i porównaj z bazą na holdoucie oraz testach bezpieczeństwa. Kolejność jest: prompt → RAG → fine-tuning, nigdy odwrotnie.

12 — ŹRÓDŁA

Wszystkie źródła w jednym miejscu

Każda liczba i teza na tej stronie pochodzi z poniższych materiałów. Ceny i gwiazdki sprawdzone 14 września 2026 — tego typu dane zmieniają się szybko, więc przed decyzją zakupową zweryfikuj je u dostawcy.

  1. OpenAI — Software Engineer, Enterprise AI Platform
  2. Anthropic — Forward Deployed Engineer
  3. Acquisition — Senior AI Engineer
  4. Eigen Labs — Senior Agentic AI Engineer
  5. Instrumentl — Sr. Software Engineer, GenAI
  6. Just Join IT — Salary Report 2026, kategoria AI/ML
  7. Devire — Raport płacowy AI 2026
  8. Built In — AI Engineer Salary (US)
  9. Levels.fyi — Machine Learning Engineer (US)
  10. Stack Overflow Developer Survey 2025 — sekcja AI
  11. Anthropic — Building effective agents (workflow vs agent)
  12. Anthropic — Demystifying evals for AI agents
  13. OpenAI — Evaluation best practices
  14. OpenAI — Production best practices
  15. OpenAI — Latency optimization
  16. OpenAI — cennik API
  17. Anthropic — cennik modeli
  18. Google — cennik Gemini API
  19. Together AI — cennik modeli open-weight
  20. AWS Bedrock — prompt caching
  21. Microsoft Azure — semantic caching
  22. Google Vertex AI — strategia retry
  23. AWS Well-Architected — Agentic AI Lens
  24. Ragas — metryka faithfulness
  25. OWASP — LLM Prompt Injection Prevention Cheat Sheet
  26. Komisja Europejska — unijne ramy regulacyjne AI
  27. Komisja Europejska — wytyczne dla dostawców GPAI
  28. LangSmith — zarządzanie promptami i wersjonowanie
  29. LangSmith — przykładowy pipeline CI/CD
  30. Qdrant — reranking i hybrid search
  31. Uber — Enhanced Agentic RAG
  32. DoorDash — simulation & evaluation flywheel
  33. LinkedIn — budowa produktu generatywnego AI
  34. Notion — dwa lata vector search
  35. GitHub — agentic memory system dla Copilota
  36. Canva — modern AI platform (case study)