StateGraph, checkpointing, durable execution, interrupts / HITL, retry. Studiuj rozdział kroków deterministycznych od agentowych.
Otwórz repo →Czym różni się „użytkownik promptów” od AI Engineera
Codzienna praca z agentami daje przewagę produktową, ale nie zastępuje inżynierii. Rynek płaci za dowiezienie przewidywalnego systemu: kod, dane, testy, monitoring, bezpieczeństwo i ekonomię jednostkową. W ogłoszeniu OpenAI prompt engineering to jeden element obok system designu, architektury danych, evali, monitoringu, audytowalności i governance.
| Prompt user | AI Engineer |
|---|---|
| Ocenia kilka odpowiedzi „na oko” | Buduje reprezentatywny dataset, baseline, rubrykę, automatyczne gradery i regresję w CI |
| Wywołuje model w notebooku | Projektuje API, stan, timeout, retry, idempotencję, fallback, auth i rollout |
| Wrzuca PDF-y do bazy wektorowej | Projektuje ingestion, deduplikację, chunking, metadane, hybrid search i reranking; mierzy recall i precision |
| Patrzy na końcową odpowiedź | Śledzi pełny trace: retrieval, prompt, tool calls, wynik, tokeny, koszt, p95 i błędy |
| Zawsze wybiera najmocniejszy model | Routuje modele według trudności, cachuje, limituje tokeny i liczy koszt na udane zadanie |
| Demo uważa za produkt | Utrzymuje SLO, alerty, bezpieczeństwo, PII, audyt i procedury incydentowe |
↔ tabelę można przewijać w poziomie na telefonie
Minimalny dowód kompetencji to nie certyfikat. To publiczne case study z diagramem, kodem, datasetem eval, wynikiem baseline kontra wersja poprawiona, p95, kosztem na 1000 zadań i opisem awarii. Dokładnie taki format odpowiada językowi realnych ofert pracy.
10 kompetencji, które powtarzają się w każdej ofercie
Źródła: oferta OpenAI, Instrumentl, Eigen Labs.
Rynek pracy 2026 — czego naprawdę szukają
Polska (miesięcznie)
UoP = brutto, B2B = faktura netto. Źródła: Just Join IT 2026, Devire 2026.
USA / remote (rocznie)
Źródła: Built In, Levels.fyi. Próg wejścia do ról „Senior AI Engineer” to zwykle 4–7+ lat inżynierii, nie staż z LLM.
7 pułapek startujących od zera
Portfolio z samych chatbotów
Zamiast trzeciego wrappera zbuduj usługę z ingestem, evalami, trace’em i budżetem kosztu.
Framework-first
Nauka LangChain bez HTTP, SQL, testów i async tworzy zależność od abstrakcji zamiast kompetencji.
„Vibe evals”
Ręczne oglądanie pięciu odpowiedzi nie wykrywa regresji. Zbuduj 50–100 przypadków na start.
Multi-agent za wcześnie
Handoffy i stan mnożą niedeterminizm. Decyzja musi wynikać z wyniku evali, nie z mody.
Brak ekonomii
Mierz cost/successful_task, tokeny, cache hit rate, p95 i retry rate — od pierwszego dnia.
Brudne dane pod promptem
Bez dedupe, schematów i testów jakości RAG zwróci dobrze napisaną odpowiedź z błędnego kontekstu.
Ślepe zaufanie do kodu AI
46% developerów bardziej nie ufa niż ufa poprawności narzędzi AI, a 45% raportuje dłuższe debugowanie wygenerowanego kodu. Testy, review, skan sekretów.
Brak failure modes
Nie opiszesz pięciu sposobów, w jakie Twój system zawodzi — nie znasz jeszcze własnego systemu.
Brak wersjonowania promptu
Prompt to kod: właściciel, hash, model, parametry, changelog i powiązany dataset.
Statystyki Stack Overflow Developer Survey 2025: 84% używa AI, 46% nie ufa poprawności, 66% wskazuje „prawie dobre” odpowiedzi jako największą frustrację.
Pięć poziomów: od pierwszego skryptu do platformy dla wielu zespołów
Kolejność ma znaczenie — każdy poziom ma kryterium wyjścia (exit criteria) oparte na dowodzie, nie na liczbie obejrzanych tutoriali. Kliknij poziom, żeby rozwinąć szczegóły.
1. Python produkcyjny
- Typowanie,
pytest,pydantic,asyncio, obsługa wyjątków, logging, packaging. - Do tego Git, Linux, HTTP, REST, JSON, OAuth2, SQL i podstawy struktur danych. Python powtarza się we wszystkich analizowanych ofertach; role wyższego poziomu wymagają też backendu, API i systemów rozproszonych.
2. Podstawy ML
- train / validation / test, leakage, overfitting, precision, recall, F1, ROC-AUC, embeddings, cosine similarity, regresja i klasyfikacja.
- NumPy, pandas, scikit-learn. PyTorch dopiero po zbudowaniu intuicji — nie zaczynaj od frameworka deep learningu.
3. API modeli
- Role wiadomości, tokenizacja, structured outputs / JSON Schema, function calling, streaming, limity, retry z exponential backoff i jitterem.
- Zbuduj jedną usługę FastAPI z testami, Dockerfilem i CI w GitHub Actions.
1. RAG od początku do końca
- Ingestion, czyszczenie, deduplikacja, chunking, embeddings, filtry metadanych, vector search i cytowanie źródeł.
- PostgreSQL +
pgvectorna start; porównaj z Qdrant / Pinecone. Mierz Recall@k, Precision@k, MRR oraz jakość odpowiedzi końcowej. - Oferty komercyjne wymagają hybrid retrieval, rerankingu, strojenia indeksów i mierzenia jakości wyszukiwania — nie samego „podłączenia bazy wektorowej”.
2. Workflow zamiast autonomii
- Najpierw deterministyczny pipeline z 2–4 krokami, walidacją Pydantic, timeoutami, retries i fallbackiem.
- LangGraph lub LlamaIndex poznaj jako narzędzie, nie fundament. OpenAI wprost ostrzega: start od multi-agentów dodaje złożoność i powinien wynikać z evali.
3. Pierwsze evale
- 50–100 przykładów z oczekiwanym wynikiem, testy exact / regex / schema, test poprawnego wyboru narzędzia, LLM-as-judge z rubryką i ręczną kalibracją próbki.
1. System design
- Kolejki, idempotency keys, cache Redis, rate limiting, circuit breakers, dead-letter queue, stan workflow, wersjonowanie promptów i modeli, bezpieczne rollouty.
- Potrafisz oszacować QPS, tokeny na żądanie, p95 oraz miesięczny koszt — zanim napiszesz kod.
2. Observability
- Trace całego przebiegu: span dla każdego wywołania modelu i narzędzia, tokeny, czas, status, model, koszt, retrieval score i feedback użytkownika.
- Stack: OpenTelemetry + Grafana / Prometheus / Sentry oraz Langfuse, LangSmith, Braintrust lub Phoenix. W praktyce 43% twórców agentów używa Grafana + Prometheus, 32% Sentry.
3. Data engineering
- Airflow / Dagster / Temporal, CDC lub batch ingestion, data contracts, schema evolution, lineage, redakcja PII, quality checks i backfill.
4. Optymalizacja
- Routing mały/duży model, semantic i prompt cache, batching, równoległe kroki, ograniczanie output tokens.
- Uwaga na orzekanie o latency: generowanie tokenów zwykle dominuje nad długością wejścia.
1. Architektura wielomodelowa i agentowa
- Granice autonomii, state machine, human approval, RBAC, audit trail, sandboxing narzędzi, ochrona przed prompt injection i kontrola skutków ubocznych.
- OpenAI wymaga od inżyniera platformowego: permissions, idempotencji, retries, obsługi rate limitów, audytu i bezpiecznych granic działania.
2. Zaawansowany retrieval i ML
- Hybrid BM25 + vector, cross-encoder reranking, query rewriting, grafy wiedzy, fine-tuning LoRA/PEFT, serving vLLM / TGI, quantization i podstawy GPU — gdy ekonomia uzasadnia self-hosting.
3. Evale jako system jakości
- Golden set, replay ruchu produkcyjnego, przypadki adversarialne, A/B, shadow traffic, drift, ocena outcome i trajectory.
- Anthropic rozdziela evale capability (jak dużo model potrafi) od regresyjnych (czy nie zepsuliśmy tego, co działało). Te drugie powinny dążyć do niemal 100% przejść.
4. Leadership
- ADR-y, threat modeling, capacity planning, incident review, mentoring i rozmowa z biznesem językiem KPI.
1. Zakres organizacji
- Platforma wspólna dla wielu zespołów, standardy eval i telemetrii, model gateway, polityki danych, guardrails, budżety i „paved road” dla wdrożeń.
2. Decyzje build / buy
- API kontra open source, RAG kontra fine-tuning, workflow kontra agent, managed vector DB kontra Postgres, SLA kontra koszt GPU.
- Staff ustala mierzalne progi i wymaga benchmarku na danych firmy przed zakupem czegokolwiek.
3. Wpływ
- Roadmapa techniczna na 12–24 miesiące, standardy bezpieczeństwa i governance, przeglądy architektury, rozwój seniorów, negocjowanie kompromisu jakość–latency–koszt.
- To poziom mnożnika organizacji, nie „osoby piszącej najtrudniejsze prompty”.
Uczciwa uwaga o czasie. Poziomy 4–5 zakładają lata inżynierii, nie tylko pracy z LLM. Najkrótsza realna droga: backend i operowanie jednym produktem AI w produkcji → specjalizacja w evalach, RAG albo niezawodności agentów.
Co realnie używa się w produkcji (stan: wrzesień 2026)
Najważniejsza decyzja nie brzmi „który framework wygrywa?”, a „ile niedeterminizmu naprawdę potrzebuję?”. Zwykły pipeline w Pythonie jest lepszy niż agent, jeśli ścieżkę można zapisać jako kod. Agent ma sens, gdy model musi dynamicznie dobierać narzędzia.
| Framework | Najlepszy do | Kiedy nie używać | GitHub / aktywność |
|---|---|---|---|
| LangChain + LangGraph | LangChain: integracje i szybki agent. LangGraph: stanowe, długie workflow, checkpointy, human-in-the-loop. | Prosty call API. Nie wybieraj LangGraph bez realnej potrzeby jawnego grafu. | 146,3k · 13.09.2026 41,6k · 09.09.2026 |
| LlamaIndex | Ingestion, indeksy, retrievery, RAG i agenci nad dokumentami. Gotowy wzorzec retrieve → rerank → synthesize. | Aplikacja bez warstwy danych / RAG albo gdy własny pipeline jest krótki. | 52,2k · 11.09.2026 |
| DSPy | Deklaratywne programy LM z metrykami i automatyczną optymalizacją promptów oraz demonstracji. | Bez zbioru przykładów i sensownej metryki. Do prostego ręcznego promptu. | 38,0k · 11.09.2026 |
| Pydantic AI | Typed Python, structured output, dependency injection, multi-provider i OpenTelemetry. | Zespół TypeScript albo gdy potrzebujesz katalogu integracji LangChain. | 19,9k · 14.09.2026 |
| OpenAI Agents SDK | Lekki Python: tools, handoffs, guardrails, sessions i tracing. Dobry z Responses API. | Gdy wymagany pełny vendor-neutral stack albo jawny durable graph. | 29,4k · 14.09.2026 |
| Haystack | Jawne, modularne pipeline’y wyszukiwania i RAG, branch / loop, komponenty enterprise. | Swobodny „autonomiczny” agent bez dominującego retrievalu. | 26,5k · 14.09.2026 |
| Mastra | TypeScript: workflow + agents + memory i evals w aplikacjach webowych. | Zespół Python / data science albo minimalny backend. | 28,0k · 14.09.2026 |
| CrewAI | Role, crews i automatyzacje biznesowe. W produkcji podejście Flow-first daje stan i kontrolę. | Gdy role-play tylko mnoży koszty; system wymagający precyzyjnej semantyki zdarzeń. | 58,5k · 14.09.2026 |
| AutoGen | Badania i złożone multi-agent, event-driven Core, komunikacja między agentami. | Prosty agent; eksperymentalny distributed runtime to za duży ciężar. | 61,0k · 06.04.2026 |
| smolagents | Małe CodeAgent / ToolCallingAgent, nauka pętli ReAct i eksperymenty HuggingFace. | Wykonywanie kodu bez izolowanego sandboxa. Ciężka orkiestracja. | 29,3k · 22.08.2026 |
Gwiazdki zaokrąglone (GitHub API, 14.09.2026). Gwiazdki mierzą zainteresowanie, nie jakość ani adopcję enterprise.
Praktyczny shortlist: Python CRUD i structured outputs → Pydantic AI. Krytyczny, długi agent → LangGraph. RAG-heavy → LlamaIndex lub Haystack. Optymalizacja oparta na danych → DSPy. TypeScript → Mastra. Szybki stack OpenAI → Agents SDK. CrewAI i AutoGen wybierz dopiero, gdy multi-agent daje mierzalną poprawę.
RAG, który działa w produkcji
Bazy wektorowe — kiedy która
Nie ustawiaj chunków globalnie na „512 tokenów”. Zachowuj nagłówki, akapity, tabele i ID dokumentu; testuj 2–3 warianty rozmiaru i overlap.
Inference — kiedy który silnik
Benchmarkuj własny model, długość kontekstu, concurrency i sprzęt. Mierz TTFT, inter-token latency, tokens/s, VRAM oraz stabilność p95/p99.
Prompt, RAG czy fine-tuning? Decyzja w trzech pytaniach
Evals i observability
Minimum produkcyjne: trace ID przez cały request, wersja promptu i modelu, parametry, tool calls, retrieved document IDs i scores, tokeny, koszt, latency, błędy i feedback użytkownika.
Fine-tuning / PEFT
LoRA zamraża bazę i uczy małe macierze adaptera. QLoRA dodatkowo trzyma bazę w 4-bit, radykalnie zmniejszając VRAM. Zacznij od QLoRA, ale zawsze porównuj z bazą na holdoucie i testach bezpieczeństwa.
Dziewięć wzorców, które oddzielają demo od systemu
Prototyp udowadnia, że model potrafi odpowiedzieć. Produkt musi odpowiadać wystarczająco dobrze przy przewidywalnym koszcie, czasie i ryzyku. Zawodowiec projektuje więc kontrakty danych, ścieżki awarii, ewaluację, telemetrię i możliwość wycofania zmiany.
RAG pipeline
Gdy prawda jest w prywatnych lub zmiennych źródłach i odpowiedź ma wskazywać dowód. Oceniaj oddzielnie ingest, retrieval, reranking i generation.
Deterministyczny workflow
Gdy kroki, stany i warunek sukcesu są znane; wymagane idempotencja, audyt, ciasne SLA lub skutki finansowe i prawne.
Agent loop
Gdy nie da się przewidzieć liczby kroków ani narzędzi, środowisko daje feedback, wynik można zweryfikować, a budżet uzasadnia wiele wywołań.
Human-in-the-loop
Przed zapisem, płatnością, publikacją, usunięciem danych, zmianą uprawnień albo decyzją wysokiego ryzyka.
Router i model cascade
Ruch ma rozróżnialne klasy trudności: mały model obsługuje prosty przypadek, niski confidence eskaluje do frontier. Router sam potrzebuje golden setu.
Prompt cache
Wiele żądań współdzieli długi, identyczny prefiks (system prompt, narzędzia, dokument). Statyczne bloki zawsze przed dynamicznymi. Typowy TTL: 5 minut.
Semantic cache
Pytania powtarzalne znaczeniowo. Wymaga progu podobieństwa, TTL i namespace per tenant. Zakaz dla danych osobowych, cen, sald i pytań zależnych od czasu.
Queue i async workers
Długie zadania hurtowe: checkpoint po każdym kroku, idempotency_key, limit prób i dead-letter queue.
Retry, fallback, circuit breaker
Dla 429, timeoutów i 5xx: exponential backoff z jitterem i budżetem prób. Circuit breaker chroni przed lawiną retry.
Workflow czy agent? Konkretne kryteria
Wybierz workflow, jeśli…
- można z góry wyliczyć stany, kolejność i kryterium sukcesu,
- błąd ma skutek finansowy lub prawny,
- operacja musi być idempotentna i audytowalna,
- SLA jest ciasne,
- istnieje jednoznaczne API do wywołania.
Przykład: klasyfikacja zgłoszenia → sprawdzenie numeru zamówienia → refund według reguł → wygenerowanie potwierdzenia.
Wybierz agenta, jeśli…
- liczby kroków i potrzebnych narzędzi nie da się przewidzieć,
- środowisko dostarcza informację zwrotną,
- wynik można automatycznie zweryfikować,
- wartość uzasadnia dodatkowe wywołania i koszt.
Przykład: analiza repozytorium, research z wielu źródeł, diagnoza incydentu. Ustal max_steps, budżet tokenów i czasu, dozwolone narzędzia, stan trwały oraz warunki stopu.
Praktyki, które ratują produkcję
Retry, fallback, degradacja
- Dla 429, timeoutów i 5xx: exponential backoff z jitterem. Google SDK domyślnie ponawia błędy przejściowe do 4 razy, od ok. 1 s do maks. 60 s.
- Nie ponawiaj 4xx związanych z walidacją — to nie błąd przejściowy.
- Po wyczerpaniu budżetu: drugi region, drugi dostawca lub model, odpowiedź zdegradowana z cache, eskalacja do człowieka.
- AWS zaleca trwałą warstwę wiadomości i DLQ zamiast bezpośredniego łączenia agentów.
Pięć awarii do przetestowania przed wdrożeniem
- timeout providera,
- częściowo wykonane narzędzie,
- powtórzony webhook,
- brak uprawnień do dokumentu,
- zerwany stream.
Każdy side effect potrzebuje idempotency key, limitu kosztu i punktu zatwierdzenia, jeśli jest destrukcyjny.
Reguła architektoniczna: wymień model lub bazę wektorową bez przepisywania logiki biznesowej. To znaczy: aplikacja wysyła żądania przez stabilny interfejs (własny adapter lub API zgodne z OpenAI), orchestrator trzyma stan poza procesem, retrieval zwraca dokumenty z wersją, tenantem i ACL, telemetria niesie jeden trace ID, a pipeline evali zna wersję modelu, promptu, indeksu i danych.
Jak wygląda realny proces ewaluacji (i dlaczego to nie „test na oko”)
Ewaluacja nie jest krokiem na końcu projektu. To system, który blokuje regresje i pozwala zmieniać prompt, model albo retriever bez zgadywania. Realny proces zaczyna się przed pierwszą zmianą promptu.
- Golden datasetZbierz reprezentatywne logi produkcyjne, ręcznie opisane odpowiedzi i oczekiwane dokumenty oraz narzędzia. Podziel na happy path, long tail, przypadki graniczne i ataki. Część trzymaj jako niewidoczny test, żeby zespół nie „dostroił się” do benchmarku.
- RubrykaOceniaj osobno: poprawność zadania, groundedness, kompletność, styl, bezpieczeństwo, koszt, p50/p95 latencji — a w agentach także wybór narzędzia, argumenty, liczbę kroków i końcowy stan.
- Scoring warstwowyReguły deterministyczne sprawdzają JSON Schema, cytaty, kwoty i zakazane akcje. LLM-as-judge ocenia kryteria semantyczne. Preferuj pass/fail albo porównanie parami z jasną rubryką; losuj kolejność odpowiedzi i kalibruj judge’a na ocenach ekspertów — modele mają bias pozycji i długości.
- Regresja w CIKażdy commit promptu, modelu, retrievera lub narzędzia uruchamia mały, szybki zestaw. Merge blokuje spadek metryki ponad próg, złamanie guardraila, wzrost kosztu albo p95. Pełny zestaw działa nocą. Snapshot modelu, parametry i wersje danych muszą być zapisane.
- Canary i A/BOffline eliminuje złe warianty, potem 1–5% ruchu może trafić na canary. Po alarmach automatyczny rollback. A/B mierzy wynik biznesowy — resolution rate, czas obsługi — wraz z complaint rate i eskalacjami. Sama liczba kciuków w górę nie wykrywa cichych błędów.
Halucynacja nie jest jedną metryką
Gradery: dobierz typ do kryterium
Anthropic rozdziela evale capability (co model potrafi) od regresyjnych (czy nie zepsuliśmy działającego). Regresyjne powinny dążyć do niemal 100% przejść.
Minimum, które warto mieć w tygodniu drugim
- 50–100 przypadków opisanych oczekiwanym wynikiem,
- rozdzielone metryki retrievalu i generacji,
- jeden plik konfiguracyjny evali w CI (np.
promptfoo), - snapshot wersji promptu, modelu i indeksu przy każdym przebiegu,
- raport kosztu i p95 obok raportu jakości.
Przykład zamkniętej pętli: DoorDash prowadzi symulator rozmów (ponad 200 rozmów w mniej niż 5 minut, ponad 50 evali) i zamienia każdy incydent produkcyjny w trwały test regresji.
Ile to naprawdę kosztuje i jak to policzyć przed wdrożeniem
Ceny listowe API za 1 mln tokenów w USD, sprawdzone we wrześniu 2026. Nie obejmują embeddings, wyszukiwania, narzędzi, storage, retry ani marży chmurowej. Wzór: koszt = N × (Tin × Pin + Tout × Pout) / 1 000 000.
| Segment i model | Input / 1M | Cached input / 1M | Output / 1M | 1000 zapytań: 2k in + 500 out |
|---|---|---|---|---|
| Frontier: GPT-5.5 | $5.00 | $0.50 | $30.00 | $25.00 |
| Mid: Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | $9.00 |
| Mid/small: GPT-5.4 mini | $0.75 | $0.075 | $4.50 | $3.75 |
| Small: Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 | $4.50 |
| Small: Gemini 3.8 Flash | $0.75 | $0.075 | $3.75 | $3.38 |
| Open-weight: Llama 3.3 70B (Together) | $1.04 | — | $1.04 | $2.60 |
Źródła cen: OpenAI, Anthropic, Google, Together. Przykład: 1000 × (2000 × 5 + 500 × 30) / 1 000 000 = $25.
🧮 Kalkulator: policz swój przypadek
Kalkulator liczy cenę listową API. Do budżetu produkcyjnego dodaj: retry, tool calls, embeddings, wyszukiwanie, storage, monitoring i p95 długości odpowiedzi — a nie samą średnią.
Router i kaskada
Proste klasyfikacje do małego modelu, niejednoznaczne do średniego, tylko niski confidence i wysokie ryzyko do frontier. Kaskada oszczędza wyłącznie wtedy, gdy koszt błędów nie zjada różnicy cen.
Batch API −50%
OpenAI i Google dają 50% rabatu dla zadań asynchronicznych. Idealne na masowe podsumowania, embeddingi i ewale.
Prompt cache ~0,1× wejścia
Anthropic wycenia odczyt prompt cache na 0,1 ceny inputu dla większości modeli. Wymaga stałego prefiksu — układaj prompt tak, by statyczne bloki były na początku.
Skracaj output, nie input
Przewodnik OpenAI: skrócenie outputu o 50% może obniżyć latencję ok. 50%. Skrócenie zwykłego inputu o 50% daje często tylko 1–5%.
Quantization FP8/INT8/INT4
Zmniejsza pamięć kosztem precyzji. Po każdej zmianie kwantyzacji ponów eval jakości — to jawny trade-off, nie darmowa optymalizacja.
Distillation
Duży model generuje dane treningowe, mały je przejmuje — sensowne, gdy zadanie jest wąskie i stabilne. Wymaga własnego eval setu.
Latencja — co naprawdę mierzyć
Śledź osobno: queue time, retrieval, time-to-first-token, tokens/s, tool time i end-to-end p50 / p95 / p99. Streaming poprawia czas odczuwany, ale nie końcowy.
Kluczowy wskaźnik ekonomiczny to nie koszt na zapytanie, tylko cost per successful task — z retry, tool calls i cache hit rate włącznie.
Model traktuj jak niezaufanego użytkownika, a treść z RAG jak niezaufane dane
OWASP zaznacza wprost: RAG i fine-tuning nie usuwają prompt injection. Dane z dokumentów, stron, e-maili i plików mogą zawierać instrukcje — a system, który je bezrefleksyjnie wykona, jest podatny niezależnie od tego, jak dobry ma model.
Minimum wdrożeniowe
- separacja instrukcji od danych (instrukcje tylko z zaufanego kanału),
- filtrowanie wejścia i wyjścia, sanitacja HTML / Markdown,
- allowlist narzędzi + walidacja argumentów i odpowiedzi,
- least privilege i krótkotrwałe tokeny,
- limity wydatków na konto i na użytkownika,
- izolowany sandbox dla kodu wykonywanego przez agenta,
- audit trail każdej akcji i zatwierdzenie człowieka przed akcją wysokiego ryzyka.
Red team — czego próbować
Narzędzie warte wdrożenia na start: promptfoo — deklaratywne testy bezpieczeństwa i regresji promptów w CI.
Dane osobowe i prywatność — kolejność działań
- Wykrywaj PII przed logowaniem i przed wysłaniem do dostawcyRedaguj albo tokenizuj. Log nie może domyślnie zawierać pełnych sekretów ani danych klienta.
- Ustal retencję i region przetwarzaniaSzyfrowanie w tranzycie i w spoczynku, RBAC, pisemna procedura usunięcia danych i odpowiedzi na żądanie dostępu (DSAR).
- Zapisuj metadane, nie treśćLog powinien nieść identyfikator śladu, wersję promptu i modelu oraz wynik polityki — wystarczy do audytu bez kopiowania danych osobowych.
AI Act w UE — co realnie dotyczy zespołu technicznego
Źródła: Komisja Europejska — ramy regulacyjne AI, wytyczne dla dostawców modeli GPAI, OWASP LLM Prompt Injection Prevention.
Uwaga praktyczna. Zwykły chatbot wsparcia nie staje się automatycznie systemem wysokiego ryzyka, ale system rekrutacyjny, scoring kredytowy lub edukacyjny może nim być. To nie kwestia techniczna — to kwestia przeznaczenia, więc pytanie o klasyfikację zadaj prawnikowi na początku projektu, nie po wdrożeniu.
Prompt to kod. Release to proces. Dashboard to kontrakt.
Różnica między projektem jednoosobowym a profesjonalnym nie polega na narzędziach, tylko na tym, że każda zmiana ma hipotezę, właściciela, pomiar, limit ryzyka i drogę odwrotu.
Struktura repozytorium (monorepo)
apps/ # aplikacja, API, worker
prompts/ # wersjonowane prompty
evals/ # zestawy i gradery
datasets/ # golden set, fixtures
services/retrieval/ # ingestion + search
infra/ # IaC, deploy, kolejki
docs/adr/ # decyzje architektoniczne
Monorepo działa, gdy aplikacja, schematy narzędzi, prompty, evale i infrastruktura zmieniają się razem. Przy wielu zespołach repo można rozdzielić — ale kontrakty i wersje muszą pozostać jawne.
Co zawiera plik promptu
- właściciel i semver / hash,
- model i snapshot, parametry,
- format wyjścia (schema),
- changelog zmian,
- powiązany dataset eval i wyniki bazowe.
PR pokazuje diff promptu oraz raport jakości, kosztu i latencji. Reviewer sprawdza injection, PII, konflikty instrukcji, token bloat i kompatybilność schematu.
Ścieżka wydania — od lokalnego testu do rollbacku
Dashboard produkcyjny
Success i error rate, 429/5xx, koszt na request i na tenant, cache hit, tokeny, p95/p99, jakość retrievalu, judge score, safety blocks, eskalacje, drift.
Trace jako podstawa
Jeden trace łączy wszystkie wywołania modelu, narzędzi i dokumentów. Jeśli nie umiesz odtworzyć zachowania z trace’a, nie masz systemu — masz demo.
Runbook
Właściciel alertu, kill switch, tryb degradacji, procedura eskalacji. Spisany zanim będzie potrzebny — nie w trakcie incydentu.
Sześć opublikowanych lekcji z produkcji
Firmy, które opisały publicznie, jak zbudowały swoje systemy LLM — i co z tego wynika dla kogoś, kto uczy się dopiero. Każda lekcja jest weryfikowalna w źródle.
Uber — Genie
Przejście z klasycznego RAG do query optimizer, source identifier, hybrydy BM25 + vector i post-processora.
Lekcja: najpierw napraw parsowanie dokumentów i retrieval, potem dodawaj agentów.
Źródło →DoorDash — Support
Symulator prowadzi wieloturowe rozmowy, mockuje backend i przepuszcza wynik przez skalibrowane LLM-as-judge. Ponad 200 rozmów trwa mniej niż 5 minut, zestaw przekroczył 50 evali, cykl skrócił się z dni do godzin.
Lekcja: każdy incydent zamień w trwały test regresji.
Źródło →LinkedIn — produkt GenAI
Stały pipeline routing → retrieval → generation: małe modele w dwóch pierwszych etapach, duży w generacji. Defensywny parser i poprawki promptu zamiast kosztownego retry.
Lekcja: format naprawiaj deterministycznym kodem, nie kolejnym wywołaniem modelu.
Źródło →Notion — Vector Search
Migracja silnika dała 60% oszczędności, a p50 zapytania spadło z 70–100 ms do 50–70 ms.
Lekcja: ekonomia RAG zależy również od indeksu, storage i pipeline’u embeddingów — nie tylko od ceny modelu.
Źródło →GitHub Copilot — agentic memory
Pamięci przechowują cytowania do kodu i są weryfikowane przy odczycie. W testach precision code review +3%, recall +4%.
Lekcja: pamięć musi mieć dowód, świeżość i mechanizm samonaprawy.
Źródło →Canva — AI Platform
Standaryzacja rozproszonego treningu dała pełne wykorzystanie GPU i niższy koszt chmury przy ponad 100 utrzymywanych modelach.
Lekcja: wspólna platforma i wykorzystanie sprzętu stają się ważniejsze niż eksperymentalny notebook.
Źródło →Profesjonalizm widać po jednej rzeczy: zespół wie nie tylko, czy system działa, lecz na jakich przypadkach przestaje działać i ile kosztuje każde dodatkowe „dziewięć” jakości.
15 repozytoriów, które warto przeczytać — nie tylko sklonować
Dla każdego: co konkretnie studiować, poziom trudności i aktywność. Gwiazdki zaokrąglone wg GitHub API (14.09.2026) — mierzą zainteresowanie, nie jakość. Filtruj i szukaj poniżej.
Ingestion pipeline, node parsers, retrievery, postprocessors / reranking, query engines i workflows RAG.
Otwórz repo →Signatures, Modules, metrics, compilation oraz optymalizatory GEPA / MIPROv2. Myślenie jak w ML zamiast ręcznego promptowania.
Otwórz repo →Typed dependencies, structured outputs, tool schema, model abstraction, OpenTelemetry i testowanie agentów.
Otwórz repo →Minimalny agent loop, Runner, handoffs, guardrails, sessions i tracing. Czytelny, mały rdzeń — dobry do nauki architektury.
Otwórz repo →Architektura TypeScript, Zod schemas, workflows suspend / resume, memory, evals i integracja z aplikacją webową.
Otwórz repo →Komponenty i directed multigraph pipelines, async execution, retrievery, DocumentStore oraz agentic RAG.
Otwórz repo →PagedAttention i KV cache, continuous batching, scheduler, serwer zgodny z OpenAI, tensor parallel, benchmarki servingu.
Otwórz repo →GGUF, kwantyzacja, backendy CPU / GPU, memory mapping, sampling oraz lekki serwer HTTP. Czytaj, gdy chcesz zrozumieć inference od środka.
Otwórz repo →RadixAttention, prefix caching, scheduler, structured generation, speculative decoding i distributed serving.
Otwórz repo →HNSW, payload filters, dense + sparse vectors, Query API, RRF i wieloetapowy reranking.
Otwórz repo →Operatory dystansu, indeksy HNSW / IVFFlat, planner Postgresa, filtrowanie i trade-off recall / latency.
Otwórz repo →Model trace / span, ingestion OpenTelemetry, wersje promptów, scores, datasets i architektura self-hosted.
Otwórz repo →Deklaratywne konfiguracje evali, asercje, macierze modeli, red teaming, caching i quality gates w CI.
Otwórz repo →LoRA / QLoRA, ładowanie 4-bit, kerneli Triton, formatowanie datasetu, eksport adapterów i integracja z TRL.
Otwórz repo →Brak wyników — zmień filtr albo frazę.
Konkretny plan na pierwsze 90 dni — od zera do pierwszej wersji produkcyjnej
Odhaczaj w trakcie pracy — postęp zapisuje się w Twojej przeglądarce (localStorage, bez wysyłania danych na serwer). Każdy punkt ma kryterium: jeśli nie umiesz go pokazać, nie jest zrobiony.
Dzień 1–30 · fundament
Dzień 31–60 · RAG i pierwsze evale
Dzień 61–90 · produkcja
Test QLoRA: sięgnij po fine-tuning tylko wtedy, gdy evale pokazują powtarzalny problem, którego prompt i RAG nie naprawiają — i porównaj z bazą na holdoucie oraz testach bezpieczeństwa. Kolejność jest: prompt → RAG → fine-tuning, nigdy odwrotnie.
Wszystkie źródła w jednym miejscu
Każda liczba i teza na tej stronie pochodzi z poniższych materiałów. Ceny i gwiazdki sprawdzone 14 września 2026 — tego typu dane zmieniają się szybko, więc przed decyzją zakupową zweryfikuj je u dostawcy.
- OpenAI — Software Engineer, Enterprise AI Platform
- Anthropic — Forward Deployed Engineer
- Acquisition — Senior AI Engineer
- Eigen Labs — Senior Agentic AI Engineer
- Instrumentl — Sr. Software Engineer, GenAI
- Just Join IT — Salary Report 2026, kategoria AI/ML
- Devire — Raport płacowy AI 2026
- Built In — AI Engineer Salary (US)
- Levels.fyi — Machine Learning Engineer (US)
- Stack Overflow Developer Survey 2025 — sekcja AI
- Anthropic — Building effective agents (workflow vs agent)
- Anthropic — Demystifying evals for AI agents
- OpenAI — Evaluation best practices
- OpenAI — Production best practices
- OpenAI — Latency optimization
- OpenAI — cennik API
- Anthropic — cennik modeli
- Google — cennik Gemini API
- Together AI — cennik modeli open-weight
- AWS Bedrock — prompt caching
- Microsoft Azure — semantic caching
- Google Vertex AI — strategia retry
- AWS Well-Architected — Agentic AI Lens
- Ragas — metryka faithfulness
- OWASP — LLM Prompt Injection Prevention Cheat Sheet
- Komisja Europejska — unijne ramy regulacyjne AI
- Komisja Europejska — wytyczne dla dostawców GPAI
- LangSmith — zarządzanie promptami i wersjonowanie
- LangSmith — przykładowy pipeline CI/CD
- Qdrant — reranking i hybrid search
- Uber — Enhanced Agentic RAG
- DoorDash — simulation & evaluation flywheel
- LinkedIn — budowa produktu generatywnego AI
- Notion — dwa lata vector search
- GitHub — agentic memory system dla Copilota
- Canva — modern AI platform (case study)