[ 00 ] — AI Engineering · Data Architecture

Działające systemy AI.
Nie slajdy.

Doprowadzamy pilotaże GenAI do produkcji: systemy agentowe i RAG, observability LLM, MLOps. Za realizacją stoi kilkunastoletnie doświadczenie w Data Science / ML — pracujemy reprodukowalnie i audytowalnie, IP zostaje po Twojej stronie.

[ 01 ] — USŁUGI

Pięć sposobów, w jakie dowozimy — plus stała współpraca.

Nazwany zakres, określony czas, konkretny artefakt na koniec. Stałą wycenę podajemy po 30-minutowym scopingu.

PAKIET 01 · 4–6 tygodni

RAG / Agent Proof-of-Value

Dla firm, które chcą dowodu wartości zanim zainwestują w platformę.

Co dostajesz
  • Działający demonstrator na Twoich danych
  • Dashboard ewaluacji jakości odpowiedzi
  • Raport decyzyjny go/no-go

Metrykę biznesową definiujemy na samym początku — żeby Twój projekt nie dołączył do zdecydowanej większości pilotaży GenAI, które nie przynoszą mierzalnego zwrotu (MIT). Jeśli wynik nie broni metryki, dostajesz uczciwy raport: dlaczego i co dalej.

Porozmawiajmy →
PAKIET 02 · 2–3 tygodnie

LLM Observability Sprint

Dla zespołów z LLM w produkcji, bez wglądu w jakość i koszty.

Co dostajesz
  • Observability (Langfuse / OpenTelemetry)
  • Ewaluacja LLM-as-a-Judge z audit trail
  • Koszt per zapytanie

Ślad audytowy i ewidencja ewaluacji pod wymogi EU AI Act. Obowiązki przejrzystości (art. 50) obowiązują od 08.2026; wymogi dla systemów wysokiego ryzyka omnibus cyfrowy przesunął na 12.2027 (Aneks III) i 08.2028 (Aneks I). Zaplecze techniczne powstaje wolniej, niż wygląda ten zapas. Odpowiadamy za nie — interpretację przepisów zostawiamy prawnikom.

Porozmawiajmy →
PAKIET 03 · 2 tygodnie
Najczęstszy punkt startu

AI Architecture Blueprint

Dla zarządów i CTO przed decyzją inwestycyjną.

Co dostajesz
  • Dokument docelowej architektury
  • Backlog wdrożenia
  • Szacunek TCO

Audyt niezależny: dostajesz dokument, backlog i szacunek — możesz wdrażać z kimkolwiek. Nie sprzedajemy sobie wdrożenia „przy okazji".

Porozmawiajmy →
PAKIET 04 · od 3 tygodni

PoC-to-Production

Dla zespołów DS z notebookami, które muszą dowozić powtarzalnie.

Co dostajesz
  • Reprodukowalne pipeline’y (Dagster / SQLMesh)
  • Walidacja danych i CI/CD dla ML
  • Pełna audytowalność

Ponad połowa pilotaży AI nigdy nie dociera do produkcji (Gartner). Domykamy tę drogę: z notebooka do reprodukowalnego, audytowalnego pipeline’u.

Porozmawiajmy →
PAKIET 05 · 3–5 tygodni

Entity Resolution & Knowledge Graph Sprint

Dla firm, których słowniki dostawców, produktów, klientów i technologii rozjechały się między systemami.

Co dostajesz
  • Deduplikacja i kanonizacja słowników głównych — od dopasowań deterministycznych po semantyczne
  • Słownik kontrolowany: definicje rozstrzygające, noty zakresowe, typologia relacji
  • Schemat grafu (property graph lub SKOS/RDF) z walidacją strukturalną w CI

„Posprzątane" to nie deklaracja, tylko wynik walidatora: raport par scalonych i odrzuconych z uzasadnieniami oraz testy strukturalne w CI, które pilnują jakości także po naszym wyjściu.

Porozmawiajmy →
PAKIET 06 · retainer, 2–4 dni / mies.

AI Engineer w Twoim zespole

Dla firm potrzebujących seniora GenAI na stałe, elastycznie.

Co dostajesz
  • Stały dostęp do seniora AI
  • Przeglądy architektury i kodu
  • Mentoring zespołu

Maks. 2–3 klientów równolegle — ekskluzywność zamiast skali agencji. Piotr sam buduje, nie tylko doradza.

Porozmawiajmy →

Nie wiesz, od czego zacząć? Umów 30 minut →

[ 02 ] — DLA KOGO

Dla kogo pracujemy

01

Mid-market i scale-upy z utkniętym pilotażem

Macie PoC GenAI, który halucynuje albo nie dowozi ROI. Doprowadzamy go do produkcji — albo uczciwie mówimy, że nie warto go ciągnąć, i dlaczego.

02

Software house’y i integratorzy

Dopisaliście AI do oferty, ale brakuje seniora GenAI na produkcyjnym poziomie. Wnosimy warstwę AI pod Waszą marką — podwykonawstwo projektowe, nie wynajem ludzi.

03

Firmy z systemami wysokiego ryzyka (EU AI Act)

HR-tech, scoring, fintech — potrzebujecie technicznego zaplecza zgodności: logowania, dokumentacji, ewaluacji i śladu audytowego.

[ 03 ] — PROCES

Przyrostowo. Płatność po odbiorze etapu.

  1. 01

    Rozmowa

    Bezpłatna konsultacja. Definiujemy problem i kryteria sukcesu.

  2. 02

    Blueprint

    Architektura, kamienie milowe, estymacja. Wiesz, za co płacisz.

  3. 03

    Build

    Każdy etap kończy się działającym produktem. Odbierasz — płacisz.

  4. 04

    Handover

    IP, dokumentacja i reprodukowalne pipeline’y zostają u Ciebie.

[ 04 ] — STOS

Stos technologiczny

Systemy agentowe w produkcji
  • Claude Agent SDK
  • MCP — serwery produkcyjne
  • Agent Skills (SKILL.md)
  • LangGraph 1.0
  • systemy wieloagentowe
  • PydanticAI v2
  • Temporal — durable execution
  • sandboxing agentów (Firecracker / E2B)
  • protokoły A2A / AG-UI
Context engineering i RAG
  • agentic retrieval
  • RAG: hybryda dense + BM25 + reranking
  • prompt engineering
  • vision retrieval (ColPali / ColQwen)
  • LazyGraphRAG
  • kompakcja i izolacja kontekstu
  • Docling + Mistral OCR
  • deep-research loops
  • embeddingi i rerankery (Voyage, Qwen3-Embedding)
Grafy wiedzy i pamięć agentów
  • Graphiti — pamięć bi-temporalna
  • Neo4j + GQL (ISO/IEC 39075)
  • Cypher / Text2Cypher
  • Splink — entity resolution
  • LinkML
  • SKOS
  • RDF 1.2 / SPARQL 1.2
  • SFIA / ESCO / O*NET
  • NetworkX
Evale, red-teaming i zgodność (EU AI Act)
  • Inspect AI (UK AISI)
  • DSPy 3 + GEPA
  • kalibrowany LLM-as-a-Judge
  • multi-model consensus
  • faithfulness gates (Ragas)
  • promocja modelu: shadow / canary
  • red-teaming: promptfoo / garak / PyRIT
  • OTel GenAI + Langfuse (self-hosted)
  • Presidio — PII
  • Annex IV / ISO/IEC 42001
Modele, koszt i suwerenność
  • frontier za bramkami evali (Claude / GPT-5 / Gemini)
  • LiteLLM / Bifrost — gateway
  • koszt i latencja: cache (Redis), budżety p95
  • Mistral Large 3
  • Qwen3 + SLM-first
  • LoRA / QLoRA — dostrajanie SLM
  • Hugging Face + Ollama — modele lokalnie
  • Bielik / PLLuM
  • vLLM + XGrammar
  • klasyczne ML tam, gdzie bije LLM
  • wdrożenia VPC / on-prem EU
Architektura danych — lean lakehouse
  • PostgreSQL (pgvector / ParadeDB)
  • DuckDB + DuckLake
  • dlt — ingestion as code
  • SQLMesh / dbt (Fusion)
  • Dagster
  • Qdrant — self-hosted EU
  • Lance — storage multimodalny
  • Polars
  • uv / ruff / pytest + hypothesis
Baza — wymienione dla porządku; tym się nie wyróżniamy

Python · SQL · pandas / NumPy · scikit-learn / XGBoost · FastAPI · REST / API · Docker · Kubernetes · Git · CI/CD · Airflow · MLflow · Azure · GCP · LangChain

[ 05 ] — REALIZACJE

Wybrane realizacje

Niezależny dorobek Datarmination — metodyki i narzędzia własne. Każda liczba poniżej jest policzalna z artefaktów projektu.

R-01
SFIA v9 / ESCO / O*NET / SCOR / BABOK, Python

Taksonomia kompetencji zawodowych

Problem

Brak spójnej, przeszukiwalnej struktury kompetencji z ogłoszeń o pracę.

Podejście

Wielopoziomowa taksonomia obejmująca tysiące kompetencji, zbudowana metodą multi-model consensus: każde sporne przypisanie oceniają niezależnie różne modele, a wynik ustala głosowanie większościowe — z pełnym zapisem każdej decyzji.

Wartość

Audytowalna hierarchia z pełnym śladem głosowań i mapą przepływów między domenami. Niska zgodność modeli w spornych przypadkach to dowód, że jeden model nie wystarcza.

R-02
synteza wielomodelowa, graf wiedzy (Graphviz), Python, React

Słownik pojęć AI 2023–2026

Problem

Rozproszona, niespójna terminologia AI bez powiązań między pojęciami.

Podejście

Hasła zebrane z wielu niezależnych źródeł modelowych w kolejnych rundach i powiązane grafem relacji typowanych. W ostatniej rundzie znaczna część kandydatów odpadła w dwustopniowej weryfikacji źródeł.

Wartość

Reprodukowalny słownik referencyjny: linki źródłowe po automatycznej walidacji, ocena dojrzałości każdego hasła, łańcuchy ewolucji pojęć — całość regenerowalna z kodu.

R-03
OpenAI Agents SDK, LangGraph, Pydantic v2 (structured outputs), pytest

Klasyfikator kompetencji — pipeline wieloagentowy

Problem

Systemy agentowe, które zgadują, zamiast przyznać, że nie wiedzą.

Podejście

Kilku wyspecjalizowanych agentów (routing po embeddingach, rozbijanie multi-kompetencji, synonimy, taksonomia, tłumaczenia) + deterministyczna walidacja spójności bez LLM. Ten sam system zbudowany dwa razy — na OpenAI Agents SDK i LangGraph — z porównaniem frameworków przed wyborem.

Wartość

Orkiestracja kodem, nie LLM-em: zamknięte kody akcji, progi pewności, ścieżka human-review i dziesiątki testów z mockowanym modelem — architektura pod produkcję, nie pod demo.

R-04
meta-prompt orkiestracji, kilka systemów deep-research, triangulacja

Deep-research orchestration

Problem

Pojedynczy model badawczy halucynuje i pomija źródła.

Podejście

Ten sam research równolegle w kilku niezależnych systemach deep-research; fakt uznajemy za pewny dopiero po potwierdzeniu w niezależnych torach. Reżim anty-halucynacyjny: twarde reguły, m.in. obowiązkowy URL źródłowy dla każdego twierdzenia.

Wartość

Reużywalny szablon researchu: raporty w kilku ścieżkach tematycznych, cytowane źródła, udokumentowane rozbieżności między torami.

[ 06 ] — PIERWSZA ROZMOWA

Jak wygląda pierwsza rozmowa

  1. 01 30 minut, bez zobowiązań.
  2. 02 Definiujemy problem i kryterium sukcesu.
  3. 03 Wychodzisz ze szkicem zakresu i rekomendacją pakietu.

[ 07 ] — FAQ

Częste pytania

Dlaczego bez cen?+

Bo uczciwa wycena zależy od Twoich danych i skali. Stałą cenę podajemy po 30-minutowym scopingu — z góry, nie „w trakcie".

Co, jeśli projekt przerośnie jedną osobę?+

Zakres każdego etapu jest jasny i skończony. Rdzeń buduję sam; na przeciążenia mam model konsorcjalny i sprawdzonych partnerów.

Czyje jest IP?+

Twoje. Kod, prompty i pipeline’y w całości — dostarczamy reprodukowalnie, uruchamiasz samodzielnie.

Jak się rozliczamy?+

Po odbiorze każdego kamienia milowego. Nie płacisz za etap, którego nie odebrałeś.

NDA i bezpieczeństwo danych?+

NDA standardowo, przed rozmową o danych. Pracujemy na Twojej infrastrukturze tam, gdzie dane nie mogą jej opuścić.

Co dzieje się po Proof-of-Value?+

Albo hardening do produkcji (PoC-to-Production), albo stała współpraca w modelu retainer.

Jak mierzycie jakość odpowiedzi LLM?+

Zbiór testowy + LLM-as-a-Judge + metryki zdefiniowane z góry. Bez tego „działa" to opinia, nie fakt.

[ 08 ] — KONTAKT

Kontakt

Porozmawiajmy o projekcie — od analizy wykonalności po działający demonstrator.

Odpowiadamy w ciągu 24 h w dni robocze.