Projekty
Systemy, eksperymenty i dowody
Wybrane publiczne projekty z dostępnym kodem, wnioskami o określonym zakresie i jawnymi ograniczeniami. Każdy przykład pokazuje problem, granice systemu, mój wkład, sposób oceny i zakres dostępnych dowodów.
-
Engineering the Agentic Stack
Problem: Niezawodność agentów często sprowadza się do wyboru modelu, choć błędy obejmują rozumowanie, pamięć, narzędzia, uprawnienia, środowisko wykonawcze i kontrolę wydań.
Wkład: Opracowałem sześcioczęściową architekturę produkcyjną i implementację referencyjną Market Analyst Agent, która łączy te warstwy.
Dowody: Przeczytaj serię · Sprawdź kod
Decyzja: Traktuj warstwę sterującą i jej niezależne kontrole jako część produktu, a koszt każdego dodanego mechanizmu uzasadniaj przez ablację.
Ograniczenie: To system referencyjny i metoda inżynierska, a nie opublikowany benchmark produkcyjny.
-
Od śladów wykonania do zestawów testów
Problem: Ocena samej odpowiedzi pomija niewywołane narzędzia, niebezpieczne argumenty, pętle i przedwczesne deklaracje sukcesu.
Wkład: Opisałem metodę przekształcania śladów działania agentów produkcyjnych w testy regresji. Zbudowałem też uruchamialne środowisko ewaluacji RAG obejmujące wyszukiwanie, filtry, reranking, generowanie, modele oceniające i opóźnienia.
Dowody: Poznaj metodę ewaluacji agentów · Uruchom ewaluator RAG
Decyzja: Wersjonuj ślady błędów jako przypadki testowe. Łącz deterministyczne kontrole przebiegu działania ze skalibrowanymi modelami oceniającymi tylko tam, gdzie potrzebna jest interpretacja.
Ograniczenie: Publiczny ewaluator korzysta ze SciFact i przykładów o ograniczonym zakresie; wyników nie można automatycznie przenieść na inny korpus lub model.
-
TypeScript Agent Service
Problem: Inżynierowie ML pracujący w Pythonie potrzebują tworzyć i przeglądać usługi agentowe w TypeScript o strukturze zbliżonej do produkcyjnej, bez uczenia się backendu od podstaw.
Wkład: Zbudowałem monorepo pnpm ze strumieniowym API Hono, walidowaną pętlą narzędzi, warstwą danych Drizzle, workerem, serwerem MCP, obserwowalnością i 40 testami.
Dowody: Przeczytaj przewodnik implementacyjny · Sprawdź kod
Decyzja: Odwzoruj znane granice usług — Pydantic, FastAPI, kolejki i przechowywanie danych — na odpowiedniki w TypeScript, zachowując ścisłe schematy na każdej granicy narzędzia.
Ograniczenie: To lokalna usługa referencyjna, a nie hostowany produkt ani opis konkretnego systemu pracodawcy.
-
Stos rankingu wyników wyszukiwania
Problem: Stosy wyszukiwania ukrywają, który etap poprawia trafność, a który tylko zwiększa koszt.
Wkład: Zbudowałem pięcioetapowe demo obejmujące BM25, wyszukiwanie wektorowe, reciprocal-rank fusion, reranking z cross-encoderem i ranking całej listy przez LLM na próbce danych Amazon ESCI.
Dowody: Przeczytaj analizę etapów · Uruchom kod
Decyzja: Mierz każdy etap oddzielnie i zachowuj go tylko wtedy, gdy poprawa trafności uzasadnia opóźnienie i koszt działania.
Ograniczenie: Korpus jest próbką, a artykuł oznacza nieaktualny wiersz LLM jako materiał, który nie stanowi dowodu.
Sprawdź materiały bezpośrednio: uruchom eksperyment lub przeglądaj blog według tematów: systemy agentowe, wyszukiwanie i język albo inżynieria modeli.