Werk

Systemen, experimenten en bewijs

Geselecteerd publiek werk met controleerbare bronnen, begrensde claims en expliciete beperkingen. Elke case toont het probleem, de systeemgrens, wat ik heb gebouwd, hoe het is geëvalueerd en waar het bewijs ophoudt.

  • Engineering the Agentic Stack

    Probleem: Betrouwbaarheid van agents wordt vaak behandeld als een modelkeuzeprobleem, zelfs wanneer fouten betrekking hebben op reasoning, memory, tools, permissies, runtime en releasebeheer.

    Bijdrage: Ik ontwikkelde een zesdelige production-architectuur en de Market Analyst Agent-referentie-implementatie die deze lagen met elkaar verbindt.

    Bewijs: Lees de serie · Bekijk de broncode

    Beslissing: Behandel de harness en zijn onafhankelijke gates als onderdeel van het product en laat elke toegevoegde controle vervolgens zijn kosten rechtvaardigen door middel van ablation.

    Beperking: Dit is een referentiesysteem en engineeringmethode, geen gepubliceerde production-benchmark.

  • Van traces naar testsuites

    Probleem: Evaluatie van alleen het antwoord mist overgeslagen tools, onveilige argumenten, loops en voortijdige succesmeldingen.

    Bijdrage: Ik beschreef een methode om traces om te zetten in regressietests voor production agents en bouwde een uitvoerbare RAG-evaluatieharness voor retrieval, filters, reranking, generation, judges en latency.

    Bewijs: Lees de methode voor agentevaluatie · Voer de RAG-evaluator uit

    Beslissing: Versiebeheer failure traces als testcases en combineer deterministische trajectory checks alleen met gekalibreerde judges waar interpretatie nodig is.

    Beperking: De publieke evaluator gebruikt SciFact en begrensde voorbeelden; de resultaten zijn niet automatisch overdraagbaar naar een ander corpus of model.

  • TypeScript Agent Service

    Probleem: Python ML-engineers moeten production-vormige TypeScript-agentservices kunnen leveren en beoordelen zonder backend engineering vanaf nul opnieuw te leren.

    Bijdrage: Ik bouwde een pnpm-monorepo met een streaming Hono API, een gevalideerde tool loop, Drizzle-storage, worker, MCP-server, observability en 40 tests.

    Bewijs: Lees de implementatiegids · Bekijk de broncode

    Beslissing: Koppel bekende servicegrenzen—Pydantic, FastAPI, queues, storage—aan hun TypeScript-equivalenten en houd schema’s strikt bij elke toolgrens.

    Beperking: Dit is een lokale referentieservice, geen gehost product of claim over het systeem van een specifieke werkgever.

  • Search-rankingstack

    Probleem: Retrievalstacks verhullen welke fase de relevantie verbetert en welke fase alleen kosten toevoegt.

    Bijdrage: Ik bouwde een demo in vijf fasen met BM25, dense retrieval, reciprocal-rank fusion, cross-encoder reranking en LLM listwise ranking op een steekproef van Amazon ESCI-data.

    Bewijs: Lees de gefaseerde analyse · Voer de broncode uit

    Beslissing: Meet elke fase onafhankelijk en behoud die alleen wanneer de relevantiewinst de latency en operationele kosten rechtvaardigt.

    Beperking: Het corpus is een steekproef en het artikel markeert de verouderde LLM-rij als niet-bewijzend.

Bekijk het bewijs rechtstreeks: voer een lab uit of blader door de Blog op agentsystemen, retrieval en taal, of model engineering.