Work

Systeme, Experimente und Evidenz

Ausgewählte öffentliche Arbeiten mit überprüfbaren Quellen, klar begrenzten Aussagen und expliziten Einschränkungen. Jeder Fall zeigt das Problem, die Systemgrenze, meinen Beitrag, die Evaluation und den Punkt, an dem die Evidenz endet.

  • Engineering the Agentic Stack

    Problem: Die Zuverlässigkeit von Agenten wird oft als Frage der Modellwahl behandelt, obwohl Fehler Reasoning, Memory, Tools, Berechtigungen, Runtime und Release-Kontrolle übergreifen.

    Beitrag: Ich entwickelte eine sechsteilige Production-Architektur und die Referenzimplementierung Market Analyst Agent, die diese Ebenen verbindet.

    Evidenz: Reihe lesen · Quellcode prüfen

    Entscheidung: Harness und unabhängige Gates als Teil des Produkts behandeln und jede zusätzliche Kontrolle ihren Aufwand durch Ablation rechtfertigen lassen.

    Einschränkung: Dies ist ein Referenzsystem und eine Engineering-Methode, kein veröffentlichter Production-Benchmark.

  • Von Traces zu Test-Suites

    Problem: Eine Bewertung nur der Antwort übersieht ausgelassene Tools, unsichere Argumente, Schleifen und vorschnell gemeldete Erfolge.

    Beitrag: Ich beschrieb eine Methode, die Traces produktiver Agenten in Regressionstests überführt, und entwickelte ein ausführbares RAG-Evaluation-Harness für Retrieval, Filter, Reranking, Generierung, Judges und Latenz.

    Evidenz: Methode zur Agenten-Evaluation lesen · RAG-Evaluator ausführen

    Entscheidung: Fehler-Traces als Testfälle versionieren und deterministische Trajektorienprüfungen nur dort mit kalibrierten Judges kombinieren, wo Interpretation erforderlich ist.

    Einschränkung: Der öffentliche Evaluator verwendet SciFact und begrenzte Beispiele; seine Ergebnisse lassen sich nicht automatisch auf einen anderen Korpus oder ein anderes Modell übertragen.

  • TypeScript Agent Service

    Problem: Python-ML-Engineers müssen produktionsnahe TypeScript-Agentenservices ausliefern und prüfen können, ohne Backend Engineering von Grund auf neu zu lernen.

    Beitrag: Ich entwickelte ein pnpm-Monorepo mit einer streamenden Hono-API, validierter Tool-Loop, Drizzle-Speicherung, Worker, MCP-Server, Observability und 40 Tests.

    Evidenz: Implementierungsleitfaden lesen · Quellcode prüfen

    Entscheidung: Vertraute Service-Grenzen – Pydantic, FastAPI, Queues, Storage – ihren TypeScript-Entsprechungen zuordnen und Schemas an jeder Tool-Grenze strikt halten.

    Einschränkung: Es handelt sich um einen lokalen Referenzservice, nicht um ein gehostetes Produkt oder eine Aussage über ein bestimmtes Arbeitgebersystem.

  • Search-Ranking-Stack

    Problem: Retrieval-Stacks verbergen, welche Stufe die Relevanz verbessert und welche lediglich Kosten hinzufügt.

    Beitrag: Ich entwickelte eine fünfstufige Demo mit BM25, Dense Retrieval, Reciprocal Rank Fusion, Cross-Encoder-Reranking und LLM-Listwise-Ranking auf einer Stichprobe der Amazon-ESCI-Daten.

    Evidenz: Stufenanalyse lesen · Quellcode ausführen

    Entscheidung: Jede Stufe unabhängig messen und nur beibehalten, wenn der Relevanzgewinn Latenz und Betriebskosten rechtfertigt.

    Einschränkung: Der Korpus ist eine Stichprobe; der Artikel kennzeichnet die veraltete LLM-Zeile ausdrücklich als nicht evidenzfähig.

Prüfen Sie die Evidenz direkt: ein Lab ausführen oder den Blog nach Agentensystemen, Retrieval und Sprachsystemen oder Model Engineering durchsuchen.