AI Engineering Labs

Ideen ausführen. Grenzen prüfen.

Dies sind reproduzierbare öffentliche Artefakte, keine gehosteten Live-Systeme. Jede Karte benennt, was lokal ausgeführt werden kann, welche Evidenz vorliegt und was unbewiesen bleibt.

  • Market Analyst Agent

    Lokal ausführen: Ein LangGraph-Research-Agent mit Reasoning-Routen, checkpoint-basiertem Memory, Tools, Guardian-Layer, Runtime-Topologie und Harness-Kontrollen.

    Prüfen: Wie ein Referenzsystem die sechs Teile des Agentic Stack verbindet.

    Artefakt: Quellcode-Repository · Architektur-Reihe

    Einschränkung: Lokale Referenzarchitektur; kein öffentlicher Benchmark zur Production-Zuverlässigkeit.

  • RAG Evals Demo

    Lokal ausführen: Evaluation-Notebooks und -Module für Retrieval, Filter, Reranking, Faithfulness, LLM-Judges und Latenz auf SciFact mit eingebettetem Qdrant.

    Begrenztes Ergebnis: Das Repository fixiert das durchgerechnete Retrieval-Beispiel des Artikels auf Recall@5 = 0,750, MRR = 0,625 und nDCG@5 = 0,627.

    Artefakt: Quellcode-Repository · Evaluation-Leitfaden

    Einschränkung: Die Ergebnisse des Beispiels und von SciFact sind korpusspezifisch; führen Sie das Harness mit Ihren eigenen Fragen und Belegen erneut aus.

  • TypeScript Agent Service

    Lokal ausführen: Ein produktionsnahes TypeScript-Monorepo mit Streaming-API, strikten Schemas, Tool-Ausführung, Persistenz, Worker, MCP, Observability und Tests.

    Prüfen: Die schrittweise Zuordnung eines Python-Service-Stacks zu TypeScript entlang der Systemgrenzen.

    Artefakt: Quellcode-Repository · Implementierungsleitfaden

    Einschränkung: Lokales Service-Gerüst; Deployment und Provider-Aufrufe erfordern Ihre eigene Infrastruktur und Zugangsdaten.

  • Search Ranking Stack

    Lokal ausführen: BM25, Dense Retrieval, Reciprocal Rank Fusion, Cross-Encoder-Reranking und LLM-Listwise-Ranking auf einer Stichprobe von Amazon-ESCI-Produktsuchdaten.

    Prüfen: Relevanz, Latenz und Kosten pro Stufe statt eines einzigen undurchsichtigen Endwerts.

    Artefakt: Quellcode-Repository · Stufenanalyse

    Einschränkung: Benchmark auf einer Stichprobe; die veraltete LLM-Zeile bleibt als Warnung erhalten, nicht als Ergebnis.

  • Model Compression Demo

    Lokal ausführen: Quantisierungsplanung, Rezepte, Dry-Runs und Benchmark-Konfigurationen für Workflows mit vLLM, LLM Compressor und TensorRT-LLM.

    Prüfen: Welcher Kompressionspfad zu Modell, Zielhardware, Qualitätsbudget und Serving-Einschränkungen passt.

    Artefakt: Quellcode-Repository · Quantisierungsleitfaden

    Einschränkung: Das öffentliche Material liefert Pläne und Rezepte; Benchmark-Aussagen müssen weiterhin auf der Zielhardware für das Serving überprüft werden.

Möchten Sie zuerst die Erklärung? Work-Seite öffnen oder Edge of Context lesen.