AI Engineering Labs
Ideen ausführen. Grenzen prüfen.
Dies sind reproduzierbare öffentliche Artefakte, keine gehosteten Live-Systeme. Jede Karte benennt, was lokal ausgeführt werden kann, welche Evidenz vorliegt und was unbewiesen bleibt.
-
Market Analyst Agent
Lokal ausführen: Ein LangGraph-Research-Agent mit Reasoning-Routen, checkpoint-basiertem Memory, Tools, Guardian-Layer, Runtime-Topologie und Harness-Kontrollen.
Prüfen: Wie ein Referenzsystem die sechs Teile des Agentic Stack verbindet.
Artefakt: Quellcode-Repository · Architektur-Reihe
Einschränkung: Lokale Referenzarchitektur; kein öffentlicher Benchmark zur Production-Zuverlässigkeit.
-
RAG Evals Demo
Lokal ausführen: Evaluation-Notebooks und -Module für Retrieval, Filter, Reranking, Faithfulness, LLM-Judges und Latenz auf SciFact mit eingebettetem Qdrant.
Begrenztes Ergebnis: Das Repository fixiert das durchgerechnete Retrieval-Beispiel des Artikels auf Recall@5 = 0,750, MRR = 0,625 und nDCG@5 = 0,627.
Artefakt: Quellcode-Repository · Evaluation-Leitfaden
Einschränkung: Die Ergebnisse des Beispiels und von SciFact sind korpusspezifisch; führen Sie das Harness mit Ihren eigenen Fragen und Belegen erneut aus.
-
TypeScript Agent Service
Lokal ausführen: Ein produktionsnahes TypeScript-Monorepo mit Streaming-API, strikten Schemas, Tool-Ausführung, Persistenz, Worker, MCP, Observability und Tests.
Prüfen: Die schrittweise Zuordnung eines Python-Service-Stacks zu TypeScript entlang der Systemgrenzen.
Artefakt: Quellcode-Repository · Implementierungsleitfaden
Einschränkung: Lokales Service-Gerüst; Deployment und Provider-Aufrufe erfordern Ihre eigene Infrastruktur und Zugangsdaten.
-
Search Ranking Stack
Lokal ausführen: BM25, Dense Retrieval, Reciprocal Rank Fusion, Cross-Encoder-Reranking und LLM-Listwise-Ranking auf einer Stichprobe von Amazon-ESCI-Produktsuchdaten.
Prüfen: Relevanz, Latenz und Kosten pro Stufe statt eines einzigen undurchsichtigen Endwerts.
Artefakt: Quellcode-Repository · Stufenanalyse
Einschränkung: Benchmark auf einer Stichprobe; die veraltete LLM-Zeile bleibt als Warnung erhalten, nicht als Ergebnis.
-
Model Compression Demo
Lokal ausführen: Quantisierungsplanung, Rezepte, Dry-Runs und Benchmark-Konfigurationen für Workflows mit vLLM, LLM Compressor und TensorRT-LLM.
Prüfen: Welcher Kompressionspfad zu Modell, Zielhardware, Qualitätsbudget und Serving-Einschränkungen passt.
Artefakt: Quellcode-Repository · Quantisierungsleitfaden
Einschränkung: Das öffentliche Material liefert Pläne und Rezepte; Benchmark-Aussagen müssen weiterhin auf der Zielhardware für das Serving überprüft werden.
Möchten Sie zuerst die Erklärung? Work-Seite öffnen oder Edge of Context lesen.