AI Engineering Labs
Voer de ideeën uit. Bekijk de beperkingen.
Dit zijn reproduceerbare publieke artefacten, geen live gehoste systemen. Elke kaart benoemt wat lokaal kan worden uitgevoerd, welk bewijs beschikbaar is en wat nog onbewezen is.
-
Market Analyst Agent
Lokaal uitvoeren: Een LangGraph-researchagent met reasoning routes, checkpointed memory, tools, een guardian layer, runtime topology en harness controls.
Bekijken: Hoe één referentiesysteem de zes onderdelen van de agentic stack met elkaar verbindt.
Artefact: Bronrepository · Architectuurserie
Beperking: Lokale referentiearchitectuur; geen publieke production reliability benchmark.
-
RAG Evals Demo
Lokaal uitvoeren: Evaluation notebooks en modules voor retrieval, filters, reranking, faithfulness, LLM judges en latency op SciFact met embedded Qdrant.
Begrensd resultaat: De repository fixeert het uitgewerkte retrievalvoorbeeld uit het artikel op Recall@5 = 0,750, MRR = 0,625 en nDCG@5 = 0,627.
Artefact: Bronrepository · Evaluatiegids
Beperking: De uitgewerkte en SciFact-resultaten zijn corpusspecifiek; voer de harness opnieuw uit op je eigen vragen en bewijs.
-
TypeScript Agent Service
Lokaal uitvoeren: Een production-vormige TypeScript-monorepo met streaming API, strikte schema’s, tool execution, persistence, worker, MCP, observability en tests.
Bekijken: De grens-voor-grensvertaling van een Python-servicestack naar TypeScript.
Artefact: Bronrepository · Implementatiegids
Beperking: Lokale servicescaffold; deployment en provider-calls vereisen je eigen infrastructuur en credentials.
-
Search Ranking Stack
Lokaal uitvoeren: BM25, dense retrieval, reciprocal-rank fusion, cross-encoder reranking en LLM listwise ranking op een steekproef van Amazon ESCI-productzoekdata.
Bekijken: Relevantie, latency en kosten per fase in plaats van één ondoorzichtige eindscore.
Artefact: Bronrepository · Gefaseerde analyse
Beperking: Benchmark op een steekproef; de verouderde LLM-rij blijft staan als waarschuwing, niet als resultaat.
-
Model Compression Demo
Lokaal uitvoeren: Quantizationplanning, recepten, dry runs en benchmarkconfiguraties voor vLLM-, LLM Compressor- en TensorRT-LLM-workflows.
Bekijken: Welk compressiepad past bij een model, doelhardware, kwaliteitsbudget en servingbeperking.
Artefact: Bronrepository · Quantizationgids
Beperking: Het publieke materiaal biedt plannen en recepten; benchmarkclaims vereisen nog steeds de beoogde servinghardware.
Liever eerst de uitleg? Bekijk de pagina Werk of lees Edge of Context.