Laboratorios de ingeniería de AI
Ejecuta las ideas. Inspecciona los límites.
Son artefactos públicos reproducibles, no sistemas alojados en funcionamiento. Cada ficha indica qué puede ejecutarse localmente, qué evidencia existe y qué sigue sin demostrarse.
-
Market Analyst Agent
Ejecución local: Un agente de investigación con LangGraph, rutas de razonamiento, memoria con checkpoints, herramientas, una capa de protección, topología de runtime y controles de harness.
Qué inspeccionar: Cómo conecta un sistema de referencia las seis partes del agentic stack.
Artefacto: Repositorio del código fuente · Serie sobre la arquitectura
Limitación: Arquitectura local de referencia; no hay ningún benchmark público de fiabilidad en producción.
-
RAG Evals Demo
Ejecución local: Notebooks y módulos de evaluación para retrieval, filtros, reranking, fidelidad, jueces LLM y latencia en SciFact con Qdrant embebido.
Resultado acotado: El repositorio fija el ejemplo práctico de retrieval del artículo en Recall@5 = 0.750, MRR = 0.625 y nDCG@5 = 0.627.
Artefacto: Repositorio del código fuente · Guía de evaluación
Limitación: Los resultados del ejemplo y de SciFact son específicos del corpus; vuelve a ejecutar el harness con tus propias preguntas y evidencia.
-
TypeScript Agent Service
Ejecución local: Un monorepo TypeScript con forma de producción que incluye API en streaming, esquemas estrictos, ejecución de herramientas, persistencia, worker, MCP, observabilidad y pruebas.
Qué inspeccionar: La correspondencia, límite por límite, entre un stack de servicios Python y TypeScript.
Artefacto: Repositorio del código fuente · Guía de implementación
Limitación: Estructura local de servicio; el despliegue y las llamadas a proveedores requieren infraestructura y credenciales propias.
-
Search Ranking Stack
Ejecución local: BM25, dense retrieval, reciprocal-rank fusion, reranking con cross-encoder y ranking listwise con LLM sobre una muestra de datos de búsqueda de productos de Amazon ESCI.
Qué inspeccionar: La relevancia, latencia y coste de cada etapa, en lugar de una única puntuación opaca.
Artefacto: Repositorio del código fuente · Análisis por etapas
Limitación: Benchmark basado en una muestra; la fila obsoleta del LLM se conserva como advertencia, no como resultado.
-
Model Compression Demo
Ejecución local: Planificación de cuantización, recetas, ejecuciones en seco y configuraciones de benchmark para flujos de trabajo con vLLM, LLM Compressor y TensorRT-LLM.
Qué inspeccionar: Qué ruta de compresión encaja con un modelo, el hardware objetivo, el presupuesto de calidad y las restricciones de serving.
Artefacto: Repositorio del código fuente · Guía de cuantización
Limitación: El material público ofrece planes y recetas; las afirmaciones sobre benchmarks deben verificarse todavía en el hardware de serving objetivo.
¿Prefieres empezar por la explicación? Explora la página Trabajo o lee Edge of Context.