Laboratorios de ingeniería de AI

Ejecuta las ideas. Inspecciona los límites.

Son artefactos públicos reproducibles, no sistemas alojados en funcionamiento. Cada ficha indica qué puede ejecutarse localmente, qué evidencia existe y qué sigue sin demostrarse.

  • Market Analyst Agent

    Ejecución local: Un agente de investigación con LangGraph, rutas de razonamiento, memoria con checkpoints, herramientas, una capa de protección, topología de runtime y controles de harness.

    Qué inspeccionar: Cómo conecta un sistema de referencia las seis partes del agentic stack.

    Artefacto: Repositorio del código fuente · Serie sobre la arquitectura

    Limitación: Arquitectura local de referencia; no hay ningún benchmark público de fiabilidad en producción.

  • RAG Evals Demo

    Ejecución local: Notebooks y módulos de evaluación para retrieval, filtros, reranking, fidelidad, jueces LLM y latencia en SciFact con Qdrant embebido.

    Resultado acotado: El repositorio fija el ejemplo práctico de retrieval del artículo en Recall@5 = 0.750, MRR = 0.625 y nDCG@5 = 0.627.

    Artefacto: Repositorio del código fuente · Guía de evaluación

    Limitación: Los resultados del ejemplo y de SciFact son específicos del corpus; vuelve a ejecutar el harness con tus propias preguntas y evidencia.

  • TypeScript Agent Service

    Ejecución local: Un monorepo TypeScript con forma de producción que incluye API en streaming, esquemas estrictos, ejecución de herramientas, persistencia, worker, MCP, observabilidad y pruebas.

    Qué inspeccionar: La correspondencia, límite por límite, entre un stack de servicios Python y TypeScript.

    Artefacto: Repositorio del código fuente · Guía de implementación

    Limitación: Estructura local de servicio; el despliegue y las llamadas a proveedores requieren infraestructura y credenciales propias.

  • Search Ranking Stack

    Ejecución local: BM25, dense retrieval, reciprocal-rank fusion, reranking con cross-encoder y ranking listwise con LLM sobre una muestra de datos de búsqueda de productos de Amazon ESCI.

    Qué inspeccionar: La relevancia, latencia y coste de cada etapa, en lugar de una única puntuación opaca.

    Artefacto: Repositorio del código fuente · Análisis por etapas

    Limitación: Benchmark basado en una muestra; la fila obsoleta del LLM se conserva como advertencia, no como resultado.

  • Model Compression Demo

    Ejecución local: Planificación de cuantización, recetas, ejecuciones en seco y configuraciones de benchmark para flujos de trabajo con vLLM, LLM Compressor y TensorRT-LLM.

    Qué inspeccionar: Qué ruta de compresión encaja con un modelo, el hardware objetivo, el presupuesto de calidad y las restricciones de serving.

    Artefacto: Repositorio del código fuente · Guía de cuantización

    Limitación: El material público ofrece planes y recetas; las afirmaciones sobre benchmarks deben verificarse todavía en el hardware de serving objetivo.

¿Prefieres empezar por la explicación? Explora la página Trabajo o lee Edge of Context.