Trabajo
Sistemas, experimentos y evidencia
Una selección de trabajo público con fuentes inspeccionables, afirmaciones acotadas y limitaciones explícitas. Cada caso muestra el problema, los límites del sistema, lo que construí, cómo se evaluó y dónde termina la evidencia.
-
Engineering the Agentic Stack
Problema: La fiabilidad de los agentes suele tratarse como un problema de elección de modelo, incluso cuando los fallos abarcan razonamiento, memoria, herramientas, permisos, runtime y control de versiones.
Contribución: Desarrollé una arquitectura de producción en seis partes y la implementación de referencia Market Analyst Agent que conecta esas capas.
Evidencia: Leer la serie · Inspeccionar el código fuente
Decisión: Tratar el harness y sus controles independientes como parte del producto, y hacer que cada control añadido justifique su coste mediante ablación.
Limitación: Es un sistema de referencia y un método de ingeniería, no un benchmark de producción publicado.
-
De trazas a suites de pruebas
Problema: La evaluación basada solo en respuestas no detecta herramientas omitidas, argumentos inseguros, bucles ni conclusiones prematuras.
Contribución: Escribí un método para convertir trazas en regresiones de agentes en producción y construí un harness ejecutable de evaluación de RAG que abarca retrieval, filtros, reranking, generación, jueces y latencia.
Evidencia: Leer el método de evaluación de agentes · Ejecutar el evaluador de RAG
Decisión: Versionar las trazas de fallos como casos de prueba y combinar comprobaciones deterministas de trayectorias con jueces calibrados solo cuando haga falta interpretación.
Limitación: El evaluador público utiliza SciFact y ejemplos acotados; sus resultados no se transfieren automáticamente a otro corpus o modelo.
-
TypeScript Agent Service
Problema: Los ingenieros de ML que trabajan con Python necesitan entregar y revisar servicios de agentes en TypeScript con forma de producción sin volver a aprender ingeniería backend desde cero.
Contribución: Construí un monorepo pnpm con una API Hono en streaming, un bucle de herramientas validado, almacenamiento Drizzle, worker, servidor MCP, observabilidad y 40 pruebas.
Evidencia: Leer la guía de implementación · Inspeccionar el código fuente
Decisión: Relacionar límites conocidos del servicio —Pydantic, FastAPI, colas, almacenamiento— con sus equivalentes en TypeScript, manteniendo esquemas estrictos en cada límite de herramienta.
Limitación: Es un servicio local de referencia, no un producto alojado ni una afirmación sobre el sistema de un empleador concreto.
-
Stack de ranking de búsqueda
Problema: Los stacks de retrieval ocultan qué etapa mejora la relevancia y cuál solo añade coste.
Contribución: Construí una demostración en cinco etapas que abarca BM25, dense retrieval, reciprocal-rank fusion, reranking con cross-encoder y ranking listwise con LLM sobre una muestra de datos de Amazon ESCI.
Evidencia: Leer el análisis por etapas · Ejecutar el código fuente
Decisión: Medir cada etapa de forma independiente y conservarla solo cuando la mejora de relevancia justifique la latencia y el coste operativo.
Limitación: El corpus es una muestra y el artículo marca la fila obsoleta del LLM como información que no constituye evidencia.
Inspecciona directamente la evidencia: ejecuta un laboratorio o explora el Blog por sistemas de agentes, retrieval y lenguaje o ingeniería de modelos.