Trabalho
Sistemas, experiências e evidências
Uma seleção de trabalho público com fontes inspecionáveis, afirmações delimitadas e limitações explícitas. Cada caso mostra o problema, os limites do sistema, o que construí, como foi avaliado e onde terminam as evidências.
-
Engineering the Agentic Stack
Problema: A fiabilidade dos agentes é frequentemente tratada como um problema de escolha do modelo, mesmo quando as falhas atravessam raciocínio, memória, ferramentas, permissões, runtime e controlo de releases.
Contribuição: Desenvolvi uma arquitetura de produção em seis partes e a implementação de referência Market Analyst Agent que liga essas camadas.
Evidências: Ler a série · Inspecionar o código-fonte
Decisão: Tratar o harness e os seus controlos independentes como parte do produto e fazer com que cada controlo adicionado justifique o seu custo através de ablação.
Limitação: É um sistema de referência e um método de engenharia, não um benchmark de produção publicado.
-
De traces a suites de testes
Problema: A avaliação baseada apenas em respostas não deteta ferramentas ignoradas, argumentos inseguros, ciclos nem conclusões prematuras.
Contribuição: Escrevi um método para transformar traces em regressões de agentes em produção e construí um harness executável de avaliação de RAG que abrange retrieval, filtros, reranking, geração, juízes e latência.
Evidências: Ler o método de avaliação de agentes · Executar o avaliador de RAG
Decisão: Versionar traces de falhas como casos de teste e combinar verificações determinísticas de trajetórias com juízes calibrados apenas quando é necessária interpretação.
Limitação: O avaliador público utiliza SciFact e exemplos delimitados; os seus resultados não são automaticamente transferíveis para outro corpus ou modelo.
-
TypeScript Agent Service
Problema: Os engenheiros de ML que trabalham com Python precisam de entregar e rever serviços de agentes em TypeScript com forma de produção sem reaprender engenharia backend desde o início.
Contribuição: Construí um monorepo pnpm com uma API Hono em streaming, um ciclo de ferramentas validado, armazenamento Drizzle, worker, servidor MCP, observabilidade e 40 testes.
Evidências: Ler o guia de implementação · Inspecionar o código-fonte
Decisão: Relacionar limites de serviço familiares — Pydantic, FastAPI, filas, armazenamento — com os seus equivalentes em TypeScript, mantendo schemas estritos em cada limite de ferramenta.
Limitação: É um serviço local de referência, não um produto alojado nem uma afirmação sobre o sistema de um empregador específico.
-
Stack de ranking de pesquisa
Problema: Os stacks de retrieval ocultam qual a etapa que melhora a relevância e qual apenas acrescenta custos.
Contribuição: Construí uma demonstração em cinco etapas que abrange BM25, dense retrieval, reciprocal-rank fusion, reranking com cross-encoder e ranking listwise com LLM sobre uma amostra de dados Amazon ESCI.
Evidências: Ler a análise por etapas · Executar o código-fonte
Decisão: Medir cada etapa de forma independente e mantê-la apenas quando o ganho de relevância justificar a latência e o custo operacional.
Limitação: O corpus é uma amostra e o artigo assinala a linha desatualizada do LLM como não sendo evidência.
Inspecione diretamente as evidências: execute um laboratório ou explore o Blog por sistemas de agentes, retrieval e linguagem ou engenharia de modelos.