Trabalho

Sistemas, experiências e evidências

Uma seleção de trabalho público com fontes inspecionáveis, afirmações delimitadas e limitações explícitas. Cada caso mostra o problema, os limites do sistema, o que construí, como foi avaliado e onde terminam as evidências.

  • Engineering the Agentic Stack

    Problema: A fiabilidade dos agentes é frequentemente tratada como um problema de escolha do modelo, mesmo quando as falhas atravessam raciocínio, memória, ferramentas, permissões, runtime e controlo de releases.

    Contribuição: Desenvolvi uma arquitetura de produção em seis partes e a implementação de referência Market Analyst Agent que liga essas camadas.

    Evidências: Ler a série · Inspecionar o código-fonte

    Decisão: Tratar o harness e os seus controlos independentes como parte do produto e fazer com que cada controlo adicionado justifique o seu custo através de ablação.

    Limitação: É um sistema de referência e um método de engenharia, não um benchmark de produção publicado.

  • De traces a suites de testes

    Problema: A avaliação baseada apenas em respostas não deteta ferramentas ignoradas, argumentos inseguros, ciclos nem conclusões prematuras.

    Contribuição: Escrevi um método para transformar traces em regressões de agentes em produção e construí um harness executável de avaliação de RAG que abrange retrieval, filtros, reranking, geração, juízes e latência.

    Evidências: Ler o método de avaliação de agentes · Executar o avaliador de RAG

    Decisão: Versionar traces de falhas como casos de teste e combinar verificações determinísticas de trajetórias com juízes calibrados apenas quando é necessária interpretação.

    Limitação: O avaliador público utiliza SciFact e exemplos delimitados; os seus resultados não são automaticamente transferíveis para outro corpus ou modelo.

  • TypeScript Agent Service

    Problema: Os engenheiros de ML que trabalham com Python precisam de entregar e rever serviços de agentes em TypeScript com forma de produção sem reaprender engenharia backend desde o início.

    Contribuição: Construí um monorepo pnpm com uma API Hono em streaming, um ciclo de ferramentas validado, armazenamento Drizzle, worker, servidor MCP, observabilidade e 40 testes.

    Evidências: Ler o guia de implementação · Inspecionar o código-fonte

    Decisão: Relacionar limites de serviço familiares — Pydantic, FastAPI, filas, armazenamento — com os seus equivalentes em TypeScript, mantendo schemas estritos em cada limite de ferramenta.

    Limitação: É um serviço local de referência, não um produto alojado nem uma afirmação sobre o sistema de um empregador específico.

  • Stack de ranking de pesquisa

    Problema: Os stacks de retrieval ocultam qual a etapa que melhora a relevância e qual apenas acrescenta custos.

    Contribuição: Construí uma demonstração em cinco etapas que abrange BM25, dense retrieval, reciprocal-rank fusion, reranking com cross-encoder e ranking listwise com LLM sobre uma amostra de dados Amazon ESCI.

    Evidências: Ler a análise por etapas · Executar o código-fonte

    Decisão: Medir cada etapa de forma independente e mantê-la apenas quando o ganho de relevância justificar a latência e o custo operacional.

    Limitação: O corpus é uma amostra e o artigo assinala a linha desatualizada do LLM como não sendo evidência.

Inspecione diretamente as evidências: execute um laboratório ou explore o Blog por sistemas de agentes, retrieval e linguagem ou engenharia de modelos.