Laboratórios de engenharia de AI

Execute as ideias. Inspecione os limites.

São artefactos públicos reproduzíveis, não sistemas alojados em funcionamento. Cada cartão indica o que pode ser executado localmente, que evidências existem e o que continua por demonstrar.

  • Market Analyst Agent

    Execução local: Um agente de investigação com LangGraph, rotas de raciocínio, memória com checkpoints, ferramentas, uma camada de proteção, topologia de runtime e controlos de harness.

    O que inspecionar: Como um sistema de referência liga as seis partes do agentic stack.

    Artefacto: Repositório do código-fonte · Série sobre a arquitetura

    Limitação: Arquitetura local de referência; não existe um benchmark público de fiabilidade em produção.

  • RAG Evals Demo

    Execução local: Notebooks e módulos de avaliação para retrieval, filtros, reranking, fidelidade, juízes LLM e latência no SciFact com Qdrant integrado.

    Resultado delimitado: O repositório fixa o exemplo prático de retrieval do artigo em Recall@5 = 0.750, MRR = 0.625 e nDCG@5 = 0.627.

    Artefacto: Repositório do código-fonte · Guia de avaliação

    Limitação: Os resultados do exemplo e do SciFact são específicos do corpus; volte a executar o harness com as suas próprias perguntas e evidências.

  • TypeScript Agent Service

    Execução local: Um monorepo TypeScript com forma de produção que inclui API em streaming, schemas estritos, execução de ferramentas, persistência, worker, MCP, observabilidade e testes.

    O que inspecionar: O mapeamento, limite a limite, entre um stack de serviços Python e TypeScript.

    Artefacto: Repositório do código-fonte · Guia de implementação

    Limitação: Estrutura local de serviço; o deployment e as chamadas a providers requerem infraestrutura e credenciais próprias.

  • Search Ranking Stack

    Execução local: BM25, dense retrieval, reciprocal-rank fusion, reranking com cross-encoder e ranking listwise com LLM sobre uma amostra de dados de pesquisa de produtos Amazon ESCI.

    O que inspecionar: A relevância, latência e custo por etapa, em vez de uma única pontuação opaca.

    Artefacto: Repositório do código-fonte · Análise por etapas

    Limitação: Benchmark baseado numa amostra; a linha desatualizada do LLM é mantida como aviso, não como resultado.

  • Model Compression Demo

    Execução local: Planeamento de quantização, receitas, dry runs e configurações de benchmark para workflows com vLLM, LLM Compressor e TensorRT-LLM.

    O que inspecionar: Que percurso de compressão se adequa a um modelo, ao hardware de destino, ao orçamento de qualidade e às restrições de serving.

    Artefacto: Repositório do código-fonte · Guia de quantização

    Limitação: O material público fornece planos e receitas; as afirmações de benchmark ainda têm de ser verificadas no hardware de serving de destino.

Prefere começar pela explicação? Explore a página Trabalho ou leia Edge of Context.