Laboratórios de engenharia de AI
Execute as ideias. Inspecione os limites.
São artefactos públicos reproduzíveis, não sistemas alojados em funcionamento. Cada cartão indica o que pode ser executado localmente, que evidências existem e o que continua por demonstrar.
-
Market Analyst Agent
Execução local: Um agente de investigação com LangGraph, rotas de raciocínio, memória com checkpoints, ferramentas, uma camada de proteção, topologia de runtime e controlos de harness.
O que inspecionar: Como um sistema de referência liga as seis partes do agentic stack.
Artefacto: Repositório do código-fonte · Série sobre a arquitetura
Limitação: Arquitetura local de referência; não existe um benchmark público de fiabilidade em produção.
-
RAG Evals Demo
Execução local: Notebooks e módulos de avaliação para retrieval, filtros, reranking, fidelidade, juízes LLM e latência no SciFact com Qdrant integrado.
Resultado delimitado: O repositório fixa o exemplo prático de retrieval do artigo em Recall@5 = 0.750, MRR = 0.625 e nDCG@5 = 0.627.
Artefacto: Repositório do código-fonte · Guia de avaliação
Limitação: Os resultados do exemplo e do SciFact são específicos do corpus; volte a executar o harness com as suas próprias perguntas e evidências.
-
TypeScript Agent Service
Execução local: Um monorepo TypeScript com forma de produção que inclui API em streaming, schemas estritos, execução de ferramentas, persistência, worker, MCP, observabilidade e testes.
O que inspecionar: O mapeamento, limite a limite, entre um stack de serviços Python e TypeScript.
Artefacto: Repositório do código-fonte · Guia de implementação
Limitação: Estrutura local de serviço; o deployment e as chamadas a providers requerem infraestrutura e credenciais próprias.
-
Search Ranking Stack
Execução local: BM25, dense retrieval, reciprocal-rank fusion, reranking com cross-encoder e ranking listwise com LLM sobre uma amostra de dados de pesquisa de produtos Amazon ESCI.
O que inspecionar: A relevância, latência e custo por etapa, em vez de uma única pontuação opaca.
Artefacto: Repositório do código-fonte · Análise por etapas
Limitação: Benchmark baseado numa amostra; a linha desatualizada do LLM é mantida como aviso, não como resultado.
-
Model Compression Demo
Execução local: Planeamento de quantização, receitas, dry runs e configurações de benchmark para workflows com vLLM, LLM Compressor e TensorRT-LLM.
O que inspecionar: Que percurso de compressão se adequa a um modelo, ao hardware de destino, ao orçamento de qualidade e às restrições de serving.
Artefacto: Repositório do código-fonte · Guia de quantização
Limitação: O material público fornece planos e receitas; as afirmações de benchmark ainda têm de ser verificadas no hardware de serving de destino.
Prefere começar pela explicação? Explore a página Trabalho ou leia Edge of Context.