Labs d’ingénierie AI

Exécutez les idées. Examinez les limites.

Il s’agit d’artefacts publics reproductibles, et non de systèmes hébergés en ligne. Chaque fiche précise ce qui peut être exécuté localement, quelles preuves existent et ce qui reste à démontrer.

  • Market Analyst Agent

    À exécuter localement : Un agent de recherche LangGraph avec des routes de raisonnement, une mémoire avec checkpoints, des outils, une couche guardian, une topologie runtime et des contrôles de harness.

    À examiner : Comment un système de référence relie les six parties de l’agentic stack.

    Artefact : Dépôt source · Série sur l’architecture

    Limite : Architecture de référence locale ; aucun benchmark public de fiabilité en production.

  • RAG Evals Demo

    À exécuter localement : Des notebooks et des modules d’évaluation pour le retrieval, les filtres, le reranking, la fidélité, les juges LLM et la latence sur SciFact avec Qdrant embarqué.

    Résultat circonscrit : Le dépôt fixe l’exemple de retrieval de l’article à Recall@5 = 0,750, MRR = 0,625 et nDCG@5 = 0,627.

    Artefact : Dépôt source · Guide d’évaluation

    Limite : Les résultats de l’exemple et de SciFact sont propres à ce corpus ; réexécutez le harness sur vos propres questions et preuves.

  • TypeScript Agent Service

    À exécuter localement : Un monorepo TypeScript proche de la production avec API en streaming, schémas stricts, exécution d’outils, persistance, worker, MCP, observabilité et tests.

    À examiner : La correspondance, limite par limite, d’une stack de services Python vers TypeScript.

    Artefact : Dépôt source · Guide d’implémentation

    Limite : Structure de service locale ; le déploiement et les appels aux fournisseurs nécessitent votre propre infrastructure et vos propres identifiants.

  • Search Ranking Stack

    À exécuter localement : BM25, retrieval dense, fusion Reciprocal Rank, reranking par cross-encoder et classement listwise par LLM sur un échantillon de données de recherche de produits Amazon ESCI.

    À examiner : La pertinence, la latence et le coût de chaque étape plutôt qu’un score final opaque.

    Artefact : Dépôt source · Analyse par étapes

    Limite : Benchmark échantillonné ; la ligne LLM obsolète est conservée comme avertissement, et non comme résultat.

  • Model Compression Demo

    À exécuter localement : Planification de la quantification, recettes, simulations et configurations de benchmark pour les workflows vLLM, LLM Compressor et TensorRT-LLM.

    À examiner : Quelle voie de compression convient à un modèle, au matériel cible, au budget qualité et aux contraintes de serving.

    Artefact : Dépôt source · Guide de quantification

    Limite : Le contenu public fournit des plans et des recettes ; les affirmations de benchmark nécessitent toujours le matériel de serving cible.

Vous préférez commencer par l’explication ? Parcourez la page Travaux ou lisez Edge of Context.