Byte, der Biber von Edge of Context

Edge of Context

Über mich

Praktisches AI Engineering von Slava Dubrov.

Ich bin Dr. Viacheslav Dubrov*, kurz Slava. Ich entwickle produktive ML- und AI-Systeme und leite Teams, die dasselbe tun.

Derzeit bin ich Staff ML/AI Engineer bei Octonomy AI. Zuvor war ich bei HubSpot tätig: zunächst als Tech Lead für die Context Layer – Retrieval-, Grounding- und Memory-Infrastruktur –, anschließend im Team Agent Execution, wo ich mich mit LLM-Deployment, Fine-Tuning, Evaluation und den Runtime-Komponenten beschäftigt habe, die dafür sorgen, dass Agents in Produktionsumgebungen zuverlässig funktionieren. Ich weiß also, was nach dem erfolgreichen Demo-Termin passiert.


Warum diesen Blog lesen?

Ich schreibe die Notizen, die ich mir beim Debugging produktiver AI- und agentic Systeme gewünscht hätte. Vieles in der AI-Welt sieht in einem Notebook sauber aus und wird kompliziert, sobald echte Nutzer, Latency, Berechtigungen, Data Drift und Kosten ins Spiel kommen. Dieser Blog konzentriert sich auf genau diese Realität.

Relevanter Hintergrund:

  • Octonomy AI: ML/AI Engineering auf Staff-Level für produktive Agentensysteme.
  • HubSpot Agent Execution: LLM-Fine-Tuning, Inference-Optimierung, Agent-Evaluation und Safety-Guardrails in Produktionsumgebungen.
  • HubSpot Embedding Hub und Context Layer: Retrieval-, Grounding- und Memory-Infrastruktur für AI Agents, als Tech Lead.
  • Wayfair: Systeme zur Erkennung von Betrug und Scams sowie von mir entwickelte und geleitete Embedding-Systeme mit jährlichen Einsparungen von etwa $4 Mio.
  • OLX (Prosus): Recommendation- und Search-Ranking-Systeme für einen Marketplace im großen Maßstab.
  • Speaker beim World Agentic AI Summit Berlin 2026: „Engineering the Agentic Stack“.
  • Kandidat der technischen Wissenschaften (russischer Doktorgrad, PhD-Äquivalent) der Southern Federal University im Bereich AI-Diagnostik sowie Autor peer-reviewter Publikationen und von Patenten.
  • TU Ilmenau: Forschungssemester im Rahmen der Promotion in Mechatronics (2013–2014) mit einem DAAD-Lomonosov-Stipendium.
  • Erfahrung mit Data Pipelines, Training, Evaluation, Deployment und den operativen Details dazwischen.
  • Produktives ML auf AWS und GCP für Batch-, Streaming- und Echtzeitsysteme.
  • Open-Source-Code, Tutorials und technische Beiträge für Menschen, die AI-Systeme entwickeln, die zuverlässig betrieben werden müssen.

Vorträge

  • „Engineering the Agentic Stack“ – World Agentic AI Summit, Berlin (2026). Produktionsarchitektur für agentic AI-Systeme: Cognitive Engine, Cortex (Memory-Architektur) und Schema-Guided Reasoning.

Worüber ich schreibe

Vor allem über Ausfälle in Produktionsumgebungen und darüber, wie ich damit umgegangen bin.


Tech-Radar

LLM Serving und Fine-Tuning: vLLM, LoRAX, LoRA/QLoRA, VLMs, SGR/SO

Agents: LangGraph, Claude, Google ADK, CrewAI, LlamaIndex, SmolAgents

Safety und Evaluation: Guardrails, automatisierte Evals, LLM-as-a-judge, Observability

Vector und Retrieval: Qdrant, Faiss, Semantic Search, Hybrid Retrieval, Reranking, Context Compression

Tools und Workflows: MCP (Model Context Protocol), A2A, FastMCP, n8n

MLOps: AWS (zwei Zertifizierungen), GCP/Vertex AI, Kubernetes, Kubeflow, Airflow, Ray, MLflow

Core: Python, SQL, Scala, Java, Rust, PyTorch, FastAPI, Spark, Polars


Kontakt

Ich beschäftige mich normalerweise mit produktivem ML, Agentensystemen, Retrieval, Evaluation und Aufräumarbeiten an Pipelines, die zu komplex geworden sind.


* Kandidat der technischen Wissenschaften (russischer Doktorgrad, PhD-Äquivalent), verliehen von der Southern Federal University in Rostow am Don im Jahr 2015.