Formal
Senior AI Engineer · Aleph AlphaSehr geehrte Damen und Herren,
Die Herausforderung, souveräne Sprachmodelle zuverlässig unter hoher Last mit niedriger Latenz und vorhersehbaren Kosten produktiv zu betreiben, ist genau die Aufgabe, bei der ich wirkliche Verbesserung bewirken kann. Bei Delivery Hero habe ich als leitender Entwickler des internen Triage-Assistenten ein hybrides Retrieval- und Serving-System gebaut, das die mediane Ticketzuordnungszeit von 4 Stunden 20 Minuten auf 1 Stunde 35 Minuten senkte und die Fehlerrate von 19 % auf 6 % reduzierte, während die Inferenzkosten durch spekulatives Decoding und dynamisches Batch-Routing zwischen einem selbst gehosteten vLLM und einer externen API um 47 % sanken.
Bei diesem Projekt war das Hauptproblem die Kombination aus heterogenen Daten, mehrsprachigen Inputs und dem Bedarf an kosteneffizienter, latenzsensitiver Inferenz. Ich entwarf eine hybride Retrieval-Pipeline mit BM25, pgvector und Cross-Encoder-Reranking über 1,4 Millionen historische Tickets, implementierte das Serving mit FastAPI auf Kubernetes und optimierte die Laufzeitkosten durch spekulative Decoding-Strategien sowie dynamische Routing-Entscheidungen zwischen lokalem und externem Inferenz. Ergebnis war eine spürbare Qualitätsverbesserung beim Routing, messbare Latenzsenkungen und eine klare Kostenreduktion, begleitet von einem Evaluations-Playbook für Offline-Benchmarks, A/B-Tests und Red-Team-Sicherheitstests, das das Team als Release-Kriterium einsetzt.
Mit freundlichen Grüßen, Alex Morgan
