Engineering-Berichte aus produktiven KI-Systemen.
Lange Beiträge über das, was wir tatsächlich gemessen haben — Voice-Agent-Latenz in sieben Segmenten, Retrieval-Obergrenzen bei On-Prem-LLMs, Entscheidungen im Systemdesign. Zahlen wörtlich aus den Läufen übernommen, nicht aus dem Pitch-Deck.
KI-Voice-Agents für die Gastronomie: warum sich der erste Turn langsam anfühlt (und wie ich es behoben habe)
In einer Echtzeit-Voice-Pipeline (SIP + Streaming-STT + LLM + Streaming-TTS) war die erste Antwort nach „Pickup" konstant 2 s langsamer als jeder spätere Turn. STT und TTS waren in Ordnung. Ursache: ein kalter Prompt-Cache am LLM. Ein Warmup parallel zur Begrüßung hat die Erst-Turn-Latenz um ~50 % reduziert — für rund 0,02 $ pro Anruf.
Medizinische Kodierung auf On-Prem-LLMs: was wir gemessen haben, bevor wir irgendetwas gebaut haben
Eine Engineering-Studie zu ICD-10-GM 2026 für ein deutsches Akutkrankenhaus, vollständig on-premise. Vor der Modellwahl haben wir die Retrieval-Obergrenze gemessen — 0,854. Die naive „Notiz einbetten, ähnlichen Code suchen"-Architektur liegt bei 3,9 %. Der Standardweg, den offiziellen BfArM-Katalog zu parsen, verliert stillschweigend 27 % des Code-Raums.
Bringen Sie uns ein System, das Sie noch nicht messen können.
Ein 20-minütiges Gespräch. Voice-Agent-Latenz, die Sie nicht erklären können, eine Retrieval-Obergrenze, die Sie noch nicht gemessen haben, eine On-Prem-Anforderung, die die Architektur verändert — wir sagen Ihnen ehrlich, ob wir helfen können und wie die ersten zwei Wochen aussehen würden.