Warteschleife, Menü, Weiterleitung: der teuerste Dialog der Wirtschaft
Wer heute bei einem Energieversorger, einer Versicherung, einem Telekommunikationsanbieter oder einer Behörde anruft, erlebt fast überall dasselbe Ritual. Ein Sprachmenü fragt Ziffern ab, eine Warteschleife spielt Musik, ein Mitarbeiter nimmt das Anliegen auf – und leitet es weiter, weil er es selbst nicht abschließen darf oder kann. Der Kunde erzählt seine Geschichte ein zweites Mal, manchmal ein drittes Mal. Am Ende steht häufig kein Ergebnis, sondern ein Ticket.
Dieses Muster ist nicht nur lästig, es ist teuer. Jede Weiterleitung kostet Bearbeitungszeit, jeder Rückruf bindet Kapazität, jeder abgebrochene Anruf beschädigt die Kundenbeziehung. Klassische Sprachcomputer, in der Branche als IVR-Systeme bekannt (Interactive Voice Response, also menügesteuerte Telefonansagen), haben das Problem eher verschärft als gelöst: Sie sortieren Anrufe vor, lösen aber nichts. Auch die erste Generation der Chatbots blieb in starren Entscheidungsbäumen stecken und produzierte genau die Frustration, die sie beseitigen sollte.
Ein typisches Serviceanliegen macht die Dimension greifbar. Eine Kundin will nach einem Umzug ihre Adresse ändern und gleich die Abschlagszahlung anpassen. Im heutigen Ablauf ruft sie an, wartet, landet in der falschen Abteilung, wird weiterverbunden, wiederholt ihr Anliegen, und der Mitarbeiter legt einen Vorgang an, den ein Kollege am nächsten Tag abarbeitet. Ein Vorgang von zwei Minuten Substanz erzeugt so schnell zwanzig Minuten Aufwand, verteilt auf mehrere Köpfe und zwei Tage Durchlaufzeit. Multipliziert mit Millionen Anrufen pro Jahr wird aus einer Unannehmlichkeit ein handfester Kostenblock. Die Skepsis der Kunden ist entsprechend messbar. In einer Umfrage von Gartner unter 5.728 Verbrauchern gaben 64 Prozent an, sie wären es lieber, wenn Unternehmen im Kundenservice ganz auf Künstliche Intelligenz verzichten würden; 53 Prozent würden sogar einen Anbieterwechsel erwägen. Die größte Sorge: dass es noch schwerer wird, einen Menschen zu erreichen. Das ist die Ausgangslage, gegen die jede neue Technologie im Kundenkontakt antreten muss.
Wenn die Maschine nicht nur antwortet, sondern handelt
Genau hier setzt ein Technologiesprung an, der sich in den vergangenen Monaten vollzogen hat. Speech-to-Speech-Modelle verarbeiten gesprochene Sprache direkt als Audio und antworten wieder als Audio – ohne den bisherigen Umweg über Transkription, Textmodell und Sprachsynthese. Das Ergebnis sind Dialoge nahezu in Echtzeit, mit natürlicher Betonung, Unterbrechungen und Sprachwechseln mitten im Satz. OpenAI etwa hat seine Realtime-Schnittstelle samt dem Modell gpt-realtime für den Produktivbetrieb freigegeben, inklusive direkter Telefonanbindung über das Telefonieprotokoll SIP und präziserem Aufruf externer Werkzeuge. Vergleichbare Angebote anderer Anbieter folgen im Monatstakt.
Der eigentliche Sprung liegt aber nicht in der Stimme, sondern im Handeln. Moderne Voice-Agents arbeiten agentisch: Sie verstehen ein Anliegen, planen die nötigen Schritte und führen sie selbst aus – sie fragen den Vertragsstatus im Bestandssystem ab, ändern die Adresse, buchen den Termin, stoßen die Gutschrift an und bestätigen das Ergebnis noch im selben Gespräch. Aus einem Auskunftssystem wird ein Sachbearbeiter mit Stimme. Kein Weiterleiten, kein Warten, Fall abgeschlossen.
Die Anwendungsfälle ähneln sich über Branchengrenzen hinweg verblüffend. Beim Energieversorger meldet der Agent den Zählerstand und passt den Abschlag an, beim Versicherer nimmt er den Schaden auf und prüft die Deckung, beim Telekommunikationsanbieter bucht er die Tarifoption und startet die Störungsdiagnose, in der Verwaltung vereinbart er den Termin und verschickt die nötigen Unterlagen. Gemeinsam ist all diesen Fällen ein Muster: ein klar umrissenes Anliegen, definierte Daten, ein bekannter Prozess. Genau dort, wo heute das Gros der Anrufe anfällt, spielt die Technologie ihre Stärke aus – nicht bei der komplexen Beschwerde, sondern beim Standardfall, der bislang trotzdem drei Stationen durchlief. Wie groß der Hebel ist, zeigt eine Prognose von Gartner: Bis 2029 soll agentische KI 80 Prozent der gängigen Serviceanliegen eigenständig lösen, ohne dass ein Mensch eingreift – bei rund 30 Prozent geringeren Betriebskosten. Selbst wenn die Realität hinter dieser Zahl zurückbleibt, verschiebt sich die Messlatte grundlegend: Der Maßstab für guten Service ist nicht mehr die schnelle Weiterleitung, sondern die fallabschließende Lösung im ersten Kontakt.
Fallabschließend heißt: im Prozess, nicht am Prozess vorbei
An dieser Stelle trennt sich die Demo vom Betrieb. Ein Sprachmodell, das frei formuliert und frei entscheidet, mag im Labor brillieren. Im Unternehmen richtet es Schaden an, sobald es Kulanz gewährt, die niemand freigegeben hat, oder eine Kündigung bestätigt, die nie geprüft wurde. Fallabschließende Automatisierung funktioniert nur, wenn der Agent exakt die Prozesse durchläuft, die das Unternehmen für diesen Fall vorgesehen hat – mit denselben Prüfschritten, denselben Vieraugenprinzipien und denselben Dokumentationspflichten, die auch für einen menschlichen Sachbearbeiter gelten.
Technisch heißt das: Der Voice-Agent ist nicht der Prozess, er ist dessen Bediener. Die Plattform gibt ihm einen klar umrissenen Handlungsrahmen. Welche Systeme er lesen darf, welche er verändern darf, bis zu welchem Betrag er entscheiden darf und wann er zwingend an einen Menschen übergibt, legt nicht das Modell fest, sondern die Fachabteilung. Eine Adressänderung läuft dann durch dieselbe Validierung wie im Kundenportal, eine Vertragsanpassung durch dieselbe Freigabelogik wie am Schalter. Der Agent beschleunigt den Prozess, aber er umgeht ihn nicht.
In der Praxis übernimmt eine Orchestrierungsschicht diese Rolle. Sie übersetzt das erkannte Anliegen in einen definierten Prozess, ruft die Fachsysteme über kontrollierte Schnittstellen auf und prüft jedes Zwischenergebnis mit deterministischen Regeln, bevor der nächste Schritt folgt. Das Sprachmodell führt das Gespräch und wählt die Werkzeuge, aber ob eine Buchung tatsächlich ausgeführt wird, entscheidet die hinterlegte Geschäftslogik. Fehlt eine Information, fragt der Agent nach; überschreitet ein Fall seine Grenzen, übergibt er mit vollständigem Gesprächskontext an einen Mitarbeiter, der nahtlos weitermacht statt von vorn zu beginnen. Dieser Zuschnitt entscheidet auch über das Vertrauen der Kunden. Eine aktuelle Gartner-Befragung von rund 3.600 Kunden zeigt: 87 Prozent erwarten, dass Unternehmen, die generative KI im Service einsetzen, jederzeit den Weg zu einem Menschen offenhalten. Die Akzeptanz wächst, wenn die Maschine Fälle wirklich löst – und kippt, sobald sie zur Barriere wird. Ein sauber definierter Eskalationspfad ist deshalb kein Eingeständnis technischer Schwäche, sondern Teil des Produktdesigns.
Governance ist kein Bremsklotz, sondern die Betriebserlaubnis
Bleibt die Frage der Kontrolle – und die ist längst nicht mehr freiwillig. Seit dem 2. August 2026 gelten die Transparenzpflichten aus Artikel 50 der europäischen KI-Verordnung, besser bekannt als EU AI Act. Nach den Leitlinien der Europäischen Kommission müssen Menschen unmissverständlich erfahren, wenn sie direkt mit einem KI-System interagieren – das gilt am Telefon genauso wie im Chat. Je nach Branche kommen weitere Vorgaben hinzu, vom Datenschutz über Aufbewahrungspflichten bis zu aufsichtsrechtlichen Anforderungen an ausgelagerte Prozesse.
Gute Plattformen behandeln diese Vorgaben nicht als nachgelagerte Prüfliste, sondern als Architekturprinzip. Jede Aktion des Agenten wird protokolliert und bleibt nachvollziehbar: Wer hat wann was entschieden, auf welcher Datengrundlage, mit welchem Ergebnis? Berechtigungen folgen dem Prinzip der minimalen Rechtevergabe, sensible Entscheidungen erfordern menschliche Freigabe, und jedes Gespräch beginnt mit der klaren Ansage, dass eine KI spricht. Was nach Bürokratie klingt, ist in Wahrheit die Voraussetzung für Skalierung: Nur ein Agent, dessen Verhalten auditierbar ist, darf am Ende auch wirklich Fälle abschließen.
Damit dreht sich die übliche Reihenfolge um. Nicht die Technik bestimmt, was automatisiert wird, sondern der Prozess samt seiner Governance bestimmt, was die Technik darf. Unternehmen, die zuerst ihre Serviceprozesse sauber beschreiben – Zuständigkeiten, Entscheidungsgrenzen, Eskalationsregeln –, können Voice-Agents in Wochen produktiv setzen. Wer dagegen mit der Demo beginnt und die Kontrollfragen aufschiebt, produziert Piloten, die nie den Regelbetrieb erreichen. Die Erfahrung aus ersten Projekten quer durch die Branchen zeigt: Der Engpass ist selten das Modell. Er ist fast immer die fehlende Klarheit darüber, was der Agent im Namen des Unternehmens tun darf. Diese Klarheit lässt sich nicht kaufen, sie muss erarbeitet werden – gemeinsam von Fachbereich, IT, Datenschutz und Compliance.
Fazit
Echtzeit-Voice-Agents verschieben die Grenze des Machbaren im Kundenservice: von der Auskunft zur Erledigung, vom Ticket zum abgeschlossenen Fall. Die Technologie dafür ist produktionsreif, der wirtschaftliche Hebel erheblich. Entscheidend wird, wer die unbequemere Hälfte der Aufgabe ernst nimmt – Prozesse präzise definieren, Handlungsrechte begrenzen, jede Aktion nachvollziehbar machen und den Weg zum Menschen offenhalten. Wer Autonomie ohne Governance einführt, riskiert Vertrauen und Bußgelder zugleich. Wer beides zusammen denkt, gewinnt in den kommenden 24 Monaten einen Vorsprung, der sich kaum noch aufholen lässt. Die Frage lautet nicht mehr, ob Maschinen Anliegen lösen, sondern in wessen Regeln.
Wer tiefer einsteigen möchte, bekommt dazu beim Handelsblatt KI Summit Gelegenheit: In der Masterclass „AI in Action! Kein Weiterleiten. Kein Warten. Fall abgeschlossen.“ zeigen Jens Heilmann und Holger Hornik von der msg.group anhand konkreter Praxisbeispiele, wie sich Echtzeit-Voice-Agents verantwortungsvoll in bestehende Serviceprozesse einbetten lassen – und wo die Grenzen aktueller Systeme liegen.