Ein Voicebot ist ein Sprachdialogsystem, das Anrufe oder Sprachanfragen selbstständig entgegennimmt, versteht und beantwortet. Für Unternehmen in Deutschland ist die Frage nicht mehr, ob ein Voicebot technisch möglich ist, sondern welcher Ansatz zum eigenen Anliegen passt: ein klassisches Sprachmenü, ein LLM-basierter Sprachbot, ein selbst betriebenes Voice-Agent-Framework oder eine gemanagte Plattform. Dieser Leitfaden erklärt, wie ein moderner Voicebot aufgebaut ist, worin er sich von einer IVR unterscheidet, was Sie vor der Entscheidung prüfen sollten und wann sich Eigenbau oder Einkauf lohnt.
Das Wichtigste in Kürze
- Ein moderner Voicebot besteht aus mehreren Schichten: Telefonie, Spracherkennung (ASR), Gesprächserkennung (Turn-Taking), Dialoglogik oder LLM und Sprachausgabe (TTS). Die Qualität des Gesamtsystems hängt an der schwächsten Schicht.
- Anrufer beurteilen nicht einzelne Komponenten, sondern die Pause nach ihrem letzten Wort, die Verständlichkeit der Antwort und ob sie den Bot unterbrechen können.
- Für deutsche Anrufe zählen Zahlen, Namen, Adressen, IBANs und Anglizismen mehr als eine schöne Demostimme.
- DSGVO und die Transparenzpflicht aus Artikel 50 der KI-Verordnung gelten unabhängig davon, ob Sie selbst bauen oder kaufen. Sie ändern nur, wer welche Pflicht technisch umsetzt.
- Build oder Buy ist selten eine Entweder-oder-Frage: Viele Teams kombinieren ein Framework oder eine Plattform mit ausgewählten eigenen Komponenten.
Was ist ein Voicebot?
Ein Voicebot ist eine Software, die gesprochene Sprache entgegennimmt, das Anliegen erkennt, eine passende Antwort oder Aktion bestimmt und diese wieder als gesprochene Sprache ausgibt. Im Kundenservice läuft das meist über das Telefon, intern auch über eine App, ein Headset oder eine Webanwendung.
Früher waren Sprachbots vor allem regelbasiert: Ein festes Vokabular und ein vorgegebener Dialogbaum bestimmten, was der Anrufer sagen durfte. Heute übernehmen große Sprachmodelle (LLMs) einen Teil der Dialoglogik. Sie verstehen freier formulierte Anliegen und können über Funktionsaufrufe auf Systeme wie CRM, Ticketing oder Terminkalender zugreifen. Das macht Voicebots flexibler, verschiebt aber das Risiko: Statt starrer Menüs müssen Sie nun kontrollieren, was der Bot sagen darf und wann er an einen Menschen übergibt.
Die Begriffe Voicebot, Sprachbot, Voice Agent und KI-Telefonassistent werden im Markt weitgehend synonym verwendet. Entscheidend ist nicht das Etikett, sondern welche Schichten ein Angebot tatsächlich abdeckt und welche Sie selbst liefern müssen.
Wie unterscheidet sich ein Voicebot von einer klassischen IVR?
Eine klassische IVR (Interactive Voice Response) führt Anrufer durch ein festes Menü, gesteuert über Tastentöne (DTMF) oder wenige Schlüsselwörter. Ein LLM-basierter Voicebot versteht dagegen freie Sätze, fragt bei Unklarheiten nach und kann mehrere Anliegen in einem Gespräch bearbeiten.
Die IVR hat echte Stärken: Sie ist vorhersagbar, gut testbar und rechtlich wie fachlich leicht abzunehmen. Für einfache Weiterleitungen („Drücken Sie die 1 für Rechnungen“) ist sie oft die günstigere und robustere Lösung. Ihre Schwäche zeigt sich, sobald Anliegen nicht in das Menü passen: Anrufer landen in Schleifen oder drücken sofort die Null.
Ein LLM-Voicebot löst dieses Problem, bringt aber neue Anforderungen mit. Seine Antworten sind nicht vollständig vorab festgelegt, er braucht klare Leitplanken, Protokollierung und Tests mit echten Formulierungen. In der Praxis ersetzen viele Unternehmen die IVR nicht vollständig, sondern setzen den Voicebot vor oder hinter das bestehende Routing: Er klärt das Anliegen, erledigt einfache Fälle und übergibt den Rest mit Kontext an die richtige Warteschlange.
Wie funktioniert ein moderner Voicebot technisch?
Ein moderner Voicebot ist eine Echtzeit-Pipeline aus fünf Schichten, die Audio in beide Richtungen streamt. Jede Schicht kann einzeln ausgetauscht werden, aber sie müssen eng zusammenspielen, damit das Gespräch natürlich wirkt.
Die erste Schicht ist die Telefonie. Der Anruf kommt über einen SIP-Trunk oder einen Telefonieanbieter herein und wird als Audiostrom an den Bot weitergereicht. Klassische Telefonverbindungen übertragen häufig schmalbandiges Audio nach ITU-T G.711. Spracherkennung und Sprachausgabe müssen deshalb mit Telefonaudio gut funktionieren, nicht nur mit Studioaufnahmen. Voice-Agent-Frameworks wie LiveKit Agents und Pipecat dokumentieren eigene Telefonieanbindungen, etwa über SIP-Trunks, Tastentöne und Anrufweiterleitung.
Die zweite Schicht ist die Spracherkennung (ASR oder Speech-to-Text). Sie wandelt das Gesagte fortlaufend in Text um. Für deutsche Anrufe ist entscheidend, wie zuverlässig sie Eigennamen, Straßennamen, Vertragsnummern und buchstabierte Angaben erkennt, auch bei Hintergrundgeräuschen und Dialektfärbung.
Die dritte Schicht ist das Turn-Taking: Der Bot muss erkennen, wann der Anrufer fertig gesprochen hat und wann er unterbricht. Einfache Systeme warten auf eine feste Stille (Voice Activity Detection, VAD). Neuere Frameworks kombinieren VAD mit Modellen, die aus Audio und Text abschätzen, ob ein Gedanke abgeschlossen ist. LiveKit beschreibt zum Beispiel ein Turn-Detector-Modell und eine adaptive Unterbrechungserkennung, die echte Unterbrechungen von bloßen Rückmeldungen wie „mhm“ unterscheiden soll.
Die vierte Schicht ist die Dialoglogik. Hier entscheidet ein LLM, ein regelbasierter Ablauf oder eine Kombination aus beiden, was als Nächstes passiert: nachfragen, eine Auskunft geben, eine Funktion im Backend aufrufen oder an einen Menschen übergeben. Diese Schicht bestimmt, ob der Bot fachlich richtig handelt.
Die fünfte Schicht ist die Sprachausgabe (Text-to-Speech, TTS). Sie verwandelt die Antwort in Audio. In einem Voicebot muss sie streamen, also mit der Ausgabe beginnen, bevor der ganze Satz fertig ist, und sie muss sofort abbrechen können, wenn der Anrufer dazwischenspricht. Wie Sie deutsche TTS-Stimmen systematisch vergleichen, beschreibt unser Leitfaden zur Auswahl von deutschem Text-to-Speech.
Worauf sollten Sie bei einem Voicebot für deutsche Anrufer achten?
Prüfen Sie einen Voicebot an fünf Punkten: Sprachqualität auf Deutsch, Latenz aus Sicht des Anrufers, Unterbrechbarkeit, Integration in Ihre Systeme sowie Datenfluss und Datenstandort. Eine überzeugende Demo deckt meist nur den ersten Punkt ab, und auch den nur für vorbereitete Sätze.
Deutsche Sprachqualität. Testen Sie mit Ihren echten Inhalten: Kundennummern, Beträge, Datumsangaben, IBANs, Produktnamen und englische Fachbegriffe. Ein Bot, der eine Rechnungsnummer falsch vorliest oder einen Straßennamen falsch versteht, verliert das Vertrauen des Anrufers schneller als einer mit etwas künstlicher Stimme. Achten Sie auf beide Richtungen: Die ASR muss es verstehen, die TTS muss es korrekt aussprechen.
Latenz, wie Anrufer sie erleben. Messen Sie die Zeit vom letzten Wort des Anrufers bis zur ersten hörbaren Silbe der Antwort in der Telefonleitung. In diese Pause fließen die Wartezeit der Turn-Erkennung, die Spracherkennung, die erste Antwort des LLMs, die erste Audioausgabe der TTS und der Transport über das Telefonnetz ein. Herstellerangaben zu einzelnen Komponenten sind nicht vergleichbar, wenn die Messgrenzen unterschiedlich sind. Messen Sie deshalb selbst, an echten Anrufen und über viele Gespräche hinweg, nicht nur einen Durchschnitt aus einer Demo. Unser Leitfaden für den Produktivstart beschreibt, welche Latenzen vor dem Go-live gemessen werden sollten.
Barge-in. Anrufer unterbrechen, korrigieren sich und sagen „Moment“. Ein Voicebot muss seine Ausgabe dann sofort stoppen, bereits erzeugte Antworten verwerfen und den neuen Satz verarbeiten. Testen Sie gezielt, was passiert, wenn jemand mitten in eine lange Antwort hineinspricht, und ob kurze Rückmeldungen fälschlich als Unterbrechung gewertet werden.
Integration und Übergabe. Ein Voicebot ist nur so nützlich wie die Aktionen, die er ausführen darf. Klären Sie früh, welche Systeme er lesen und schreiben soll, wie Authentifizierung am Telefon funktioniert und wie die Übergabe an einen Mitarbeiter samt Gesprächskontext abläuft. Eine Übergabe, bei der der Kunde alles noch einmal erzählen muss, zerstört den Nutzen.
Datenfluss und Datenstandort. Legen Sie für jede Schicht fest, wo Audio, Transkripte und Protokolle verarbeitet und gespeichert werden, wie lange sie aufbewahrt werden und welcher Anbieter sie sieht. Der nächste Abschnitt geht darauf ein.
Welche Rolle spielen DSGVO und KI-Verordnung beim Voicebot?
Ein Voicebot verarbeitet personenbezogene Daten, weil Stimme, Telefonnummer und Gesprächsinhalt einer Person zugeordnet werden können. Damit gilt die DSGVO vollständig, und seit dem 2. August 2026 gilt zusätzlich die Transparenzpflicht aus Artikel 50 der KI-Verordnung für Systeme, die direkt mit Menschen interagieren.
Aus der DSGVO folgen für ein Voicebot-Projekt vor allem praktische Aufgaben. Mit jedem Anbieter, der im Auftrag Audio oder Transkripte verarbeitet, brauchen Sie einen Vertrag zur Auftragsverarbeitung nach Artikel 28. Werden Daten außerhalb des Europäischen Wirtschaftsraums verarbeitet, müssen die Voraussetzungen für Drittlandübermittlungen nach Kapitel V erfüllt sein. Anrufer müssen nach Artikel 13 informiert werden, und je nach Umfang und Risiko der Verarbeitung ist eine Datenschutz-Folgenabschätzung nach Artikel 35 zu prüfen. Kein Anbieter macht einen Voicebot automatisch DSGVO-konform. Die Verantwortung für Zweck, Rechtsgrundlage und Aufbewahrung bleibt beim Unternehmen, das den Bot einsetzt.
Werden Gespräche aufgezeichnet, kommt das Strafrecht hinzu: § 201 StGB stellt die unbefugte Aufnahme des nichtöffentlich gesprochenen Wortes unter Strafe. Details zu Aufzeichnung, Einwilligung und Datenresidenz in der DACH-Region behandelt unser Artikel zu Voice AI in Deutschland und der DACH-Region.
Artikel 50 Absatz 1 der KI-Verordnung verpflichtet Anbieter, KI-Systeme, die für die direkte Interaktion mit natürlichen Personen bestimmt sind, so zu gestalten, dass die Personen informiert werden, dass sie mit einem KI-System sprechen, sofern das nicht offensichtlich ist. Die Europäische Kommission versteht diese Ausnahme eng und verlangt die Information spätestens zu Beginn der ersten Interaktion. Für einen Voicebot heißt das in der Regel: Der Bot sagt gleich zu Beginn des Anrufs, dass er ein KI-System ist. Wer einen Voicebot selbst entwickelt und unter eigenem Namen in Betrieb nimmt, kann dabei selbst als Anbieter im Sinne der Verordnung gelten. Dieser Abschnitt ist technische Orientierung, keine Rechtsberatung. Lassen Sie die Einordnung Ihres Projekts juristisch prüfen.
Voicebot selbst bauen oder kaufen: welcher Ansatz passt?
Die Entscheidung hängt davon ab, wie viel Kontrolle Sie über Datenfluss, Komponenten und Gesprächsverhalten brauchen und wie viel Engineering-Kapazität Sie dauerhaft dafür aufbringen können. Die folgende Tabelle ordnet die vier gängigen Ansätze ein.
Der reine Eigenbau lohnt sich selten. Die Echtzeitprobleme, also Audio-Streaming, Unterbrechungen, Turn-Erkennung und Telefonieanbindung, sind in Frameworks bereits gelöst, und ein Nachbau bindet über Monate Kapazität, ohne das Produkt zu verbessern. Sinnvoll ist er vor allem dann, wenn Ihre Anforderungen von allen verfügbaren Bausteinen abweichen.
Ein Framework ist der Mittelweg. LiveKit Agents und Pipecat sind Open Source und herstellerunabhängig: Sie wählen ASR, LLM und TTS selbst und können das Ganze in Ihrer eigenen Umgebung betreiben. Das gibt Ihnen Kontrolle über Datenstandort und Komponenten, verlangt aber ein Team, das den Betrieb übernimmt.
Eine gemanagte Plattform bringt Sie am schnellsten zu einem funktionierenden Anruf. Vapi beschreibt sich als Entwicklerplattform, deren Assistenten Speech-to-Text, ein Sprachmodell und Text-to-Speech kombinieren und über Telefonnummern ein- und ausgehende Anrufe führen. Cognigy richtet sich an große Unternehmen und bindet Telefonie über das Cognigy Voice Gateway an. Prüfen Sie bei jeder Plattform, welche Komponenten Sie austauschen können, wo Audio und Transkripte verarbeitet werden und wie Sie später wechseln könnten.
Wie starten Sie ein Voicebot-Projekt mit geringem Risiko?
Starten Sie mit einem eng umrissenen Anliegen, das häufig vorkommt, klar abgrenzbar ist und bei Fehlern wenig Schaden anrichtet, etwa Terminbestätigungen, Statusauskünfte oder die Vorqualifizierung von Anliegen vor der Weiterleitung. Legen Sie vor dem Bau fest, woran Sie Erfolg messen.
Gute Abnahmekriterien sind messbar und aus Anrufersicht formuliert: Anteil der Gespräche, die ohne Übergabe korrekt abgeschlossen werden, Anteil korrekt erkannter Kundennummern, die gemessene Pause nach dem letzten Wort des Anrufers über viele Anrufe und die Zahl der Gespräche, in denen der Bot etwas Falsches zusagt. Sammeln Sie dafür vorab echte, anonymisierte Formulierungen Ihrer Kunden, statt nur Beispielsätze aus dem Projektteam zu verwenden.
Planen Sie die Übergabe an Menschen von Anfang an als Teil des Produkts. Der Bot sollte jederzeit erkennen, wann er nicht weiterkommt, und das Gespräch mit Zusammenfassung übergeben. Wenn Sie früh wissen, dass Datenhoheit eine harte Anforderung ist, klären Sie außerdem, welche Schichten Sie in eigener Infrastruktur betreiben müssen. Unser Leitfaden zu On-Premise-Voice-AI beschreibt die Optionen.
Wo passt KugelAudio in einen Voicebot-Stack?
Offenlegung: Dieser Artikel erscheint bei KugelAudio, und die folgenden Angaben sind Herstellerangaben, keine unabhängigen Testergebnisse. KugelAudio ist die Sprachausgabe (TTS) innerhalb eines Voicebots. Wir bieten kein fertiges Telefonbot- oder Callcenter-Produkt an. Telefonie, Spracherkennung und Dialoglogik kommen aus einem Framework oder einer Plattform Ihrer Wahl.
Die KugelAudio GmbH mit Sitz in Berlin entwickelt eine Text-to-Speech-API mit deutschen Stimmen. Für Voicebots relevant sind die Streaming-Schnittstellen, die für Echtzeit-Voice-Agents ausgelegt sind, sowie eine dokumentierte Barge-in-Funktion, mit der Sie die laufende Ausgabe abbrechen, ohne die Verbindung zu schließen. Die Cloud-API bietet einen direkten EU-Endpunkt, den Sie ausdrücklich auswählen, wenn die Verarbeitung in der EU bleiben soll. Alternativ lässt sich KugelAudio per Kubernetes und Helm selbst hosten. Dann bleiben Text und Audio in Ihrer Infrastruktur, und Sie steuern die Aufbewahrung selbst. Eine Null-Speicherung in der Cloud sagen wir nicht zu.
Integrationen sind für LiveKit Agents, Pipecat, Vapi (als eigener TTS-Endpunkt) und Cognigy dokumentiert, dazu eine ElevenLabs-kompatible Schnittstelle. Hörproben finden Sie auf der Seite für deutsches Text-to-Speech und in der Stimmenbibliothek, aktuelle Preise auf der Preisseite. Einen breiteren Vergleich von Sprach-APIs bietet unser Überblick über Text-to-Speech-APIs für Entwickler.
FAQ
Was ist der Unterschied zwischen Voicebot und Chatbot?
Ein Chatbot arbeitet mit geschriebenem Text, ein Voicebot mit gesprochener Sprache. Der Voicebot braucht zusätzlich Spracherkennung, Sprachausgabe und Turn-Erkennung in Echtzeit, und seine Antworten müssen für das Ohr formuliert sein: kürzer, ohne Listen und ohne Formatierung.
Ersetzt ein Voicebot die bestehende IVR?
Nicht zwingend. Viele Unternehmen setzen den Voicebot vor das bestehende Routing, um Anliegen zu erkennen und einfache Fälle zu lösen, und behalten die IVR-Logik für die Weiterleitung. Für wenige, stabile Menüoptionen kann eine IVR weiterhin die robustere Lösung sein.
Muss ein Voicebot sagen, dass er eine KI ist?
In der Regel ja. Artikel 50 Absatz 1 der KI-Verordnung verlangt, dass Personen informiert werden, wenn sie mit einem KI-System interagieren, sofern das nicht offensichtlich ist, und gilt seit dem 2. August 2026. Die Kommission legt die Ausnahme eng aus. Am sichersten ist ein Hinweis direkt zu Beginn des Anrufs.
Darf ein Voicebot Anrufe aufzeichnen?
Nur mit einer tragfähigen Rechtsgrundlage und in der Regel mit Einwilligung. Die unbefugte Aufnahme des nichtöffentlich gesprochenen Wortes ist nach § 201 StGB strafbar, zusätzlich gelten die Informationspflichten der DSGVO. Trennen Sie außerdem die Verarbeitung für das laufende Gespräch von einer dauerhaften Speicherung.
Wie schnell muss ein Voicebot antworten?
So schnell, dass die Pause nach dem letzten Wort des Anrufers nicht als Stocken wahrgenommen wird. Messen Sie diese Pause selbst, Ende zu Ende über die Telefonleitung und über viele echte Anrufe, statt Herstellerangaben einzelner Komponenten zu addieren, deren Messgrenzen sich unterscheiden.
Kann ein Voicebot Dialekte verstehen?
Das hängt von der eingesetzten Spracherkennung ab und lässt sich nur mit eigenen Aufnahmen belastbar prüfen. Testen Sie mit Anrufern aus Ihren Regionen und mit typischem Telefonaudio, nicht mit Studioaufnahmen.
Brauche ich für einen Voicebot eigene GPU-Server?
Nein, nicht zwingend. Mit Cloud-APIs und gemanagten Plattformen betreiben Sie keine eigene Hardware. Eigene Server werden erst relevant, wenn Sie einzelne Schichten wie ASR, LLM oder TTS aus Gründen der Datenhoheit in Ihrer eigenen Infrastruktur betreiben wollen.
Quellen
- Verordnung (EU) 2024/1689 (KI-Verordnung), Artikel 50: https://eur-lex.europa.eu/eli/reg/2024/1689/oj
- Europäische Kommission, Transparency obligations under Article 50 of the AI Act: https://digital-strategy.ec.europa.eu/en/faqs/transparency-obligations-under-article-50-ai-act
- Verordnung (EU) 2016/679 (Datenschutz-Grundverordnung): https://eur-lex.europa.eu/eli/reg/2016/679/oj
- § 201 StGB, Verletzung der Vertraulichkeit des Wortes: https://www.gesetze-im-internet.de/stgb/__201.html
- ITU-T G.711, Pulse code modulation (PCM) of voice frequencies: https://www.itu.int/rec/T-REC-G.711
- LiveKit Agents, Turn detection and interruptions: https://docs.livekit.io/agents/build/turns/
- LiveKit, Telephony: https://docs.livekit.io/telephony/
- Pipecat, Telephony overview: https://docs.pipecat.ai/guides/telephony/overview
- Vapi, Introduction: https://docs.vapi.ai/quickstart/introduction
- Cognigy, Voice Gateway: https://docs.cognigy.com/voice-gateway/
- KugelAudio Dokumentation, Integrationen, Barge-in, Regionen und Self-Hosting: https://docs.kugelaudio.com
Mit KugelAudio entwickeln
Europäische Voice-Infrastruktur produktiv einsetzen.
Nutzen Sie den EU-Endpunkt oder besprechen Sie ein selbst betriebenes Kubernetes-Deployment.