Ein KI-Telefonassistent nimmt Anrufe an, versteht das Anliegen in gesprochener Sprache, erledigt einfache Vorgänge wie Terminbuchungen selbst und verbindet alles andere mit der richtigen Stelle. Für Arztpraxen, IT-Service-Desks und Kundenservice-Teams im Mittelstand ist das attraktiv, weil Telefonspitzen, Randzeiten und wiederkehrende Standardfragen Personal binden, das an anderer Stelle fehlt. Ob man ihn KI-Telefonassistent, KI Telefonassistent oder Voicebot nennt: Die Entscheidung hängt weniger am Namen als an drei Fragen. Was darf das System am Telefon allein entscheiden, welche deutschen Rechtspflichten gelten dabei, und klingt es für Ihre Anrufer akzeptabel?
Dieser Leitfaden richtet sich an Verantwortliche aus Betrieb und IT, die einen KI-Telefonassistenten bewerten. Er erklärt, was während eines Anrufs technisch passiert, wo die Grenzen liegen, welche Pflichten aus EU AI Act, StGB und DSGVO relevant sind, und wie Sie einen Pilot so aufsetzen, dass am Ende eine belastbare Entscheidung steht.
Das Wichtigste in Kürze
Ein KI-Telefonassistent ist eine Kette aus Telefonie, Spracherkennung, Sprachmodell mit Anbindung an Ihre Systeme und Sprachsynthese. Die Qualität des Gesamtsystems ist nur so gut wie das schwächste Glied, und am Telefon fallen Fehler bei Zahlen, Daten und Unterbrechungen sofort auf.
Seit dem 2. August 2026 gilt die Transparenzpflicht aus Art. 50 Abs. 1 EU AI Act: Anrufer müssen spätestens bei der ersten Interaktion erfahren, dass sie mit einem KI-System sprechen, sofern das nicht offensichtlich ist. Für Aufzeichnungen verlangt die deutsche Datenschutzaufsicht in aller Regel eine aktive Einwilligung, und § 201 StGB stellt unbefugte Aufnahmen unter Strafe.
Jeder Dienstleister in der Kette, der personenbezogene Daten verarbeitet, braucht einen Auftragsverarbeitungsvertrag nach Art. 28 DSGVO, und der Datenstandort muss pro Komponente geklärt werden, nicht pro Rufnummer.
Messen Sie einen Pilot an Abschlussquote, korrekter Weiterleitung und Fehlern bei Zahlen und Terminen gegen Ihre heutige Ausgangslage, nicht an einer Demo.
Was macht ein KI-Telefonassistent während eines Anrufs?
Ein KI-Telefonassistent hört zu, erkennt das Anliegen, führt eine Aktion in einem angebundenen System aus und antwortet mit synthetischer Stimme, und das in einer Schleife, bis der Anruf erledigt oder übergeben ist. Technisch besteht das aus vier Bausteinen: einer Telefonieanbindung (SIP-Trunk oder Cloud-Telefonie), einer Spracherkennung, die Audio in Text umwandelt, einem Sprachmodell mit Werkzeugen für Kalender, Ticketsystem oder CRM und einer Sprachsynthese (Text-to-Speech), die die Antwort ausspricht.
Die typischen Aufgaben sind überschaubar und genau deshalb gut automatisierbar. Dazu gehören Termine vereinbaren, verschieben oder absagen, Öffnungszeiten und Standardauskünfte geben, ein Anliegen vorqualifizieren und mit Zusammenfassung an die richtige Durchwahl oder Warteschlange übergeben, Rückrufwünsche aufnehmen und einfache Statusabfragen beantworten, etwa zu einem offenen Ticket. Voice-Agent-Frameworks bringen die Telefoniebausteine dafür mit: LiveKit dokumentiert eingehende und ausgehende Anrufe, Tastentöne (DTMF) sowie kalte und warme Weiterleitungen, Pipecat dokumentiert ein- und ausgehende Anrufe über Telefonnetz und SIP einschließlich Weiterleitungen.
Der wichtigste Teil des Designs ist die Übergabe. Ein guter KI-Telefonassistent erkennt, wann er nicht weiterkommt, und reicht den Anruf mit Kontext weiter, statt den Anrufer in einer Schleife zu halten. Planen Sie die Übergabewege daher vor den Dialogen: Wer nimmt außerhalb der Geschäftszeiten ab, was passiert bei Notfällen, und wie erfährt der Mitarbeiter, was bereits besprochen wurde?
Wo liegen die Grenzen eines KI-Telefonassistenten?
Die Grenzen liegen dort, wo ein Fehler teuer ist und das System ihn nicht selbst bemerkt. Ein Sprachmodell kann plausibel klingende, aber falsche Auskünfte geben, eine Spracherkennung kann eine Hausnummer oder ein Geburtsdatum falsch verstehen, und bei schlechter Mobilfunkverbindung, starkem Dialekt oder Hintergrundlärm steigt die Fehlerrate. Am Telefon gibt es keinen Bildschirm, auf dem der Anrufer eine falsche Eingabe sieht.
Daraus folgt eine klare Aufgabenteilung. Medizinische Einschätzungen, verbindliche Vertragsauskünfte, Beschwerden mit Eskalationspotenzial und alles, was eine Ermessensentscheidung verlangt, gehört zu einem Menschen. Der Assistent sammelt die Daten, bestätigt sie laut und übergibt. Für Arztpraxen kommt hinzu, dass Gesundheitsdaten nach Art. 9 DSGVO besonders geschützt sind und Berufsgeheimnisträger nach § 203 StGB dafür sorgen müssen, dass mitwirkende Dienstleister zur Geheimhaltung verpflichtet sind. Das spricht nicht gegen den Einsatz, verlangt aber eine sorgfältige Auswahl und Vertragsgestaltung.
Eine weitere Grenze ist die Integration. Ein Assistent, der keinen Schreibzugriff auf den Kalender hat, kann nur Rückrufwünsche notieren. Planen Sie die Schnittstellen zu Praxisverwaltung, Ticketsystem oder Telefonanlage deshalb so früh wie die Dialoge; ohne sie bleibt auch eine sehr gute Stimme wirkungslos.
Welche Rechtspflichten gelten für einen KI-Telefonassistenten in Deutschland?
Vier Themen bestimmen den Rahmen: die Offenlegung als KI nach EU AI Act, die Aufzeichnung und Einwilligung nach StGB und DSGVO, die Auftragsverarbeitung und der Datenstandort. Die folgende Übersicht beschreibt die Pflichten mit ihrer Quelle. Sie ersetzt keine Rechtsberatung; klären Sie die konkrete Ausgestaltung mit Ihrem Datenschutzbeauftragten und Ihrer Rechtsberatung. Eine ausführlichere Darstellung zu DSGVO, Aufzeichnung und Datenstandort in Deutschland, Österreich und der Schweiz finden Sie in unserem Artikel Voice AI in der DACH-Region.
Offenlegung nach Art. 50 EU AI Act. Anbieter von KI-Systemen, die direkt mit natürlichen Personen interagieren, müssen diese so gestalten, dass die Personen erfahren, dass sie mit einem KI-System interagieren, es sei denn, das ist für eine vernünftige, informierte Person offensichtlich. Nach Art. 50 Abs. 5 muss die Information klar und unterscheidbar spätestens zum Zeitpunkt der ersten Interaktion erfolgen. Nach Art. 113 gilt diese Offenlegungspflicht seit dem 2. August 2026. Am Telefon heißt das praktisch: ein kurzer Hinweis in der Begrüßung, bevor das Gespräch in die Sache geht. Wer den Assistenten selbst baut und in Betrieb nimmt, kann selbst Anbieter im Sinne der Verordnung sein; wer eine fertige Lösung einsetzt, sollte sich zeigen lassen, wie der Anbieter die Offenlegung umsetzt. Art. 50 Abs. 2 verlangt zusätzlich, dass Anbieter von Systemen, die synthetische Audioinhalte erzeugen, diese maschinenlesbar als künstlich erzeugt kennzeichnen. Verstöße gegen Art. 50 können nach Art. 99 Abs. 4 mit Geldbußen belegt werden.
Aufzeichnung und Einwilligung. Nach § 201 StGB macht sich strafbar, wer unbefugt das nichtöffentlich gesprochene Wort eines anderen auf einen Tonträger aufnimmt. Die Datenschutzkonferenz (DSK) hat 2018 festgehalten, dass die Aufzeichnung von Telefongesprächen in aller Regel nur mit Einwilligung zulässig ist, die aktiv erklärt wird, etwa durch ein ausgesprochenes „Ja“ oder einen Tastendruck. Die bloße Möglichkeit zu widersprechen reicht danach nicht. Ein KI-Telefonassistent muss Audio verarbeiten, um zu funktionieren; ob und wie lange Audio oder Transkripte gespeichert werden, ist eine eigene Entscheidung mit eigener Rechtsgrundlage. Legen Sie fest, was gespeichert wird, wofür und wie lange, und informieren Sie Anrufer nach Art. 13 DSGVO zum Zeitpunkt der Erhebung.
Auftragsverarbeitung (AVV). Verarbeitet ein Dienstleister personenbezogene Daten in Ihrem Auftrag, verlangt Art. 28 DSGVO einen Vertrag, der unter anderem Weisungsbindung, Vertraulichkeit, technische und organisatorische Maßnahmen, die Bedingungen für Unterauftragsverarbeiter sowie Löschung oder Rückgabe nach Vertragsende regelt. Bei einem KI-Telefonassistenten sind das oft mehrere Parteien: Telefonieanbieter, Plattform, Spracherkennung, Sprachmodell und Sprachsynthese. Lassen Sie sich die vollständige Liste der Unterauftragsverarbeiter geben, nicht nur den Vertrag mit dem Hauptanbieter.
Datenstandort. Die DSGVO schreibt keinen pauschalen Speicherort in der EU vor, regelt aber in Kapitel V (ab Art. 44) die Übermittlung in Drittländer. Eine deutsche Rufnummer sagt nichts darüber, wo Audio, Transkripte und Protokolle verarbeitet werden. Fragen Sie pro Komponente nach Region, Speicherdauer und Supportzugriff. Wenn Audio und Text Ihre eigene Infrastruktur nicht verlassen sollen, kommt ein Betrieb der Komponenten auf eigenen Servern in Betracht; die Abwägung dazu beschreibt unser Artikel zu On-Premise Voice AI.
Was lässt einen KI Telefonassistenten auf Deutsch akzeptabel klingen?
Akzeptabel klingt ein Assistent, wenn Anrufer nach wenigen Sekunden aufhören, auf die Stimme zu achten, und sich auf ihr Anliegen konzentrieren. Drei Dinge entscheiden darüber: eine natürliche deutsche Stimme, korrekt gesprochene Zahlen, Daten und Adressen und ein sauberer Umgang mit Unterbrechungen.
Natürlichkeit der Stimme. Eine Stimme, die in einer englischen Demo überzeugt, kann auf Deutsch bei Komposita, Satzmelodie und Fremdwörtern stolpern. Hören Sie Stimmen deshalb mit Ihren eigenen Texten an: Ihrem Praxis- oder Firmennamen, Produktbezeichnungen, Straßennamen aus Ihrer Region. Beachten Sie auch, dass Telefonie das Audiosignal stark einschränkt. Eine Stimme sollte im schmalbandigen Telefonformat (G.711, 8 kHz) geprüft werden, nicht nur im Studioformat. Hinweise zur Auswahl deutscher Stimmen enthält unser Artikel zu deutscher Dialekt-TTS.
Zahlen, Daten und Adressen. Das ist der häufigste Grund für Rückfragen. „Am 03.10. um 14:30“ muss als „am dritten Oktober um vierzehn Uhr dreißig“ gesprochen werden, eine Kundennummer Ziffer für Ziffer und eine E-Mail-Adresse Zeichen für Zeichen. Das erfordert eine Textnormalisierung vor der Sprachsynthese und die Möglichkeit, bestimmte Passagen buchstabieren zu lassen. Umgekehrt muss die Spracherkennung Zahlen, die Anrufer diktieren, zuverlässig erfassen. Lassen Sie den Assistenten kritische Angaben wie Datum, Uhrzeit und Rückrufnummer immer laut bestätigen.
Unterbrechungen. Menschen fallen einander am Telefon ins Wort, etwa mit „Nein, Dienstag“ mitten in einem Satz. Der Assistent muss dann sofort aufhören zu sprechen, zuhören und den Rest seiner geplanten Antwort verwerfen. Fehlt diese Fähigkeit (im Fachjargon Barge-in), wirkt das Gespräch schnell mechanisch. Ebenso wichtig ist die Antwortgeschwindigkeit: Lange Pausen nach einer Frage lassen Anrufer nachfragen oder auflegen. Dafür ist gestreamte Sprachsynthese gedacht, die bereits spricht, während der Rest der Antwort noch erzeugt wird.
Welche Bauform passt zu Ihrem Unternehmen?
Es gibt drei gängige Wege: eine fertige Telefonassistenten-Lösung als SaaS, ein Voicebot-Modul Ihrer bestehenden Contact-Center-Plattform oder ein eigener Aufbau auf einem Voice-Agent-Framework. Sie unterscheiden sich vor allem darin, wie viel Kontrolle Sie über Daten, Stimme und Integrationen haben und wie viel Entwicklungsarbeit Sie selbst tragen.
Eine fertige Lösung ist der schnellste Weg zu einem ersten Eindruck, aber prüfen Sie vor Vertragsschluss, ob Sie Stimme, Speicherdauer und Übergabewege selbst bestimmen können. Die Plattform-Variante lohnt sich, wenn Routing, Warteschlangen und Auswertung ohnehin dort liegen. Der Eigenbau ist die richtige Wahl, wenn die Integration in Ihre Fachsysteme der eigentliche Nutzen ist oder Daten Ihre Infrastruktur nicht verlassen dürfen.
Wo passt KugelAudio in einen KI-Telefonassistenten?
KugelAudio verkauft keinen fertigen Telefonassistenten. KugelAudio ist die Stimme, also die Sprachsynthese innerhalb eines solchen Systems. Hinweis zur Einordnung: Dieser Artikel wird von KugelAudio veröffentlicht, die folgenden Angaben stammen aus unserer eigenen Dokumentation und sind keine unabhängigen Testergebnisse.
Die Text-to-Speech-API wird in Europa entwickelt. Laut Dokumentation gibt es offizielle Integrationen für LiveKit Agents und Pipecat, einen Custom-TTS-Weg für Vapi und eine Anbindung als Speech-Anbieter im Cognigy Voice Gateway. Die Ausgabe ist auf Streaming für Echtzeit-Voice-Agents ausgelegt, unterstützt Barge-in und kann direkt im Telefonieformat G.711 ausgegeben werden. Textnormalisierung und Buchstabier-Tags sind für Zahlen, Daten und Codes gedacht. Laut Dokumentation wird jede erzeugte Audioausgabe mit einem eingebetteten Wasserzeichen und einem Offenlegungs-Header als KI-generiert gekennzeichnet; das ersetzt nicht die Ansage an den Anrufer nach Art. 50 Abs. 1.
Für den Datenstandort gibt es einen direkten EU-Endpunkt, der ausdrücklich gewählt werden muss, weil der Standard-Endpunkt geografisch routet. Alternativ lässt sich KugelAudio per Kubernetes und Helm in eigener Infrastruktur betreiben; dann bleiben Text und Audio in Ihrer Umgebung, und Sie bestimmen die Speicherdauer selbst. Für die Cloud-API ist eine Null-Speicherung keine zugesicherte Eigenschaft; klären Sie die Aufbewahrung im Rahmen der Auftragsverarbeitung. Deutsche Stimmen können Sie auf der Seite Deutsche Text-to-Speech und in der Stimmenübersicht anhören, Preise stehen auf der Preisseite.
Wie pilotieren und messen Sie einen KI-Telefonassistenten?
Pilotieren Sie mit einem einzigen, klar abgegrenzten Anliegen, messen Sie gegen Ihre heutige Ausgangslage und legen Sie die Erfolgskriterien vor dem Start fest. Ein guter Einstieg ist ein Bereich mit hohem Volumen und geringem Risiko, zum Beispiel Terminanfragen außerhalb der Sprechzeiten oder Überlaufanrufe, wenn alle Leitungen besetzt sind.
Erfassen Sie zuerst die Ausgangslage: Wie viele Anrufe gehen heute verloren, wie lange warten Anrufer, welche Anliegen machen den Großteil aus? Ohne diese Zahlen lässt sich am Ende nicht sagen, ob der Assistent etwas verbessert hat.
Testen Sie dann vor dem Livegang mit einem festen Skript aus realistischen Anrufen, das Ihre schwierigen Fälle enthält: diktierte Geburtsdaten und Kundennummern, Straßennamen, Terminwünsche wie „nächsten Dienstag nach der Mittagspause“, Unterbrechungen, Dialekt, schlechte Verbindung und Anrufer, die ausdrücklich einen Menschen verlangen. Dasselbe Skript nutzen Sie später für jede Konfigurationsänderung, damit Verbesserungen und Rückschritte vergleichbar bleiben.
Im Livebetrieb messen Sie wenige Kennzahlen konsequent: den Anteil der Anrufe, die ohne Übergabe korrekt abgeschlossen wurden, den Anteil korrekt weitergeleiteter Anrufe, die Zahl falsch eingetragener Termine oder Daten, Abbrüche während des Gesprächs und die Beschwerden. Prüfen Sie zusätzlich eine Stichprobe von Gesprächen manuell, denn ein Anruf kann formal abgeschlossen sein und trotzdem einen falschen Termin erzeugt haben. Legen Sie die Schwellen, ab denen Sie ausweiten, gemeinsam mit dem Team fest, das heute die Anrufe annimmt. Eine Checkliste für den Schritt vom Pilot in den Produktivbetrieb finden Sie in unserem Artikel zur Produktionsreife von Enterprise Voice AI.
FAQ
Muss ein KI-Telefonassistent sagen, dass er eine KI ist?
Ja, sofern es nicht offensichtlich ist. Art. 50 Abs. 1 EU AI Act verlangt, dass Personen erfahren, dass sie mit einem KI-System interagieren, und nach Art. 50 Abs. 5 spätestens bei der ersten Interaktion. Die Pflicht gilt seit dem 2. August 2026. Ein kurzer Satz in der Begrüßung ist die übliche Umsetzung; die genaue Formulierung sollten Sie mit Ihrer Rechtsberatung abstimmen.
Darf ein KI-Telefonassistent Gespräche aufzeichnen?
Nur mit tragfähiger Rechtsgrundlage. § 201 StGB stellt unbefugte Aufnahmen des nichtöffentlich gesprochenen Wortes unter Strafe, und die Datenschutzkonferenz erwartet für Gesprächsaufzeichnungen in aller Regel eine aktive Einwilligung. Entscheiden Sie bewusst, ob Audio und Transkripte gespeichert werden, und lassen Sie das Konzept von Ihrem Datenschutzbeauftragten prüfen.
Brauche ich einen Auftragsverarbeitungsvertrag?
In aller Regel ja, mit jedem Dienstleister, der personenbezogene Daten aus den Anrufen in Ihrem Auftrag verarbeitet. Art. 28 DSGVO legt die Mindestinhalte fest. Achten Sie darauf, dass alle Unterauftragsverarbeiter wie Spracherkennung, Sprachmodell und Sprachsynthese erfasst sind.
Kann ein KI-Telefonassistent in einer Arztpraxis eingesetzt werden?
Grundsätzlich ja, für organisatorische Aufgaben wie Terminvergabe und Rezeptanfragen mit anschließender Prüfung durch das Praxisteam. Gesundheitsdaten sind nach Art. 9 DSGVO besonders geschützt, und Berufsgeheimnisträger müssen mitwirkende Dienstleister nach § 203 StGB zur Geheimhaltung verpflichten. Medizinische Einschätzungen gehören nicht in den Assistenten.
Was kostet ein KI Telefonassistent?
Das hängt von der Bauform ab. Bei fertigen Lösungen bestimmt das Preismodell des Anbieters die Kosten, etwa pro Minute oder pro Monat, beim Eigenbau setzen sich die Kosten aus Telefonie, Spracherkennung, Sprachmodell, Sprachsynthese und Betrieb zusammen. Vergleichen Sie Angebote pro erfolgreich abgeschlossenem Anruf und nicht nur pro Minute. Die Preise für die Sprachsynthese von KugelAudio stehen auf der Preisseite.
Versteht ein KI-Telefonassistent Dialekte?
Das hängt von der eingesetzten Spracherkennung ab und lässt sich nur mit Ihren eigenen Anrufern verlässlich beurteilen. Nehmen Sie Sprecher aus Ihrer Region in das Testskript auf und lassen Sie kritische Angaben immer laut bestätigen, damit Erkennungsfehler im Gespräch auffallen.
Muss die Verarbeitung in Deutschland stattfinden?
Die DSGVO verlangt keinen pauschalen Standort in Deutschland oder der EU, regelt aber Übermittlungen in Drittländer. Sie können trotzdem intern festlegen, dass Audio und Transkripte die EU nicht verlassen. Prüfen Sie dafür jede Komponente einzeln, einschließlich Protokollen und Supportzugriff.
Ersetzt ein KI-Telefonassistent das Empfangs- oder Service-Team?
Nein. Er nimmt dem Team wiederkehrende, einfache Anrufe und Randzeiten ab und übergibt alles, was Urteilsvermögen verlangt. Wie groß die Entlastung ist, zeigt nur ein Pilot mit gemessener Ausgangslage.
Quellen
- EU AI Act, Verordnung (EU) 2024/1689, insbesondere Art. 50, Art. 99 und Art. 113: https://eur-lex.europa.eu/eli/reg/2024/1689/oj/deu
- Datenschutz-Grundverordnung, Verordnung (EU) 2016/679, insbesondere Art. 9, Art. 13, Art. 28 und Kapitel V: https://eur-lex.europa.eu/eli/reg/2016/679/oj/deu
- § 201 StGB, Verletzung der Vertraulichkeit des Wortes: https://www.gesetze-im-internet.de/stgb/__201.html
- § 203 StGB, Verletzung von Privatgeheimnissen: https://www.gesetze-im-internet.de/stgb/__203.html
- Datenschutzkonferenz, Beschluss vom 23.03.2018 zur Aufzeichnung von Telefongesprächen: https://www.datenschutzkonferenz-online.de/media/dskb/20180323_dskb_aufzeichnung_telefon.pdf
- LiveKit, Telephony-Dokumentation und warme Weiterleitung: https://docs.livekit.io/telephony/ und https://docs.livekit.io/telephony/features/transfers/warm
- Pipecat, Telephony-Übersicht: https://docs.pipecat.ai/guides/telephony/overview
- KugelAudio-Dokumentation zu Audioformaten und KI-Kennzeichnung: https://docs.kugelaudio.com/api-reference/tts/audio-formats
- KugelAudio-Dokumentation zu Regionen: https://docs.kugelaudio.com/guides/regions
- KugelAudio-Dokumentation zu Barge-in und Textnormalisierung: https://docs.kugelaudio.com/streaming/barge-in und https://docs.kugelaudio.com/features/text-processing
- KugelAudio-Integrationen für LiveKit, Cognigy und Vapi: https://docs.kugelaudio.com/integrations/livekit, https://docs.kugelaudio.com/integrations/cognigy und https://docs.kugelaudio.com/integrations/vapi
Mit KugelAudio entwickeln
Europäische Voice-Infrastruktur produktiv einsetzen.
Nutzen Sie den EU-Endpunkt oder besprechen Sie ein selbst betriebenes Kubernetes-Deployment.