KI · 11 Min. Lesezeit
Chatbot mit Sprachausgabe: Latenz, Kosten und Datenschutz
Chatbot mit Sprachausgabe: warum die Stimme die laufenden Kosten dominiert, wie Sie die Latenz begrenzen und was DSGVO und KI-VO bei Sprache verlangen.
Von Amperbyte AI, geschrieben von unserem Gründer ·

Ein Chatbot mit Sprachausgabe beantwortet Fragen nicht nur als Text, sondern spricht die Antwort mit einer synthetischen Stimme. Dafür kommen zum Sprachmodell zwei Bausteine hinzu: die Spracherkennung für gesprochene Eingaben und die Sprachsynthese (Text-to-Speech, TTS) für die Ausgabe. Beide verändern drei Dinge, die bei einem reinen Text-Chatbot kaum auffallen: die Wartezeit, die laufenden Kosten und den Datenschutz. In unserem eigenen Produkt macht die Stimme laut unserer Kostenschätzung vom 17.09.2026 rund 90 Prozent der variablen Kosten einer gesprochenen Antwort aus.
Die Messwerte stammen aus unserer eigenen Videochat-Conversational-AI, einer KI-Chatbot- und Videochat-Anwendung für Endkunden, die wir selbst entwickeln und betreiben. Den Produktnamen nennen wir hier nicht, weil es sich an Endkunden richtet. Vom 8. September bis 5. Oktober 2026 liefen dort rund 69.000 Videochat-Sitzungen. Sprache heißt in diesem Artikel: Ein- und Ausgabe im Browser oder in der App, nicht am Telefon.
Rechtsstand: 7. Oktober 2026
Dieser Artikel ist allgemeine Information und keine Rechtsberatung. Wir sind ein Software- und KI-Dienstleister, keine Kanzlei. Ob eine Pflicht in Ihrem konkreten Fall greift, erfordert eine rechtliche Prüfung des Einzelfalls im Sinne von § 2 Abs. 1 Rechtsdienstleistungsgesetz; dafür sind Ihr Datenschutzbeauftragter, Ihre Rechtsabteilung oder eine Kanzlei zuständig.
Chatbot, Voicebot, Telefonassistent: die Unterschiede
Ein Voicebot ist ein KI-System, mit dem man überwiegend per Sprache kommuniziert. Ein Chatbot mit Sprachausgabe bleibt dagegen ein Chat: Die Antwort steht als Text auf dem Bildschirm, die Stimme kommt hinzu, und Nutzer wählen, ob sie tippen oder sprechen. Ein Telefonassistent ist ein Voicebot hinter einer Rufnummer.
| Bauart | Kanal | Eingabe | Ausgabe | Was zusätzlich zählt |
|---|---|---|---|---|
| Text-Chatbot | Website, App | Tastatur | Text | Antwortzeit und Antwortqualität |
| Chatbot mit Sprachausgabe | Browser, App | Tastatur oder Mikrofon | Text und Stimme | Zeit bis zum Sprechbeginn, Kosten der Stimme, Datenschutz |
| Voicebot | Browser, App | Mikrofon | Stimme, Text höchstens ergänzend | Erkennung bei Störgeräuschen, gesprochener KI-Hinweis |
| Telefonassistent | Telefonnetz (Rufnummer, SIP) | Sprache am Telefon | Stimme | Telefonanbindung, Unterbrechen während der Ausgabe, kein Bildschirm |
Ein Telefonassistent braucht eine Anbindung ans Telefonnetz, meist über SIP (Session Initiation Protocol), und Anrufer erwarten, ihn jederzeit unterbrechen zu können (Barge-in). Telefonie behandelt dieser Artikel nicht.
Ob Sprache Ihren Kunden nützt, sollten Sie messen. In unserem Produkt hatte die Spracheingabe in einem A/B-Test, also einem Vergleich zufällig zugeteilter Nutzergruppen, keinen messbaren Effekt auf die Zielkennzahl (rund 5.000 Nutzer je Gruppe, 12. August bis 15. September 2026).
Die Bausteine eines Chatbots mit Sprachausgabe
- Spracheingabe. Die Spracherkennung (Speech-to-Text) wandelt Gesprochenes in Text um, im Browser etwa über die Web Speech API, eine Programmierschnittstelle des Browsers.
- Sprachmodell. Ein Sprachmodell (Large Language Model, LLM) schreibt die Antwort, meist mit automatischer Prüfung von Eingabe und Antwort.
- Sprachsynthese. Ein TTS-Dienst erzeugt aus dem Antworttext Audio mit einer festgelegten Stimme.
- Wiedergabe. Die Anwendung spielt das Audio ab und zeigt den Text an.
In unserem Produkt kommt ein Video hinzu. Es wird nicht live von einer KI generiert, sondern in Echtzeit aus vorproduzierten Clips zusammengesetzt. Für eine gesprochene Antwort wählt das System einen vorproduzierten Sprech-Clip, dessen Länge zur Zeichenzahl der Antwort passt. Mehr dazu im Artikel Chatbot mit Avatar.
Latenzbudget: wie lange eine gesprochene Antwort dauern darf
Latenz ist die Wartezeit zwischen der Nachricht des Nutzers und der Reaktion des Systems. Beim Chatbot mit Sprachausgabe zählt der Sprechbeginn. Ein Latenzbudget gibt jedem Schritt eine Zeitgrenze und einen Rückfall für den Fall, dass sie abläuft.
Parallel statt nacheinander
Ein wirksamer Hebel ist die Reihenfolge. In unserem Produkt läuft die Prüfung der Eingabe gleichzeitig mit der Antwortgenerierung, mit einer Zeitgrenze von 2,5 Sekunden je Versuch und 3,5 Sekunden insgesamt bei höchstens zwei Versuchen. Sobald der Antworttext steht, startet die Sprachsynthese parallel zur Auswahl des passenden Clips und wird erst danach abgewartet.
Wie eine Reserve beim zweiten LLM-Anbieter die Antwortzeit des Sprachmodells stabil hält und welche Werte wir dabei messen, zeigt der Artikel LLM-Fallback: Ausfallsicherheit und Antwortzeit.
Messwerte und Rückfälle für die Stimme
Eine neue Sprachausgabe braucht bei uns meist 0,2 bis 0,5 Sekunden. Der gesamte Sprachschritt lag vom 25. September bis 2. Oktober 2026 im 99,9. Perzentil bei 1,3 Sekunden. Seit dem 2. Oktober 2026 begrenzt ihn ein Budget von 5 Sekunden. Läuft es ab, kommt eine gespeicherte Aufnahme desselben Texts oder die Antwort ohne Stimme.
Die Stimme wartet auf das Bild des Sprungs zum Sprech-Clip. Der Text erscheint spätestens nach 3 Sekunden, die Antwort bleibt also immer lesbar. Das hilft auch bei der Barrierefreiheit, die das BFSG seit dem 28. Juni 2025 für bestimmte Online-Dienste verlangt (Barrierefreie Website: Wen das BFSG trifft).
Warum die Stimme die laufenden Kosten dominiert
Bei einem Text-Chatbot ist meist das Sprachmodell der größte variable Kostenblock. Mit Sprachausgabe kehrt sich das häufig um; wie stark, hängt von Stimme, Sprachmodell und Listenpreisen ab. Laut unserer Kostenschätzung vom 17.09.2026, gerechnet mit den Listenpreisen der Anbieter, macht die Sprachsynthese rund 90 Prozent der variablen Kosten einer gesprochenen Videochat-Antwort aus. Das ist etwa das Zehnfache der LLM-Antwort.
Der Grund liegt im Preis pro Einheit. Sprachmodelle werden nach Tokens abgerechnet, also nach Textbausteinen; unsere Prompts haben 3.000 bis 4.000 Tokens, die Antwort höchstens 160. Sprachsynthese wird in der Regel nach Zeichen oder Audiodauer abgerechnet, und ein vertontes Zeichen kostet nach den Listenpreisen unserer Schätzung ein Vielfaches eines Tokens. Jede neu erzeugte Aufnahme wird nach ihrer Länge berechnet, bei uns für höchstens 500 Zeichen je Antwort. Das Video kostet nur Bandbreite im CDN (Content Delivery Network, ein verteiltes Auslieferungsnetz), weil es aus vorproduzierten Clips besteht. Selbst die Reserve beim zweiten LLM-Anbieter, durch die jede Anfrage zwei LLM-Aufrufe erzeugt, bleibt dagegen klein.
Rechnen Sie deshalb mit Kosten pro gesprochener Antwort und schätzen Sie, welcher Anteil der Antworten tatsächlich gesprochen wird. Warum unbekannte Kosten pro Antwort viele KI-Vorhaben aufhalten, beschreibt der Artikel Vom Pilot in die Produktion.
Hebel: wie Sie die Kosten der Stimme senken
Diese fünf Hebel nutzen wir in unserem eigenen Produkt:
| Hebel | Was er bewirkt | Was Nutzer merken |
|---|---|---|
| Keine Stimme ohne Zuhörer | Keine Sprachsynthese bei stummem Video oder gesperrter bzw. auffälliger Antwort | Bei stummem Video nichts, der Ton ist ohnehin aus |
| Stummer Start | Stumm gestartete Sitzungen erzeugen keine Sprachsynthese | Im A/B-Test kein Unterschied bei der Aktivierung |
| Längengrenzen | Antwort höchstens 120 Tokens, Sprachausgabe nur bis 500 Zeichen | Kürzere Antworten |
| Cache für ganze Antworttexte | Höchstens drei neue Aufnahmen pro Text, danach Wiederverwendung | Wiederholungen klingen nicht identisch |
| Schnelleres Sprachsynthese-Modell | Deutlich geringere Kosten | Kürzere Erzeugungszeit |
Stummer Start. Ob Sitzungen mit Ton starten sollen, haben wir vom 10. bis 29. September 2026 per A/B-Test geprüft. Das Ergebnis war unentschieden: 79,3 gegenüber 79,4 Prozent Aktivierung. Gewählt haben wir den stummen Autostart, auch aus Kostengründen.
Längengrenzen. Die Antwortlänge ist auf 120 Tokens begrenzt, im strukturierten Modus mit festem JSON-Schema auf 160. Im April 2026 haben wir die Grenze von 200 auf 120 Tokens gesenkt.
Cache für ganze Antworttexte. Ein Cache speichert erzeugte Ergebnisse zur Wiederverwendung. Unserer arbeitet je Stimme, Sprache und exaktem Antworttext. Pro Text entstehen bis zu drei Aufnahmen, danach wird zufällig eine davon wiederverwendet. Was das spart, hängt davon ab, wie oft Antworttexte wortgleich wiederkehren. Zugleich ist der Cache eine Ausfallsicherung: Schlägt die Sprachsynthese fehl, etwa mit Statuscode 429 (zu viele Anfragen) oder einem Serverfehler, spielt das System eine vorhandene Aufnahme desselben Texts statt Stille.
Schnelleres Modell. Ein früherer Wechsel auf ein schnelleres Sprachsynthese-Modell hat bei uns die Erzeugungszeit und die Kosten deutlich gesenkt. Prüfen Sie vor einem Wechsel den Klang mit echten Antworten in allen angebotenen Sprachen.
Gleichbleibender Klang über das ganze Gespräch
Eine synthetische Stimme klingt nicht bei jeder Erzeugung gleich; Betonung und Tempo können zwischen zwei Antworten schwanken. Wir richten deshalb jede neue Sprachausgabe am Klang einiger kurz zuvor erzeugter Aufnahmen derselben Stimme aus. Außerdem geben wir die Sprache je Chat fest vor. Sonst kann der TTS-Dienst die Sprache bei kurzen Sätzen falsch erkennen und sie mit fremder Aussprache vorlesen.
Spracheingabe und DSGVO
Sprachaufnahmen sind personenbezogene Daten. Der Europäische Datenschutzausschuss (EDPB) sieht Sprachdaten in seinen Leitlinien 02/2021 zu virtuellen Sprachassistenten (Version 2.0, 7. Juli 2021) als von Natur aus biometrisch an (Rn. 31). Zu den besonders geschützten Daten nach Art. 9 Abs. 1 DSGVO gehören sie aber erst, wenn sie zur eindeutigen Identifizierung einer Person verarbeitet werden (zur Definition Art. 4 Nr. 14 DSGVO). Ein Chatbot, der nur verstehen soll, was gesagt wird, tut das in der Regel nicht. Unabhängig davon kann der Inhalt des Gesagten besondere Kategorien berühren, etwa Angaben zur Gesundheit.
Wohin das Audio geht
Die Web Speech API erspart einen eigenen Erkennungsdienst, das Audio bleibt deshalb aber nicht auf dem Gerät. Laut MDN zur Web Speech API läuft die Erkennung standardmäßig serverseitig, je nach Browser also in der Cloud des Browser-Anbieters. Mit der Option processLocally ist Erkennung auf dem Gerät möglich. Die Datenschutzerklärung sollte den Empfänger deshalb nennen, oder die Erkennung läuft lokal.
In unserem Produkt erhält der Server nur den erkannten Text. Das Mikrofon schaltet sich nach 120 Sekunden ohne Sprache ab, im Sinne der Datenminimierung. Vor dem Start der Spracheingabe entstanden eine Schwellwertanalyse zur Datenschutz-Folgenabschätzung, also die dokumentierte Prüfung, ob eine vollständige Folgenabschätzung nötig ist, und ein Eintrag im Verarbeitungsverzeichnis (Stand 7. August 2026).
Für Sprachassistenten hält der EDPB eine Datenschutz-Folgenabschätzung für sehr wahrscheinlich erforderlich, etwa wegen neuer Technologie und möglicher Überwachung (Rn. 141). Ein Chatbot, der das Mikrofon nur auf Klick öffnet, unterscheidet sich davon; ob eine Folgenabschätzung nötig ist, klärt die Schwellwertanalyse. Außerdem sollen Anbieter Techniken erwägen, die Hintergrundstimmen und unnötige Daten herausfiltern (Rn. 139), und Betroffene sollen ihre Rechte auch per Sprache ausüben können.
Der Sprachsynthese-Dienst erhält personenbezogene Daten, sobald der Antworttext welche enthält, und gehört dann in der Regel in Auftragsverarbeitungsvertrag und Verarbeitungsverzeichnis. Verträge und Löschfristen für die Text-Seite beschreibt der Artikel DSGVO-konforme LLM-Integration.
Mikrofonzugriff und § 25 TDDDG
§ 25 TDDDG verlangt eine Einwilligung für das Speichern und Auslesen von Informationen auf dem Endgerät, außer es ist für einen ausdrücklich gewünschten Dienst unbedingt erforderlich. Ob schon der Mikrofonzugriff im Browser darunter fällt, ist nicht abschließend geklärt. Praktisch hilft ein eigener Hinweis vor dem Berechtigungsdialog des Browsers: wofür das Mikrofon genutzt wird, wohin das Audio geht und wie man es abschaltet.
KI-Kennzeichnung bei Sprache nach Art. 50 KI-VO
Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung (EU) 2024/1689 (KI-VO). Die Leitlinien der EU-Kommission zu Art. 50 vom 20. Juli 2026, Dokument C(2026) 5054 final, sind nicht bindend, zeigen aber, wie die Kommission die Pflichten liest. Fundstellen nennen wir als Randnummer (Rn.).
Abs. 1: Hinweis, dass eine KI spricht
Anbieter von Systemen, die direkt mit Menschen kommunizieren, müssen darauf hinweisen, dass eine KI spricht, sofern das nicht offensichtlich ist. Sprachassistenten und Chatbots im Kundenservice nennt die Kommission ausdrücklich (Rn. 31). Bei Sprache nennt sie als geeignete Technik einen gesprochenen Hinweis zu Beginn, in längeren Gesprächen bei Bedarf ergänzt durch Erinnerungen; Signaltöne allein hält sie nicht für ausreichend (Rn. 37). Hinweise nur in AGB oder Metadaten, ein generisches „Assistent“ oder „Diese Website nutzt KI“ genügen nicht (Rn. 38). Ein einzelner, gut sichtbarer Hinweis vor der ersten Interaktion reicht laut Kommission meist, in riskanteren Kontexten sind Erinnerungen wahrscheinlich nötig. Auf Nachfrage muss das System offenlegen, dass es eine KI ist (beides Rn. 40). Die Ausnahme „offensichtlich“ legt die Kommission eng aus: Eine menschlich klingende Stimme macht die KI weniger offensichtlich (Rn. 41 ff.).
Abs. 2: maschinenlesbare Markierung der Stimme
Anbieter generativer KI-Systeme müssen erzeugte Inhalte maschinenlesbar markieren und einen Weg zur Erkennung bereitstellen (Rn. 69 f.), ausdrücklich auch Audio einschließlich Sprache (Rn. 60). Das reine Auswählen oder Anordnen vorhandener Inhalte fällt nicht darunter (Rn. 65), eine live erzeugte Stimme aber schon. Für Systeme, die vor dem 2. August 2026 in Verkehr gebracht wurden, gilt Abs. 2 nach dem KI-Omnibus, Verordnung (EU) 2026/1744, erst ab dem 2. Dezember 2026; für Abs. 1 gibt es diese Übergangsfrist nicht.
Wer einen fremden Sprachsynthese-Dienst unter eigener Marke einsetzt, darf sich laut Kommission auf dessen Markierung stützen, bleibt als Anbieter des Systems aber selbst verantwortlich (Rn. 74). Wer in dieser Konstellation Anbieter ist, beurteilen Fachbeiträge unterschiedlich; abschließend geklärt ist das nicht.
Für Echtzeit-Inhalte, die sofort konsumiert und weder gespeichert noch weitergegeben werden, kennen die Leitlinien eine Ausnahme (Rn. 88). Sie setzt voraus, dass eine Markierung technisch nicht machbar ist und die KI im Erlebnis offengelegt wird. Ob sie für eine Sprachausgabe gilt, die im Cache gespeichert und wiederverwendet wird, ist unsicher; wir halten das eher für ausgeschlossen.
Technische Wege beschreibt der freiwillige Verhaltenskodex der Kommission zur Markierung und Kennzeichnung KI-generierter Inhalte vom 10. Juni 2026 (Code of Practice). Laut Zusammenfassungen von Kanzleien sieht er mindestens zwei Techniken vor, etwa Metadaten nach C2PA (Content Credentials) und ein Wasserzeichen; für Audio nennt er Wasserzeichen oder hörbare Hinweise. Bei C2PA muss die Markierung der letzte Schritt vor dem Speichern sein, weil eine spätere Neukodierung das Manifest entfernt.
Für die Praxis empfehlen wir:
- einen sichtbaren Hinweis im Chatfenster vor der ersten Eingabe, einen kurzen gesprochenen Hinweis beim ersten Sprechen und Erinnerungen in langen Gesprächen;
- eine Regel im Prompt und einen Testfall dafür, dass der Chatbot auf Nachfrage offenlegt, dass er eine KI ist;
- eine maschinenlesbare Markierung jeder Audiodatei, bevor sie in den Cache geschrieben wird.
Wirkt die Stimme wie die eines realen Menschen, kann für den Betreiber zusätzlich die Deepfake-Pflicht nach Art. 50 Abs. 4 greifen, also die Offenlegung realistisch wirkender KI-Inhalte. Die Kommission legt „existierende Personen“ weit aus: Es genügt, dass eine Person plausibel existieren könnte, und auch realistische KI-generierte Personas und ihre Stimmen zählen dazu (Rn. 113). Eine Täuschungsabsicht ist nicht nötig (Rn. 114). Ahmt die Stimme eine reale Person nach, etwa aus der Geschäftsführung, liegt ein Deepfake besonders nahe. Keine Deepfakes sind laut Kommission etwa KI-Stimmen für Figuren in Hörbüchern, Spielen oder Animationen, sofern über die Identität der Sprecher nicht getäuscht wird. Wo die Grenze bei einer offen als KI gekennzeichneten Chatbot-Stimme verläuft, hängt vom Kontext ab und ist nicht abschließend geklärt.
Verstöße gegen Art. 50 sind nach Art. 99 Abs. 4 KI-VO bußgeldbewehrt; den Rahmen fasst der Artikel KI-Verordnung: Pflichten für Unternehmen zusammen.
Fazit
Ein Chatbot mit Sprachausgabe ist technisch ein Text-Chatbot mit zwei zusätzlichen Bausteinen, im Betrieb aber ein anderes System. Die Stimme bestimmt oft die laufenden Kosten; Hebel sind Sprachausgabe nur bei Zuhörern, Längengrenzen und ein Cache für ganze Antworttexte. Bei der Latenz zählen parallele Schritte, feste Budgets und ein Rückfall auf Aufnahme oder Text. Rechtlich sollten der Empfänger einer serverseitigen Spracherkennung in der Datenschutzerklärung stehen und ein KI-Hinweis, bei Sprache am besten gesprochen, samt maschinenlesbarer Markierung der erzeugten Audiodateien zum Konzept gehören.
Sie planen einen Chatbot, der Ihren Kunden auch per Stimme antwortet? Wie wir solche Anwendungen mit Text, Sprache und Video umsetzen, beschreibt die Seite KI-Chatbot für Website. Die Messwerte aus unserem eigenen Produkt fasst das Praxisbeispiel Videochat-Conversational-AI zusammen. Für ein erstes Gespräch über Ihren Anwendungsfall nehmen Sie Kontakt auf.
Passende Leistung
KI-Chatbot für Website und Kundenservice in München: Conversational AI mit Text, Sprache und Video
Ein KI-Chatbot für Website und Kundenservice, der aus Ihren freigegebenen Inhalten antwortet, an Ihr Serviceteam übergibt und wahlweise spricht oder per Video antwortet.
Zur Leistung KI-Chatbot für Website