Zum Inhalt springen

KI · 11 Min. Lesezeit

Chatbot mit Sprachausgabe: Latenz, Kosten und Datenschutz

Chatbot mit Sprachausgabe: warum die Stimme die laufenden Kosten dominiert, wie Sie die Latenz begrenzen und was DSGVO und KI-VO bei Sprache verlangen.

Von Amperbyte AI, geschrieben von unserem Gründer ·

Symbolbild: Smartphone mit großer Audiowellenform und runder Mikrofon-Taste auf einem Schreibtisch, daneben kabellose Ohrhörer und ein Laptop mit Audio-Zeitleiste und einfachem Kostendiagramm

Ein Chatbot mit Sprachausgabe beantwortet Fragen nicht nur als Text, sondern spricht die Antwort mit einer synthetischen Stimme. Dafür kommen zum Sprachmodell zwei Bausteine hinzu: die Spracherkennung für gesprochene Eingaben und die Sprachsynthese (Text-to-Speech, TTS) für die Ausgabe. Beide verändern drei Dinge, die bei einem reinen Text-Chatbot kaum auffallen: die Wartezeit, die laufenden Kosten und den Datenschutz. In unserem eigenen Produkt macht die Stimme laut unserer Kostenschätzung vom 17.09.2026 rund 90 Prozent der variablen Kosten einer gesprochenen Antwort aus.

Die Messwerte stammen aus unserer eigenen Videochat-Conversational-AI, einer KI-Chatbot- und Videochat-Anwendung für Endkunden, die wir selbst entwickeln und betreiben. Den Produktnamen nennen wir hier nicht, weil es sich an Endkunden richtet. Vom 8. September bis 5. Oktober 2026 liefen dort rund 69.000 Videochat-Sitzungen. Sprache heißt in diesem Artikel: Ein- und Ausgabe im Browser oder in der App, nicht am Telefon.

Rechtsstand: 7. Oktober 2026

Dieser Artikel ist allgemeine Information und keine Rechtsberatung. Wir sind ein Software- und KI-Dienstleister, keine Kanzlei. Ob eine Pflicht in Ihrem konkreten Fall greift, erfordert eine rechtliche Prüfung des Einzelfalls im Sinne von § 2 Abs. 1 Rechtsdienstleistungsgesetz; dafür sind Ihr Datenschutzbeauftragter, Ihre Rechtsabteilung oder eine Kanzlei zuständig.

Chatbot, Voicebot, Telefonassistent: die Unterschiede

Ein Voicebot ist ein KI-System, mit dem man überwiegend per Sprache kommuniziert. Ein Chatbot mit Sprachausgabe bleibt dagegen ein Chat: Die Antwort steht als Text auf dem Bildschirm, die Stimme kommt hinzu, und Nutzer wählen, ob sie tippen oder sprechen. Ein Telefonassistent ist ein Voicebot hinter einer Rufnummer.

BauartKanalEingabeAusgabeWas zusätzlich zählt
Text-ChatbotWebsite, AppTastaturTextAntwortzeit und Antwortqualität
Chatbot mit SprachausgabeBrowser, AppTastatur oder MikrofonText und StimmeZeit bis zum Sprechbeginn, Kosten der Stimme, Datenschutz
VoicebotBrowser, AppMikrofonStimme, Text höchstens ergänzendErkennung bei Störgeräuschen, gesprochener KI-Hinweis
TelefonassistentTelefonnetz (Rufnummer, SIP)Sprache am TelefonStimmeTelefonanbindung, Unterbrechen während der Ausgabe, kein Bildschirm

Ein Telefonassistent braucht eine Anbindung ans Telefonnetz, meist über SIP (Session Initiation Protocol), und Anrufer erwarten, ihn jederzeit unterbrechen zu können (Barge-in). Telefonie behandelt dieser Artikel nicht.

Ob Sprache Ihren Kunden nützt, sollten Sie messen. In unserem Produkt hatte die Spracheingabe in einem A/B-Test, also einem Vergleich zufällig zugeteilter Nutzergruppen, keinen messbaren Effekt auf die Zielkennzahl (rund 5.000 Nutzer je Gruppe, 12. August bis 15. September 2026).

Die Bausteine eines Chatbots mit Sprachausgabe

  1. Spracheingabe. Die Spracherkennung (Speech-to-Text) wandelt Gesprochenes in Text um, im Browser etwa über die Web Speech API, eine Programmierschnittstelle des Browsers.
  2. Sprachmodell. Ein Sprachmodell (Large Language Model, LLM) schreibt die Antwort, meist mit automatischer Prüfung von Eingabe und Antwort.
  3. Sprachsynthese. Ein TTS-Dienst erzeugt aus dem Antworttext Audio mit einer festgelegten Stimme.
  4. Wiedergabe. Die Anwendung spielt das Audio ab und zeigt den Text an.

In unserem Produkt kommt ein Video hinzu. Es wird nicht live von einer KI generiert, sondern in Echtzeit aus vorproduzierten Clips zusammengesetzt. Für eine gesprochene Antwort wählt das System einen vorproduzierten Sprech-Clip, dessen Länge zur Zeichenzahl der Antwort passt. Mehr dazu im Artikel Chatbot mit Avatar.

Latenzbudget: wie lange eine gesprochene Antwort dauern darf

Latenz ist die Wartezeit zwischen der Nachricht des Nutzers und der Reaktion des Systems. Beim Chatbot mit Sprachausgabe zählt der Sprechbeginn. Ein Latenzbudget gibt jedem Schritt eine Zeitgrenze und einen Rückfall für den Fall, dass sie abläuft.

Parallel statt nacheinander

Ein wirksamer Hebel ist die Reihenfolge. In unserem Produkt läuft die Prüfung der Eingabe gleichzeitig mit der Antwortgenerierung, mit einer Zeitgrenze von 2,5 Sekunden je Versuch und 3,5 Sekunden insgesamt bei höchstens zwei Versuchen. Sobald der Antworttext steht, startet die Sprachsynthese parallel zur Auswahl des passenden Clips und wird erst danach abgewartet.

Wie eine Reserve beim zweiten LLM-Anbieter die Antwortzeit des Sprachmodells stabil hält und welche Werte wir dabei messen, zeigt der Artikel LLM-Fallback: Ausfallsicherheit und Antwortzeit.

Messwerte und Rückfälle für die Stimme

Eine neue Sprachausgabe braucht bei uns meist 0,2 bis 0,5 Sekunden. Der gesamte Sprachschritt lag vom 25. September bis 2. Oktober 2026 im 99,9. Perzentil bei 1,3 Sekunden. Seit dem 2. Oktober 2026 begrenzt ihn ein Budget von 5 Sekunden. Läuft es ab, kommt eine gespeicherte Aufnahme desselben Texts oder die Antwort ohne Stimme.

Die Stimme wartet auf das Bild des Sprungs zum Sprech-Clip. Der Text erscheint spätestens nach 3 Sekunden, die Antwort bleibt also immer lesbar. Das hilft auch bei der Barrierefreiheit, die das BFSG seit dem 28. Juni 2025 für bestimmte Online-Dienste verlangt (Barrierefreie Website: Wen das BFSG trifft).

Warum die Stimme die laufenden Kosten dominiert

Bei einem Text-Chatbot ist meist das Sprachmodell der größte variable Kostenblock. Mit Sprachausgabe kehrt sich das häufig um; wie stark, hängt von Stimme, Sprachmodell und Listenpreisen ab. Laut unserer Kostenschätzung vom 17.09.2026, gerechnet mit den Listenpreisen der Anbieter, macht die Sprachsynthese rund 90 Prozent der variablen Kosten einer gesprochenen Videochat-Antwort aus. Das ist etwa das Zehnfache der LLM-Antwort.

Der Grund liegt im Preis pro Einheit. Sprachmodelle werden nach Tokens abgerechnet, also nach Textbausteinen; unsere Prompts haben 3.000 bis 4.000 Tokens, die Antwort höchstens 160. Sprachsynthese wird in der Regel nach Zeichen oder Audiodauer abgerechnet, und ein vertontes Zeichen kostet nach den Listenpreisen unserer Schätzung ein Vielfaches eines Tokens. Jede neu erzeugte Aufnahme wird nach ihrer Länge berechnet, bei uns für höchstens 500 Zeichen je Antwort. Das Video kostet nur Bandbreite im CDN (Content Delivery Network, ein verteiltes Auslieferungsnetz), weil es aus vorproduzierten Clips besteht. Selbst die Reserve beim zweiten LLM-Anbieter, durch die jede Anfrage zwei LLM-Aufrufe erzeugt, bleibt dagegen klein.

Rechnen Sie deshalb mit Kosten pro gesprochener Antwort und schätzen Sie, welcher Anteil der Antworten tatsächlich gesprochen wird. Warum unbekannte Kosten pro Antwort viele KI-Vorhaben aufhalten, beschreibt der Artikel Vom Pilot in die Produktion.

Hebel: wie Sie die Kosten der Stimme senken

Diese fünf Hebel nutzen wir in unserem eigenen Produkt:

HebelWas er bewirktWas Nutzer merken
Keine Stimme ohne ZuhörerKeine Sprachsynthese bei stummem Video oder gesperrter bzw. auffälliger AntwortBei stummem Video nichts, der Ton ist ohnehin aus
Stummer StartStumm gestartete Sitzungen erzeugen keine SprachsyntheseIm A/B-Test kein Unterschied bei der Aktivierung
LängengrenzenAntwort höchstens 120 Tokens, Sprachausgabe nur bis 500 ZeichenKürzere Antworten
Cache für ganze AntworttexteHöchstens drei neue Aufnahmen pro Text, danach WiederverwendungWiederholungen klingen nicht identisch
Schnelleres Sprachsynthese-ModellDeutlich geringere KostenKürzere Erzeugungszeit

Stummer Start. Ob Sitzungen mit Ton starten sollen, haben wir vom 10. bis 29. September 2026 per A/B-Test geprüft. Das Ergebnis war unentschieden: 79,3 gegenüber 79,4 Prozent Aktivierung. Gewählt haben wir den stummen Autostart, auch aus Kostengründen.

Längengrenzen. Die Antwortlänge ist auf 120 Tokens begrenzt, im strukturierten Modus mit festem JSON-Schema auf 160. Im April 2026 haben wir die Grenze von 200 auf 120 Tokens gesenkt.

Cache für ganze Antworttexte. Ein Cache speichert erzeugte Ergebnisse zur Wiederverwendung. Unserer arbeitet je Stimme, Sprache und exaktem Antworttext. Pro Text entstehen bis zu drei Aufnahmen, danach wird zufällig eine davon wiederverwendet. Was das spart, hängt davon ab, wie oft Antworttexte wortgleich wiederkehren. Zugleich ist der Cache eine Ausfallsicherung: Schlägt die Sprachsynthese fehl, etwa mit Statuscode 429 (zu viele Anfragen) oder einem Serverfehler, spielt das System eine vorhandene Aufnahme desselben Texts statt Stille.

Schnelleres Modell. Ein früherer Wechsel auf ein schnelleres Sprachsynthese-Modell hat bei uns die Erzeugungszeit und die Kosten deutlich gesenkt. Prüfen Sie vor einem Wechsel den Klang mit echten Antworten in allen angebotenen Sprachen.

Gleichbleibender Klang über das ganze Gespräch

Eine synthetische Stimme klingt nicht bei jeder Erzeugung gleich; Betonung und Tempo können zwischen zwei Antworten schwanken. Wir richten deshalb jede neue Sprachausgabe am Klang einiger kurz zuvor erzeugter Aufnahmen derselben Stimme aus. Außerdem geben wir die Sprache je Chat fest vor. Sonst kann der TTS-Dienst die Sprache bei kurzen Sätzen falsch erkennen und sie mit fremder Aussprache vorlesen.

Spracheingabe und DSGVO

Sprachaufnahmen sind personenbezogene Daten. Der Europäische Datenschutzausschuss (EDPB) sieht Sprachdaten in seinen Leitlinien 02/2021 zu virtuellen Sprachassistenten (Version 2.0, 7. Juli 2021) als von Natur aus biometrisch an (Rn. 31). Zu den besonders geschützten Daten nach Art. 9 Abs. 1 DSGVO gehören sie aber erst, wenn sie zur eindeutigen Identifizierung einer Person verarbeitet werden (zur Definition Art. 4 Nr. 14 DSGVO). Ein Chatbot, der nur verstehen soll, was gesagt wird, tut das in der Regel nicht. Unabhängig davon kann der Inhalt des Gesagten besondere Kategorien berühren, etwa Angaben zur Gesundheit.

Wohin das Audio geht

Die Web Speech API erspart einen eigenen Erkennungsdienst, das Audio bleibt deshalb aber nicht auf dem Gerät. Laut MDN zur Web Speech API läuft die Erkennung standardmäßig serverseitig, je nach Browser also in der Cloud des Browser-Anbieters. Mit der Option processLocally ist Erkennung auf dem Gerät möglich. Die Datenschutzerklärung sollte den Empfänger deshalb nennen, oder die Erkennung läuft lokal.

In unserem Produkt erhält der Server nur den erkannten Text. Das Mikrofon schaltet sich nach 120 Sekunden ohne Sprache ab, im Sinne der Datenminimierung. Vor dem Start der Spracheingabe entstanden eine Schwellwertanalyse zur Datenschutz-Folgenabschätzung, also die dokumentierte Prüfung, ob eine vollständige Folgenabschätzung nötig ist, und ein Eintrag im Verarbeitungsverzeichnis (Stand 7. August 2026).

Für Sprachassistenten hält der EDPB eine Datenschutz-Folgenabschätzung für sehr wahrscheinlich erforderlich, etwa wegen neuer Technologie und möglicher Überwachung (Rn. 141). Ein Chatbot, der das Mikrofon nur auf Klick öffnet, unterscheidet sich davon; ob eine Folgenabschätzung nötig ist, klärt die Schwellwertanalyse. Außerdem sollen Anbieter Techniken erwägen, die Hintergrundstimmen und unnötige Daten herausfiltern (Rn. 139), und Betroffene sollen ihre Rechte auch per Sprache ausüben können.

Der Sprachsynthese-Dienst erhält personenbezogene Daten, sobald der Antworttext welche enthält, und gehört dann in der Regel in Auftragsverarbeitungsvertrag und Verarbeitungsverzeichnis. Verträge und Löschfristen für die Text-Seite beschreibt der Artikel DSGVO-konforme LLM-Integration.

Mikrofonzugriff und § 25 TDDDG

§ 25 TDDDG verlangt eine Einwilligung für das Speichern und Auslesen von Informationen auf dem Endgerät, außer es ist für einen ausdrücklich gewünschten Dienst unbedingt erforderlich. Ob schon der Mikrofonzugriff im Browser darunter fällt, ist nicht abschließend geklärt. Praktisch hilft ein eigener Hinweis vor dem Berechtigungsdialog des Browsers: wofür das Mikrofon genutzt wird, wohin das Audio geht und wie man es abschaltet.

KI-Kennzeichnung bei Sprache nach Art. 50 KI-VO

Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung (EU) 2024/1689 (KI-VO). Die Leitlinien der EU-Kommission zu Art. 50 vom 20. Juli 2026, Dokument C(2026) 5054 final, sind nicht bindend, zeigen aber, wie die Kommission die Pflichten liest. Fundstellen nennen wir als Randnummer (Rn.).

Abs. 1: Hinweis, dass eine KI spricht

Anbieter von Systemen, die direkt mit Menschen kommunizieren, müssen darauf hinweisen, dass eine KI spricht, sofern das nicht offensichtlich ist. Sprachassistenten und Chatbots im Kundenservice nennt die Kommission ausdrücklich (Rn. 31). Bei Sprache nennt sie als geeignete Technik einen gesprochenen Hinweis zu Beginn, in längeren Gesprächen bei Bedarf ergänzt durch Erinnerungen; Signaltöne allein hält sie nicht für ausreichend (Rn. 37). Hinweise nur in AGB oder Metadaten, ein generisches „Assistent“ oder „Diese Website nutzt KI“ genügen nicht (Rn. 38). Ein einzelner, gut sichtbarer Hinweis vor der ersten Interaktion reicht laut Kommission meist, in riskanteren Kontexten sind Erinnerungen wahrscheinlich nötig. Auf Nachfrage muss das System offenlegen, dass es eine KI ist (beides Rn. 40). Die Ausnahme „offensichtlich“ legt die Kommission eng aus: Eine menschlich klingende Stimme macht die KI weniger offensichtlich (Rn. 41 ff.).

Abs. 2: maschinenlesbare Markierung der Stimme

Anbieter generativer KI-Systeme müssen erzeugte Inhalte maschinenlesbar markieren und einen Weg zur Erkennung bereitstellen (Rn. 69 f.), ausdrücklich auch Audio einschließlich Sprache (Rn. 60). Das reine Auswählen oder Anordnen vorhandener Inhalte fällt nicht darunter (Rn. 65), eine live erzeugte Stimme aber schon. Für Systeme, die vor dem 2. August 2026 in Verkehr gebracht wurden, gilt Abs. 2 nach dem KI-Omnibus, Verordnung (EU) 2026/1744, erst ab dem 2. Dezember 2026; für Abs. 1 gibt es diese Übergangsfrist nicht.

Wer einen fremden Sprachsynthese-Dienst unter eigener Marke einsetzt, darf sich laut Kommission auf dessen Markierung stützen, bleibt als Anbieter des Systems aber selbst verantwortlich (Rn. 74). Wer in dieser Konstellation Anbieter ist, beurteilen Fachbeiträge unterschiedlich; abschließend geklärt ist das nicht.

Für Echtzeit-Inhalte, die sofort konsumiert und weder gespeichert noch weitergegeben werden, kennen die Leitlinien eine Ausnahme (Rn. 88). Sie setzt voraus, dass eine Markierung technisch nicht machbar ist und die KI im Erlebnis offengelegt wird. Ob sie für eine Sprachausgabe gilt, die im Cache gespeichert und wiederverwendet wird, ist unsicher; wir halten das eher für ausgeschlossen.

Technische Wege beschreibt der freiwillige Verhaltenskodex der Kommission zur Markierung und Kennzeichnung KI-generierter Inhalte vom 10. Juni 2026 (Code of Practice). Laut Zusammenfassungen von Kanzleien sieht er mindestens zwei Techniken vor, etwa Metadaten nach C2PA (Content Credentials) und ein Wasserzeichen; für Audio nennt er Wasserzeichen oder hörbare Hinweise. Bei C2PA muss die Markierung der letzte Schritt vor dem Speichern sein, weil eine spätere Neukodierung das Manifest entfernt.

Für die Praxis empfehlen wir:

  1. einen sichtbaren Hinweis im Chatfenster vor der ersten Eingabe, einen kurzen gesprochenen Hinweis beim ersten Sprechen und Erinnerungen in langen Gesprächen;
  2. eine Regel im Prompt und einen Testfall dafür, dass der Chatbot auf Nachfrage offenlegt, dass er eine KI ist;
  3. eine maschinenlesbare Markierung jeder Audiodatei, bevor sie in den Cache geschrieben wird.

Wirkt die Stimme wie die eines realen Menschen, kann für den Betreiber zusätzlich die Deepfake-Pflicht nach Art. 50 Abs. 4 greifen, also die Offenlegung realistisch wirkender KI-Inhalte. Die Kommission legt „existierende Personen“ weit aus: Es genügt, dass eine Person plausibel existieren könnte, und auch realistische KI-generierte Personas und ihre Stimmen zählen dazu (Rn. 113). Eine Täuschungsabsicht ist nicht nötig (Rn. 114). Ahmt die Stimme eine reale Person nach, etwa aus der Geschäftsführung, liegt ein Deepfake besonders nahe. Keine Deepfakes sind laut Kommission etwa KI-Stimmen für Figuren in Hörbüchern, Spielen oder Animationen, sofern über die Identität der Sprecher nicht getäuscht wird. Wo die Grenze bei einer offen als KI gekennzeichneten Chatbot-Stimme verläuft, hängt vom Kontext ab und ist nicht abschließend geklärt.

Verstöße gegen Art. 50 sind nach Art. 99 Abs. 4 KI-VO bußgeldbewehrt; den Rahmen fasst der Artikel KI-Verordnung: Pflichten für Unternehmen zusammen.

Fazit

Ein Chatbot mit Sprachausgabe ist technisch ein Text-Chatbot mit zwei zusätzlichen Bausteinen, im Betrieb aber ein anderes System. Die Stimme bestimmt oft die laufenden Kosten; Hebel sind Sprachausgabe nur bei Zuhörern, Längengrenzen und ein Cache für ganze Antworttexte. Bei der Latenz zählen parallele Schritte, feste Budgets und ein Rückfall auf Aufnahme oder Text. Rechtlich sollten der Empfänger einer serverseitigen Spracherkennung in der Datenschutzerklärung stehen und ein KI-Hinweis, bei Sprache am besten gesprochen, samt maschinenlesbarer Markierung der erzeugten Audiodateien zum Konzept gehören.

Sie planen einen Chatbot, der Ihren Kunden auch per Stimme antwortet? Wie wir solche Anwendungen mit Text, Sprache und Video umsetzen, beschreibt die Seite KI-Chatbot für Website. Die Messwerte aus unserem eigenen Produkt fasst das Praxisbeispiel Videochat-Conversational-AI zusammen. Für ein erstes Gespräch über Ihren Anwendungsfall nehmen Sie Kontakt auf.

Passende Leistung

KI-Chatbot für Website und Kundenservice in München: Conversational AI mit Text, Sprache und Video

Ein KI-Chatbot für Website und Kundenservice, der aus Ihren freigegebenen Inhalten antwortet, an Ihr Serviceteam übergibt und wahlweise spricht oder per Video antwortet.

Zur Leistung KI-Chatbot für Website

Häufige Fragen

Häufige Fragen zum Thema

Voicebot oder Chatbot: Was passt für den Kundenservice?

Das hängt vom Kanal und von Ihren Kunden ab. Auf der Website ist ein Text-Chatbot meist der Ausgangspunkt, weil er günstiger ist und Antworten lesbar bleiben. Eine Sprachausgabe lohnt sich, wenn Nutzer unterwegs sind, die Hände nicht frei haben oder lieber hören als lesen. Sie erhöht aber die laufenden Kosten deutlich, weil die Stimme oft den größten Teil der variablen Kosten einer gesprochenen Antwort ausmacht. Prüfen Sie den Nutzen mit einem Test an echten Kunden, bevor Sie Sprache für alle einschalten. Ein Telefonbot ist ein eigenes Vorhaben mit anderen Anforderungen.

Ist ein Voicebot DSGVO-konform umsetzbar?

Ja, wenn Datenflüsse, Verträge und Hinweise stimmen. Klären Sie zuerst, wo die Spracherkennung läuft: Bei der Spracherkennung im Browser geht das Audio standardmäßig an einen Dienst des Browser-Anbieters, auf dem Gerät bleibt es nur mit lokaler Erkennung. Der Dienst für die Sprachsynthese erhält den Antworttext und gehört in der Regel in Auftragsverarbeitungsvertrag und Verarbeitungsverzeichnis. Schalten Sie das Mikrofon nur auf Klick ein und nach einer Pause automatisch ab, und dokumentieren Sie, ob eine Datenschutz-Folgenabschätzung nötig ist. Rechtsstand 7. Oktober 2026, keine Rechtsberatung.

Muss eine KI-Stimme gekennzeichnet werden, wenn sie erkennbar künstlich klingt?

Davon sollten Sie ausgehen. Art. 50 Abs. 1 KI-VO verlangt einen Hinweis, sofern die KI nicht offensichtlich ist, und die EU-Kommission legt diese Ausnahme in ihren Leitlinien eng aus. Bei Sprache empfiehlt sie einen gesprochenen Hinweis zu Beginn; Signaltöne allein hält sie nicht für ausreichend. Unabhängig davon muss der Anbieter des Systems erzeugte Audioinhalte nach Abs. 2 maschinenlesbar markieren, bei Systemen, die vor dem 2. August 2026 in Verkehr gebracht wurden, ab dem 2. Dezember 2026. Ein kurzer Satz zu Beginn des Gesprächs kostet wenig und erspart die Diskussion, ob die KI offensichtlich war. Rechtsstand 7. Oktober 2026, keine Rechtsberatung.

Unterstützen alle Browser die Spracheingabe über die Web Speech API?

Nicht einheitlich. Spracherkennung und Sprachausgabe der Web Speech API sind in den Browsern unterschiedlich weit umgesetzt, und auch Optionen wie die Erkennung auf dem Gerät hängen vom Browser ab. Prüfen Sie die Kompatibilitätsangaben bei MDN für die Browser Ihrer Zielgruppe und testen Sie auf echten Smartphones, nicht nur am Desktop. Planen Sie die Texteingabe immer als gleichwertigen Weg ein, damit der Chatbot auch ohne Mikrofon oder Spracherkennung funktioniert.

Sie planen etwas in diese Richtung?

Im Erstgespräch übertragen wir die Erfahrung aus dem Artikel auf Ihre Situation. Kostenlos und unverbindlich.