Zum Inhalt springen

KI · Eigenes Produkt

Videochat-Conversational-AI mit über 60.000 Nutzern

Eigenes Produkt: ein Videochat, in dem ein LLM live antwortet und die Stimme live entsteht. Über 60.000 registrierte Nutzer, Antwort im Median unter 2 Sekunden.

Registrierte Nutzer (Oktober 2026)
60.000+
Videochat-Sitzungen in vier Wochen
rund 69.000
Antwortzeit im Chat (Median)
unter 2 s

Dieses Praxisbeispiel ist ein eigenes Produkt, das wir selbst entwickeln und betreiben. Den Produktnamen nennen wir hier nicht, weil es sich an Endkunden richtet. Die Zahlen stammen aus unserem eigenen Monitoring.

Smartphone auf einem Ständer mit Videoanruf eines virtuellen Gesprächspartners, daneben ein Laptop mit Antwortzeit-Diagramm und einem Graphen verbundener Videoclips

Wir entwickeln und betreiben eine eigene Conversational AI für Endkunden: einen Videochat, in dem man mit einem virtuellen Gesprächspartner per Text oder Sprache spricht. Ein Sprachmodell (Large Language Model, LLM) schreibt jede Antwort live, die Stimme wird live erzeugt, und das Video setzt sich in Echtzeit passend zum Gespräch zusammen. Stand Oktober 2026 hat das Produkt über 60.000 registrierte Nutzer; zuletzt kamen rund 10.000 pro Monat hinzu.

Ausgangslage

Ein Chatbot, der Text zurückgibt, ist schnell gebaut. Ein Gespräch, das sich wie ein Videoanruf anfühlt, stellt andere Anforderungen: Die Antwort muss in wenigen Sekunden stehen, die Stimme muss dazu passen, und das Bild darf nicht ruckeln oder einfrieren, während im Hintergrund mehrere KI-Dienste arbeiten. Gleichzeitig zahlen Endkunden nur für ein Produkt, das zuverlässig läuft, auf dem Smartphone funktioniert (rund drei von vier Sitzungen sind mobil) und dessen laufende Kosten pro Gespräch beherrschbar bleiben.

Aufgabe

  • Ein Gesprächserlebnis bauen, bei dem Text, Stimme und Video zusammenpassen und die erste Reaktion in wenigen Sekunden kommt.
  • Abhängigkeit von einzelnen KI-Anbietern begrenzen: Fällt ein Modell aus oder wird langsam, soll das Gespräch trotzdem weiterlaufen.
  • Kosten pro Antwort messen und senken, weil jede gesprochene Antwort Geld kostet.
  • Entscheidungen über Produktänderungen mit Daten treffen statt nach Gefühl.
  • Datenschutz und Verbraucherrecht von Anfang an mitbauen, nicht nachträglich.

Lösung

Gesprächskern mit Ausfallsicherung. Zwei LLM-Anbieter laufen parallel. Hat das Hauptmodell nach 2,5 Sekunden nicht geantwortet, startet eine Reserve beim jeweils anderen Anbieter, und die erste fertige Antwort gewinnt. Ein eigenes Moderationsmodell und eine zweite Sicherheitsprüfung kontrollieren Eingaben und Antworten, ein weiteres Modell bewertet die Antwortqualität.

Stimme mit Cache. Die Sprachsynthese ist laut unserer Kostenschätzung rund 90 Prozent der variablen Kosten. Bereits gesprochene Sätze landen deshalb in einem Cache und werden wiederverwendet, statt neu erzeugt zu werden. Spracheingabe läuft über die Spracherkennung des Browsers, ohne zusätzlichen Dienst.

Video in Echtzeit aus vorproduzierten Clips. Das Video wird nicht live von einer KI generiert. Es setzt sich aus vorproduzierten Clips zusammen, zwischen denen ein Clip-Graph nahtlose Übergänge kennt. Die Übergangspunkte berechnet eine eigene Pipeline aus der Bildähnlichkeit der Frames. Ausgeliefert wird per HLS-Streaming über ein CDN; die Auswahl des nächsten Clips dauert im Median rund 0,17 Sekunden.

Plattform. Frontend mit Vue 3 und Vite, vorgerendert für schnelle erste Ladezeit, in 29 Sprachen; neue Texte übersetzt ein LLM beim Deployment automatisch. Backend mit Node.js auf Google Cloud Functions hinter einem Load Balancer mit Web Application Firewall, Daten in Firestore, Medien in Cloud Storage und CDN. Abos und Guthaben laufen über zwei Zahlungsanbieter mit Ausweichweg. Eine Bild- und Videogenerierung auf Wunsch fällt bei Problemen auf einen Cache und einen zweiten Anbieter zurück.

Messen statt vermuten. Ein eigenes A/B-Test-System verteilt Nutzer per Hash auf Varianten und hat für jeden Test einen Notschalter; 29 Tests sind dokumentiert. Ein täglicher Funnel-Snapshot hält Besucher, Registrierungen, Gespräche und Antwortzeiten fest.

Datenschutz und Verbraucherrecht. Einwilligungsbanner, Verarbeitungsverzeichnis mit Vorabprüfung für die Spracheingabe, Kündigung ohne Login, Bestätigungsmail nach dem ersten Kauf und ein Widerrufsablauf.

Ergebnis

  • Über 60.000 registrierte Nutzer (Stand 6. Oktober 2026), im September 2026 rund 10.000 Neuregistrierungen.
  • Rund 69.000 Videochat-Sitzungen zwischen dem 8. September und dem 5. Oktober 2026.
  • Antwortzeit im Chat im Median 1,4 bis 2,0 Sekunden, 95 Prozent der Antworten in 3,6 bis 6,5 Sekunden (Tageswerte September/Oktober 2026).
  • Ein A/B-Test, der den Videoclip enger an die Bitte des Nutzers koppelt, hob den Anteil passender Clips von 64,0 auf 72,1 Prozent (+8,1 Prozentpunkte, 95-Prozent-Konfidenzintervall +3,7 bis +12,4).
  • Die Bild- und Videogenerierung lief nach einem Release Ende September in 508 Durchläufen ohne Ausfall; 40 Prozent der Ergebnisse kamen aus dem Cache.

Erkenntnisse aus dem Projekt

  • Ausfallsicherung schlägt das beste Einzelmodell. Ein zweiter Anbieter mit klarer Zeitgrenze hält die Antwortzeit stabiler als jede Feinabstimmung eines einzelnen Modells.
  • Die teuerste Komponente ist selten das LLM. Bei gesprochenen Antworten dominiert die Stimme die Kosten; ein Cache bringt dort mehr als ein günstigeres Sprachmodell.
  • Nicht alles muss generativ sein. Vorproduzierte Clips mit einem guten Übergangsgraphen liefern ein flüssiges Bild zu einem Bruchteil der Kosten und Latenz einer Live-Generierung.
  • Viele Ideen wirken nicht. Mehrere Tests zeigten keinen messbaren Unterschied, etwa ein anderes Layout des Registrierungsformulars (41,6 gegenüber 41,5 Prozent). Ohne Tests wären sie trotzdem gebaut und behalten worden.
  • KI-gestützte Entwicklung trägt ein ganzes Produkt. Einen großen Teil des Codes schreiben wir mit Claude Code, allein seit September 2026 über 1.000 Commits, mit denselben Tests und Reviews wie bei handgeschriebenem Code.

Übertragbar auf Ihr Vorhaben

Ob Kundenservice-Assistent, Sprachschnittstelle für eine Fachanwendung oder interaktive Produktberatung: Die Bausteine sind dieselben. Ein LLM mit Ausweichanbieter und Zeitgrenze, Moderation, ein Cache für teure Ausgaben, Messung von Antwortzeit und Qualität ab dem ersten Tag und Experimente, die zeigen, was wirklich wirkt. Wie wir solche Systeme für Unternehmen umsetzen, beschreibt die Leistung KI-Entwicklung; wie wir KI-gestützt entwickeln, steht unter Softwareentwicklung mit KI.

Aufgeschrieben vom Gründer von Amperbyte AI.

Passende Leistungen

Passende Leistungen

KI-Entwicklung

LLM-Funktionen in bestehenden Anwendungen, KI-Agenten für mehrstufige Abläufe und ML-Features, die im Betrieb mit Kennzahlen gemessen werden.

KI-Chatbot & RAG

Ein interner Wissensassistent, der Fragen aus Ihren eigenen Dokumenten beantwortet, jede Antwort mit Quelle belegt und nur zeigt, was der Nutzer sehen darf.

KI-Beratung

KI-Potenzialanalyse im Workshop, Build-vs-Buy-Entscheidung und ein Pilotplan mit Messgrößen. Herstellerunabhängig, aus Olching bei München.

Ähnliches Vorhaben geplant?

Wir übertragen die Erfahrung aus diesem Projekt auf Ihre Situation. Das Erstgespräch ist kostenlos.