KI · 11 Min. Lesezeit
Chatbot mit Avatar: Video live generieren oder aus Clips?
Chatbot mit Avatar: live generiertes Video, vorab gerenderte Antworten oder Clips in Echtzeit? Latenz, Kosten und Kennzeichnung nach Art. 50 im Vergleich.
Von Amperbyte AI, geschrieben von unserem Gründer ·

Ein Chatbot mit Avatar beantwortet Fragen nicht nur als Text, sondern über eine sichtbare Figur, die meist auch spricht. Technisch gibt es drei Bauarten: live von einer KI erzeugtes Video, vorab gerenderte Antwortvideos und Video, das sich in Echtzeit aus vorproduzierten Clips zusammensetzt. Sie unterscheiden sich in Antwortzeit, laufenden Kosten, Kontrolle über das Bild und Kennzeichnungspflicht.
Grundlage sind die Leitlinien der EU-Kommission zu Art. 50 der KI-Verordnung und unsere eigene Videochat-Conversational-AI für Endkunden, die wir selbst entwickeln und betreiben. Den Produktnamen nennen wir hier nicht, weil es sich an Endkunden richtet. Stand Oktober 2026 hat sie über 60.000 registrierte Nutzer; vom 8. September bis 5. Oktober 2026 liefen rund 69.000 Videochat-Sitzungen. Zahlen zum eigenen Produkt stammen, wo nicht anders angegeben, aus unserem eigenen Monitoring.
Rechtsstand: 7. Oktober 2026
Dieser Artikel ist allgemeine Information und keine Rechtsberatung. Wir sind ein Software- und KI-Dienstleister, keine Kanzlei. Die zitierten Leitlinien der Kommission sind nicht bindend. Ob und wie Ihr Avatar zu kennzeichnen ist, klärt eine Prüfung Ihres Einzelfalls durch Ihre Rechtsabteilung oder eine Kanzlei.
Was ein Chatbot mit Avatar ist
Ein Chatbot mit Avatar, auch Video-Chatbot oder interaktiver KI-Avatar genannt, verbindet drei Schichten. Ein Sprachmodell (LLM, Large Language Model) formuliert die Antwort. Eine Sprachsynthese (Text-to-Speech) spricht sie. Ein Videobild zeigt eine Figur, die auf das Gespräch reagiert. Der Oberbegriff ist Conversational AI: Software, die per Text, Sprache oder Video ein Gespräch führt.
Wo ein KI-Avatar im Unternehmen passt
- Kundenservice: wiederkehrende Fragen zu Lieferung, Rückgabe oder Bedienung
- Produktberatung: Bedarf erfragen und Varianten erklären
- Schulung: Lerneinheiten, in denen Mitarbeitende Rückfragen stellen können
- Empfang: Besucher auf der Website oder am Bildschirm im Foyer begrüßen und weiterleiten
Ein Avatar ersetzt keine gute Wissensbasis. Ob ein Assistent richtig antwortet, entscheidet die Quelle, etwa Retrieval-Augmented Generation (RAG) aus freigegebenen Inhalten; mehr dazu unter RAG oder Fine-Tuning.
Drei Bauarten im Vergleich
Live generiertes Video (Avatar-Plattform). Ein Videomodell erzeugt das Bild während des Gesprächs passend zur Stimme, meist als Dienst spezialisierter Plattformen. Jedes Bild ist neu und vorab ungeprüft.
Vorab gerenderte Antworten. Für einen festen Fragenkatalog entsteht vorab je ein Antwortvideo, das der Chatbot über ein CDN (Content Delivery Network, ein Netz verteilter Server nah am Nutzer) abspielt.
Echtzeit aus vorproduzierten Clips. Text und Stimme entstehen live, das Bild setzt sich aus einer Clip-Bibliothek zusammen. Diese Bauart nutzen wir im eigenen Produkt.
| Kriterium | Live generiertes Video | Vorab gerenderte Antworten | Echtzeit aus vorproduzierten Clips |
|---|---|---|---|
| Latenz des Videos | höher, das Videomodell rechnet zusätzlich zu Text und Stimme | niedrig, eine fertige Datei wird abgespielt | niedrig, kein Videomodell im Gespräch; der Server plant den nächsten Sprung im Median in unter 0,2 Sekunden |
| Laufende Kosten | steigen mit jeder Gesprächsminute | gering, vor allem CDN; Aufwand je neuer Antwort | Video nur CDN-Bandbreite, die Stimme dominiert |
| Kontrolle über das Bild | eingeschränkt, Bildfehler nicht vorab prüfbar | vollständig, jedes Video vorab freigegeben | hoch, nur freigegebene Clips und geprüfte Übergänge |
| Flexibilität | hoch, Mundbewegung lautgenau möglich | gering, nur vorbereitete Antworten | Text und Stimme frei, Bild auf die Clips begrenzt, Mundbewegung nicht lautgenau |
| Kennzeichnung | Abs. 1; Abs. 2 für Bild und Ton; Abs. 4 bei realistischem Menschen | Abs. 1; Abs. 2 und 4 je nach Entstehung der Videos | Abs. 1; Abs. 2 für Text und Stimme, für die Clips je nach Entstehung; Abs. 4 je nach Material |
Werte rechts aus unserem eigenen Produkt: Sprungplanung serverseitig, Tagesmediane vom 9. September bis 6. Oktober 2026 (10-Prozent-Stichprobe); Kosten laut unserer Kostenschätzung vom 17.09.2026. Kennzeichnung: Absätze von Art. 50 KI-VO, als Orientierung.
Was ein KI-Avatar kostet: die Kostentreiber
Feste Preise nennen wir nicht, sie hängen von Umfang, Gesprächsvolumen und Anbietern ab. Einmalig fallen Gesprächskonzept, Produktion der Videos oder Clips, Integration und Test-Set an, später deren Pflege. Laufend kosten Sprachmodell und Stimme, bei live generiertem Video zusätzlich die Bildberechnung.
Laut unserer Kostenschätzung vom 17.09.2026 (Listenpreise der Anbieter) macht die Sprachausgabe rund 90 Prozent der variablen Kosten einer gesprochenen Videochat-Antwort aus, etwa das Zehnfache der LLM-Antwort. Der größte Hebel liegt also bei der Stimme, wie der Artikel Chatbot mit Sprachausgabe zeigt.
Echtzeit aus vorproduzierten Clips: der Clip-Graph
Das Video wird nicht live von einer KI generiert. Es setzt sich in Echtzeit aus vorproduzierten Clips zusammen, zwischen denen ein Clip-Graph nahtlose Übergänge kennt: ein Netz aus Clips und den Stellen, an denen ein Sprung in einen anderen Clip nicht auffällt. Ausgeliefert wird per HLS-Streaming (HTTP Live Streaming, also in kurzen Segmenten) über ein CDN.
Wie die Übergangspunkte entstehen
Eine eigene Python-Pipeline vergleicht Einzelbilder über den Structural Similarity Index (SSIM), ein Maß für die Ähnlichkeit zweier Bilder in Helligkeit, Kontrast und Struktur. Sie rechnet mit reduzierter Auflösung (250 Pixel Höhe) und in drei Durchgängen von grob nach fein. Ein Sprung gilt ab einem SSIM von 0,65 als brauchbar.
Sind zwei Bilder ähnlich, aber nicht identisch (SSIM bis etwa 0,74), berechnet ein Frame-Interpolationsmodell vorab fünf Zwischenbilder. Diese Übergänge entstehen offline in der Produktion, nicht live im Gespräch.
Zwischen zwei Sprüngen liegen mindestens 300 Millisekunden, bis zum nächsten möglichen Sprung höchstens 6 Sekunden. Pipeline und Programmierschnittstelle (API) nutzen dieselben Grenzen, damit die API keine ungeprüften Übergänge plant.
Stimme, Text und Bild synchron halten
Die Sprachausgabe startet parallel zur Clip-Auswahl und wird erst danach abgewartet. Für eine gesprochene Antwort wählt das System einen vorproduzierten Sprech-Clip, dessen Länge zur Zeichenzahl der Antwort passt. Die Stimme wartet auf das Bild des Sprungs, der Text erscheint spätestens nach 3 Sekunden.
Ehrlich dazu: Lautgenaue Lippensynchronität entsteht so nicht, denn der Sprech-Clip passt zur Länge der Antwort, nicht zu jedem Laut. Vorab gerenderte Antworten sind lippensynchron, aber auf den Fragenkatalog begrenzt. Wer lautgenaue Lippenbewegungen bei frei formulierten Antworten braucht, landet meist bei live generiertem Video, mit dessen Kosten und Latenz.
Die Player-Uhr. Wie heikel das Timing ist, zeigte ein Fehler: Unser Player löste jeden Sprung 1,48 Sekunden zu früh aus, auf iPhones landeten Sprünge 1,6 statt 0,2 Sekunden im Clip. Seit dem 29. September 2026 rechnet eine neue Uhr mit der Inhaltszeit, also der Position im Video.
Antwort und Bild müssen zusammenpassen
Ein Avatar wirkt unglaubwürdig, wenn Antwort und Bild nicht zusammenpassen. Bei uns wählt deshalb das Sprachmodell den nächsten Clip aus einer festen Liste mit aus. Es antwortet in JSON, einem strukturierten Textformat, nach einem JSON-Schema: einer maschinenlesbaren Beschreibung, die die erlaubten Werte aufzählt, also die Clips, die das Video wirklich abspielen kann.
Ohne Schema lieferte ein Modell in 294 von 57.043 Antworten (0,52 Prozent) einen Wert außerhalb der Liste, mit Schema in 1 von 30.679. In einer Messung am 2. September 2026 (44 Aufrufe je Variante) brauchte die Variante mit Schema im Median 1.128 Millisekunden, freies JSON 1.272; über der Zeitgrenze von 2,5 Sekunden für das Hauptmodell lagen 4,5 gegenüber 11,4 Prozent.
Passt kein Clip zum Gesprächsinhalt, bekommt das Modell einen Hinweis und wählt den nächstliegenden. In Tests im Oktober 2026 sanken Antworten, die nicht zum gewählten Clip passten, so bei beiden getesteten Modellen auf 0, vorher waren es 8 bis 20 von 20. Auch der Prompt, also die Arbeitsanweisung an das Modell, zählt: Ohne ein Beispiel darin sank die Quote richtig gewählter Clips von 68 auf 46 Prozent.
Flüssig auf dem Smartphone
Rund 75 Prozent der Erstbesuche kommen bei uns von Smartphones (Web-Analyse, 8. September bis 5. Oktober 2026). Wir entwickeln für eine sichtbare Bildschirmfläche (Viewport) von 412 × 915 Pixeln und testen Android vor dem iPhone. Wie wir dieses Vorgehen auf Apps für Ihr Unternehmen übertragen, beschreibt die Seite App-Entwicklung in München.
Eigener Player. Unser HLS-Player basiert auf Media Source Extensions, einer Browser-Schnittstelle für eigene Videoplayer. Er ist darauf ausgelegt, die Qualität nach der Ladezeit je Segment zu wechseln, erst nach drei gleichen Signalen in Folge. Scheitert die Wiedergabe, folgen die Bibliothek hls.js, eine Wiederherstellung, natives HLS auf Apple-Geräten und zuletzt progressives MP4.
Ruckelfrei vor scharf. Ausgeliefert wird seit einer Entscheidung vom 9. September 2026 trotzdem nur eine Qualitätsstufe: 720p mit 700 kbit/s, bei Quellen mit rund 1.900 kbit/s. Dabei geht etwas Bildschärfe verloren, dafür hat ruckelfreie Wiedergabe Vorrang.
Schneller Start. Auf einer Verbindung mit 1,6 Mbit/s dauerte es rund 21 Sekunden bis zum ersten Videobild, weil im Hintergrund noch andere Videodateien luden. Seit diese Downloads beim Start des Gesprächs abgebrochen werden, sind es rund 7,5 Sekunden.
Ältere iPhones. Ein regulärer Ausdruck mit Lookbehind, einem Suchmuster für den Text vor einer Stelle, ließ die App unter iOS 15 bis 16.3 nie interaktiv werden: Safari vor Version 16.4 verwirft dann das ganze JavaScript-Modul. Seitdem verbietet eine Build-Prüfung Lookbehind.
Messen, ob das Video passt
A/B-Test: passende Clips nach vorne
Vom 21. September bis 5. Oktober 2026 lief ein A/B-Test, also ein Vergleich zufällig zugeteilter Varianten, mit 5.569 Gesprächsrunden auf 1.768 Geräten. In einer Variante standen die zum Gesprächsinhalt passenden Clips vorne in der Liste, die das Sprachmodell bekommt. Das passende Video spielte dann in 72,1 statt 64,0 Prozent der Fälle, ein Plus von 8,1 Prozentpunkten (95-Prozent-Konfidenzintervall +3,7 bis +12,4). Ausgewertet haben wir stratifiziert mit Cluster-Bootstrap, einem Verfahren, das zusammenhängende Gesprächsrunden gemeinsam neu zieht.
Eine Handstichprobe von 150 Treffern ergab 9 Prozent falsche Zuordnungen, fast alle durch allgemeine Wörter im übersetzten Wörterbuch. Ein Nebenbefund: Die Liste wurde mit sort(() => Math.random() - 0.5) gemischt, was nicht gleichverteilt mischt. Seit dem 6. Oktober 2026 mischt der Fisher-Yates-Algorithmus, bei dem jede Reihenfolge gleich wahrscheinlich ist.
Laufend messen. Ist der Clip gewählt, plant der Server den Sprung dorthin im Median in unter 0,2 Sekunden (Tagesmediane 0,16 bis 0,19 Sekunden, 9. September bis 6. Oktober 2026, 10-Prozent-Stichprobe). Seit dem 22. September 2026 schreibt jede Videochat-Sitzung Health-Daten, getrennt vom Fehler-Logging: Zeit bis zum ersten Bild, Hänger, Abweichung der Sprünge vom Plan, Zeit bis zum Sprechbeginn und genutzter Wiedergabepfad. Dieselben Kennzahlen empfehlen wir für jeden Avatar, ergänzt um die Qualität der Antworten.
Kennzeichnung nach Art. 50 KI-VO
Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung (KI-VO). Wie die Kommission sie versteht, beschreiben ihre Leitlinien zu Art. 50 vom 20. Juli 2026 (C(2026) 5054 final), hier zitiert nach Randnummern (Rn.).
Hinweis auf die KI (Abs. 1)
Anbieter müssen dafür sorgen, dass Menschen erfahren, dass sie mit einer KI interagieren, sofern das nicht offensichtlich ist. KI-Avatare nennen die Leitlinien ausdrücklich, neben Sprachassistenten und Chatbots im Kundenservice (Rn. 31). Ein gut sichtbarer Hinweis vor der ersten Interaktion genügt meist; in riskanteren Kontexten wie Beschwerden oder Finanzfragen sind Erinnerungen wahrscheinlich nötig (Rn. 40). Fragt jemand nach, muss das System seine KI-Natur offenlegen. Nicht ausreichend sind etwa ein Hinweis nur in den AGB oder ein Pauschalsatz wie „Diese Website nutzt KI“ (Rn. 38). Die Ausnahme „offensichtlich“ legt die Kommission eng aus: Menschlich klingende Stimme oder menschliches Gesicht machen die KI weniger offensichtlich (Rn. 41 ff.).
Maschinenlesbare Markierung (Abs. 2)
Anbieter generativer KI müssen erzeugten Text, Bild, Audio einschließlich Sprache und Video maschinenlesbar markieren und erkennbar machen (Rn. 60 f., 69 f.), bei Video mit Ton beide Spuren. Das bloße Auswählen, Anordnen oder Präsentieren vorhandener Inhalte ist nicht erfasst (Rn. 65). Nach unserer Lesart ist die Auswahl vorproduzierter Clips deshalb keine Generierung; live erzeugte Stimme und LLM-Text bleiben aber erfasst. Für die offline berechneten Zwischenbilder kommt eine Ausnahme in Betracht: Automatische Übergangsclips („automatic transition clips“) nennen die Leitlinien als unwesentliche Änderung ohne Markierungspflicht (Beispiele nach Rn. 92). Das ist im Einzelfall zu prüfen.
Für generative Systeme, die vor dem 2. August 2026 in Verkehr gebracht oder in Betrieb genommen wurden, gilt Abs. 2 erst ab dem 2. Dezember 2026. Diese Übergangsfrist betrifft nur die Markierung; den Hinweis nach Abs. 1 muss auch ein bestehendes System, das interagiert und Inhalte erzeugt, seit dem 2. August 2026 geben (Rn. 153). Unsicher ist die Anbieterrolle bei fremden KI-Schnittstellen unter eigener Marke.
Deepfakes (Abs. 4): der Irrtum mit fiktiven Avataren
Mehrere deutsche Ratgeber schreiben, ein frei erfundener Avatar sei nicht kennzeichnungspflichtig. Nach den Leitlinien der Kommission greift das aus zwei Gründen zu kurz. Erstens gilt der Hinweis nach Abs. 1 für interaktive Avatare unabhängig davon, ob sie eine echte Person darstellen.
Zweitens ist der Deepfake-Begriff weit gefasst. Abs. 4 verpflichtet Betreiber, die KI beruflich einsetzen, Deepfakes offenzulegen (Rn. 112). Ein Deepfake ist KI-erzeugtes oder manipuliertes Bild-, Ton- oder Videomaterial, das wirklichen Personen, Orten oder Ereignissen ähnelt und fälschlich als echt erscheinen würde (Art. 3 Nr. 60 KI-VO). Für das Merkmal „existierend“ genügt laut Rn. 113, dass die Person plausibel existieren könnte. „Personen“ umfasst ausdrücklich realistische KI-generierte menschliche Avatare und Personas sowie die Stimme. Eine Täuschungsabsicht ist nicht nötig (Rn. 114). Das Beispiel der Kommission: der realistische synthetische Avatar eines CEO, der der Belegschaft gratuliert.
Nicht erfasst sind erkennbar unrealistische Figuren wie ein fliegender Drache. Fiktiv heißt also nicht unrealistisch: Je fotorealistischer ein erfundener Mensch wirkt, desto eher liegt ein Deepfake vor. Allein entscheidet der Fotorealismus aber nicht; maßgeblich ist, ob der Inhalt im konkreten Einsatz und für das erwartbare Publikum echt wirkt (Rn. 114). Klären Sie deshalb vor der Produktion, wie Bild und Stimme Ihres Avatars entstehen. Offenzulegen ist spätestens beim ersten Kontakt (Art. 50 Abs. 5).
Kennzeichnung in der Praxis: C2PA und Code of Practice
Für KI-erzeugte Bild- und Videodateien eignen sich signierte C2PA-Manifeste (Content Credentials), ein offener Standard für signierte Herkunftsangaben. Dazu gehören der IPTC-Herkunftstyp „trainedAlgorithmicMedia“ (von einem trainierten Modell erzeugt), eine ES256-Signatur und ein Zeitstempel nach RFC 3161. Zwei Punkte für die Umsetzung: Die Markierung gehört an das Ende der Verarbeitung, weil eine spätere Neukodierung das Manifest entfernen kann. Und nicht jedes Videoformat kann ein C2PA-Manifest tragen; prüfen Sie das für jedes Format, das Sie ausliefern.
Der Code of Practice zur Markierung und Kennzeichnung KI-generierter Inhalte vom 10. Juni 2026 ist freiwillig. Laut Zusammenfassungen von Kanzleien sieht er mindestens zwei Techniken vor, etwa Metadaten wie C2PA plus Wasserzeichen. Den sichtbaren Hinweis im Chat ersetzt das nicht. Verstöße gegen Art. 50 sind nach Art. 99 Abs. 4 KI-VO bußgeldbewehrt; Fristen und Rollen fasst der Artikel KI-Verordnung: Pflichten für Unternehmen zusammen.
Fazit
Ein Chatbot mit Avatar ist zuerst ein Chatbot: Ohne gute Wissensbasis und kurze Antwortzeit hilft auch ein überzeugendes Bild nicht. Live generiertes Video folgt jedem Wort, kostet aber je Gesprächsminute und lässt sich vorab nicht prüfen. Vorab gerenderte Antworten sind kontrolliert, aber starr. Clips in Echtzeit verbinden freie Antworten mit einem geprüften Bild, ohne lautgenaue Lippensynchronität. Und ein fiktiver Avatar entbindet nicht von der Kennzeichnung.
Wenn Sie einen Avatar für Kundenservice, Produktberatung, Schulung oder Empfang planen, zeigt unsere Seite KI-Chatbot für Website und Kundenservice, wie wir Text, Sprache und Video umsetzen. Das Praxisbeispiel Videochat-Conversational-AI beschreibt die Bausteine im Betrieb. Für eine erste Einschätzung nehmen Sie Kontakt mit uns auf.
Passende Leistung
KI-Chatbot für Website und Kundenservice in München: Conversational AI mit Text, Sprache und Video
Ein KI-Chatbot für Website und Kundenservice, der aus Ihren freigegebenen Inhalten antwortet, an Ihr Serviceteam übergibt und wahlweise spricht oder per Video antwortet.
Zur Leistung KI-Chatbot für Website