Zum Inhalt springen

KI · 11 Min. Lesezeit

Chatbot mit Avatar: Video live generieren oder aus Clips?

Chatbot mit Avatar: live generiertes Video, vorab gerenderte Antworten oder Clips in Echtzeit? Latenz, Kosten und Kennzeichnung nach Art. 50 im Vergleich.

Von Amperbyte AI, geschrieben von unserem Gründer ·

Symbolbild: Smartphone im Ständer mit dem Videobild eines virtuellen Gesprächspartners, daneben ein Laptop mit Antwortzeit-Diagramm und einem Graphen verbundener Clips

Ein Chatbot mit Avatar beantwortet Fragen nicht nur als Text, sondern über eine sichtbare Figur, die meist auch spricht. Technisch gibt es drei Bauarten: live von einer KI erzeugtes Video, vorab gerenderte Antwortvideos und Video, das sich in Echtzeit aus vorproduzierten Clips zusammensetzt. Sie unterscheiden sich in Antwortzeit, laufenden Kosten, Kontrolle über das Bild und Kennzeichnungspflicht.

Grundlage sind die Leitlinien der EU-Kommission zu Art. 50 der KI-Verordnung und unsere eigene Videochat-Conversational-AI für Endkunden, die wir selbst entwickeln und betreiben. Den Produktnamen nennen wir hier nicht, weil es sich an Endkunden richtet. Stand Oktober 2026 hat sie über 60.000 registrierte Nutzer; vom 8. September bis 5. Oktober 2026 liefen rund 69.000 Videochat-Sitzungen. Zahlen zum eigenen Produkt stammen, wo nicht anders angegeben, aus unserem eigenen Monitoring.

Rechtsstand: 7. Oktober 2026

Dieser Artikel ist allgemeine Information und keine Rechtsberatung. Wir sind ein Software- und KI-Dienstleister, keine Kanzlei. Die zitierten Leitlinien der Kommission sind nicht bindend. Ob und wie Ihr Avatar zu kennzeichnen ist, klärt eine Prüfung Ihres Einzelfalls durch Ihre Rechtsabteilung oder eine Kanzlei.

Was ein Chatbot mit Avatar ist

Ein Chatbot mit Avatar, auch Video-Chatbot oder interaktiver KI-Avatar genannt, verbindet drei Schichten. Ein Sprachmodell (LLM, Large Language Model) formuliert die Antwort. Eine Sprachsynthese (Text-to-Speech) spricht sie. Ein Videobild zeigt eine Figur, die auf das Gespräch reagiert. Der Oberbegriff ist Conversational AI: Software, die per Text, Sprache oder Video ein Gespräch führt.

Wo ein KI-Avatar im Unternehmen passt

  • Kundenservice: wiederkehrende Fragen zu Lieferung, Rückgabe oder Bedienung
  • Produktberatung: Bedarf erfragen und Varianten erklären
  • Schulung: Lerneinheiten, in denen Mitarbeitende Rückfragen stellen können
  • Empfang: Besucher auf der Website oder am Bildschirm im Foyer begrüßen und weiterleiten

Ein Avatar ersetzt keine gute Wissensbasis. Ob ein Assistent richtig antwortet, entscheidet die Quelle, etwa Retrieval-Augmented Generation (RAG) aus freigegebenen Inhalten; mehr dazu unter RAG oder Fine-Tuning.

Drei Bauarten im Vergleich

Live generiertes Video (Avatar-Plattform). Ein Videomodell erzeugt das Bild während des Gesprächs passend zur Stimme, meist als Dienst spezialisierter Plattformen. Jedes Bild ist neu und vorab ungeprüft.

Vorab gerenderte Antworten. Für einen festen Fragenkatalog entsteht vorab je ein Antwortvideo, das der Chatbot über ein CDN (Content Delivery Network, ein Netz verteilter Server nah am Nutzer) abspielt.

Echtzeit aus vorproduzierten Clips. Text und Stimme entstehen live, das Bild setzt sich aus einer Clip-Bibliothek zusammen. Diese Bauart nutzen wir im eigenen Produkt.

KriteriumLive generiertes VideoVorab gerenderte AntwortenEchtzeit aus vorproduzierten Clips
Latenz des Videoshöher, das Videomodell rechnet zusätzlich zu Text und Stimmeniedrig, eine fertige Datei wird abgespieltniedrig, kein Videomodell im Gespräch; der Server plant den nächsten Sprung im Median in unter 0,2 Sekunden
Laufende Kostensteigen mit jeder Gesprächsminutegering, vor allem CDN; Aufwand je neuer AntwortVideo nur CDN-Bandbreite, die Stimme dominiert
Kontrolle über das Bildeingeschränkt, Bildfehler nicht vorab prüfbarvollständig, jedes Video vorab freigegebenhoch, nur freigegebene Clips und geprüfte Übergänge
Flexibilitäthoch, Mundbewegung lautgenau möglichgering, nur vorbereitete AntwortenText und Stimme frei, Bild auf die Clips begrenzt, Mundbewegung nicht lautgenau
KennzeichnungAbs. 1; Abs. 2 für Bild und Ton; Abs. 4 bei realistischem MenschenAbs. 1; Abs. 2 und 4 je nach Entstehung der VideosAbs. 1; Abs. 2 für Text und Stimme, für die Clips je nach Entstehung; Abs. 4 je nach Material

Werte rechts aus unserem eigenen Produkt: Sprungplanung serverseitig, Tagesmediane vom 9. September bis 6. Oktober 2026 (10-Prozent-Stichprobe); Kosten laut unserer Kostenschätzung vom 17.09.2026. Kennzeichnung: Absätze von Art. 50 KI-VO, als Orientierung.

Was ein KI-Avatar kostet: die Kostentreiber

Feste Preise nennen wir nicht, sie hängen von Umfang, Gesprächsvolumen und Anbietern ab. Einmalig fallen Gesprächskonzept, Produktion der Videos oder Clips, Integration und Test-Set an, später deren Pflege. Laufend kosten Sprachmodell und Stimme, bei live generiertem Video zusätzlich die Bildberechnung.

Laut unserer Kostenschätzung vom 17.09.2026 (Listenpreise der Anbieter) macht die Sprachausgabe rund 90 Prozent der variablen Kosten einer gesprochenen Videochat-Antwort aus, etwa das Zehnfache der LLM-Antwort. Der größte Hebel liegt also bei der Stimme, wie der Artikel Chatbot mit Sprachausgabe zeigt.

Echtzeit aus vorproduzierten Clips: der Clip-Graph

Das Video wird nicht live von einer KI generiert. Es setzt sich in Echtzeit aus vorproduzierten Clips zusammen, zwischen denen ein Clip-Graph nahtlose Übergänge kennt: ein Netz aus Clips und den Stellen, an denen ein Sprung in einen anderen Clip nicht auffällt. Ausgeliefert wird per HLS-Streaming (HTTP Live Streaming, also in kurzen Segmenten) über ein CDN.

Wie die Übergangspunkte entstehen

Eine eigene Python-Pipeline vergleicht Einzelbilder über den Structural Similarity Index (SSIM), ein Maß für die Ähnlichkeit zweier Bilder in Helligkeit, Kontrast und Struktur. Sie rechnet mit reduzierter Auflösung (250 Pixel Höhe) und in drei Durchgängen von grob nach fein. Ein Sprung gilt ab einem SSIM von 0,65 als brauchbar.

Sind zwei Bilder ähnlich, aber nicht identisch (SSIM bis etwa 0,74), berechnet ein Frame-Interpolationsmodell vorab fünf Zwischenbilder. Diese Übergänge entstehen offline in der Produktion, nicht live im Gespräch.

Zwischen zwei Sprüngen liegen mindestens 300 Millisekunden, bis zum nächsten möglichen Sprung höchstens 6 Sekunden. Pipeline und Programmierschnittstelle (API) nutzen dieselben Grenzen, damit die API keine ungeprüften Übergänge plant.

Stimme, Text und Bild synchron halten

Die Sprachausgabe startet parallel zur Clip-Auswahl und wird erst danach abgewartet. Für eine gesprochene Antwort wählt das System einen vorproduzierten Sprech-Clip, dessen Länge zur Zeichenzahl der Antwort passt. Die Stimme wartet auf das Bild des Sprungs, der Text erscheint spätestens nach 3 Sekunden.

Ehrlich dazu: Lautgenaue Lippensynchronität entsteht so nicht, denn der Sprech-Clip passt zur Länge der Antwort, nicht zu jedem Laut. Vorab gerenderte Antworten sind lippensynchron, aber auf den Fragenkatalog begrenzt. Wer lautgenaue Lippenbewegungen bei frei formulierten Antworten braucht, landet meist bei live generiertem Video, mit dessen Kosten und Latenz.

Die Player-Uhr. Wie heikel das Timing ist, zeigte ein Fehler: Unser Player löste jeden Sprung 1,48 Sekunden zu früh aus, auf iPhones landeten Sprünge 1,6 statt 0,2 Sekunden im Clip. Seit dem 29. September 2026 rechnet eine neue Uhr mit der Inhaltszeit, also der Position im Video.

Antwort und Bild müssen zusammenpassen

Ein Avatar wirkt unglaubwürdig, wenn Antwort und Bild nicht zusammenpassen. Bei uns wählt deshalb das Sprachmodell den nächsten Clip aus einer festen Liste mit aus. Es antwortet in JSON, einem strukturierten Textformat, nach einem JSON-Schema: einer maschinenlesbaren Beschreibung, die die erlaubten Werte aufzählt, also die Clips, die das Video wirklich abspielen kann.

Ohne Schema lieferte ein Modell in 294 von 57.043 Antworten (0,52 Prozent) einen Wert außerhalb der Liste, mit Schema in 1 von 30.679. In einer Messung am 2. September 2026 (44 Aufrufe je Variante) brauchte die Variante mit Schema im Median 1.128 Millisekunden, freies JSON 1.272; über der Zeitgrenze von 2,5 Sekunden für das Hauptmodell lagen 4,5 gegenüber 11,4 Prozent.

Passt kein Clip zum Gesprächsinhalt, bekommt das Modell einen Hinweis und wählt den nächstliegenden. In Tests im Oktober 2026 sanken Antworten, die nicht zum gewählten Clip passten, so bei beiden getesteten Modellen auf 0, vorher waren es 8 bis 20 von 20. Auch der Prompt, also die Arbeitsanweisung an das Modell, zählt: Ohne ein Beispiel darin sank die Quote richtig gewählter Clips von 68 auf 46 Prozent.

Flüssig auf dem Smartphone

Rund 75 Prozent der Erstbesuche kommen bei uns von Smartphones (Web-Analyse, 8. September bis 5. Oktober 2026). Wir entwickeln für eine sichtbare Bildschirmfläche (Viewport) von 412 × 915 Pixeln und testen Android vor dem iPhone. Wie wir dieses Vorgehen auf Apps für Ihr Unternehmen übertragen, beschreibt die Seite App-Entwicklung in München.

Eigener Player. Unser HLS-Player basiert auf Media Source Extensions, einer Browser-Schnittstelle für eigene Videoplayer. Er ist darauf ausgelegt, die Qualität nach der Ladezeit je Segment zu wechseln, erst nach drei gleichen Signalen in Folge. Scheitert die Wiedergabe, folgen die Bibliothek hls.js, eine Wiederherstellung, natives HLS auf Apple-Geräten und zuletzt progressives MP4.

Ruckelfrei vor scharf. Ausgeliefert wird seit einer Entscheidung vom 9. September 2026 trotzdem nur eine Qualitätsstufe: 720p mit 700 kbit/s, bei Quellen mit rund 1.900 kbit/s. Dabei geht etwas Bildschärfe verloren, dafür hat ruckelfreie Wiedergabe Vorrang.

Schneller Start. Auf einer Verbindung mit 1,6 Mbit/s dauerte es rund 21 Sekunden bis zum ersten Videobild, weil im Hintergrund noch andere Videodateien luden. Seit diese Downloads beim Start des Gesprächs abgebrochen werden, sind es rund 7,5 Sekunden.

Ältere iPhones. Ein regulärer Ausdruck mit Lookbehind, einem Suchmuster für den Text vor einer Stelle, ließ die App unter iOS 15 bis 16.3 nie interaktiv werden: Safari vor Version 16.4 verwirft dann das ganze JavaScript-Modul. Seitdem verbietet eine Build-Prüfung Lookbehind.

Messen, ob das Video passt

A/B-Test: passende Clips nach vorne

Vom 21. September bis 5. Oktober 2026 lief ein A/B-Test, also ein Vergleich zufällig zugeteilter Varianten, mit 5.569 Gesprächsrunden auf 1.768 Geräten. In einer Variante standen die zum Gesprächsinhalt passenden Clips vorne in der Liste, die das Sprachmodell bekommt. Das passende Video spielte dann in 72,1 statt 64,0 Prozent der Fälle, ein Plus von 8,1 Prozentpunkten (95-Prozent-Konfidenzintervall +3,7 bis +12,4). Ausgewertet haben wir stratifiziert mit Cluster-Bootstrap, einem Verfahren, das zusammenhängende Gesprächsrunden gemeinsam neu zieht.

Eine Handstichprobe von 150 Treffern ergab 9 Prozent falsche Zuordnungen, fast alle durch allgemeine Wörter im übersetzten Wörterbuch. Ein Nebenbefund: Die Liste wurde mit sort(() => Math.random() - 0.5) gemischt, was nicht gleichverteilt mischt. Seit dem 6. Oktober 2026 mischt der Fisher-Yates-Algorithmus, bei dem jede Reihenfolge gleich wahrscheinlich ist.

Laufend messen. Ist der Clip gewählt, plant der Server den Sprung dorthin im Median in unter 0,2 Sekunden (Tagesmediane 0,16 bis 0,19 Sekunden, 9. September bis 6. Oktober 2026, 10-Prozent-Stichprobe). Seit dem 22. September 2026 schreibt jede Videochat-Sitzung Health-Daten, getrennt vom Fehler-Logging: Zeit bis zum ersten Bild, Hänger, Abweichung der Sprünge vom Plan, Zeit bis zum Sprechbeginn und genutzter Wiedergabepfad. Dieselben Kennzahlen empfehlen wir für jeden Avatar, ergänzt um die Qualität der Antworten.

Kennzeichnung nach Art. 50 KI-VO

Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung (KI-VO). Wie die Kommission sie versteht, beschreiben ihre Leitlinien zu Art. 50 vom 20. Juli 2026 (C(2026) 5054 final), hier zitiert nach Randnummern (Rn.).

Hinweis auf die KI (Abs. 1)

Anbieter müssen dafür sorgen, dass Menschen erfahren, dass sie mit einer KI interagieren, sofern das nicht offensichtlich ist. KI-Avatare nennen die Leitlinien ausdrücklich, neben Sprachassistenten und Chatbots im Kundenservice (Rn. 31). Ein gut sichtbarer Hinweis vor der ersten Interaktion genügt meist; in riskanteren Kontexten wie Beschwerden oder Finanzfragen sind Erinnerungen wahrscheinlich nötig (Rn. 40). Fragt jemand nach, muss das System seine KI-Natur offenlegen. Nicht ausreichend sind etwa ein Hinweis nur in den AGB oder ein Pauschalsatz wie „Diese Website nutzt KI“ (Rn. 38). Die Ausnahme „offensichtlich“ legt die Kommission eng aus: Menschlich klingende Stimme oder menschliches Gesicht machen die KI weniger offensichtlich (Rn. 41 ff.).

Maschinenlesbare Markierung (Abs. 2)

Anbieter generativer KI müssen erzeugten Text, Bild, Audio einschließlich Sprache und Video maschinenlesbar markieren und erkennbar machen (Rn. 60 f., 69 f.), bei Video mit Ton beide Spuren. Das bloße Auswählen, Anordnen oder Präsentieren vorhandener Inhalte ist nicht erfasst (Rn. 65). Nach unserer Lesart ist die Auswahl vorproduzierter Clips deshalb keine Generierung; live erzeugte Stimme und LLM-Text bleiben aber erfasst. Für die offline berechneten Zwischenbilder kommt eine Ausnahme in Betracht: Automatische Übergangsclips („automatic transition clips“) nennen die Leitlinien als unwesentliche Änderung ohne Markierungspflicht (Beispiele nach Rn. 92). Das ist im Einzelfall zu prüfen.

Für generative Systeme, die vor dem 2. August 2026 in Verkehr gebracht oder in Betrieb genommen wurden, gilt Abs. 2 erst ab dem 2. Dezember 2026. Diese Übergangsfrist betrifft nur die Markierung; den Hinweis nach Abs. 1 muss auch ein bestehendes System, das interagiert und Inhalte erzeugt, seit dem 2. August 2026 geben (Rn. 153). Unsicher ist die Anbieterrolle bei fremden KI-Schnittstellen unter eigener Marke.

Deepfakes (Abs. 4): der Irrtum mit fiktiven Avataren

Mehrere deutsche Ratgeber schreiben, ein frei erfundener Avatar sei nicht kennzeichnungspflichtig. Nach den Leitlinien der Kommission greift das aus zwei Gründen zu kurz. Erstens gilt der Hinweis nach Abs. 1 für interaktive Avatare unabhängig davon, ob sie eine echte Person darstellen.

Zweitens ist der Deepfake-Begriff weit gefasst. Abs. 4 verpflichtet Betreiber, die KI beruflich einsetzen, Deepfakes offenzulegen (Rn. 112). Ein Deepfake ist KI-erzeugtes oder manipuliertes Bild-, Ton- oder Videomaterial, das wirklichen Personen, Orten oder Ereignissen ähnelt und fälschlich als echt erscheinen würde (Art. 3 Nr. 60 KI-VO). Für das Merkmal „existierend“ genügt laut Rn. 113, dass die Person plausibel existieren könnte. „Personen“ umfasst ausdrücklich realistische KI-generierte menschliche Avatare und Personas sowie die Stimme. Eine Täuschungsabsicht ist nicht nötig (Rn. 114). Das Beispiel der Kommission: der realistische synthetische Avatar eines CEO, der der Belegschaft gratuliert.

Nicht erfasst sind erkennbar unrealistische Figuren wie ein fliegender Drache. Fiktiv heißt also nicht unrealistisch: Je fotorealistischer ein erfundener Mensch wirkt, desto eher liegt ein Deepfake vor. Allein entscheidet der Fotorealismus aber nicht; maßgeblich ist, ob der Inhalt im konkreten Einsatz und für das erwartbare Publikum echt wirkt (Rn. 114). Klären Sie deshalb vor der Produktion, wie Bild und Stimme Ihres Avatars entstehen. Offenzulegen ist spätestens beim ersten Kontakt (Art. 50 Abs. 5).

Kennzeichnung in der Praxis: C2PA und Code of Practice

Für KI-erzeugte Bild- und Videodateien eignen sich signierte C2PA-Manifeste (Content Credentials), ein offener Standard für signierte Herkunftsangaben. Dazu gehören der IPTC-Herkunftstyp „trainedAlgorithmicMedia“ (von einem trainierten Modell erzeugt), eine ES256-Signatur und ein Zeitstempel nach RFC 3161. Zwei Punkte für die Umsetzung: Die Markierung gehört an das Ende der Verarbeitung, weil eine spätere Neukodierung das Manifest entfernen kann. Und nicht jedes Videoformat kann ein C2PA-Manifest tragen; prüfen Sie das für jedes Format, das Sie ausliefern.

Der Code of Practice zur Markierung und Kennzeichnung KI-generierter Inhalte vom 10. Juni 2026 ist freiwillig. Laut Zusammenfassungen von Kanzleien sieht er mindestens zwei Techniken vor, etwa Metadaten wie C2PA plus Wasserzeichen. Den sichtbaren Hinweis im Chat ersetzt das nicht. Verstöße gegen Art. 50 sind nach Art. 99 Abs. 4 KI-VO bußgeldbewehrt; Fristen und Rollen fasst der Artikel KI-Verordnung: Pflichten für Unternehmen zusammen.

Fazit

Ein Chatbot mit Avatar ist zuerst ein Chatbot: Ohne gute Wissensbasis und kurze Antwortzeit hilft auch ein überzeugendes Bild nicht. Live generiertes Video folgt jedem Wort, kostet aber je Gesprächsminute und lässt sich vorab nicht prüfen. Vorab gerenderte Antworten sind kontrolliert, aber starr. Clips in Echtzeit verbinden freie Antworten mit einem geprüften Bild, ohne lautgenaue Lippensynchronität. Und ein fiktiver Avatar entbindet nicht von der Kennzeichnung.

Wenn Sie einen Avatar für Kundenservice, Produktberatung, Schulung oder Empfang planen, zeigt unsere Seite KI-Chatbot für Website und Kundenservice, wie wir Text, Sprache und Video umsetzen. Das Praxisbeispiel Videochat-Conversational-AI beschreibt die Bausteine im Betrieb. Für eine erste Einschätzung nehmen Sie Kontakt mit uns auf.

Passende Leistung

KI-Chatbot für Website und Kundenservice in München: Conversational AI mit Text, Sprache und Video

Ein KI-Chatbot für Website und Kundenservice, der aus Ihren freigegebenen Inhalten antwortet, an Ihr Serviceteam übergibt und wahlweise spricht oder per Video antwortet.

Zur Leistung KI-Chatbot für Website

Häufige Fragen

Häufige Fragen zum Thema

Was kostet ein KI-Avatar im laufenden Betrieb?

Das hängt vor allem von der Bauart und vom Gesprächsvolumen ab. Bei live generiertem Video kostet jede Gesprächsminute Rechenzeit für das Bild, dazu kommen Sprachmodell und Stimme. Bei vorab gerenderten Antworten und bei vorproduzierten Clips fällt für das Video im Betrieb vor allem die Auslieferung über ein CDN an. Dann kann die Stimme der größte laufende Posten sein: In unserem eigenen Produkt macht sie laut unserer Kostenschätzung vom 17.09.2026 rund 90 Prozent der variablen Kosten einer gesprochenen Antwort aus.

Ist ein frei erfundener KI-Avatar ein Deepfake?

Er kann es sein. Nach den Leitlinien der EU-Kommission zu Art. 50 KI-VO zählen realistische, KI-generierte menschliche Avatare als Personen, und für das Merkmal „existierend“ genügt, dass die dargestellte Person plausibel existieren könnte. Eine Täuschungsabsicht ist nicht nötig. Entscheidend ist, ob der Avatar im konkreten Einsatz fälschlich als echt erscheinen würde; Fotorealismus allein gibt nicht den Ausschlag. Erkennbar unrealistische Figuren fallen nicht darunter. Unabhängig davon braucht ein interaktiver Avatar den Hinweis, dass Nutzer mit einer KI sprechen, sofern das nicht offensichtlich ist. Rechtsstand 7. Oktober 2026, keine Rechtsberatung.

Was passiert, wenn der KI-Avatar eine Frage nicht beantworten kann?

Das legt das Gesprächsdesign fest, nicht der Avatar. Ein Assistent im Kundenservice sollte eine Wissenslücke offen benennen, statt zu raten, und an das Serviceteam übergeben, etwa als Ticket oder Kontaktanfrage. Das setzen wir für Chatbots um, die auf freigegebenen Inhalten antworten. Beim Bild gilt dasselbe Prinzip: Passt kein Clip zum Gesprächsinhalt, bekommt das Sprachmodell einen Hinweis und wählt den nächstliegenden, damit Antwort und Bild zusammenpassen. In unseren Tests im Oktober 2026 sanken Antworten, die nicht zum gewählten Clip passten, damit auf null.

Ersetzt ein KI-Avatar den First-Level-Support?

Nein, er entlastet ihn. Ein Avatar kann wiederkehrende Fragen zu Produkten, Abläufen oder Öffnungszeiten rund um die Uhr beantworten und Anfragen vorsortieren. Für Reklamationen, Sonderfälle und alles, was eine Entscheidung braucht, bleibt das Serviceteam zuständig. Planen Sie die Übergabe an Menschen deshalb von Anfang an mit und messen Sie im Betrieb, welche Anfragen der Avatar wirklich abschließt. Ob sich das Video gegenüber einem reinen Text-Chatbot lohnt, zeigt erst ein Test mit echten Nutzern.

Sie planen etwas in diese Richtung?

Im Erstgespräch übertragen wir die Erfahrung aus dem Artikel auf Ihre Situation. Kostenlos und unverbindlich.