Zum Inhalt springen

Datenschutz · 11 Min. Lesezeit

KI-Chatbot DSGVO-konform: LLM-Integration, Hosting, AVV

KI-Chatbot DSGVO-konform einführen: Datenflüsse, AVV, Business-Tarif oder API, LLM lokal oder EU-Cloud. Mit Go-live-Checkliste, Stand September 2026.

Von Amperbytes AI ·

Symbolbild: Gang in einem Rechenzentrum, links ältere Serverschränke mit offener Verkabelung, rechts moderne beleuchtete Racks, als Sinnbild für die Hosting-Optionen von Sprachmodellen

Damit ein KI-Chatbot DSGVO-konform arbeitet, sind vor allem vier Grundlagen entscheidend. Jede Verarbeitung hat eine Rechtsgrundlage. Jeder Anbieter, der Daten in Ihrem Auftrag verarbeitet, ist über einen Auftragsverarbeitungsvertrag (AVV) gebunden. Das Training auf Ihren Daten ist vertraglich ausgeschlossen. Prompts, Dokumente und Protokolle werden nur so weit und so lange verarbeitet, wie der Zweck es verlangt. Welches Sprachmodell (Large Language Model, LLM) Sie nutzen, entscheidet dabei weniger als Tarif, Vertrag und Datenstandort. Seit dem 2. August 2026 verlangt zusätzlich die KI-Verordnung, dass Nutzer erfahren, wenn sie mit einer KI sprechen.

Rechtsstand: 29. September 2026

Dieser Artikel ist allgemeine Information und keine Rechtsberatung. Die Bewertung Ihres konkreten Falls gehört zu Ihrem Datenschutzbeauftragten oder Ihrer Rechtsabteilung. Wir beschreiben, welche Daten wohin fließen und welche Regeln gelten. Außerdem zeigen wir, wie sich Business-Tarife und API unterscheiden, wann sich ein lokal betriebenes Modell lohnt und welche technischen und organisatorischen Maßnahmen die Datenschutzaufsicht empfiehlt.

Welche Daten ein KI-Chatbot verarbeitet

Bevor Sie über Verträge und Hosting sprechen, brauchen Sie ein Bild der Datenflüsse. Bei einem Assistenten mit Retrieval (Retrieval-Augmented Generation, RAG: das System sucht zuerst passende Abschnitte in Ihren Dokumenten und übergibt sie dem Modell als Kontext) gibt es fünf Ströme. Wie RAG im Detail funktioniert, erklärt der Artikel KI mit eigenen Daten nutzen.

DatenstromEnthält typischerweiseWo er landetRisiko
PromptFreitext des Nutzers, oft mit Namen, Kundennummern, VorgängenModellanbieter, LogsPersonenbezug durch Nutzereingabe
KontextAbschnitte aus Dokumenten, Tickets, E-MailsModellanbieter, je AnfrageVertrauliche Inhalte, Personenbezug in Dokumenten
EmbeddingsVektoren der DokumentabschnitteVektordatenbank, Embedding-AnbieterRückschluss auf Inhalte möglich
LogsFrage, Antwort, Nutzer-ID, Zeitstempel, BewertungMonitoring, Log-SpeicherVerhaltensprofil der Nutzer
FeedbackBewertung, FreitextkommentarDatenbankPersonenbezug im Kommentar

Zwei Punkte werden unterschätzt. Erstens enthalten die Prompts personenbezogene Daten, sobald Mitarbeitende Kundennamen oder Vorgangsnummern eintippen, auch wenn Ihre Dokumente keine enthalten. Zweitens sind Logs Beschäftigtendaten: Wer wann was gefragt hat, sagt viel über die Arbeit einer Person aus. Beides braucht eine Rechtsgrundlage und eine Löschfrist.

Rechtsgrundlagen: DSGVO und KI-Verordnung

Die Artikel beziehen sich auf die Datenschutz-Grundverordnung im Amtsblatt der EU. Ohne Anspruch auf Vollständigkeit:

  • Art. 6 DSGVO, Rechtsgrundlage. Für einen internen Assistenten kommt häufig das berechtigte Interesse in Betracht, für einen Kundenservice-Assistenten die Vertragserfüllung, soweit die Verarbeitung dafür erforderlich ist, sonst ebenfalls das berechtigte Interesse. Einwilligungen sind im Beschäftigungskontext schwierig, weil sie freiwillig und widerrufbar sein müssen.
  • Art. 28 DSGVO, Auftragsverarbeitung. Verarbeitet ein Anbieter Daten in Ihrem Auftrag, brauchen Sie einen AVV. Prüfen Sie darin besonders Datenstandort, Unterauftragnehmer und den Ausschluss von Training auf Ihren Daten.
  • Kapitel V DSGVO, Drittlandtransfer. Werden Daten außerhalb der EU verarbeitet oder ist ein Zugriff von dort möglich, brauchen Sie eine Grundlage nach Kapitel V, etwa einen Angemessenheitsbeschluss oder Standardvertragsklauseln; bei Standardvertragsklauseln kommt eine Bewertung des Transferrisikos hinzu. Für US-Anbieter, die unter dem EU-US Data Privacy Framework zertifiziert sind, gilt der Angemessenheitsbeschluss der EU-Kommission vom 10. Juli 2023. Das Gericht der EU hat ihn am 3. September 2025 bestätigt (Rechtssache T-553/23). Ein Rechtsmittel beim Gerichtshof ist anhängig (C-703/25 P).
  • Art. 35 DSGVO, Datenschutz-Folgenabschätzung (DSFA). Bei voraussichtlich hohem Risiko ist sie vorgeschrieben. Dokumentieren Sie in jedem Fall, ob und warum Sie sie für nötig halten.
  • Art. 13 und 14 DSGVO, Information. Mitarbeitende brauchen eine Nutzungsinformation, Kunden einen Hinweis in der Datenschutzerklärung.
  • § 25 TDDDG, Zugriff auf das Endgerät. Speichert das Chat-Widget auf Ihrer Website Informationen auf dem Endgerät, etwa Cookies, oder liest es solche aus, und ist das für den vom Nutzer gewünschten Dienst nicht unbedingt erforderlich, braucht es eine Einwilligung (§ 25 TDDDG).
  • Art. 50 KI-Verordnung, Transparenz. Die Transparenzpflichten gelten seit dem 2. August 2026, etwa der Hinweis, dass Nutzer mit einer KI chatten. Die maschinenlesbare Kennzeichnung nach Art. 50 Abs. 2 gilt für Systeme, die vor diesem Datum in Verkehr gebracht wurden, ab dem 2. Dezember 2026 (EU-Kommission, Fragen und Antworten zu Art. 50). Welche weiteren Pflichten die KI-Verordnung nach dem KI-Omnibus mit sich bringt, fasst der Artikel KI-Verordnung: Pflichten für Unternehmen zusammen.

ChatGPT, Microsoft Copilot und Claude im Unternehmen: DSGVO bei Business-Tarif und API

Dieselben Modelle erreichen Ihr Unternehmen auf drei Wegen, und datenschutzrechtlich sind das drei verschiedene Fälle:

  1. Verbraucher-Tarife. Private oder einzeln abgeschlossene Konten. Es gibt keinen AVV mit Ihrem Unternehmen, und Training und Speicherdauer richten sich nach den Einstellungen der einzelnen Person.
  2. Business-Tarife. Chat-Oberflächen für Mitarbeitende mit zentraler Verwaltung, AVV und festgelegten Regeln zur Datennutzung.
  3. API. Das Modell wird über eine Programmierschnittstelle in Ihre eigene Anwendung eingebunden, etwa in einen Chatbot über Ihre Dokumente. Datenflüsse, Berechtigungen und Löschfristen bestimmen Sie selbst.

Was die Anbieter nach eigenen Angaben zusagen:

  • OpenAI nutzt laut der Seite Business data privacy Daten aus ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu und der API standardmäßig nicht für das Training, solange der Kunde nicht aktiv zustimmt. Für ChatGPT Enterprise und Edu lassen sich Inhalte nach eigenen Angaben in Europa speichern, für die API auch in Europa verarbeiten (Datenresidenz in Europa).
  • Microsoft schreibt in der Dokumentation zu Datenschutz in Microsoft Copilot (Stand Juli 2026, früher Microsoft 365 Copilot), dass Prompts, Antworten und die aus Ihren Microsoft-365-Daten abgerufenen Inhalte nicht zum Training der Basismodelle verwendet werden. Für EU-Kunden ist Copilot danach ein Dienst innerhalb der EU Data Boundary. Ausgenommen davon sind derzeit Modelle von Anthropic, die Microsoft als Unterauftragsverarbeiter einbindet. Wer diese Modelle in Copilot freischaltet, sollte das in der Bewertung berücksichtigen.
  • Anthropic schließt in den Commercial Terms das Training auf Kundeninhalten aus. Die Änderung der Verbraucherbedingungen vom 28. August 2025, nach der Nutzer selbst über die Verwendung ihrer Chats für das Training entscheiden, betrifft Claude Free, Pro und Max, nicht aber Claude for Work und die API.

Solche Zusagen ändern sich. Prüfen Sie den AVV und die aktuellen Bedingungen zum Zeitpunkt der Entscheidung und wiederholen Sie die Prüfung bei Vertragsverlängerung.

Das größere Risiko liegt in der Praxis selten im Business-Tarif, sondern im privaten Konto, auf das Mitarbeitende ausweichen, weil kein freigegebenes Werkzeug da ist. Bei der Einführung von GitHub Copilot, Claude Code und Coding-Agenten in einem Entwicklungsteam, die unser Gründer bei einem Premium-Automobilhersteller verantwortet hat (Praxisbeispiel KI-gestützte Entwicklung im Team), wurden zuerst Datenschutz und geistiges Eigentum mit den Architektur- und Governance-Verantwortlichen geklärt. Erst danach hat das Team die Werkzeuge an echten Tickets erprobt. Diese Reihenfolge empfehlen wir für jede Einführung: Freigabe und Nutzungsrichtlinie vor dem ersten produktiven Prompt. Was das für Coding-Assistenten im Detail bedeutet, beschreibt die Seite Softwareentwicklung mit KI.

Faustregel: Für allgemeine Büroaufgaben reicht ein Business-Tarif. Sobald der Chatbot auf Ihre Fachdokumente zugreifen, Berechtigungen aus Quellsystemen übernehmen oder Kunden antworten soll, führt der Weg meist über die API und eine eigene Anwendung. Wie Sie die Varianten nach Qualität, Kosten und Aufwand vergleichen, zeigt der Artikel Copilot, ChatGPT oder eigene KI: Build vs. Buy.

Welches LLM ist DSGVO-konform?

Kein Modell ist für sich genommen DSGVO-konform. Bewertet wird die Verarbeitung: welche Daten in welchem Tarif an welchen Anbieter gehen, mit welchem Vertrag, an welchem Standort und mit welchen Löschfristen. Aus der Praxis unseres Gründers beim Diagnose-Assistenten eines Premium-Automobilherstellers: Die KI-Services wurden nach Antwortqualität, Kosten, Latenz und Datenschutz bewertet. Wir empfehlen, die datenschutzrechtlichen und vertraglichen Mindestanforderungen als Ausschlusskriterium zuerst zu prüfen. Erst danach vergleichen Sie Qualität, Kosten und Latenz der verbleibenden Kandidaten mit Ihren eigenen Testfragen. Wie Sie die Qualität messbar machen, beschreibt der Artikel RAG-Antwortqualität messen.

LLM lokal betreiben oder EU-Cloud: wann es sich lohnt

Die Wahl des Hostings ist zugleich die Wahl des Datenstandorts. Drei Optionen kommen für den Mittelstand in Frage.

EU-Region eines Hyperscalers. Die großen Cloud-Anbieter stellen aktuelle Modelle in Rechenzentren in der EU bereit, mit standardisierten AVV und Zusagen zum Trainingsausschluss. Vorteile sind Modellauswahl, Skalierung und vorhandene Zertifizierungen. Nachteile: Die Anbieter unterliegen als US-Konzerne auch US-Recht, und Details wie eine Missbrauchsüberwachung mit Zwischenspeicherung der Eingaben müssen vertraglich geklärt sein.

Europäische Anbieter. Modellanbieter oder Hoster mit Sitz und Rechenzentren in der EU. Das vereinfacht die Bewertung des Drittlandtransfers. Modellauswahl, Kapazität und Reifegrad der Plattform sind im Einzelfall zu prüfen.

Open-Weights-Modelle lokal betrieben. Modelle mit frei verfügbaren Gewichten laufen auf eigener Hardware oder in einem gemieteten GPU-Cluster. Auf eigener Hardware verlassen die Daten Ihre Umgebung nicht; beim gemieteten Cluster ist der Hoster Auftragsverarbeiter und braucht einen AVV. In beiden Fällen tragen Sie GPU-Betrieb, Sicherheit, Updates und das nötige Personal.

OptionDatenstandortBetriebsaufwandPasst, wenn
EU-Region eines HyperscalersEU, Anbieter außerhalb der EUniedrigSie die Cloud bereits nutzen und aktuelle Modelle brauchen
Europäischer AnbieterEU, Anbieter in der EUniedrig bis mittelDatenstandort und Anbieter in der EU Priorität haben
Open-Weights lokalIhre Umgebung, beim gemieteten Cluster der HosterhochDaten das Haus nicht verlassen dürfen und Betriebskompetenz vorhanden ist

Ein lokales LLM lohnt sich vor allem, wenn Verträge oder Geheimhaltung eine Verarbeitung außer Haus ausschließen, die Last gleichmäßig und planbar ist und jemand im Haus GPU-Server betreiben kann. Die DSK-Orientierungshilfe zu RAG-Systemen (Oktober 2025) nennt diesen Weg ausdrücklich als Möglichkeit: Weil das Wissen bei RAG aus den Dokumenten kommt, kommen mehr und auch kleinere Modelle in Betracht, und das System lässt sich unter Umständen on-premise betreiben. Die Aufsichtsbehörden betonen aber auch, dass kleine Modelle dieselben datenschutzrechtlichen Herausforderungen mitbringen wie große, und dass die Eignung jedes Sprachmodells geprüft und dokumentiert werden sollte. Für schwankende Last, hohe Qualitätsansprüche und Teams ohne GPU-Erfahrung ist die EU-Cloud meist die wirtschaftlichere Wahl. Wie wir Hosting-Optionen bis hin zu lokaler KI umsetzen, beschreibt die Seite KI-Entwicklung in München.

Technische und organisatorische Maßnahmen

Die Datenschutzkonferenz (DSK) hat dazu unter anderem zwei Orientierungshilfen veröffentlicht: die Orientierungshilfe zu technischen und organisatorischen Maßnahmen bei KI-Systemen (Juni 2025) und die bereits genannte zu RAG-Systemen (Oktober 2025). Die folgenden Maßnahmen greifen Empfehlungen dieser Orientierungshilfen auf; die Beteiligung des Betriebsrats kommt aus dem Arbeitsrecht hinzu.

Technisch

  • Datenminimierung im Retrieval. Nur die Abschnitte in den Kontext, die zur Frage passen. Nicht benötigte personenbezogene Felder vor der Indexierung entfernen oder maskieren.
  • Pseudonymisierung vor dem Prompt. Namen, Kundennummern und Kontaktdaten werden durch Platzhalter ersetzt, bevor die Anfrage den Modellanbieter erreicht. Die Zuordnung bleibt in Ihrer Umgebung. Das ist kein vollständiger Schutz, verringert aber, welche personenbezogenen Daten den Anbieter erreichen.
  • Berechtigungen im Retrieval. Der Assistent findet nur Dokumente, die der fragende Nutzer auch im Quellsystem sehen dürfte, umgesetzt als Filter in der Suche. Die DSK weist darauf hin, dass sich Zugriffsrechte in der Vektordatenbank steuern lassen, im Sprachmodell selbst dagegen nicht.
  • Löschfristen für Logs. Prompts und Antworten mit Nutzerbezug nach einer festen Frist löschen, die Sie mit dem Datenschutzbeauftragten am Zweck ausrichten, etwa so lange, wie Fehleranalyse und Qualitätsmessung die Rohdaten brauchen. Qualitätskennzahlen aggregiert aufbewahren. Einträge in der Vektordatenbank lassen sich laut DSK gezielt löschen, im Sprachmodell selbst bleibt die Löschung ein ungelöstes Problem.
  • Kein Training, keine unnötige Speicherung. Trainingsausschluss vertraglich sichern und klären, ob und wie lange der Anbieter Eingaben zur Missbrauchsüberwachung speichert.
  • Schutz vor Prompt-Injection. Dokumentinhalte als Daten behandeln, Systemanweisung und Kontext trennen, Ausgaben filtern, Aktionen wie Versand oder Löschung nur nach Bestätigung.
  • Verschlüsselung und Mandantentrennung. Verschlüsselung bei Übertragung und im Ruhezustand, getrennte Indizes für Abteilungen oder Kunden.

Organisatorisch

  • Verarbeitungsverzeichnis nach Art. 30 DSGVO mit Zweck, Datenkategorien, Empfängern und Löschfristen.
  • DSFA-Prüfung dokumentiert, bei Bedarf Durchführung vor dem Go-live.
  • Betriebsrat früh einbeziehen. Ein Assistent, der protokolliert, wer was fragt, kann zur Leistungs- und Verhaltenskontrolle geeignet sein und ist dann nach § 87 Abs. 1 Nr. 6 BetrVG mitbestimmungspflichtig. Eine Betriebsvereinbarung regelt, was protokolliert wird und wofür es nicht genutzt wird.
  • Nutzungsrichtlinie und Einweisung. Welche Daten eingegeben werden dürfen, dass der Assistent Fehler macht und wie Antworten geprüft werden.
  • Anbieterprüfung dokumentieren. AVV, Datenstandort, Unterauftragnehmer und Trainingsausschluss festhalten und bei Anbieterwechsel wiederholen.
  • Betroffenenrechte und Vorfälle. Auskunft und Löschung erfassen auch Logs und Vektorindex, ein Datenabfluss läuft über den normalen Meldeweg.

Checkliste vor dem Go-live

  • Datenflüsse für Prompt, Kontext, Embeddings, Logs und Feedback dokumentiert
  • Rechtsgrundlage je Verarbeitung festgelegt, Eintrag im Verarbeitungsverzeichnis
  • AVV mit jedem beteiligten Anbieter, Datenstandort oder Drittlandtransfer bewertet
  • Training vertraglich ausgeschlossen, Speicherung zur Missbrauchsüberwachung geklärt
  • Business-Tarif oder API bewusst gewählt, private Konten per Richtlinie ausgeschlossen
  • DSFA-Prüfung dokumentiert
  • Pseudonymisierung, Berechtigungsfilter und Löschfristen technisch umgesetzt und mit mehreren Rollen getestet
  • Schutz vor Prompt-Injection umgesetzt
  • Betriebsrat einbezogen, Nutzungsrichtlinie bekannt
  • Hinweis im Chatfenster, dass Nutzer mit einer KI interagieren (Art. 50 KI-VO)

Fazit

Ein DSGVO-konformer KI-Chatbot ist das Ergebnis einer Reihe von Entscheidungen: welcher Tarif oder welche API, welcher Standort, welcher Vertrag, welche Daten und wie lange gespeichert. Die Business-Tarife und APIs von OpenAI, Microsoft und Anthropic schließen das Training auf Kundendaten nach eigenen Angaben standardmäßig aus, bei privaten Konten entscheidet die einzelne Person. Ein lokales LLM lohnt sich, wenn Daten das Haus nicht verlassen dürfen und Betriebskompetenz vorhanden ist, sonst ist eine EU-Region meist die wirtschaftlichere Wahl. Zeichnen Sie die Datenflüsse früh auf und stellen Sie Datenschutz als Ausschlusskriterium vor die Qualitätsbewertung. Setzen Sie Berechtigungen, Pseudonymisierung und Löschfristen technisch um. Dann sind die meisten Fragen des Datenschutzbeauftragten beantwortet, bevor er sie stellt.

Sie planen einen Wissensassistenten oder Kundenchatbot, den Ihr Datenschutzbeauftragter freigeben soll? Wie wir solche Assistenten bauen, beschreibt die Seite KI-Chatbot für Unternehmen. Für ein erstes Gespräch über Ihren Anwendungsfall erreichen Sie uns über die Kontaktseite.

Passende Leistung

KI-Chatbot für Unternehmen: ein RAG-Assistent über Ihr Firmenwissen, mit Quellenangaben

Ein interner Wissensassistent, der Fragen aus Ihren eigenen Dokumenten beantwortet, jede Antwort mit Quelle belegt und nur zeigt, was der Nutzer sehen darf.

Zur Leistung KI-Chatbot & RAG

Häufige Fragen

Häufige Fragen zum Thema

Brauche ich für einen KI-Chatbot einen Auftragsverarbeitungsvertrag?

Sobald ein externer Anbieter personenbezogene Daten in Ihrem Auftrag verarbeitet, etwa der Betreiber des Sprachmodells oder der Vektordatenbank, ist ein Auftragsverarbeitungsvertrag nach Art. 28 DSGVO erforderlich. Die großen Anbieter stellen dafür Standardverträge bereit, die Sie auf Datenstandort, Unterauftragnehmer, Löschfristen und den Ausschluss von Training prüfen sollten. Ob im Einzelfall eine Auftragsverarbeitung vorliegt, klären Sie mit Ihrem Datenschutzbeauftragten.

Dürfen Mitarbeitende private ChatGPT- oder Claude-Konten für Firmendaten nutzen?

Davon ist abzuraten. Ein privates Konto ist ein Vertrag zwischen der Person und dem Anbieter, Ihr Unternehmen hat dann keinen Auftragsverarbeitungsvertrag, und für Verbraucher-Tarife gelten andere Regeln zu Training und Speicherdauer als für Business-Tarife und API. Legen Sie in einer Nutzungsrichtlinie fest, welche freigegebenen Werkzeuge für welche Datenklassen erlaubt sind, und stellen Sie eine freigegebene Lösung bereit, damit niemand auf private Konten ausweicht.

Ist ein selbst betriebenes Open-Weights-Modell automatisch DSGVO-konform?

Nein. Ein Open-Weights-Modell, also ein Modell mit frei verfügbaren Gewichten, das Sie auf eigener Hardware betreiben, löst die Frage des Datenstandorts und macht einen Auftragsverarbeitungsvertrag mit dem Modellanbieter überflüssig. Läuft das Modell auf gemieteter Infrastruktur, brauchen Sie weiterhin einen AVV mit dem Hoster. Rechtsgrundlage, Datenminimierung, Berechtigungen im Retrieval, Löschfristen für Logs und die Information der Betroffenen bleiben Ihre Aufgabe. Dazu kommt der Aufwand für Betrieb, Sicherheit und Modellpflege.

Wann ist eine Datenschutz-Folgenabschätzung für einen LLM-Assistenten nötig?

Wenn die Verarbeitung voraussichtlich ein hohes Risiko für die Betroffenen mit sich bringt, etwa bei Beschäftigtendaten, Gesundheitsdaten, großen Datenmengen oder neuen Technologien in Verbindung mit Bewertungen von Personen. Bei vielen Assistenten über Produkt- und Prozesswissen ohne Personenbezug ist sie nicht erforderlich; die Prüfung, ob sie nötig ist, sollten Sie aber dokumentieren. Die Entscheidung trifft der Verantwortliche; nach Art. 35 Abs. 2 DSGVO holt er dabei den Rat des Datenschutzbeauftragten ein.

Sie planen etwas in diese Richtung?

Im Erstgespräch übertragen wir die Erfahrung aus dem Artikel auf Ihre Situation. Kostenlos und unverbindlich.