KI · 11 Min. Lesezeit
KI Build vs. Buy: Copilot, ChatGPT oder eigene KI?
Microsoft 365 Copilot, ChatGPT Business oder eigene KI? Acht Kriterien, Entscheidungsmatrix und der MIT-Befund zu Kaufen und Bauen im Mittelstand.
Von Amperbytes AI ·

Copilot, ChatGPT oder eigene KI? Bei KI Build vs. Buy gilt für die meisten Unternehmen: Kaufen Sie für allgemeine Büroaufgaben ein Standardprodukt wie Microsoft 365 Copilot oder ChatGPT Business. Eine eigene KI, also einen Assistenten auf Ihren eigenen Daten, bauen Sie nur dort, wo Ihre Fachdaten und die Integration in Ihre Systeme über die Qualität entscheiden. Beides schließt sich nicht aus. Welche Option für einen Anwendungsfall gewinnt, zeigt ein Vergleich mit Ihren eigenen Fragen und Daten, nicht die beste Demo.
Dieser Artikel stellt die drei Optionen vor, vergleicht die bekannten Kaufprodukte, ordnet den MIT-Befund ein und gibt Ihnen eine Entscheidungsmatrix mit Gewichtung. Grundlage ist unter anderem ein Projekt, das unser Gründer bei einem Premium-Automobilhersteller verantwortet hat, nicht im Auftrag von Amperbytes AI. Dort hat er KI-Services nach Antwortqualität, Kosten, Latenz und Datenschutz bewertet. Danach ging ein Assistent mit Retrieval über Diagnoseinhalte in einem Diagnose-Service mit über 15.000 Nutzern pro Monat in Produktion.
Die drei Optionen
Option 1: Standardprodukt kaufen. Ein fertiger Assistent, meist als Zusatz zu Bürosoftware oder als eigenständiger Chat-Dienst, abgerechnet pro Nutzer. Sie konfigurieren, Sie entwickeln nicht. Der Assistent kennt die Daten seiner Produktwelt. Wissen im Dateiserver, im Ticketsystem oder in der Maschinendokumentation sieht er nicht oder nur über Zusatzmodule.
Option 2: Plattform mit eigener Integration. Eine KI-Plattform eines Cloud-Anbieters wird an Ihre Datenquellen, Berechtigungen und Oberflächen angebunden. Häufig kommt dabei RAG zum Einsatz (Retrieval-Augmented Generation): Der Assistent sucht zuerst in Ihren Dokumenten und lässt das Sprachmodell auf dieser Basis antworten. Modell, Suche und Betrieb liefert die Plattform, die Integration liefern Sie.
Option 3: Eigenentwicklung auf LLM-APIs. Ein eigener Service mit Retrieval, Prompts, Berechtigungen, Oberfläche und Monitoring. Das Sprachmodell (Large Language Model, LLM) kommt über eine Programmierschnittstelle (API) von einem Anbieter. Sie kontrollieren jede Komponente und tragen jede Komponente.
Viele Unternehmen kombinieren: ein Kaufprodukt für das Büro, daneben ein Assistent für das Fachwissen, das kein Kaufprodukt kennt.
Microsoft 365 Copilot, ChatGPT Business oder eigener Assistent
Die Produktnamen ändern sich schnell. Die folgenden Angaben entsprechen dem Stand vom 29. September 2026 laut den verlinkten Anbieterseiten.
Microsoft 365 Copilot
Microsoft unterscheidet laut seiner Übersicht zu Microsoft Copilot drei Lizenzstufen. Copilot Chat ist in berechtigten Microsoft-365-Lizenzen enthalten und antwortet vor allem auf Basis von Webdaten; eigene Inhalte müssen Nutzer hochladen oder im geöffneten Inhalt bereitstellen. Ohne Zusatzlizenz gibt es zudem einen Basiszugang zu Copilot in Textverarbeitung, Tabellen und Präsentationen, ebenfalls ohne automatischen Zugriff auf Unternehmensdaten. Erst die kostenpflichtige Zusatzlizenz Microsoft 365 Copilot (Premium) greift automatisch über Microsoft Graph auf E-Mails, Dateien, Besprechungen und Kalender zu, jeweils im Rahmen der Rechte des Nutzers. Prompts, Antworten und über Microsoft Graph abgerufene Daten nutzt Microsoft laut seiner Dokumentation zu Datenschutz in Copilot nicht zum Training der Basismodelle.
Die Stärke ist die Nähe zur täglichen Arbeit in Textverarbeitung, Tabellen und Postfach. Die Kehrseite: Copilot findet alles, was ein Nutzer sehen darf, auch zu weit freigegebene Ordner. Aufgeräumte Berechtigungen sind deshalb Voraussetzung, nicht Nebensache.
Für Nutzer in der EU bleibt der Datenverkehr laut Microsoft innerhalb der EU-Datengrenze. Ausnahmen bei zugeschalteten Modellen anderer Anbieter und die Vertragsfragen beschreibt der Artikel DSGVO-konforme LLM-Integration.
ChatGPT Business und ChatGPT Enterprise
OpenAI bietet für Organisationen die Tarife ChatGPT Business und ChatGPT Enterprise an: ein gemeinsamer Arbeitsbereich mit zentraler Nutzerverwaltung. Über die Funktion Company Knowledge greift ChatGPT auf angebundene Anwendungen wie Dokumentablagen oder Projektwerkzeuge zu, jeweils nur im Rahmen der Rechte des Nutzers und mit Verweis auf die Quelle. Laut OpenAI zum Umgang mit Unternehmensdaten werden Daten aus diesen Tarifen standardmäßig nicht zum Training der Modelle verwendet.
Für allgemeine Aufgaben ist ChatGPT für Unternehmen damit eine naheliegende Wahl. Auf Suche, Aufbereitung der Quellen und Qualitätsmessung haben Sie dabei wenig Einfluss. Wo hochgeladene Dateien und Standard-Anbindungen an Grenzen stoßen, beschreibt unser Artikel ChatGPT mit eigenen Daten trainieren.
Eigener Assistent
Ein eigener Assistent sucht in genau den Quellen, die für eine Fachfrage zählen, auch in Fachsystemen ohne fertige Anbindung. Er übernimmt die Berechtigungen der Quellsysteme und nennt zu jeder Antwort die Fundstelle. Er erscheint dort, wo die Frage entsteht, etwa in einer Fachanwendung. Das Modell lässt sich austauschen, wenn die Anbindung gekapselt ist. Dafür tragen Sie Aufbau und Betrieb. Ob sich das lohnt, entscheidet eine messbare Antwortqualität, wie sie der Artikel RAG-Antwortqualität messen beschreibt.
Kurz gesagt: Copilot, wenn das Wissen in Microsoft 365 liegt. ChatGPT Business, wenn ein allgemeiner Assistent mit zentraler Verwaltung gesucht ist. Eigener Assistent, wenn Fachwissen aus mehreren Systemen mit unterschiedlichen Rechten belastbar beantwortet werden muss.
| Merkmal | Microsoft 365 Copilot (Premium) | ChatGPT Business/Enterprise | Eigener Assistent |
|---|---|---|---|
| Zugriff auf Firmendaten | automatisch über Microsoft Graph, vor allem Inhalte aus Microsoft 365 | hochgeladene Dateien und angebundene Anwendungen über Company Knowledge | beliebige Quellsysteme über deren Schnittstellen |
| Berechtigungen | Rechte des Nutzers in Microsoft 365 | Rechte des Nutzers in den angebundenen Anwendungen | aus den Quellsystemen übernommen |
| Training auf Ihren Daten | laut Anbieter nein | laut Anbieter standardmäßig nein | im API-Vertrag geregelt |
| Suche und Quellenangabe | vom Produkt vorgegeben | vom Produkt vorgegeben | frei gestaltbar |
| Betrieb | Anbieter | Anbieter | Sie oder ein Dienstleister |
| Passt, wenn | das Wissen in Microsoft 365 liegt | ein allgemeiner Assistent mit zentraler Verwaltung gesucht ist | Fachwissen aus mehreren Systemen belastbar beantwortet werden muss |
Was der MIT-Bericht über Kaufen und Bauen sagt
Im August 2025 berichtete Fortune über einen Bericht des MIT-Projekts NANDA: Nur etwa 5 Prozent der Piloten mit generativer KI erzielten eine schnelle Umsatzsteigerung. Lösungen, die bei spezialisierten Anbietern gekauft oder gemeinsam mit externen Partnern umgesetzt wurden, gelangen in etwa 67 Prozent der Fälle. Rein interne Eigenbauten gelangen nur etwa ein Drittel so oft. Grundlage sind laut Fortune 150 Interviews, eine Befragung von 350 Beschäftigten und die Auswertung von 300 öffentlich bekannten KI-Einführungen. Eine genaue Erfolgsdefinition nennt der Bericht für die 67 Prozent nicht.
Wir bieten Eigenentwicklungen an und lesen diese Zahl trotzdem als klare Aussage: Kaufen ist der Standard, Bauen braucht eine Begründung. Das gilt auch, wenn ein externer Partner wie wir baut. Eine gute Begründung gibt es dort, wo die eigenen Daten und die Integration die Qualität bestimmen, etwa bei Fachwissen mit eigener Terminologie, verteilt über mehrere Systeme. Eine schlechte Begründung ist der Wunsch, ein allgemeines Chat-Werkzeug nachzubauen. Warum viele Piloten unabhängig von dieser Frage stecken bleiben, behandeln wir im Artikel Warum scheitern KI-Projekte?.
Acht Kriterien und die Entscheidungsmatrix
Kriterien und Gewichtung
| Kriterium | Gewicht | Leitfrage |
|---|---|---|
| Antwortqualität auf den eigenen Daten | 25 | Wie viele der Testfragen beantwortet der Kandidat korrekt und belegt? |
| Datenschutz und Datenstandort | 15 | Wo werden Prompts, Dokumente und Logs verarbeitet, und was steht im Vertrag? |
| Kosten pro Nutzer und pro Antwort | 15 | Was kostet der Betrieb bei realer Nutzung über drei Jahre? |
| Integrationstiefe | 15 | Erreicht der Assistent die Systeme und Berechtigungen, auf die es ankommt? |
| Time-to-Value | 10 | Wann arbeiten die ersten 20 Nutzer produktiv damit? |
| Betriebsaufwand | 10 | Wer betreibt Monitoring, Test-Set, Updates und Modellwechsel? |
| Lock-in | 5 | Was kostet ein Wechsel von Modell, Plattform oder Anbieter? |
| Latenz | 5 | Wie schnell kommt die Antwort im Arbeitsablauf an? |
Die Gewichte sind ein Ausgangspunkt. Ein Kundenservice mit Wartezeit am Telefon gewichtet Latenz höher, ein Unternehmen mit Gesundheitsdaten den Datenschutz. Legen Sie die Gewichte vor der Bewertung fest, nicht danach, wenn der Favorit feststeht. Jedes Kriterium bekommt je Kandidat 1 bis 5 Punkte; multipliziert mit dem Gewicht und aufsummiert ergibt das den Gesamtwert.
Typische Ausgangswerte
| Kriterium (Gewicht) | Kaufen | Plattform mit Integration | Eigenentwicklung |
|---|---|---|---|
| Antwortqualität auf eigenen Daten (25) | 2 bis 4, je nach Datenlage | 3 bis 4 | 4 bis 5 |
| Datenschutz und Datenstandort (15) | 3, vom Anbieter vorgegeben | 3 bis 4, Region wählbar | 4 bis 5, frei wählbar |
| Kosten (15) | 4 bei wenigen, 2 bei vielen Nutzern | 3 | 2 bis 4, abhängig vom Volumen |
| Integrationstiefe (15) | 2 | 4 | 5 |
| Time-to-Value (10) | 5 | 3 | 2 |
| Betriebsaufwand (10) | 5 | 3 | 2 |
| Lock-in (5) | 2 | 3 | 4 |
| Latenz (5) | 4 | 3 | 3 bis 5 |
Kaufen gewinnt bei Time-to-Value und Betriebsaufwand und verliert bei Integrationstiefe und Lock-in. Eigenentwicklung gewinnt bei Qualität auf eigenen Daten und Integration und verliert bei Zeit und Betrieb. Die Plattform liegt dazwischen. Ihre eigene Messung mit dem Test-Set ersetzt diese Werte.
Drei typische Fälle
Interner Wissensassistent. Fragen zu Prozessen, Produkten, Verträgen und Technik. Liegen die Dokumente überwiegend in einer Produktwelt mit sauberen Berechtigungen, testen Sie zuerst das Kaufprodukt. Liegt das Wissen in Dateiservern, Wikis, Ticketsystemen und PDF-Handbüchern mit eigener Terminologie, wird das Kaufprodukt meist enttäuschen. Empfehlung: Plattform mit Integration als Start, Eigenentwicklung, wenn Berechtigungen und Qualität im Test nicht reichen.
Kundenservice. Hier zählen Anbindung an CRM und Ticketsystem, Eskalation an Menschen, Tonalität und Haftung. Kaufprodukte für den Kundenservice sind ausgereift, wenn Ihre Prozesse hineinpassen. Empfehlung: Kaufprodukt oder Plattform; Eigenentwicklung nur bei einem Kernprozess mit hohem Volumen und eigener Logik.
Dokumentenextraktion. Verträge, Prüfberichte oder Formulare in strukturierte Daten überführen. Die Qualität ist messbar (Feld korrekt oder nicht), das Volumen oft hoch. Für Standarddokumente gibt es fertige Produkte. Für eigene Dokumenttypen ist eine Eigenentwicklung auf LLM-APIs mit Validierungsregeln oft wirtschaftlicher, weil die Integration klein und der Betrieb überschaubar ist.
Das Bewertungsverfahren: Testfragen, Kosten, Datenschutz
Im Projekt unseres Gründers beim Automobilhersteller wurden die Kandidaten auf echten Diagnosefragen verglichen: nach Antwortqualität, Kosten, Latenz und Datenschutz. Die Ergebnisse wurden dokumentiert und mit den Stakeholdern abgestimmt, bevor die Entscheidung fiel. Im Betrieb wurde die Antwortqualität anschließend mit definierten Kennzahlen gemessen und in Grafana und Kibana sichtbar gemacht. Unser Schluss daraus: Mit dokumentierten Messwerten lässt sich eine Entscheidung begründen, mit Eindrücken aus Demos nicht. Daraus leiten wir dieses Verfahren für den Mittelstand ab:
- Rund 50 Fragen aus dem Fachbereich. Echte Fragen mit Referenzantwort und Quelle, abgenommen von zwei Fachleuten. Darunter Fragen mit Abkürzungen, mehrstufige Fragen und einige, deren Antwort in keinem Dokument steht.
- Alle Kandidaten mit denselben Daten. Die Antworten werden anonymisiert und von Fachleuten bewertet: korrekt, belegt, brauchbar. So bewerten Sie Systeme und nicht Präsentationen.
- Kosten hochrechnen. Nutzerzahl mal Fragen pro Tag mal Kosten je Antwort, plus Lizenzen und Betrieb, über drei Jahre. Bei Kaufprodukten zählen die lizenzierten Nutzer, nicht die aktiven.
- Latenz messen. Antwortzeit im 95. Perzentil unter realistischer Last, nicht im Einzeltest.
- Datenschutz prüfen. Datenstandort, Auftragsverarbeitungsvertrag, Ausschluss von Training auf Ihren Daten, Löschfristen für Logs, Berechtigungen im Retrieval. Wer hier durchfällt, fällt ganz durch.
- Ergebnis dokumentieren und abstimmen. Mit Fachbereich, Datenschutz und IT, bevor der Vertrag unterschrieben wird.
Der Aufwand hängt vor allem von der Zahl der Kandidaten und der Verfügbarkeit des Fachbereichs für das Test-Set ab. Für eine Entscheidung, die drei Jahre bindet, ist das gut angelegte Zeit.
Häufige Fehlentscheidungen
- Demo statt Test-Set. Erst nach dem Kauf zeigt sich, dass die eigene Terminologie nicht verstanden wird.
- Lizenzen für alle, Nutzung bei wenigen. Starten Sie mit einer Pilotgruppe und rechnen Sie mit der realen Nutzung.
- Eigenentwicklung ohne Betriebsplan. Niemand pflegt Test-Set, Monitoring und Modellwechsel. Nach einem Jahr ist der Assistent schlechter als am ersten Tag, weil sich die Dokumente geändert haben.
- Datenschutz am Ende. Der Favorit steht fest, dann liegen die Logs außerhalb der EU. Datenschutz gehört als Ausschlusskriterium an den Anfang.
- Lock-in ignoriert. Prompts, Vektorindizes und Workflows in proprietären Formaten machen einen Modellwechsel zum Projekt. Kapseln Sie die Modellanbindung.
- Modell statt System bewertet. Ein starkes Modell hilft nicht, wenn das Retrieval den falschen Abschnitt liefert. Bewerten Sie die gesamte Kette.
Fazit
Build oder Buy ist bei KI keine Glaubensfrage, sondern eine Rechnung mit acht Kriterien und Ihren eigenen Daten. Der MIT-Bericht spricht dafür, Kaufen als Standard zu prüfen: Microsoft 365 Copilot und ChatGPT Business decken allgemeine Büroaufgaben gut ab. Ein eigener Assistent lohnt sich dort, wo Fachwissen aus mehreren Systemen, eigene Terminologie und unterschiedliche Berechtigungen die Qualität bestimmen. Ein Vergleich mit rund 50 echten Fragen, hochgerechneten Kosten und einer Datenschutzprüfung verhindert Entscheidungen, die drei Jahre binden.
Wenn Sie vor dieser Entscheidung stehen: In der KI-Beratung erarbeiten wir mit Ihnen Anwendungsfall, Test-Set und Bewertung, auch mit dem Ergebnis, dass ein Kaufprodukt besser passt. Für ein erstes Gespräch erreichen Sie uns über die Kontaktseite.
Passende Leistung
KI-Beratung für Unternehmen in München: Use Cases finden, richtig entscheiden
KI-Potenzialanalyse im Workshop, Build-vs-Buy-Entscheidung und ein Pilotplan mit Messgrößen. Herstellerunabhängig, aus Olching bei München.
Zur Leistung KI-Beratung