Zum Inhalt springen

KI · 11 Min. Lesezeit

KI Build vs. Buy: Copilot, ChatGPT oder eigene KI?

Microsoft 365 Copilot, ChatGPT Business oder eigene KI? Acht Kriterien, Entscheidungsmatrix und der MIT-Befund zu Kaufen und Bauen im Mittelstand.

Von Amperbytes AI ·

Workshop an einem Whiteboard mit Haftnotizen und Prozessdiagrammen zur Bewertung von KI-Optionen

Copilot, ChatGPT oder eigene KI? Bei KI Build vs. Buy gilt für die meisten Unternehmen: Kaufen Sie für allgemeine Büroaufgaben ein Standardprodukt wie Microsoft 365 Copilot oder ChatGPT Business. Eine eigene KI, also einen Assistenten auf Ihren eigenen Daten, bauen Sie nur dort, wo Ihre Fachdaten und die Integration in Ihre Systeme über die Qualität entscheiden. Beides schließt sich nicht aus. Welche Option für einen Anwendungsfall gewinnt, zeigt ein Vergleich mit Ihren eigenen Fragen und Daten, nicht die beste Demo.

Dieser Artikel stellt die drei Optionen vor, vergleicht die bekannten Kaufprodukte, ordnet den MIT-Befund ein und gibt Ihnen eine Entscheidungsmatrix mit Gewichtung. Grundlage ist unter anderem ein Projekt, das unser Gründer bei einem Premium-Automobilhersteller verantwortet hat, nicht im Auftrag von Amperbytes AI. Dort hat er KI-Services nach Antwortqualität, Kosten, Latenz und Datenschutz bewertet. Danach ging ein Assistent mit Retrieval über Diagnoseinhalte in einem Diagnose-Service mit über 15.000 Nutzern pro Monat in Produktion.

Die drei Optionen

Option 1: Standardprodukt kaufen. Ein fertiger Assistent, meist als Zusatz zu Bürosoftware oder als eigenständiger Chat-Dienst, abgerechnet pro Nutzer. Sie konfigurieren, Sie entwickeln nicht. Der Assistent kennt die Daten seiner Produktwelt. Wissen im Dateiserver, im Ticketsystem oder in der Maschinendokumentation sieht er nicht oder nur über Zusatzmodule.

Option 2: Plattform mit eigener Integration. Eine KI-Plattform eines Cloud-Anbieters wird an Ihre Datenquellen, Berechtigungen und Oberflächen angebunden. Häufig kommt dabei RAG zum Einsatz (Retrieval-Augmented Generation): Der Assistent sucht zuerst in Ihren Dokumenten und lässt das Sprachmodell auf dieser Basis antworten. Modell, Suche und Betrieb liefert die Plattform, die Integration liefern Sie.

Option 3: Eigenentwicklung auf LLM-APIs. Ein eigener Service mit Retrieval, Prompts, Berechtigungen, Oberfläche und Monitoring. Das Sprachmodell (Large Language Model, LLM) kommt über eine Programmierschnittstelle (API) von einem Anbieter. Sie kontrollieren jede Komponente und tragen jede Komponente.

Viele Unternehmen kombinieren: ein Kaufprodukt für das Büro, daneben ein Assistent für das Fachwissen, das kein Kaufprodukt kennt.

Microsoft 365 Copilot, ChatGPT Business oder eigener Assistent

Die Produktnamen ändern sich schnell. Die folgenden Angaben entsprechen dem Stand vom 29. September 2026 laut den verlinkten Anbieterseiten.

Microsoft 365 Copilot

Microsoft unterscheidet laut seiner Übersicht zu Microsoft Copilot drei Lizenzstufen. Copilot Chat ist in berechtigten Microsoft-365-Lizenzen enthalten und antwortet vor allem auf Basis von Webdaten; eigene Inhalte müssen Nutzer hochladen oder im geöffneten Inhalt bereitstellen. Ohne Zusatzlizenz gibt es zudem einen Basiszugang zu Copilot in Textverarbeitung, Tabellen und Präsentationen, ebenfalls ohne automatischen Zugriff auf Unternehmensdaten. Erst die kostenpflichtige Zusatzlizenz Microsoft 365 Copilot (Premium) greift automatisch über Microsoft Graph auf E-Mails, Dateien, Besprechungen und Kalender zu, jeweils im Rahmen der Rechte des Nutzers. Prompts, Antworten und über Microsoft Graph abgerufene Daten nutzt Microsoft laut seiner Dokumentation zu Datenschutz in Copilot nicht zum Training der Basismodelle.

Die Stärke ist die Nähe zur täglichen Arbeit in Textverarbeitung, Tabellen und Postfach. Die Kehrseite: Copilot findet alles, was ein Nutzer sehen darf, auch zu weit freigegebene Ordner. Aufgeräumte Berechtigungen sind deshalb Voraussetzung, nicht Nebensache.

Für Nutzer in der EU bleibt der Datenverkehr laut Microsoft innerhalb der EU-Datengrenze. Ausnahmen bei zugeschalteten Modellen anderer Anbieter und die Vertragsfragen beschreibt der Artikel DSGVO-konforme LLM-Integration.

ChatGPT Business und ChatGPT Enterprise

OpenAI bietet für Organisationen die Tarife ChatGPT Business und ChatGPT Enterprise an: ein gemeinsamer Arbeitsbereich mit zentraler Nutzerverwaltung. Über die Funktion Company Knowledge greift ChatGPT auf angebundene Anwendungen wie Dokumentablagen oder Projektwerkzeuge zu, jeweils nur im Rahmen der Rechte des Nutzers und mit Verweis auf die Quelle. Laut OpenAI zum Umgang mit Unternehmensdaten werden Daten aus diesen Tarifen standardmäßig nicht zum Training der Modelle verwendet.

Für allgemeine Aufgaben ist ChatGPT für Unternehmen damit eine naheliegende Wahl. Auf Suche, Aufbereitung der Quellen und Qualitätsmessung haben Sie dabei wenig Einfluss. Wo hochgeladene Dateien und Standard-Anbindungen an Grenzen stoßen, beschreibt unser Artikel ChatGPT mit eigenen Daten trainieren.

Eigener Assistent

Ein eigener Assistent sucht in genau den Quellen, die für eine Fachfrage zählen, auch in Fachsystemen ohne fertige Anbindung. Er übernimmt die Berechtigungen der Quellsysteme und nennt zu jeder Antwort die Fundstelle. Er erscheint dort, wo die Frage entsteht, etwa in einer Fachanwendung. Das Modell lässt sich austauschen, wenn die Anbindung gekapselt ist. Dafür tragen Sie Aufbau und Betrieb. Ob sich das lohnt, entscheidet eine messbare Antwortqualität, wie sie der Artikel RAG-Antwortqualität messen beschreibt.

Kurz gesagt: Copilot, wenn das Wissen in Microsoft 365 liegt. ChatGPT Business, wenn ein allgemeiner Assistent mit zentraler Verwaltung gesucht ist. Eigener Assistent, wenn Fachwissen aus mehreren Systemen mit unterschiedlichen Rechten belastbar beantwortet werden muss.

MerkmalMicrosoft 365 Copilot (Premium)ChatGPT Business/EnterpriseEigener Assistent
Zugriff auf Firmendatenautomatisch über Microsoft Graph, vor allem Inhalte aus Microsoft 365hochgeladene Dateien und angebundene Anwendungen über Company Knowledgebeliebige Quellsysteme über deren Schnittstellen
BerechtigungenRechte des Nutzers in Microsoft 365Rechte des Nutzers in den angebundenen Anwendungenaus den Quellsystemen übernommen
Training auf Ihren Datenlaut Anbieter neinlaut Anbieter standardmäßig neinim API-Vertrag geregelt
Suche und Quellenangabevom Produkt vorgegebenvom Produkt vorgegebenfrei gestaltbar
BetriebAnbieterAnbieterSie oder ein Dienstleister
Passt, wenndas Wissen in Microsoft 365 liegtein allgemeiner Assistent mit zentraler Verwaltung gesucht istFachwissen aus mehreren Systemen belastbar beantwortet werden muss

Was der MIT-Bericht über Kaufen und Bauen sagt

Im August 2025 berichtete Fortune über einen Bericht des MIT-Projekts NANDA: Nur etwa 5 Prozent der Piloten mit generativer KI erzielten eine schnelle Umsatzsteigerung. Lösungen, die bei spezialisierten Anbietern gekauft oder gemeinsam mit externen Partnern umgesetzt wurden, gelangen in etwa 67 Prozent der Fälle. Rein interne Eigenbauten gelangen nur etwa ein Drittel so oft. Grundlage sind laut Fortune 150 Interviews, eine Befragung von 350 Beschäftigten und die Auswertung von 300 öffentlich bekannten KI-Einführungen. Eine genaue Erfolgsdefinition nennt der Bericht für die 67 Prozent nicht.

Wir bieten Eigenentwicklungen an und lesen diese Zahl trotzdem als klare Aussage: Kaufen ist der Standard, Bauen braucht eine Begründung. Das gilt auch, wenn ein externer Partner wie wir baut. Eine gute Begründung gibt es dort, wo die eigenen Daten und die Integration die Qualität bestimmen, etwa bei Fachwissen mit eigener Terminologie, verteilt über mehrere Systeme. Eine schlechte Begründung ist der Wunsch, ein allgemeines Chat-Werkzeug nachzubauen. Warum viele Piloten unabhängig von dieser Frage stecken bleiben, behandeln wir im Artikel Warum scheitern KI-Projekte?.

Acht Kriterien und die Entscheidungsmatrix

Kriterien und Gewichtung

KriteriumGewichtLeitfrage
Antwortqualität auf den eigenen Daten25Wie viele der Testfragen beantwortet der Kandidat korrekt und belegt?
Datenschutz und Datenstandort15Wo werden Prompts, Dokumente und Logs verarbeitet, und was steht im Vertrag?
Kosten pro Nutzer und pro Antwort15Was kostet der Betrieb bei realer Nutzung über drei Jahre?
Integrationstiefe15Erreicht der Assistent die Systeme und Berechtigungen, auf die es ankommt?
Time-to-Value10Wann arbeiten die ersten 20 Nutzer produktiv damit?
Betriebsaufwand10Wer betreibt Monitoring, Test-Set, Updates und Modellwechsel?
Lock-in5Was kostet ein Wechsel von Modell, Plattform oder Anbieter?
Latenz5Wie schnell kommt die Antwort im Arbeitsablauf an?

Die Gewichte sind ein Ausgangspunkt. Ein Kundenservice mit Wartezeit am Telefon gewichtet Latenz höher, ein Unternehmen mit Gesundheitsdaten den Datenschutz. Legen Sie die Gewichte vor der Bewertung fest, nicht danach, wenn der Favorit feststeht. Jedes Kriterium bekommt je Kandidat 1 bis 5 Punkte; multipliziert mit dem Gewicht und aufsummiert ergibt das den Gesamtwert.

Typische Ausgangswerte

Kriterium (Gewicht)KaufenPlattform mit IntegrationEigenentwicklung
Antwortqualität auf eigenen Daten (25)2 bis 4, je nach Datenlage3 bis 44 bis 5
Datenschutz und Datenstandort (15)3, vom Anbieter vorgegeben3 bis 4, Region wählbar4 bis 5, frei wählbar
Kosten (15)4 bei wenigen, 2 bei vielen Nutzern32 bis 4, abhängig vom Volumen
Integrationstiefe (15)245
Time-to-Value (10)532
Betriebsaufwand (10)532
Lock-in (5)234
Latenz (5)433 bis 5

Kaufen gewinnt bei Time-to-Value und Betriebsaufwand und verliert bei Integrationstiefe und Lock-in. Eigenentwicklung gewinnt bei Qualität auf eigenen Daten und Integration und verliert bei Zeit und Betrieb. Die Plattform liegt dazwischen. Ihre eigene Messung mit dem Test-Set ersetzt diese Werte.

Drei typische Fälle

Interner Wissensassistent. Fragen zu Prozessen, Produkten, Verträgen und Technik. Liegen die Dokumente überwiegend in einer Produktwelt mit sauberen Berechtigungen, testen Sie zuerst das Kaufprodukt. Liegt das Wissen in Dateiservern, Wikis, Ticketsystemen und PDF-Handbüchern mit eigener Terminologie, wird das Kaufprodukt meist enttäuschen. Empfehlung: Plattform mit Integration als Start, Eigenentwicklung, wenn Berechtigungen und Qualität im Test nicht reichen.

Kundenservice. Hier zählen Anbindung an CRM und Ticketsystem, Eskalation an Menschen, Tonalität und Haftung. Kaufprodukte für den Kundenservice sind ausgereift, wenn Ihre Prozesse hineinpassen. Empfehlung: Kaufprodukt oder Plattform; Eigenentwicklung nur bei einem Kernprozess mit hohem Volumen und eigener Logik.

Dokumentenextraktion. Verträge, Prüfberichte oder Formulare in strukturierte Daten überführen. Die Qualität ist messbar (Feld korrekt oder nicht), das Volumen oft hoch. Für Standarddokumente gibt es fertige Produkte. Für eigene Dokumenttypen ist eine Eigenentwicklung auf LLM-APIs mit Validierungsregeln oft wirtschaftlicher, weil die Integration klein und der Betrieb überschaubar ist.

Das Bewertungsverfahren: Testfragen, Kosten, Datenschutz

Im Projekt unseres Gründers beim Automobilhersteller wurden die Kandidaten auf echten Diagnosefragen verglichen: nach Antwortqualität, Kosten, Latenz und Datenschutz. Die Ergebnisse wurden dokumentiert und mit den Stakeholdern abgestimmt, bevor die Entscheidung fiel. Im Betrieb wurde die Antwortqualität anschließend mit definierten Kennzahlen gemessen und in Grafana und Kibana sichtbar gemacht. Unser Schluss daraus: Mit dokumentierten Messwerten lässt sich eine Entscheidung begründen, mit Eindrücken aus Demos nicht. Daraus leiten wir dieses Verfahren für den Mittelstand ab:

  1. Rund 50 Fragen aus dem Fachbereich. Echte Fragen mit Referenzantwort und Quelle, abgenommen von zwei Fachleuten. Darunter Fragen mit Abkürzungen, mehrstufige Fragen und einige, deren Antwort in keinem Dokument steht.
  2. Alle Kandidaten mit denselben Daten. Die Antworten werden anonymisiert und von Fachleuten bewertet: korrekt, belegt, brauchbar. So bewerten Sie Systeme und nicht Präsentationen.
  3. Kosten hochrechnen. Nutzerzahl mal Fragen pro Tag mal Kosten je Antwort, plus Lizenzen und Betrieb, über drei Jahre. Bei Kaufprodukten zählen die lizenzierten Nutzer, nicht die aktiven.
  4. Latenz messen. Antwortzeit im 95. Perzentil unter realistischer Last, nicht im Einzeltest.
  5. Datenschutz prüfen. Datenstandort, Auftragsverarbeitungsvertrag, Ausschluss von Training auf Ihren Daten, Löschfristen für Logs, Berechtigungen im Retrieval. Wer hier durchfällt, fällt ganz durch.
  6. Ergebnis dokumentieren und abstimmen. Mit Fachbereich, Datenschutz und IT, bevor der Vertrag unterschrieben wird.

Der Aufwand hängt vor allem von der Zahl der Kandidaten und der Verfügbarkeit des Fachbereichs für das Test-Set ab. Für eine Entscheidung, die drei Jahre bindet, ist das gut angelegte Zeit.

Häufige Fehlentscheidungen

  • Demo statt Test-Set. Erst nach dem Kauf zeigt sich, dass die eigene Terminologie nicht verstanden wird.
  • Lizenzen für alle, Nutzung bei wenigen. Starten Sie mit einer Pilotgruppe und rechnen Sie mit der realen Nutzung.
  • Eigenentwicklung ohne Betriebsplan. Niemand pflegt Test-Set, Monitoring und Modellwechsel. Nach einem Jahr ist der Assistent schlechter als am ersten Tag, weil sich die Dokumente geändert haben.
  • Datenschutz am Ende. Der Favorit steht fest, dann liegen die Logs außerhalb der EU. Datenschutz gehört als Ausschlusskriterium an den Anfang.
  • Lock-in ignoriert. Prompts, Vektorindizes und Workflows in proprietären Formaten machen einen Modellwechsel zum Projekt. Kapseln Sie die Modellanbindung.
  • Modell statt System bewertet. Ein starkes Modell hilft nicht, wenn das Retrieval den falschen Abschnitt liefert. Bewerten Sie die gesamte Kette.

Fazit

Build oder Buy ist bei KI keine Glaubensfrage, sondern eine Rechnung mit acht Kriterien und Ihren eigenen Daten. Der MIT-Bericht spricht dafür, Kaufen als Standard zu prüfen: Microsoft 365 Copilot und ChatGPT Business decken allgemeine Büroaufgaben gut ab. Ein eigener Assistent lohnt sich dort, wo Fachwissen aus mehreren Systemen, eigene Terminologie und unterschiedliche Berechtigungen die Qualität bestimmen. Ein Vergleich mit rund 50 echten Fragen, hochgerechneten Kosten und einer Datenschutzprüfung verhindert Entscheidungen, die drei Jahre binden.

Wenn Sie vor dieser Entscheidung stehen: In der KI-Beratung erarbeiten wir mit Ihnen Anwendungsfall, Test-Set und Bewertung, auch mit dem Ergebnis, dass ein Kaufprodukt besser passt. Für ein erstes Gespräch erreichen Sie uns über die Kontaktseite.

Passende Leistung

KI-Beratung für Unternehmen in München: Use Cases finden, richtig entscheiden

KI-Potenzialanalyse im Workshop, Build-vs-Buy-Entscheidung und ein Pilotplan mit Messgrößen. Herstellerunabhängig, aus Olching bei München.

Zur Leistung KI-Beratung

Häufige Fragen

Häufige Fragen zum Thema

Wann reicht ein Kaufprodukt wie Microsoft 365 Copilot oder ChatGPT Business?

Ein Kaufprodukt reicht, wenn die Aufgaben allgemein sind: Texte entwerfen, E-Mails zusammenfassen, Tabellen auswerten, Besprechungen nachbereiten. Microsoft 365 Copilot passt, wenn das relevante Wissen überwiegend in der Microsoft-365-Umgebung liegt und die Berechtigungen dort sauber gepflegt sind. ChatGPT Business passt, wenn Abteilungen einen allgemeinen Assistenten mit zentraler Verwaltung brauchen und das Fachwissen überschaubar ist.

Wann lohnt sich eine Eigenentwicklung auf LLM-APIs statt eines Kaufprodukts?

Wenn die Antwortqualität auf Ihren eigenen Fachdaten entscheidet, die Integration in bestehende Systeme tief sein muss und Sie den Betrieb personell tragen können. Typisch sind Assistenten über Fachwissen mit eigener Terminologie und unterschiedlichen Berechtigungen sowie Extraktion eigener Dokumenttypen mit fester Ausgabestruktur. Für allgemeine Büroaufgaben ist ein Kaufprodukt fast immer die passendere Wahl.

Scheitern selbst gebaute KI-Lösungen häufiger als gekaufte?

Laut dem MIT-Bericht, über den Fortune im August 2025 berichtete, gelingen Käufe bei spezialisierten Anbietern und Partnerschaften in etwa 67 Prozent der Fälle, rein interne Eigenbauten nur etwa ein Drittel so oft. Eine genaue Erfolgsdefinition nennt der Fortune-Bericht für diese Zahl nicht. Die Zahl spricht dafür, Kaufen als Standard zu prüfen und Eigenbau nur dort zu wählen, wo eigene Daten und Integration die Qualität bestimmen.

Wie vergleicht man Kaufprodukt, Plattform und Eigenentwicklung fair?

Mit denselben rund 50 Fragen aus dem Fachbereich gegen alle Kandidaten, bewertet von Fachleuten, die nicht wissen, welche Antwort von welchem System stammt. Dazu rechnen Sie die Kosten auf die erwartete Nutzerzahl und die Fragen pro Tag hoch, messen die Latenz und prüfen Datenstandort und Vertragsbedingungen. Das Ergebnis dokumentieren Sie, damit die Entscheidung nachvollziehbar bleibt.

Sie planen etwas in diese Richtung?

Im Erstgespräch übertragen wir die Erfahrung aus dem Artikel auf Ihre Situation. Kostenlos und unverbindlich.