Eine KI-Wissensdatenbank aufbauen heißt, einen gepflegten Bestand aus freigegebenen Fragen und Antworten anzulegen und eine Such- und Formulierungsschicht darüberzulegen, die jede Antwort mit ihrer Quelle ausgibt. Der Aufbau läuft in sechs Schritten: festlegen, wer welche Fragen stellt; Quellen zulassen und begrenzen; Gesprächswissen rechtlich und fachlich prüfen; kleine Wissenseinheiten bauen, je eine Frage, eine Antwort, eine Quelle; Antworten mit Beleg ausgeben und bei fehlender Grundlage das auch sagen; Rückmeldungen in die nächste Pflegerunde führen. Für kleine Unternehmen liegt ein großer Teil des wertvollen Wissens dabei nicht in Handbüchern, sondern in Verkaufs-, Support- und Beratungsgesprächen. Der falsche Start lautet: „Wir laden alles in eine KI.“ Der bessere Start lautet: Welche Fragen soll das System beantworten, wer darf welche Quellen sehen und wer gibt eine Antwort fachlich frei?
Bei mir beginnt die Wissensdatenbank deshalb nicht beim Dokument, sondern beim Gespräch. Das geprüfte Zwischenprodukt dafür ist das Muster-Register aus Gesprächsanalysen: wiederkehrende Fragen, jede mit meiner bislang klarsten eigenen Antwort und der Fundstelle. Dieser Beitrag zeigt, wie aus dem Register ein Antwortsystem wird, das ein Team benutzen kann. Welche Rolle bei mir welche Aufgabe übernimmt, steht unter KI-Mitarbeiter.
Wissensbasis und KI-Antwortsystem trennen
Die Wissensbasis ist der gepflegte Bestand. Darin liegen freigegebene Fragen, Antworten, Quellen, Versionen und Gültigkeitsdaten. Die KI ist die Such- und Formulierungsschicht darüber.
Ein robustes Antwortsystem arbeitet vereinfacht in vier Schritten:
- Eine Person stellt eine Frage.
- Das System sucht passende, freigegebene Wissenseinträge.
- Die KI formuliert eine Antwort auf Basis dieser Treffer, und nur dieser Treffer.
- Die Antwort zeigt die Belegstellen oder meldet, dass die Grundlage nicht reicht.
Das Muster dahinter heißt Retrieval Augmented Generation, kurz RAG. Microsoft beschreibt es als Muster, das ein Sprachmodell erweitert, indem es Antworten in den eigenen Inhalten verankert. Der Punkt ist die Verankerung: Das Modell antwortet aus den abgerufenen Einträgen, nicht aus dem, was es im Training gesehen hat. Das senkt das Risiko frei erfundener Antworten, beseitigt es aber nicht. Quellen können veraltet, widersprüchlich oder falsch zugeordnet sein, und ein Modell kann einen Treffer überdehnen. Deshalb bleibt die Pflege des Bestands der wichtigste Teil, und deshalb zeigt jede Antwort ihre Quelle: Wer die Belegstelle sieht, kann die Antwort in dreißig Sekunden prüfen.
Welche Call-Inhalte hineingehören
Ein Rohtranskript ist keine Wissensdatenbank. Es enthält Füllwörter, personenbezogene Daten, Einzelfälle und widersprüchliche Aussagen. Vor der Übernahme brauchst du ein geprüftes Zwischenprodukt, bei mir das Register. Ein freigegebener Eintrag sollte mindestens enthalten:
Die Frage in Kundensprache ist das wichtigste Feld: Eine Suche findet „Was kostet so etwas ungefähr?“ nur, wenn der Eintrag so heißt und nicht „Preisgestaltung Erstgespräch“.
KI-Wissensdatenbank aufbauen: der Ablauf in sechs Schritten
1. Fragen und Nutzer festlegen
Eine interne Supportkraft braucht andere Antworten als ein Website-Besucher. Schreibe zehn reale Fragen auf und daneben, wer sie stellt: Kunde vor dem Kauf, Kunde nach dem Kauf, neue Kollegin in der ersten Woche, du selbst im Verkaufsgespräch. Erst dann wählst du Quellen und Technik. Die zehn Fragen sind später dein Testsatz.
2. Quellen zulassen und begrenzen
Geeignet sind freigegebene FAQ, Prozessbeschreibungen, Produktinformationen und geprüfte Muster aus Gesprächen. Nicht geeignet sind unkontrollierte Altbestände, private Notizen oder Aufnahmen ohne geklärte Rechtsgrundlage. Schreib die Liste der zugelassenen Quellen auf, mit Verantwortlichem je Quelle.
3. Gesprächswissen prüfen
Vor der fachlichen Auswertung stehen Einwilligung, Zweck, Zugriffsschutz und Speicherdauer. Namen durch Rollen und Firmen durch Branchen zu ersetzen ist Pseudonymisierung, keine automatische Anonymisierung; die Einträge bleiben personenbezogen, solange eine Zuordnung möglich ist. Ich bin Entwickler und kein Anwalt, das hier ist keine Rechtsberatung, im Zweifel gehört der Einzelfall geprüft. Wie lokale Transkription die Datenwege verkürzt, zeigt Transkriptionssoftware im Vergleich.
4. Kleine Wissenseinheiten bauen
Ein Eintrag beantwortet eine Frage. Teile lange Gesprächszusammenfassungen auf, behalte aber Kontext und Quelle. Microsoft empfiehlt für RAG ausdrücklich, große Dokumente in Abschnitte zu zerlegen, damit einzelne Teile unabhängig voneinander gefunden werden können. So findet die Suche den passenden Absatz, statt ein komplettes 45-Minuten-Transkript zu durchsuchen. Das Register ist schon in dieser Form: ein Eintrag, eine Frage, eine Antwort, eine Fundstelle.
5. Antworten mit Belegen ausgeben
Die Oberfläche sollte Quelle, Aktualität und Zuständigkeit sichtbar machen. Fehlt eine ausreichende Grundlage, ist „Dazu gibt es noch keine freigegebene Antwort“ besser als eine überzeugend klingende Erfindung. Diese Antwort ist kein Versagen des Systems, sie ist ein Arbeitsauftrag: Die Frage kommt vor, und der Bestand hat noch keinen Eintrag dazu.
6. Feedback zurückführen
Markiere unbeantwortete Fragen, unpassende Treffer und häufig korrigierte Antworten. Daraus entsteht die nächste Pflegerunde. Wissensmanagement ist kein einmaliger Import; bei mir läuft die Pflege im Quartalstakt wie das Register.
Ein durchgerechnetes Beispiel mit Demo-Daten
Das folgende Beispiel ist gebaut, alle Calls, Zahlen und Aussagen sind fiktiv. Ein Handwerksbetrieb mit zwölf Leuten wertet zehn Demo-Erstgespräche aus. Im Register stehen danach vierzehn Einträge, drei davon drehen sich um die Einrichtung eines neuen Ablaufs. Der häufigste Eintrag:
Jetzt stellt eine neue Kollegin im System die Frage: „Kunde sagt, er hat keine Zeit für die Einrichtung, was antworte ich?“ Die Suche findet den Eintrag über die Kundenformulierung, das Modell formuliert die kurze Antwort und hängt die drei Fundstellen und den Review-Termin an. Die Kollegin sieht, dass die Antwort von der Inhaberin freigegeben ist und in drei Gesprächen so gegeben wurde.
Zweite Frage, eine Woche später: „Was antworte ich, wenn der Kunde fragt, ob wir auch am Wochenende einrichten?“ Kein Eintrag trifft. Das System antwortet: „Dazu gibt es noch keine freigegebene Antwort“, und die Frage landet in der Liste für die nächste Pflegerunde. Genau das ist der Ertrag: eine Liste der Fragen, die dein Bestand nicht beantwortet, statt zehn improvisierter Antworten, die sich widersprechen.
Rechte und getrennte Wissensräume
Nicht jede Quelle darf für jede Person oder jeden Kanal sichtbar sein. Trenne mindestens:
- öffentlich: freigegebene Website- und FAQ-Inhalte;
- intern: Prozesse, Trainingsmaterial und interne Erläuterungen;
- vertraulich: personenbezogene oder vertraglich geschützte Informationen.
Die Zugriffskontrolle muss vor der Antwort greifen, nicht erst nach ihrer Formulierung. Wenn ein Nutzer eine Quelle nicht sehen darf, darf das System ihren Inhalt auch nicht in einer Antwort verraten. Microsoft nennt das in seiner RAG-Übersicht als eigene Herausforderung: Nutzer und Agenten dürfen nur Inhalte abrufen, für die sie berechtigt sind. Technisch heißt das, der Filter nach Berechtigung sitzt an der Suche, also bei Schritt 2, und wird bei jeder einzelnen Anfrage angewandt. Ein Sprachmodell, das die Quelle schon gelesen hat, kann sie nicht mehr vergessen. Für ein kleines Unternehmen reicht am Anfang oft die Spalte „Sichtbarkeit“ im Register und ein System, das je Kanal nur die passenden Einträge durchsucht.
Wann reicht Suche, wann RAG, wann ein Knowledge Graph?
Diese Ansätze schließen sich nicht aus. Ein Knowledge Graph aus Calls kann die Beziehungen liefern, eine Textsuche die passenden Abschnitte und ein Sprachmodell die verständliche Antwort. Für kleine Betriebe ist eine gepflegte Kartei oft der richtige Start.
Typische Fehler beim Aufbau
- Alles hochladen. Ein Bestand ohne Auswahl ist ein Bestand ohne Verantwortlichen. Jede Antwort daraus ist so gut wie die schlechteste Quelle darin.
- Kein Gültigkeitsdatum. Eine Antwort von vor zwei Jahren klingt genauso sicher wie eine von gestern. Ohne Review-Termin merkt das niemand.
- Kein „Ich weiß es nicht“. Ein System, das immer antwortet, erfindet irgendwann. Das Verhalten bei fehlender Grundlage ist eine Entscheidung, die du vor dem Start triffst.
- Rechte nach der Antwort. Wer erst filtert, nachdem das Modell die Quelle gelesen hat, filtert zu spät.
Drei direkte Ausgaben aus der Wissensbasis
Eine gute Wissensbasis ist kein Archiv. Sie beliefert Arbeitsabläufe. Häufige Kundenfragen werden zu FAQ aus Kundengesprächen. Wiederkehrende Verkaufshürden werden zu Einwandkarten für den Vertrieb. Fachwissen mit Verantwortlichen und Review-Takt wird zu Wissensmanagement mit KI.
Wie Gustav hilft
Gustav übernimmt bei mir den vorbereitenden Teil: Whisper transkribiert lokal, danach folgt der feste Pseudonymisierungs-Pass. Gustav destilliert Fragen, Antworten, Einwände und Belegstellen in Etappen von zehn bis zwanzig Calls, nach jeder Etappe mit Stichproben-Review. Das Ergebnis ist ein Register, dessen Einträge schon die Form haben, die eine Wissensdatenbank braucht: eine Frage in Kundensprache, meine geprüfte Antwort, die Fundstelle. Die interne Wissensbasis ist eine der Zielausgaben, die er von Anfang an kennt, neben Playbook, FAQ und Einwand-Bibliothek. Die fachliche Freigabe bleibt beim Verantwortlichen, das Rechtekonzept legst du fest; beides sind Entscheidungen deines Betriebs, und genau deshalb stehen sie nicht in einer Rolle.
Häufige Fragen
Was ist eine KI-Wissensdatenbank?
Ein gepflegter Bestand aus freigegebenen Fragen, Antworten und Quellen, über dem eine KI die Suche und die Formulierung übernimmt. Der Bestand ist das Produkt, die KI ist die Bedienung. Eine gute KI-Wissensdatenbank zeigt zu jeder Antwort die Belegstelle und sagt, wenn sie zu einer Frage keinen freigegebenen Eintrag hat. Das unterscheidet sie von einem Chatbot, der auf alles antwortet.
Wie erstelle ich eine Wissensdatenbank mit KI?
In sechs Schritten: Nutzer und zehn reale Fragen festlegen, Quellen zulassen und begrenzen, Gesprächswissen rechtlich und fachlich prüfen, kleine Einheiten bauen, Antworten mit Beleg ausgeben, Rückmeldungen in die Pflege führen. Die Reihenfolge ist der Punkt: Die Technik kommt zuletzt.
Was ist der Unterschied zwischen Wissensdatenbank und Knowledge Graph?
Die Wissensdatenbank beantwortet eine Frage mit Quelle, der Knowledge Graph zeigt, was womit zusammenhängt. In der Wissensdatenbank suchst du eine Antwort und bekommst sie mit Beleg. Im Graph fragst du, welche Einträge an einer Antwort hängen, die du gerade änderst. Beides kann aus demselben Register entstehen. Für die meisten kleinen Betriebe ist die Wissensdatenbank der erste Schritt, der Graph kommt, wenn Abhängigkeiten wichtig werden.
Kann eine KI-Wissensdatenbank lokal laufen?
Die Transkription ja, in meinem Aufbau läuft Whisper lokal auf dem eigenen Rechner. Ob Suche und Sprachmodell lokal oder in der Cloud laufen, hängt vom Aufbau ab; bei mir gehen erst die pseudonymisierten Extrakte in die Cloud-Verarbeitung, das Rohtranskript verlässt den Rechner nicht. Welche Stufe zu dir passt, entscheidet die Sichtbarkeit deiner Einträge: Für vertrauliches Wissen ist der Datenweg die erste Frage, nicht das Modell.
Wie du weitermachst
Schreib heute die zehn Fragen aus Schritt 1 auf, mit der Person daneben, die sie stellt. Dann such zu jeder Frage die Antwort, die du zuletzt gegeben hast, und die Stelle, an der du sie gegeben hast. Hast du für sieben von zehn eine Antwort mit Quelle, hast du den Kern deiner Wissensbasis; die drei anderen sind deine erste Pflegerunde.
Das Register davor führt bei mir Gustav, sein Paket liegt in meiner Community. Quellenliste, Sichtbarkeit und das Verhalten bei fehlender Grundlage legst du für deinen Betrieb fest, und dabei bist du nicht allein: In den Calls gehen wir solche Entscheidungen gemeinsam durch, und wer seine Quellenliste in einem Posting zeigt, bekommt meist eine Rückfrage, die später eine Korrektur spart. Alles dazu unter Community.