SENSUS MEDIA Logo
KI-Entwicklung · RAG

RAG-System entwickeln lassen: KI-Antworten mit Quelle aus Dokumenten, Datenbanken und Systemen

Retrieval-Augmented Generation verbindet ein Sprachmodell mit deinen Dokumenten, Datenbanken und Systemen. Das Ergebnis sind Antworten mit Quellenangabe, die Rechte beachten und aktuell bleiben. Wir entwickeln RAG-Systeme, die über einen Standard-Chat hinausgehen.

Warum RAG und nicht einfach ein großes Kontextfenster?

Moderne Modelle können sehr viel Text auf einmal verarbeiten. Trotzdem ist es selten sinnvoll, bei jeder Frage das gesamte Firmenwissen mitzuschicken: Es kostet bei jeder Anfrage, verlangsamt die Antwort und ignoriert Zugriffsrechte. RAG wählt stattdessen zu jeder Frage die wenigen passenden Abschnitte aus, prüft dabei die Rechte der fragenden Person und gibt dem Modell genau diese Grundlage.

Ein Unternehmens-GPT als Standardlösung deckt viele Anwendungsfälle ab. Individuelle RAG-Entwicklung lohnt sich, wenn die Qualität der Antworten geschäftskritisch ist, wenn strukturierte Daten aus ERP oder PIM mit Dokumenten kombiniert werden sollen, wenn die Antworten in eine eigene Anwendung oder ein Kundenportal eingebaut werden oder wenn besondere Anforderungen an Rechte und Nachvollziehbarkeit bestehen.

Was ein gutes RAG-System ausmacht

Die Qualität entscheidet sich in der Aufbereitung und der Suche, nicht im Modell.

  • Saubere Aufbereitung

    Dokumente werden sinnvoll zerlegt, Tabellen und Grafiken berücksichtigt, Metadaten wie Gültigkeit und Abteilung erfasst.

  • Hybride Suche

    Kombination aus Vektorsuche und Stichwortsuche mit Filtern, damit auch Artikelnummern und Fachbegriffe gefunden werden.

  • Rechtekonzept

    Nur Inhalte, die die fragende Person sehen darf, fließen in die Antwort ein.

  • Quellenangaben

    Jede Antwort verweist auf die verwendeten Abschnitte, damit sie nachprüfbar ist.

  • Aktualität

    Neue und geänderte Dokumente werden automatisch nachindexiert, veraltete entfernt.

  • Messbare Qualität

    Testfragen mit bekannten Antworten zeigen, wie gut Suche und Antwort funktionieren.

RAG-Architektur: vom Dokument zur belegten Antwort

Ein RAG-System besteht aus einer Aufbereitungsstrecke und einer Antwortstrecke. In der Aufbereitung werden Quellen wie SharePoint, Confluence, Dateiablagen, Ticketsysteme oder Datenbanken angebunden, Inhalte extrahiert, in Abschnitte zerlegt und als Embeddings in einer Vektordatenbank gespeichert, oft in PostgreSQL mit pgvector oder einer spezialisierten Lösung.

In der Antwortstrecke wird die Frage gegebenenfalls umformuliert, die passenden Abschnitte werden gesucht, nach Relevanz sortiert und mit der Anweisung an das Modell übergeben, nur auf dieser Grundlage zu antworten. Findet sich keine passende Quelle, sagt das System das, statt zu raten. So sinkt das Risiko von Halluzinationen deutlich.

Das Modell ist austauschbar: Je nach Datenschutz laufen die Antworten über ein Cloud-Modell mit EU-Verarbeitung oder über ein selbst gehostetes Modell.

RAG, Fine-Tuning oder langes Kontextfenster?

Drei Wege, einem Sprachmodell Firmenwissen mitzugeben. In der Praxis ist RAG meist der Ausgangspunkt, die anderen ergänzen.

RAG, Fine-Tuning oder langes Kontextfenster?
RAG
Fine-Tuning
Langes Kontextfenster
Wofür geeignetWissen, das sich ändert, mit QuellenStil, Format, Fachsprache, Klassifikationeinzelne große Dokumente in einer Sitzung
Aktualitätja, neue Dokumente sofort nutzbar✗ neues Training nötigja, pro Anfrage
Quellenangabenjaneinmöglich, aber unzuverlässig bei viel Text
Zugriffsrechteja, pro Abschnitt prüfbarneinnein
Kosten pro Anfragegering, nur relevante Abschnittegering im Betrieb, Aufwand beim Traininghoch bei viel Kontext
Typischer EinsatzWissensassistent, Support, PortalTicket-Klassifikation, TextstilVertragsanalyse, Code-Review

Wie wir Antwortqualität messen

Ob ein RAG-System taugt, entscheidet sich nicht in der Demo, sondern an echten Fragen. Deshalb legen wir vor dem Ausbau einen Testsatz an: typische Fragen aus deinem Alltag mit den Dokumenten, in denen die Antwort steht, und einer Soll-Antwort.

Gegen diesen Testsatz messen wir drei Dinge: ob die Suche die richtigen Abschnitte findet (Trefferquote), ob die Antwort durch die gefundenen Quellen gedeckt ist (Quellenabdeckung) und ob sie die Frage vollständig beantwortet. Jede Änderung an Aufbereitung, Suche oder Modell wird gegen denselben Testsatz geprüft, damit Verbesserungen messbar sind und nichts unbemerkt schlechter wird.

Im Betrieb werten wir zusätzlich Fragen aus, auf die das System keine Antwort fand. Sie zeigen, wo Dokumente fehlen oder veraltet sind, ein oft unterschätzter Nebeneffekt für die Wissenspflege.

Was kostet ein RAG-System?

Die Kosten eines RAG-Systems hängen weniger vom Modell ab als von den Daten. Die wichtigsten Treiber sind:

  • Datenquellen: Jede angebundene Quelle braucht einen Konnektor, eine Aufbereitung und eine laufende Aktualisierung.
  • Dokumentmenge und -qualität: Eingescannte PDFs, Tabellen und Grafiken brauchen mehr Aufbereitung als saubere Texte.
  • Rechtekonzept: Einheitliche Rechte sind einfach; Rechte pro Dokument, übernommen aus SharePoint oder dem DMS, brauchen mehr Aufwand.
  • Hosting: Cloud-Modell mit EU-Verarbeitung, gemanagter GPU-Server in Deutschland oder Betrieb bei dir.

Ein Prototyp mit einer Quelle und einem Testsatz ist in wenigen Wochen umsetzbar und zeigt, wie gut die Antworten werden. Den Ausbau planen wir danach auf Basis gemessener Qualität. Im Betrieb fallen Hosting, Modellnutzung und Pflege an.

So entsteht dein RAG-System

  1. Schritt 1

    Quellen & Fragen

    Welche Quellen sind relevant, welche Fragen soll das System beantworten, wer darf was sehen?

  2. Schritt 2

    Prototyp & Testsatz

    Erste Aufbereitung und ein Satz echter Testfragen, gegen den wir Suche und Antworten messen.

  3. Schritt 3

    Ausbau & Integration

    Alle Quellen, Rechtekonzept, Oberfläche oder Einbindung in bestehende Anwendungen.

  4. Schritt 4

    Betrieb

    Laufende Indexierung, Monitoring, Auswertung unbeantworteter Fragen und Verbesserung.

Häufige Fragen zu RAG-Systemen

Wann reicht RAG, wann braucht es Fine-Tuning?

RAG gibt dem Modell zur Laufzeit passende Informationen mit und nennt Quellen. Fine-Tuning verändert das Modell selbst und eignet sich eher für Stil und Verhalten als für Wissen, das sich ändert.

Welche Datenquellen lassen sich anbinden?

Typisch sind SharePoint, Confluence, Dateiablagen, PDFs, Ticketsysteme, CRM und Datenbanken aus ERP oder PIM.

Wie gut sind die Antworten?

Das messen wir mit einem Satz echter Testfragen. So wird sichtbar, wo Suche oder Aufbereitung nachgebessert werden müssen, bevor das System live geht.

Wo laufen die Daten?

Index und Anwendung laufen in der EU oder bei dir. Für die Antworten nutzen wir je nach Anforderung Cloud-Modelle mit EU-Verarbeitung oder selbst gehostete Modelle.

Was kostet ein RAG-System?

Das hängt von Anzahl und Qualität der Datenquellen, dem Rechtekonzept und dem Hosting ab. Ein Prototyp mit einer Quelle und Testsatz ist ein überschaubares Projekt; den Ausbau planen wir anhand der gemessenen Qualität.

Mach dein Firmenwissen abfragbar

Nenn uns die wichtigsten Quellen und ein paar typische Fragen. Wir zeigen dir, wie ein RAG-System darauf antwortet.