RAG-Systeme auf eigener Hardware: KI-Wissenssuche für B2B-SaaS in Österreich

Warum B2B-SaaS-Teams in Österreich auf RAG-Systeme setzen

Viele B2B-SaaS-Unternehmen in Österreich mit 11 bis 50 Mitarbeitern kämpfen mit der manuellen Dateneingabe und der langsamen Beantwortung interner Anfragen. Die Compliance-Abteilung ist überlastet, und das Wissen ist in isolierten Dokumenten verstreut. Ein RAG-System (Retrieval-Augmented Generation) löst dieses Problem, indem es einen KI-Assistenten über die eigene Dokumentation und CRM-Daten legt. Dieser Assistent beantwortet Fragen in Echtzeit und reduziert die manuelle Arbeit erheblich. Der Ansatz ist besonders effektiv, wenn die Daten sensibel sind und nicht an externe Cloud-Anbieter übermittelt werden dürfen. Durch die Nutzung von Open-Weight-Modellen auf eigener Hardware bleibt die Datenhoheit vollständig beim Unternehmen. Die Implementierung erfolgt in einem 6-Monats-Zeitraum und umfasst die Integration in Slack oder Microsoft Teams, sodass die Mitarbeiter die KI dort nutzen können, wo sie täglich arbeiten.

Architektur: Open-Weight-Modelle auf eigener Hardware

Die Architektur basiert auf Open-Weight-Modellen wie Llama 3 oder Mistral, die auf der eigenen GPU-Hardware laufen. Dies ist entscheidend für die Compliance mit dem EU AI Act und der DSGVO, da keine Daten das Firmennetzwerk verlassen. Das RAG-System besteht aus drei Kernkomponenten: einer Vektor-Datenbank für die Dokumente, einem Retrieval-Mechanismus und dem LLM für die Generierung. Die Dokumente werden in Vektoren umgewandelt und in der Datenbank gespeichert. Bei einer Anfrage sucht das System die relevantesten Vektoren und injiziert sie als Kontext in das LLM. Die Antworten sind damit auf den aktuellen, firmenspezifischen Daten basierend und zitierfähig. Diese On-Premise-Lösung erfordert zwar eine höhere initiale Investition in Hardware, bietet aber langfristig eine höhere Kontrolle und Sicherheit.

Integration in Slack und Microsoft Teams

Die Integration in Slack oder Microsoft Teams erfolgt über Bot-APIs. Der Assistent wird als Bot im Kanal eingerichtet und antwortet auf @-Erwähnungen. Dies senkt die Einstiegshürde, da die Mitarbeiter keine neue Software lernen müssen. Für die Compliance-Abteilung wird ein Predictive Scoring-Modul hinzugefügt. Dieses bewertet jede eingehende Anfrage nach ihrem Risiko und drängt nur die kritischen Fälle in die Warteschlange der Juristen. Routineanfragen werden automatisch beantwortet, was die Arbeitslast der Compliance-Abteilung um bis zu 40 % reduziert. Das System wird in einem Integrationssprint von 8 bis 12 Wochen implementiert. Der Sprint umfasst die Einrichtung der Vektor-Datenbank, das Deployment des LLMs und die Konfiguration der Retrieval-Pipeline. Abschließend erfolgt die Schulung der Mitarbeiter und die Feinabstimmung der Antworten.

Skalierung über Abteilungen und Automatisierung der Dateneingabe

Die Skalierung über mehrere Abteilungen hinweg erfordert eine modulare Architektur. Die Retrieval- und Generierungs-Schichten werden entkoppelt, sodass neue Datenquellen unabhängig voneinander angebunden werden können. Die On-Premise-Infrastruktur muss horizontal skalierbar sein, um die steigende Last zu bewältigen. Eine zentrale Governance-Struktur ist nötig, um die Konsistenz der Antworten und die Compliance über alle Abteilungen hinweg sicherzustellen. Die manuelle Dateneingabe wird durch OCR und LLM-basierte Extraktion ersetzt. Das System liest Dokumente wie Rechnungen oder Verträge, extrahiert die relevanten Felder und überträgt sie direkt in das ERP- oder CRM-System. Ein Human-in-the-Loop-Prozess stellt sicher, dass kritische Daten vor der finalen Übertragung von einem Mitarbeiter geprüft werden. Dies senkt die Fehlerquote auf unter 1 % und beschleunigt die Back-Office-Prozesse erheblich.

Compliance nach EU AI Act und DSGVO

Der EU AI Act klassifiziert interne KI-Systeme zur Wissenssuche in der Regel als „minimal risk“, sofern sie keine biometrische Überwachung oder Hochrisiko-Entscheidungen treffen. Dennoch müssen Unternehmen sicherstellen, dass die Datenverarbeitung DSGVO-konform ist und dass die Modelle keine diskriminierenden Outputs erzeugen. Bei der Nutzung von Open-Weight-Modellen auf eigener Hardware ist die Compliance-Kontrolle einfacher, da keine externen Datenflüsse bestehen. Die Datenhoheit bleibt vollständig beim Unternehmen, und die Audit-Trails sind leichter zu erstellen. Für die 24/7-Kundenantwort wird ein separater Assistent eingerichtet, der Routineanfragen außerhalb der Geschäftszeiten beantwortet. Er triagt Tickets, generiert erste Antworten und leitet dringende Fälle an die zuständigen Mitarbeiter weiter. Dies gewährleistet eine konstante Reaktionszeit für Kunden und entlastet das Team am nächsten Morgen.

Kommentare

Leave a Reply

Your email address will not be published. Required fields are marked *