Interne Wissenssuche in Medtech-HR: RAG mit Open-Weight-Modellen in 4 Wochen

Das Problem: Überlastete HR-Abteilungen in Medtech-Firmen

Medtech-Unternehmen mit 11 bis 50 Mitarbeitern stehen vor einem spezifischen Problem: Die HR-Abteilung ist überlastet, weil sie Anfragen zu Onboarding-Prozessen, Recruiting-Richtlinien und internen Compliance-Fragen manuell beantwortet. Die Zykluszeit für eine einfache Anfrage liegt bei 45 Minuten, die Fehlerquote bei 12 %, weil die Informationen in verstreuten Dokumenten (PDF, Word, SharePoint) liegen. Die Skalierung ohne neue Mitarbeiter ist nicht möglich, weil die HR-Kapazität an die Anzahl der Anfragen gebunden ist. Die Lösung liegt in einer internen Wissenssuche, die auf Retrieval-Augmented Generation (RAG) basiert und über Slack oder Microsoft Teams zugänglich ist. Der Bot liefert Vorschläge, die HR-Mitarbeiter prüfen und freigeben. Die Architektur ist model-agnostic und nutzt Open-Weight-Modelle auf der eigenen Hardware, um die Daten im Gebäude zu halten.

Mechanismus: RAG-Stack mit Open-Weight-Modellen

Die Architektur besteht aus vier Schichten: 1. Ingestion: Die internen Dokumente (PDF, Word, Markdown) werden in einem Ingestion-Pipeline verarbeitet, die die Texte in Chunks von 512 Tokens aufteilt und in einen Vektorindex (z. B. Weaviate oder Qdrant) einbindet. 2. Retrieval: Bei einer Anfrage wird der Text in einen Embedding-Vektor umgewandelt (z. B. mit BGE-M3 oder E5-Mistral), und die Top-5 ähnlichen Chunks werden abgerufen. 3. Generation: Das Open-Weight-Modell (z. B. Llama 3 70B oder Mistral Large 123B) erhält den Prompt mit den abgerufenen Chunks und generiert die Antwort. 4. Orchestration: Die Workflow-Orchestration (z. B. mit LangGraph oder CrewAI) steuert den Ablauf, prüft die Berechtigungen und liefert die Antwort über die Slack- oder Teams-API. Die Latenz beträgt 1,5 bis 3 Sekunden, die Genauigkeit liegt bei über 85 % für die Top-3-Ergebnisse.

Trade-offs: Modellwahl, Datenhaltung und Integration

Die wichtigsten Entscheidungen betreffen die Modellwahl, die Datenhaltung und die Integration. Modellwahl: Open-Weight-Modelle wie Llama 3 70B oder Mistral Large 123B sind auf A100-GPUs (80 GB VRAM) lauffähig und erreichen eine Präzision von über 85 % bei einer Latenz von unter 2 Sekunden. Cloud-APIs (OpenAI, Anthropic) sind schneller, aber die Daten verlassen das Gebäude, was bei Medtech-Firmen nicht akzeptabel ist. Datenhaltung: Der Vektorindex läuft auf der eigenen Hardware (z. B. 256 GB RAM, 1 TB NVMe), die Daten werden nicht in der Cloud gespeichert. Integration: Die Slack- oder Teams-API wird über einen lokalen Gateway-Server angesprochen, der die Authentifizierung (OAuth 2.0) und die Berechtigungslogik übernimmt. Die Kosten für die Hardware betragen einmalig 15.000 bis 25.000 CHF, die monatlichen Betriebskosten liegen bei 2.000 bis 4.000 CHF.

Empfehlung: 4-Wochen-Pilot mit messbaren Ergebnissen

Die Implementierung in 4 Wochen folgt einem festen Plan: Woche 1: Audit und Dateninventarisierung. Die HR-Dokumente werden gesammelt, die Datenqualität geprüft, die Berechtigungslogik definiert. Woche 2: Pilot-Implementierung. Der RAG-Stack wird auf der eigenen Hardware deployed, die Slack- oder Teams-Integration wird eingerichtet, der Bot wird im Testkanal freigeschaltet. Woche 3: Parallelbetrieb. Die HR-Mitarbeiter stellen Anfragen, der Bot liefert Vorschläge, die Mitarbeiter prüfen und korrigieren. Die Metriken (Zykluszeit, Fehlerquote, Akzeptanzrate) werden automatisch erfasst. Woche 4: Go/No-Go-Entscheid. Basierend auf einer Reduktion der Bearbeitungszeit um mindestens 40 % wird der Betrieb freigegeben. Der Managed Operation beginnt, die Modellpflege und die Datenaktualisierung werden übernommen.

Skalierung: Von der HR-Abteilung zum gesamten Unternehmen

Die Skalierung erfolgt durch das Hinzufügen neuer Datenquellen (z. B. CRM, ERP) und die Erweiterung der Modellkapazität. Da die Architektur model-agnostic ist, können neue Modelle ohne Neuentwicklung integriert werden. Die Workflow-Orchestration wird durch die Hinzufügung neuer Agenten-Schritte erweitert, ohne die bestehende Infrastruktur zu ändern. Die HR-Abteilung erhält einen dedizierten Kanal in Slack oder Teams, die Anfragen werden über @mention oder einen spezifischen Befehl getriggert. Die Antworten enthalten Quellenverweise auf die internen Dokumente, damit die Mitarbeiter die Richtigkeit nachvollziehen können. Die Berechtigungen sind so gesetzt, dass nur HR-Mitarbeiter Zugriff auf die sensiblen Recruiting-Daten haben. Die Skalierung ist linear und erfordert keine Neuentwicklung.

Kommentare

Leave a Reply

Your email address will not be published. Required fields are marked *