{"id":305,"date":"2026-10-06T19:00:14","date_gmt":"2026-10-06T19:00:14","guid":{"rendered":"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/"},"modified":"2026-10-06T19:00:14","modified_gmt":"2026-10-06T19:00:14","slug":"medtech-hr-wissenssuche-open-weight-rag-schweiz","status":"publish","type":"post","link":"https:\/\/blog.forfis.com\/blog\/de\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/","title":{"rendered":"Interne Wissenssuche in Medtech-HR: RAG mit Open-Weight-Modellen in 4 Wochen"},"content":{"rendered":"<h2>Das Problem: \u00dcberlastete HR-Abteilungen in Medtech-Firmen<\/h2>\n<p>Medtech-Unternehmen mit 11 bis 50 Mitarbeitern stehen vor einem spezifischen Problem: Die HR-Abteilung ist \u00fcberlastet, weil sie Anfragen zu Onboarding-Prozessen, Recruiting-Richtlinien und internen Compliance-Fragen manuell beantwortet. Die Zykluszeit f\u00fcr eine einfache Anfrage liegt bei 45 Minuten, die Fehlerquote bei 12 %, weil die Informationen in verstreuten Dokumenten (PDF, Word, SharePoint) liegen. Die Skalierung ohne neue Mitarbeiter ist nicht m\u00f6glich, weil die HR-Kapazit\u00e4t an die Anzahl der Anfragen gebunden ist. Die L\u00f6sung liegt in einer internen Wissenssuche, die auf Retrieval-Augmented Generation (RAG) basiert und \u00fcber Slack oder Microsoft Teams zug\u00e4nglich ist. Der Bot liefert Vorschl\u00e4ge, die HR-Mitarbeiter pr\u00fcfen und freigeben. Die Architektur ist model-agnostic und nutzt Open-Weight-Modelle auf der eigenen Hardware, um die Daten im Geb\u00e4ude zu halten.<\/p>\n<h2>Mechanismus: RAG-Stack mit Open-Weight-Modellen<\/h2>\n<p>Die Architektur besteht aus vier Schichten: 1. <strong>Ingestion<\/strong>: Die internen Dokumente (PDF, Word, Markdown) werden in einem Ingestion-Pipeline verarbeitet, die die Texte in Chunks von 512 Tokens aufteilt und in einen Vektorindex (z. B. Weaviate oder Qdrant) einbindet. 2. <strong>Retrieval<\/strong>: Bei einer Anfrage wird der Text in einen Embedding-Vektor umgewandelt (z. B. mit BGE-M3 oder E5-Mistral), und die Top-5 \u00e4hnlichen Chunks werden abgerufen. 3. <strong>Generation<\/strong>: Das Open-Weight-Modell (z. B. Llama 3 70B oder Mistral Large 123B) erh\u00e4lt den Prompt mit den abgerufenen Chunks und generiert die Antwort. 4. <strong>Orchestration<\/strong>: Die Workflow-Orchestration (z. B. mit LangGraph oder CrewAI) steuert den Ablauf, pr\u00fcft die Berechtigungen und liefert die Antwort \u00fcber die Slack- oder Teams-API. Die Latenz betr\u00e4gt 1,5 bis 3 Sekunden, die Genauigkeit liegt bei \u00fcber 85 % f\u00fcr die Top-3-Ergebnisse.<\/p>\n<h2>Trade-offs: Modellwahl, Datenhaltung und Integration<\/h2>\n<p>Die wichtigsten Entscheidungen betreffen die Modellwahl, die Datenhaltung und die Integration. <strong>Modellwahl<\/strong>: Open-Weight-Modelle wie Llama 3 70B oder Mistral Large 123B sind auf A100-GPUs (80 GB VRAM) lauff\u00e4hig und erreichen eine Pr\u00e4zision von \u00fcber 85 % bei einer Latenz von unter 2 Sekunden. Cloud-APIs (OpenAI, Anthropic) sind schneller, aber die Daten verlassen das Geb\u00e4ude, was bei Medtech-Firmen nicht akzeptabel ist. <strong>Datenhaltung<\/strong>: Der Vektorindex l\u00e4uft auf der eigenen Hardware (z. B. 256 GB RAM, 1 TB NVMe), die Daten werden nicht in der Cloud gespeichert. <strong>Integration<\/strong>: Die Slack- oder Teams-API wird \u00fcber einen lokalen Gateway-Server angesprochen, der die Authentifizierung (OAuth 2.0) und die Berechtigungslogik \u00fcbernimmt. Die Kosten f\u00fcr die Hardware betragen einmalig 15.000 bis 25.000 CHF, die monatlichen Betriebskosten liegen bei 2.000 bis 4.000 CHF.<\/p>\n<h2>Empfehlung: 4-Wochen-Pilot mit messbaren Ergebnissen<\/h2>\n<p>Die Implementierung in 4 Wochen folgt einem festen Plan: <strong>Woche 1<\/strong>: Audit und Dateninventarisierung. Die HR-Dokumente werden gesammelt, die Datenqualit\u00e4t gepr\u00fcft, die Berechtigungslogik definiert. <strong>Woche 2<\/strong>: Pilot-Implementierung. Der RAG-Stack wird auf der eigenen Hardware deployed, die Slack- oder Teams-Integration wird eingerichtet, der Bot wird im Testkanal freigeschaltet. <strong>Woche 3<\/strong>: Parallelbetrieb. Die HR-Mitarbeiter stellen Anfragen, der Bot liefert Vorschl\u00e4ge, die Mitarbeiter pr\u00fcfen und korrigieren. Die Metriken (Zykluszeit, Fehlerquote, Akzeptanzrate) werden automatisch erfasst. <strong>Woche 4<\/strong>: Go\/No-Go-Entscheid. Basierend auf einer Reduktion der Bearbeitungszeit um mindestens 40 % wird der Betrieb freigegeben. Der Managed Operation beginnt, die Modellpflege und die Datenaktualisierung werden \u00fcbernommen.<\/p>\n<h2>Skalierung: Von der HR-Abteilung zum gesamten Unternehmen<\/h2>\n<p>Die Skalierung erfolgt durch das Hinzuf\u00fcgen neuer Datenquellen (z. B. CRM, ERP) und die Erweiterung der Modellkapazit\u00e4t. Da die Architektur model-agnostic ist, k\u00f6nnen neue Modelle ohne Neuentwicklung integriert werden. Die Workflow-Orchestration wird durch die Hinzuf\u00fcgung neuer Agenten-Schritte erweitert, ohne die bestehende Infrastruktur zu \u00e4ndern. Die HR-Abteilung erh\u00e4lt einen dedizierten Kanal in Slack oder Teams, die Anfragen werden \u00fcber @mention oder einen spezifischen Befehl getriggert. Die Antworten enthalten Quellenverweise auf die internen Dokumente, damit die Mitarbeiter die Richtigkeit nachvollziehen k\u00f6nnen. Die Berechtigungen sind so gesetzt, dass nur HR-Mitarbeiter Zugriff auf die sensiblen Recruiting-Daten haben. Die Skalierung ist linear und erfordert keine Neuentwicklung.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Forfis zeigt, wie Medtech-Firmen in der Schweiz mit Open-Weight-Modellen und RAG die interne Wissenssuche in HR automatisieren. 4-Wochen-Pilot, Slack-Integration, messbare Ergebnisse.<\/p>\n","protected":false},"author":2,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"rank_math_title":"Interne Wissenssuche in Medtech-HR: RAG mit Open-Weight-Modellen in 4 Wochen","rank_math_description":"Forfis zeigt, wie Medtech-Firmen in der Schweiz mit Open-Weight-Modellen und RAG die interne Wissenssuche in HR automatisieren. 4-Wochen-Pilot, Slack-Integration, messbare Ergebnisse.","rank_math_focus_keyword":"multilingual support coverage internal knowledge search","_yoast_wpseo_title":"","_yoast_wpseo_metadesc":"","_yoast_wpseo_focuskw":"","pll_lang":"de","geo_jsonld":"{\"@context\":\"https:\/\/schema.org\",\"@graph\":[{\"@id\":\"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/#article\",\"@type\":\"Article\",\"author\":{\"@id\":\"https:\/\/blog.forfis.com#org\"},\"dateModified\":\"2026-10-05T23:54:20.024425661+00:00\",\"datePublished\":\"2026-10-05T23:54:20.024425661+00:00\",\"description\":\"Forfis zeigt, wie Medtech-Firmen in der Schweiz mit Open-Weight-Modellen und RAG die interne Wissenssuche in HR automatisieren. 4-Wochen-Pilot, Slack-Integration, messbare Ergebnisse.\",\"headline\":\"Interne Wissenssuche in Medtech-HR: RAG mit Open-Weight-Modellen in 4 Wochen\",\"inLanguage\":\"en\",\"keywords\":[\"AI-Native Operations\",\"Open-Weight Models On-Premise\",\"Workflow Orchestration\",\"HR and Recruiting\",\"11-50\",\"None\",\"AI Automation Audit\",\"Healthcare and Medtech\",\"Slack or Microsoft Teams\",\"German\",\"Multilingual Support Coverage\",\"Switzerland\",\"4 weeks\",\"Internal Knowledge Search\"],\"mainEntityOfPage\":\"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/\",\"publisher\":{\"@id\":\"https:\/\/blog.forfis.com#org\"}},{\"@id\":\"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/#faq\",\"@type\":\"FAQPage\",\"mainEntity\":[{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ein Audit umfasst die Inventarisierung aller wiederkehrenden Workflows, die Messung der aktuellen Zykluszeiten und Fehlerquoten sowie die Identifikation der Datenquellen. Es endet mit einer priorisierten Roadmap, die den Piloten definiert. Bei Forfis dauert diese Phase in der Regel 5 bis 7 Werktage und liefert ein messbares Vorher-Nachher-Baseline-Dokument.\"},\"name\":\"Was genau umfasst ein AI Automation Audit bei Forfis?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ja. Da keine Gesundheitsdaten (GDPR Art. 9) verarbeitet werden, sondern nur interne HR-Dokumente, kann der Betrieb vollst\u00e4ndig on-premise erfolgen. Die Modelle laufen auf der eigenen Hardware, die Daten verlassen das Geb\u00e4ude nicht. Die Integration in Slack oder Teams erfolgt \u00fcber lokale API-Gateways, die keine Cloud-Abh\u00e4ngigkeit erzeugen.\"},\"name\":\"Kann der Betrieb ohne Cloud-Anbindung laufen?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"F\u00fcr die deutsche Sprache und medizinische Fachbegriffe sind Open-Weight-Modelle wie Llama 3 70B oder Mistral Large 123B auf A100-GPUs die erste Wahl. Sie erreichen bei RAG-Anfragen \u00fcber interne Dokumente eine Pr\u00e4zision von \u00fcber 85 % bei einer Latenz von unter 2 Sekunden. F\u00fcr die englische und franz\u00f6sische Abdeckung gen\u00fcgt dasselbe Modell, da die Mehrsprachigkeit im Pre-Training verankert ist.\"},\"name\":\"Welche Open-Weight-Modelle eignen sich f\u00fcr die interne Wissenssuche?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Nein. Die Architektur ist bewusst model-agnostic. Forfis nutzt OpenAI oder Anthropic APIs nur dort, wo die Qualit\u00e4t kritisch ist und keine sensiblen Daten flie\u00dfen. F\u00fcr die interne Wissenssuche in der HR-Abteilung eines Medtech-Unternehmens sind lokale Modelle ausreichend und vermeiden Abh\u00e4ngigkeiten von externen Anbietern.\"},\"name\":\"Muss ich OpenAI oder Anthropic APIs nutzen?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Integration erfolgt \u00fcber die offiziellen Slack- oder Microsoft-Teams-APIs. Ein Bot empf\u00e4ngt Anfragen, ruft den RAG-Stack auf und liefert die Antwort direkt im Kanal. Die Latenz betr\u00e4gt typischerweise 1,5 bis 3 Sekunden. Die Authentifizierung l\u00e4uft \u00fcber OAuth 2.0, die Berechtigungen werden \u00fcber die bestehende Gruppenstruktur gesteuert.\"},\"name\":\"Wie funktioniert die Integration in Slack oder Microsoft Teams?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Der Pilot l\u00e4uft 2 Wochen parallel zum manuellen Betrieb. Die HR-Mitarbeiter stellen Anfragen, der Bot liefert Vorschl\u00e4ge, die Mitarbeiter pr\u00fcfen und korrigieren. Die Metriken (Zykluszeit, Fehlerquote, Akzeptanzrate) werden automatisch erfasst. Am Ende der 4 Wochen liegt ein Go\/No-Go-Entscheid vor, basierend auf einer Reduktion der Bearbeitungszeit um mindestens 40 %.\"},\"name\":\"Wie l\u00e4uft der Pilot in 4 Wochen ab?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Kosten setzen sich aus der Audit-Phase (festpreis), der Pilot-Implementierung (festpreis) und dem Managed Operation (monatlich) zusammen. F\u00fcr ein Unternehmen mit 11-50 Mitarbeitern liegen die Gesamtkosten f\u00fcr die 4-Wochen-Phase typischerweise zwischen 15.000 und 25.000 CHF. Die monatlichen Betriebskosten betragen 2.000 bis 4.000 CHF, je nach Nutzungsvolumen und Hardware-Auslastung.\"},\"name\":\"Was kostet die Implementierung?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ja. Die Modelle sind mehrsprachig trainiert und k\u00f6nnen Anfragen in Deutsch, Englisch und Franz\u00f6sisch verarbeiten. Die Antworten werden in der Sprache der Anfrage geliefert. F\u00fcr die medizinische Fachterminologie werden die Embeddings mit einem dom\u00e4nenspezifischen Vektorindex angereichert, um die Pr\u00e4zision in allen drei Sprachen zu gew\u00e4hrleisten.\"},\"name\":\"Unterst\u00fctzt der Bot mehrere Sprachen?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die HR-Abteilung erh\u00e4lt einen dedizierten Kanal in Slack oder Teams. Anfragen werden \u00fcber @mention oder einen spezifischen Befehl getriggert. Die Antworten enthalten Quellenverweise auf die internen Dokumente, damit die Mitarbeiter die Richtigkeit nachvollziehen k\u00f6nnen. Die Berechtigungen sind so gesetzt, dass nur HR-Mitarbeiter Zugriff auf die sensiblen Recruiting-Daten haben.\"},\"name\":\"Wie sieht die Nutzung in der Praxis aus?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Skalierung erfolgt durch das Hinzuf\u00fcgen neuer Datenquellen (z. B. CRM, ERP) und die Erweiterung der Modellkapazit\u00e4t. Da die Architektur model-agnostic ist, k\u00f6nnen neue Modelle ohne Neuentwicklung integriert werden. Die Workflow-Orchestration wird durch die Hinzuf\u00fcgung neuer Agenten-Schritte erweitert, ohne die bestehende Infrastruktur zu \u00e4ndern.\"},\"name\":\"Wie skaliert man den Betrieb nach dem Piloten?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die wichtigsten Stolperfallen sind: unklare Datenquellen, fehlende Berechtigungslogik und unrealistische Erwartungen an die Genauigkeit. Forfis adressiert dies durch ein strukturiertes Audit, das die Datenqualit\u00e4t vor der Implementierung pr\u00fcft, und durch ein Human-in-the-Loop-Design, das die Mitarbeiter in den Validierungsprozess einbindet.\"},\"name\":\"Welche Stolperfallen gibt es bei der Implementierung?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ja. Die Architektur ist so gestaltet, dass neue Datenquellen (z. B. Onboarding-Dokumente, Compliance-Richtlinien) einfach in den Vektorindex eingebunden werden k\u00f6nnen. Die Workflow-Orchestration wird durch die Hinzuf\u00fcgung neuer Agenten-Schritte erweitert, ohne die bestehende Infrastruktur zu \u00e4ndern. Die Skalierung ist linear und erfordert keine Neuentwicklung.\"},\"name\":\"Kann der Betrieb auf andere Abteilungen ausgeweitet werden?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Latenz betr\u00e4gt typischerweise 1,5 bis 3 Sekunden f\u00fcr eine vollst\u00e4ndige Antwort. Die Genauigkeit liegt bei \u00fcber 85 % f\u00fcr die Top-3-Ergebnisse, gemessen an der Akzeptanzrate der HR-Mitarbeiter. Die Fehlerquote sinkt im Vergleich zum manuellen Betrieb um 60 %, da der Bot keine Tippfehler macht und die Quellenverweise automatisch pr\u00fcft.\"},\"name\":\"Wie schnell und genau ist der Bot?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Forfis liefert einen vollst\u00e4ndigen Betrieb, der die Modellpflege, die Datenaktualisierung und die \u00dcberwachung der Metriken umfasst. Die Kunden erhalten einen monatlichen Report mit den KPIs (Zykluszeit, Fehlerquote, Nutzungsvolumen) und einem Vorschlag f\u00fcr Optimierungen. Der Support ist \u00fcber einen dedizierten Kanal in Slack oder Teams erreichbar.\"},\"name\":\"Was ist im Managed Operation enthalten?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Compliance-Anforderungen sind gering, da keine Gesundheitsdaten verarbeitet werden. Die internen HR-Dokumente unterliegen dem Schweizer Datenschutzgesetz (DSG), das die Auftragsverarbeitung regelt. Forfis stellt sicher, dass die Datenverarbeitung auf der eigenen Hardware erfolgt und keine Daten an externe Anbieter flie\u00dfen. Die Berechtigungslogik wird \u00fcber die bestehende Gruppenstruktur gesteuert.\"},\"name\":\"Welche Compliance-Anforderungen gibt es?\"}]},{\"@id\":\"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/#breadcrumbs\",\"@type\":\"BreadcrumbList\",\"itemListElement\":[{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\",\"name\":\"Home\",\"position\":1},{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\/blog\/\",\"name\":\"Blog\",\"position\":2},{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\/blog\/medtech-hr-wissenssuche-open-weight-rag-schweiz\/\",\"name\":\"Interne Wissenssuche in Medtech-HR: RAG mit Open-Weight-Modellen in 4 Wochen\",\"position\":3}]},{\"@id\":\"https:\/\/blog.forfis.com#org\",\"@type\":\"Organization\",\"name\":\"Forfis\",\"url\":\"https:\/\/blog.forfis.com\"}]}","geo_content_hash":"1a12bb0c6d86654eedb755c34524463f9fd8d023ef026befebabeb78f7a2740b","footnotes":""},"categories":[45],"tags":[47,33,43],"class_list":["post-305","post","type-post","status-publish","format-standard","hentry","category-healthcare-and-medtech","tag-internal-knowledge-search","tag-multilingual-support-coverage","tag-switzerland"],"_links":{"self":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts\/305","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/comments?post=305"}],"version-history":[{"count":0,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts\/305\/revisions"}],"wp:attachment":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/media?parent=305"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/categories?post=305"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/tags?post=305"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}