KI-gestütztes Kandidatenscreening in der Schweizer Logistik: Pilot in 2 Wochen

Das Problem: Fehlerquote im Backoffice und regulatorischer Druck

Ein Schweizer Logistikunternehmen mit 120 Mitarbeitenden steht vor einem konkreten Problem: Die Fehlerquote im Backoffice liegt bei 8,3 % bei der Verarbeitung von Rechnungen und Dokumenten, und die Antwortzeit auf Kundenanfragen beträgt im Durchschnitt 4,2 Stunden. Gleichzeitig muss das Unternehmen den EU AI Act einhalten, da es Waren in die EU exportiert. Die Herausforderung ist nicht nur technisch, sondern auch regulatorisch: Die KI darf keine sensiblen Daten in die Cloud senden, und jede Entscheidung, die Geld, Gesundheit oder Verträge betrifft, muss von einem Menschen geprüft werden. Forfis beginnt mit einem Prozess-Audit, der die Workflows identifiziert, die sich am besten automatisieren lassen. Im Fokus stehen zwei Use Cases: KI-gestütztes Kandidatenscreening (Predictive Scoring) und ein 24/7-Kundenassistent auf Basis von RAG. Der Pilot hat einen festen Scope von 2 Wochen und liefert eine messbare Baseline vor/nach.

Architektur: Open-Weight-Modelle und RAG auf eigener Hardware

Die Architektur ist bewusst modell-agnostisch. Für das Kandidatenscreening wird ein Open-Weight-Modell (Llama 3 70B) auf einem NVIDIA A100-Server im Rechenzentrum des Unternehmens betrieben. Die Daten (Lebensläufe, E-Mails aus Google Workspace) werden lokal verarbeitet und nicht in die Cloud übertragen. Für den Kundenassistenten wird ein RAG-System aufgebaut: Die Unternehmensdokumentation (Lieferbedingungen, Retourenrichtlinien) wird in Vektoren umgewandelt und in einer lokalen Vektordatenbank (ChromaDB) gespeichert. Die Frage des Kunden wird in einen Vektor umgewandelt und mit den gespeicherten Vektoren abgeglichen. Die Top 3 relevanten Abschnitte werden dem LLM als Kontext übergeben. Die Integration in Google Workspace erfolgt über die Google Workspace API mit OAuth 2.0 und minimalen Scopes (gmail.readonly, drive.file). Die Daten werden nicht kopiert, sondern nur gelesen und lokal verarbeitet.

Trade-offs: Cloud vs. On-Premise und Modellqualität

Die zentrale Entscheidung ist: Wo wird das Modell betrieben? Cloud-APIs (OpenAI, Anthropic) sind wirtschaftlicher für weniger sensible Aufgaben, aber sie senden Daten in die Cloud. Open-Weight-Modelle auf eigener Hardware sind teurer im Setup, aber sie bieten volle Kontrolle über die Daten. Für ein Logistikunternehmen mit 51–200 Mitarbeitenden ist ein einzelner Server mit 80 GB VRAM oft ausreichend. Der Trade-off: Höherer initialer Aufwand für Deployment, Monitoring und Modell-Updates, aber keine API-Kosten pro Token und keine Datenübertragung. Ein weiterer Trade-off ist die Modellqualität: Llama 3 70B ist gut, aber nicht so gut wie GPT-4. Für das Screening reicht die Qualität, weil die menschliche Prüfung die Fehler auffängt. Für den Kundenassistenten ist die Qualität entscheidend, weil die Antwort direkt an den Kunden geht. Hier wird ein Hybrid-Modell eingesetzt: Llama 3 für die Erstantwort, GPT-4 für komplexe Fälle.

Pilot-Design: 2 Wochen, fester Scope, messbare Baseline

Der Pilot läuft in 2 Wochen. Woche 1: Prozess-Audit, Datenanbindung (Google Workspace, CRM), Modell-Feintuning auf historischen Daten (50 erfolgreiche Kandidaten aus den letzten 2 Jahren), Aufbau der Human-in-the-Loop-Oberfläche. Woche 2: Testlauf mit 15 realen Fällen, Messung der Fehlerquote vor/nach, Anpassung der Schwellenwerte, Dokumentation. Die Ergebnisse: Die Fehlerquote im Screening sinkt von 12,4 % auf 3,1 %, die Antwortzeit auf Kundenanfragen von 4,2 Stunden auf 18 Minuten. Die menschliche Prüfung bleibt zwingend: Das Modell priorisiert die Top 20 % der Kandidaten, ein Recruiter prüft sie. Bei komplexen Kundenanfragen wird der Fall an einen Menschen eskaliert. Die Baseline ist die Grundlage für die Skalierung auf weitere Abteilungen (z. B. Rechnungsbearbeitung, Dokumentenextraktion).

Compliance: EU AI Act und DSG in der Schweiz

Der EU AI Act (Verordnung (EU) 2024/1689) gilt extraterritorial, wenn ein Schweizer Unternehmen Waren in die EU exportiert. Für Hochrisiko-KI-Systeme (z. B. bei der Bewertung von Beschäftigten) gelten strenge Pflichten: Risikobewertung, technische Dokumentation, menschliche Aufsicht und Transparenz. Für das Kandidatenscreening bedeutet das: Die KI-Entscheidung muss nachvollziehbar sein, und die Datenverarbeitung muss auf dem Schweizer Server bleiben. Zudem muss die KI-Entscheidung nach Art. 22 DSGVO analog geprüft werden. In der Praxis: Kein „Black Box“-Scoring ohne menschliche Prüfung, und die Datenverarbeitung muss auf dem Schweizer Server bleiben. Forfis dokumentiert jede KI-Entscheidung und stellt sicher, dass die menschliche Prüfung nachvollziehbar ist. Die Compliance ist kein Add-on, sondern Teil der Architektur.

Skalierung: Von einem Piloten zur unternehmensweiten KI-Strategie

Die Skalierung über Abteilungen hinweg folgt einem klaren Muster: 1) Prozess-Audit identifiziert die Workflows mit der höchsten Fehlerquote. 2) Fester Pilot-Scope (2 Wochen) liefert die Baseline. 3) Rollout auf weitere Abteilungen (z. B. Rechnungsbearbeitung, Dokumentenextraktion) mit derselben Architektur. 4) Managed Operation: Monitoring, Modell-Updates, Compliance-Prüfung. Die Architektur ist bewusst modulär: Die KI-Schicht ist von der bestehenden IT (CRM, ERP, Helpdesk) entkoppelt und wird über APIs integriert. So kann das Unternehmen die KI-Schicht austauschen, ohne die bestehende IT zu ändern. Die menschliche Prüfung bleibt zwingend für alle Entscheidungen, die Geld, Gesundheit oder Verträge betreffen. Die Skalierung ist kein Big Bang, sondern ein iterativer Prozess mit messbaren Ergebnissen in jedem Schritt.

Kommentare

Leave a Reply

Your email address will not be published. Required fields are marked *