Das Problem: Manuelle Lead-Qualifikation in der Logistik
Ein Logistikunternehmen mit über 2000 Mitarbeitern in Deutschland verarbeitet täglich hunderte Anfragen über Microsoft Teams. Die Lead-Qualifikation läuft manuell: Vertrieb liest die Nachricht, bewertet sie, tragt sie in das CRM ein. Die Fehlerquote liegt bei 12 %, die Durchlaufzeit bei 4 Stunden pro Lead. Das Unternehmen ist ISO 27001-zertifiziert, die Daten dürfen das Gebäude nicht verlassen. Der Pilot soll in 3 Monaten zeigen, ob ein Open-Weight-Modell auf eigener Hardware die Fehlerquote auf unter 5 % senkt, ohne die Compliance-Struktur zu brechen. Der Scope ist fix: nur Lead-Qualifikation, nur Teams, nur ein CRM-System. Kein Rollout, kein Marketing-Auftritt, keine Skalierung. Nur die Messung.
Architektur: Open-Weight-Modell auf eigener Hardware
Die Architektur ist bewusst model-agnostic. Das Open-Weight-Modell (z. B. Llama 3 70B) läuft auf einem GPU-Server im eigenen Rechenzentrum. Die Inferenz-API ist ein lokaler Endpunkt, der über HTTPS mit dem Teams-Bot kommuniziert. Der Bot empfängt die Nachricht, ruft das Modell auf, erhält die Klassifikation (Lead-Qualität: hoch/mittel/niedrig) und die extrahierten Felder (Name, Firma, Bedarf). Ein Human-in-the-Loop-Schritt folgt: ein Vertriebsmitarbeiter bestätigt oder korrigiert die Klassifikation in Teams. Erst dann wird der Eintrag in das CRM geschrieben. Die Audit-Logs protokollieren jede Interaktion: wer, wann, welche Korrektur. Das ist die Grundlage für die ISO 27001-Revision.
Trade-offs: Datenlokalisierung vs. Skalierbarkeit
Die Wahl des Modells ist ein Trade-off. Open-Weight-Modelle auf eigener Hardware garantieren Datenlokalisierung, kosten aber GPU-Infrastruktur (ca. 4 000 EUR/Monat für einen A100-Server) und Wartungsaufwand. Cloud-APIs (OpenAI, Anthropic) sind günstiger und skalieren besser, aber die Daten verlassen das Gebäude. Für ein ISO 27001-zertifiziertes Unternehmen ist das oft ein No-Go. Die Kompromisslösung: Open-Weight für die Klassifikation, Cloud-API nur für die Textgenerierung, wenn die Daten anonymisiert sind. Die Integration über die Teams-API ist der zweite Trade-off: Teams ist in Deutschland verbreitet, aber die API-Oberfläche ist weniger flexibel als Slack. Die Latenz liegt bei 18 ms pro Inferenz, akzeptabel für die Anwendung.
Empfehlung: Der 3-Monats-Pilot als bewerteter Schritt
Der Pilot läuft 3 Monate. Woche 1-2: Prozess-Audit. Forfis dokumentiert den aktuellen Workflow, misst die Baseline-Fehlerquote (12 %) und die Durchlaufzeit (4 Stunden). Woche 3-8: Entwicklung. Das Modell wird auf den historischen Daten trainiert, der Teams-Bot wird integriert, der Human-in-the-Loop-Schritt wird eingerichtet. Woche 9-12: Betrieb. Das System läuft produktiv, die Fehlerquote wird täglich gemessen. Am Ende: Bericht mit Vorher/Nachher-Zahlen. Die Empfehlung: Wenn die Fehlerquote unter 5 % liegt und die Durchlaufzeit unter 1 Stunde, ist der Rollout auf weitere Workflows (z. B. Dokumentenextraktion) sinnvoll. Der Pilot ist kein Experiment, sondern ein bewerteter Schritt in die AI-Reife.