Ticket-Triage mit KI: DSGVO-konform in 2 Wochen für Schweizer Versicherer

1. Triage-Genauigkeit schlägt Antwortgeschwindigkeit

Die manuelle Zuordnung von Support-Tickets in Zendesk kostet einen Schweizer Versicherer mit 11-50 Mitarbeitern durchschnittlich 3-5 Stunden pro Tag. Bei 200 Tickets pro Woche bedeutet das 12-20 Stunden reine Routing-Arbeit, die keine Wertschöpfung erzeugt. Ein On-Premise-Deployment mit einem Open-Weight-Modell wie Llama 3 8B auf einer A10G-GPU (24 GB VRAM) klassifiziert jedes Ticket in unter 500 ms und leitet es an die korrekte Queue weiter. Die Daten bleiben im Rechenzentrum des Versicherers, was die Anforderungen der Schweizer Datenschutzbehörde (EDÖB) und der DSGVO erfüllt. Der Pilot läuft in 2 Wochen: Woche 1 für die Integration der Zendesk-API und das Fine-Tuning des Modells auf 500 historische Tickets, Woche 2 für den Live-Betrieb mit Human-in-the-Loop-Review. Die Triage-Genauigkeit wird gegen die manuelle Zuordnung gemessen; Ziel ist >95 % Übereinstimmung bei der Queue-Zuordnung.

2. DSGVO-Konformität durch On-Premise-Deployment

Die DSGVO verlangt, dass personenbezogene Daten nur verarbeitet werden, wenn eine Rechtsgrundlage vorliegt (Art. 6 DSGVO). Bei der Ticket-Triage ist dies meist die Vertragserfüllung (Art. 6 Abs. 1 lit. b), da die Bearbeitung des Anliegens zur Erfüllung des Versicherungsvertrags gehört. Eine separate Einwilligung ist nicht nötig, aber die Transparenzpflicht (Art. 13/14) muss eingehalten werden: Kunden müssen erfahren, dass ihre Daten automatisiert verarbeitet werden. In der Praxis bedeutet das: Im Zendesk-Ticket-Header wird ein Hinweis eingeblendet, dass die Zuordnung durch ein KI-System erfolgt. Für die On-Premise-Verarbeitung ist keine Data Processing Agreement (DPA) mit einem externen Anbieter nötig, da keine Daten das Rechenzentrum verlassen. Die Schweizer Datenschutzbehörde (EDÖB) akzeptiert diese Konfiguration, solange die Datenverschlüsselung (AES-256) und die Zugriffskontrollen (RBAC) dokumentiert sind.

3. Multilinguale Triage ohne separate Modelle

Ein Versicherer in der Deutschschweiz erhält Tickets in Deutsch, Französisch und Italienisch. Ein monolingues Modell würde 30-40 % der Tickets falsch zuordnen, weil es die sprachliche Nuance nicht erkennt. Llama 3 8B ist multilingual trainiert und verarbeitet alle drei Sprachen mit einer Triage-Genauigkeit von >92 %. Die Routing-Regeln bleiben gleich: ‘Schadenmeldung’ → Queue A, ‘Prämienanpassung’ → Queue B, unabhängig von der Sprache. Für die Romandie und die Tessiner Kantonsgrenzen reicht ein einziges Modell, ohne dass separate Modelle pro Sprache benötigt werden. Die Latenz bleibt unter 500 ms, da das Modell auf der A10G-GPU läuft und keine externe API-Aufrufe nötig sind. Die Kosten für die GPU-Betrieb (ca. 400 CHF/Monat für eine A10G in einem Schweizer Rechenzentrum) sind um den Faktor 10 niedriger als die Kosten für externe LLM-APIs bei 200 Tickets pro Tag.

4. Human-in-the-Loop als Standard, nicht als Option

Die Triage ist eine Klassifikationsaufgabe, keine generative. Das Modell liest den Ticket-Text, extrahiert die Absicht (z. B. ‘Prämienanpassung’, ‘Schadenmeldung’) und den Dringlichkeitsgrad, und leitet das Ticket an die richtige Queue in Zendesk weiter. Es wird kein Antworttext generiert, der an den Kunden geht, solange kein Human-in-the-Loop-Workflow für die Erstantwort aktiviert ist. Die menschliche Kontrolle bleibt bei der eigentlichen Bearbeitung: Ein Support-Mitarbeiter sieht das geroutete Ticket, prüft die Zuordnung und bearbeitet es. Wenn die KI ein Ticket falsch zuordnet, kann der Mitarbeiter es manuell umleiten. Diese Umleitung wird als Feedback-Signal gespeichert und dient dem wöchentlichen Fine-Tuning des Modells. Die Fehlerquote (falsch geroutete Tickets) wird wöchentlich gemessen und muss unter 5 % bleiben, sonst wird das Modell nachtrainiert. Der Human-in-the-Loop-Ansatz ist in der Schweiz gesetzlich nicht vorgeschrieben, aber er reduziert das Risiko von Fehlzuteilungen und hält die Mitarbeiter im Prozess.

5. Integration in Zendesk ohne Custom Code

Die Integration in Zendesk erfolgt über die Zendesk API (REST v3). Das On-Premise-Modell wird als Webhook in Zendesk eingebunden: Wenn ein neues Ticket erstellt wird, sendet Zendesk den Ticket-Text an das Modell, das die Klassifikation zurückgibt. Zendesk aktualisiert dann die Queue-Zuordnung und die Tags. Die Latenz für diesen Roundtrip liegt bei 200-400 ms, da das Modell lokal läuft und keine externe API-Aufrufe nötig sind. Für Intercom funktioniert die Integration ähnlich über die Intercom API. Die Konfiguration dauert 2-3 Tage: API-Keys einrichten, Webhook-Endpoint testen, Routing-Regeln in Zendesk definieren. Die Kosten für die Integration sind gering: 2-3 Tage Entwicklerzeit (ca. 3 000-4 500 CHF) plus die GPU-Betrieb (ca. 400 CHF/Monat). Im Vergleich zu externen LLM-APIs (OpenAI, Anthropic) sind die laufenden Kosten um den Faktor 10 niedriger, da keine Token-Gebühren anfallen.

6. Zwei Wochen bis zum Live-Betrieb

Der Pilot läuft in 2 Wochen. Woche 1: Prozess-Audit (Tag 1-2), Zendesk-API-Integration (Tag 3-4), Fine-Tuning des Modells auf 500 historische Tickets (Tag 5-7). Woche 2: Live-Betrieb mit Human-in-the-Loop-Review (Tag 8-10), Messung der Triage-Genauigkeit (Tag 11-12), Dokumentation und Übergabe (Tag 13-14). Die Triage-Genauigkeit wird gegen die manuelle Zuordnung gemessen; Ziel ist >95 % Übereinstimmung bei der Queue-Zuordnung. Die Latenz (Zeit von Ticket-Eingang bis Routing) sollte unter 2 Sekunden liegen. Die Fehlerquote (falsch geroutete Tickets) wird wöchentlich gemessen und muss unter 5 % bleiben, sonst wird das Modell nachtrainiert. Nach dem Pilot wird das System in den Managed AI Operations-Modus überführt: Forfis überwacht die Modell-Performance, führt wöchentliches Fine-Tuning durch und aktualisiert die Routing-Regeln bei neuen Ticket-Typen. Die Kosten für den Managed Service liegen bei ca. 1 500-2 500 CHF/Monat, je nach Ticket-Volumen.

7. Skalierung vom Pilot zum Managed Service

Die Triage-Automatisierung ist der erste Schritt, nicht das Ende. Nach dem Pilot (1 Prozess automatisiert) kann das System auf weitere Workflows erweitert werden: Erstantwort-Generierung (mit Human-in-the-Loop-Review), Dokumenten-Extraktion aus Schadensmeldungen, oder multilinguale Chatbots für die Website. Die Architektur ist model-agnostic: Wenn die Triage-Genauigkeit unter 90 % fällt, kann ein Teil der Tickets an ein externes LLM (OpenAI, Anthropic) mit anonymisierten Daten weitergeleitet werden, sofern eine DPA vorliegt. Für die Erstantwort-Generierung ist ein größeres Modell (Llama 3 70B oder GPT-4) nötig, das auf einer A100-GPU (80 GB VRAM) läuft. Die Kosten steigen dann auf ca. 1 200 CHF/Monat für die GPU, aber die Wertschöpfung ist höher: Die Erstantwort-Zeit sinkt von 4 Stunden auf 15 Minuten. Der Managed AI Operations-Service skaliert mit dem Ticket-Volumen und den neuen Workflows, ohne dass der Versicherer eigene ML-Experten einstellen muss.

Kommentare

Leave a Reply

Your email address will not be published. Required fields are marked *