Das Problem: Routine-Tickets binden deine Senior-Staff
Dein Support-Team in Wien oder Graz bearbeitet 400–800 Tickets pro Woche. Davon sind 60–70 % Routineanfragen: Passwort-Reset, Lizenzfragen, einfache Fehlermeldungen. Deine Senior Engineers und Account Manager verbringen 30–40 % ihrer Arbeitszeit mit dieser Arbeit, statt sich auf Kundenbeziehungen und Produktentwicklung zu konzentrieren. Der EU AI Act (VO (EU) 2024/1689) verlangt ab August 2025 dokumentierte Risikobewertungen für KI-Systeme, die mit personenbezogenen Daten arbeiten. Gleichzeitig dürfen regulierte Daten aus deinem B2B-SaaS-Produkt nicht auf externe Cloud-APIs wandern. Die Lösung: Ein AI-System, das auf deiner eigenen Hardware läuft, Tickets klassifiziert und routet, und menschliche Freigaben für alles, was über Routine hinausgeht, erzwingt. Forfis begleitet dich dabei als dediziertes AI-Team über den gesamten 6-Monats-Zeitraum.
Voraussetzungen vor dem ersten Schritt
Bevor du mit der Implementierung beginnst, musst du folgende Voraussetzungen schaffen:
- API-Zugang zum Helpdesk: Dokumentierte REST-APIs und Webhook-Endpunkte für Ticket-Erstellung, -Lesezugriff und Statusänderung. Bei Zendesk, Freshdesk oder Jira Service Management sind diese standardmäßig verfügbar.
- On-Premise-Infrastruktur: Ein GPU-fähiger Server (mindestens NVIDIA A100 oder L40S, 48 GB VRAM) in deinem Rechenzentrum oder bei einem österreichischen Hoster. Das Modell muss lokal laufen, damit keine Daten das Gebäude verlassen.
- Prozessdokumentation: Eine Liste der 10 häufigsten Ticket-Typen mit den zugehörigen Eskalationsregeln. Wer entscheidet, wann ein Ticket an einen Senior geht?
- Compliance-Verantwortlicher: Eine Person, die die EU AI Act-Risikobewertung signiert und die Freigabeprozesse überwacht.
- Baseline-Messung: Die aktuellen Durchlaufzeiten und Fehlerquoten für die letzten 90 Tage, exportiert aus dem Helpdesk.
Schritt 1: Prozess-Audit und Pilot-Workflows auswählen
Forfis analysiert deinen Ticket-Verlauf der letzten 90 Tage und identifiziert die Workflows mit dem höchsten Automatisierungspotenzial. Konkret: Wir kategorisieren alle Tickets nach Typ, Komplexität und Bearbeitungszeit. Das Ergebnis ist eine Priorisierungsliste, aus der wir den Pilot-Workflow auswählen. Typischerweise ist das die Ticket-Triage: Ein neues Ticket wird eingelesen, klassifiziert (z. B. “Lizenzfrage”, “Fehlermeldung”, “Rechnungsanfrage”) und an die richtige Queue geroutet. Der Pilot umfasst 20–30 % des Ticketvolumens, damit das Team die Ergebnisse validieren kann, ohne den Betrieb zu gefährden. Die Auswahl erfolgt nach zwei Kriterien: Hohe Wiederholbarkeit und klare Eskalationsregeln. Wenn ein Ticket-Typ keine eindeutige Zuordnung erlaubt, kommt er nicht in den Pilot.
Schritt 2: On-Premise-Modell einrichten
Du wählst ein Open-Weight-Modell, das auf deiner Hardware läuft. Für Ticket-Triage in deutscher Sprache sind Llama 3.1 70B oder Mistral Large 123B geeignete Kandidaten. Beide Modelle werden über vLLM oder TGI (Text Generation Inference) als REST-API bereitgestellt. Die Konfiguration sieht so aus:
# vLLM-Server starten
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-70B-Instruct \
--tensor-parallel-size 2 \
--max-model-len 8192 \
--port 8000
Das Modell wird nicht für die generische Texterstellung genutzt, sondern für eine spezifische Klassifizierungs- und Routing-Aufgabe. Der Prompt ist eng gefasst: Er enthält die Ticket-Typen, die Eskalationsregeln und die Ausgabe-Formatierung (JSON mit Feldern category, priority, route_to, requires_human_review). Die Latenz liegt bei 18–35 ms pro Inferenz auf einer A100, was für Echtzeit-Triage ausreicht.
Schritt 3: REST-API und Webhooks integrieren
Du baust die Integration zwischen deinem Helpdesk und dem AI-Service. Der Helpdesk sendet jedes neue Ticket per Webhook an deinen Endpunkt. Dein Service ruft das Modell ab, erhält die Klassifizierung und schreibt das Ergebnis zurück in den Helpdesk. Die REST-API-Endpunkte, die du implementierst:
POST /webhooks/ticket-created– empfängt das neue TicketGET /api/classify– ruft das Modell ab und liefert die JSON-AntwortPOST /helpdesk/tickets/{id}/update– schreibt Kategorie, Priorität und Routing zurück
Die Webhook-Authentifizierung erfolgt über HMAC-Signaturen, um Manipulationen zu verhindern. Jede Anfrage wird mit einem Zeitstempel und einer korrelierenden ID protokolliert. Diese Logs sind für die EU AI Act-Dokumentation und interne Audits erforderlich. Die Integration wird in einem separaten Container-Orchestrator (Kubernetes oder Docker Compose) betrieben, damit sie unabhängig vom Helpdesk skaliert.
Schritt 4: Pilotbetrieb mit Human-in-the-Loop
Der Pilot läuft 4–6 Wochen mit 20–30 % des Ticketvolumens. Das AI-System klassifiziert und routet die Tickets, aber jede Antwort, die an den Kunden geht, wird von einem Menschen freigegeben. Die Freigabemaske zeigt dem Support-Mitarbeiter die vorgeschlagene Klassifizierung, den Routing-Vorschlag und den Entwurf der Antwort. Der Mitarbeiter kann akzeptieren, korrigieren oder ablehnen. Jede Entscheidung wird protokolliert. Nach 4 Wochen vergleichst du die Baseline mit den Pilot-Ergebnissen: Durchlaufzeit, Fehlerquote, Eskalationsrate. Wenn die Fehlerquote unter 5 % liegt und die Durchlaufzeit um mindestens 40 % gesunken ist, ist der Pilot erfolgreich. Falls nicht, iterierst du an den Prompts und den Eskalationsregeln. Forfis liefert ein wöchentliches Report mit den Metriken und den korrigierten Tickets, um das Modell zu verbessern.
Schritt 5: Rollout und Managed Operation
Nach dem erfolgreichen Pilot rollst du das System auf 100 % des Ticketvolumens aus. Die Eskalationsregeln werden schärfer: Tickets mit finanziellen Auswirkungen (Rückbuchungen, Vertragsänderungen) oder Gesundheitsdaten erfordern dauerhaft eine menschliche Freigabe. Alle anderen Tickets werden vom System abschließend geroutet, aber die Antwort wird erst nach 24 Stunden automatisch versendet, falls keine Korrektur eingegangen ist. Das Monitoring umfasst: Latenz des Modells, Fehlerquote der Klassifizierung, Anzahl der Eskalationen pro Tag und Customer Effort Score. Forfis übernimmt den Managed Operation: Modell-Updates, Prompt-Optimierung, Monitoring und Support. Die Übergabe an dein internes Team erfolgt in Monat 6, inklusive Dokumentation und Schulung.
Leave a Reply