Zwei Ansätze für Conversational Agents im Fintech
Der Vergleich betrachtet zwei Ansätze zur Implementierung eines Conversational Agenten für Customer Support in einem Schweizer Fintech mit 120 Mitarbeitern. Option A nutzt die Anthropic Claude API (Sonnet 3.5) über eine RAG-Pipeline mit Vektordatenbank und Zendesk-Integration. Option B setzt ein offenes Sprachmodell (Llama 3 70B) auf eigener GPU-Hardware (NVIDIA A100) im Rechenzentrum des Kunden ein. Beide Optionen folgen demselben Integrations-Sprint-Modell: 4 Wochen von Prozess-Audit bis Pilotbetrieb, mit Human-in-the-Loop als Standard. Der Agent klassifiziert Tickets, entwirft Antworten auf Basis interner Dokumentation und eskaliert bei Unsicherheit an menschliche Agenten. Ziel ist die Reduktion der First-Response Time von 18 auf unter 10 Minuten bei gleichbleibender Ticket-Volumen von 4.500/Monat.
Vergleichskriterien
- Latenz: Zeit vom Ticket-Eingang bis zur generierten Antwort (ms)
- Kosten: Laufende monatliche Kosten (CHF), exkl. Engineering
- Compliance: Erfüllung von ISO 27001 und DSGVO-Anforderungen
- Skalierbarkeit: Verhalten bei Lastspitzen (>100 Requests/Minute)
- Datenhoheit: Wo die Daten physisch verarbeitet werden
- Implementierungsaufwand: Zeit bis zur Produktivität (Wochen)
- Vendor Lock-in: Abhängigkeit von einem bestimmten Anbieter
- Wartungsaufwand: Engineering-Zeit für Updates und Monitoring (Stunden/Monat)
Quantitativer Vergleich
| Kriterium | Option A: Anthropic API | Option B: Lokales LLM |
|---|---|---|
| Latenz | 800–1.200 ms | 300–500 ms |
| Laufende Kosten | 2.500–4.000 CHF/Monat | 15.000–20.000 CHF/Monat |
| Compliance | DSGVO-konform (EU-Hosting), ISO 27001-Dokumentation erforderlich | Vollständige Datenhoheit, ISO 27001-einfacher zu auditieren |
| Skalierbarkeit | Horizontal skalierbar, keine Lastgrenzen | Begrenzt durch GPU-Kapazität, Scaling erfordert zusätzliche Hardware |
| Datenhoheit | Daten verlassen das Gebäude (API-Call) | Daten bleiben im Rechenzentrum |
| Implementierung | 4 Wochen | 6–8 Wochen |
| Vendor Lock-in | Mittel (Anthropic-Abhängigkeit) | Gering (offenes Modell, aber Hardware-Abhängigkeit) |
| Wartungsaufwand | 2–4 Stunden/Monat | 10–15 Stunden/Monat |
Szenario-spezifische Bewertung
Option A gewinnt bei: Zeitkritischen Projekten mit 4-Wochen-Timeline. Die API-Option ist in Woche 4 produktiv, das lokale Modell benötigt 6–8 Wochen wegen Hardware-Provisionierung und Modell-Finetuning. Bei Kostenbewusstsein: Die API-Option ist 4–8x günstiger im laufenden Betrieb. Bei Skalierbarkeit unter Last: Die API skaliert horizontal ohne eigene Infrastruktur-Last, während das lokale Modell bei >100 Requests/Minute an GPU-Grenzen stößt. Option B gewinnt bei: Strikten Datenhoheits-Anforderungen, bei denen keine Daten das Gebäude verlassen dürfen. Bei sehr hohen Ticket-Volumina (>10.000/Monat), wo die API-Kosten die Hardware-Investition übersteigen. Bei vollständiger Unabhängigkeit von externen API-Anbietern.
Empfehlung
Für ein Schweizer Fintech mit 120 Mitarbeitern, 4.500 Tickets/Monat und ISO 27001-Anforderungen ist Option A (Anthropic Claude API) die empfohlene Wahl. Die 4-Wochen-Timeline ist nur mit der API-Option realistisch. Die laufenden Kosten von 2.500–4.000 CHF/Monat sind für diese Unternehmensgröße tragbar. Die ISO 27001-Konformität ist durch EU-Hosting und dokumentierte technische Maßnahmen (Verschlüsselung, Zugriffskontrollen) erreichbar. Der Human-in-the-Loop-Workflow bleibt bei beiden Optionen identisch, sodass ein späterer Wechsel auf ein lokales Modell möglich ist, wenn das Ticket-Volumen wächst oder die Datenhoheits-Anforderungen strenger werden. Die API-Option bietet die beste Balance aus Geschwindigkeit, Kosten und Compliance für das gegebene Szenario.
Leave a Reply