Der Engpass in der Schweizer Beratungsbranche
In der Schweizer Beratungsbranche (Professional Services) mit 51-200 Mitarbeitenden staut sich die Lead-Qualifikation oft im Backoffice. Neue Anfragen aus Deutschland, Frankreich oder Italien landen im CRM, werden manuell gelesen, kategorisiert und an den zuständigen Account Manager weitergeleitet. Die durchschnittliche Reaktionszeit liegt bei 4-6 Stunden, die Fehlerrate bei der Kategorisierung bei 10-15 %. Das kostet nicht nur Zeit, sondern auch Konversionsraten: Studien zeigen, dass die Wahrscheinlichkeit einer Konvertierung um 400 % sinkt, wenn die Reaktionszeit von 5 auf 30 Minuten steigt. Der Ansatz von Forfis adressiert genau diesen Engpass: Ein Integration-Sprint, der in 8 Wochen eine AI-Schicht über das bestehende CRM legt, ohne die Software zu ersetzen. Das Ziel ist nicht die vollständige Automatisierung, sondern die Reduktion der Kosten pro Support-Ticket und die Beschleunigung der Lead-Qualifikation durch Predictive Scoring.
Architektur: pgvector, Predictive Scoring und Slack-Integration
Die Architektur basiert auf drei Komponenten: (1) Ein RAG-Stack mit pgvector für die semantische Suche über CRM-Records und interne Dokumentation. (2) Ein Predictive Scoring-Modell, das die Wahrscheinlichkeit einer Konvertierung basierend auf historischen Daten und semantischen Ähnlichkeiten berechnet. (3) Eine Integration in Slack oder Microsoft Teams, die das Ergebnis an den Account Manager liefert. Der RAG-Stack nutzt Embeddings (z. B. von BGE-M3 oder multilingual-e5-large), die in pgvector als Vektoren gespeichert werden. Bei einer neuen Lead-Anfrage wird der Text in einen Vektor transformiert und die nächsten Nachbarn (k-NN) im Vektorraum gesucht. Diese Ähnlichkeit wird zusammen mit dem Predictive Score (z. B. ein Gradient Boosting Classifier oder ein einfaches Logistisches Regressionsmodell) in eine Slack-Nachricht gepackt. Das Modell ist model-agnostisch: Für die Embeddings und das Scoring können Open-Weight-Modelle auf eigener Hardware genutzt werden, da keine regulierten Daten (Gesundheit, Finanzen) vorliegen. Die LLM-Schicht für die Zusammenfassung kann über API-Calls (OpenAI, Anthropic) oder lokal laufen.
Trade-offs: Modellwahl, Datenlage und Akzeptanz
Die zentrale Entscheidung ist die Wahl des Embedding-Modells. Multilinguale Modelle wie BGE-M3 oder multilingual-e5-large erkennen semantische Ähnlichkeiten über Sprachgrenzen hinweg, sind aber rechenintensiver. Monolinguale Modelle sind schneller, aber ungenau bei Leads in Französisch oder Italienisch. Der Kompromiss: Ein multilinguales Modell für die Embeddings, ein leichtes Modell (z. B. Llama 3 8B) für die Zusammenfassung. Der Predictive Score nutzt historische Konversionsdaten aus dem CRM. Wenn die Datenlage dünn ist (< 500 qualifizierte Leads), ist ein einfaches Logistisches Regressionsmodell besser als ein komplexes Deep Learning-Modell, da es weniger Overfitting erzeugt. Die Slack-Integration ist bewusst einfach: Eine Nachricht mit Score, Zusammenfassung und empfohlener Aktion. Kein Chatbot, keine komplexe UI. Das reduziert die Akzeptanzbarriere bei den Account Managern.
Empfehlung: 8-Wochen-Sprint mit messbarer Baseline
Für ein Schweizer Beratungsunternehmen mit 100 Mitarbeitenden und 500 neuen Leads pro Monat ist der 8-Wochen-Sprint wirtschaftlich sinnvoll, wenn die Reaktionszeit von 4 Stunden auf < 15 Minuten sinkt und die Fehlerrate unter 5 % fällt. Die Kosten für den Sprint liegen bei 40.000-80.000 CHF, plus laufende Infrastrukturkosten (Server für Open-Weight-Modelle oder API-Calls). Die Einsparung pro Lead (weniger manuelle Arbeit, höhere Konversionsrate) muss diese Kosten innerhalb von 6-12 Monaten übersteigen. Der Pilot wird mit einer gemessenen Baseline ausgeliefert: Vorher-Nachher-Vergleich der Reaktionszeit und Fehlerrate. Wenn die Metriken nicht erreicht werden, wird der Scope angepasst, nicht das Modell. Die menschliche Kontrolle bleibt: Der Account Manager bestätigt oder korrigiert die Lead-Qualifikation. Das System ersetzt nicht, sondern unterstützt.
Leave a Reply