RAG mit pgvector vs. LLM-Orchestrierung: Statusanfragen im Versicherungsbereich

Zwei Ansätze zur Automatisierung von Statusanfragen

Die Automatisierung von Statusanfragen im Schweizer Versicherungsbereich steht vor einer klaren Entscheidung: Ein RAG-System mit pgvector, das auf der eigenen Hardware läuft, oder eine LLM-Orchestrierung, die auf externen APIs basiert. Beide Ansätze zielen darauf ab, die Fehlerquote im Back Office zu senken und die Durchlaufzeit zu verkürzen. Der Unterschied liegt in der Architektur, den Kosten und der Kontrolle über die Daten. Das RAG-System nutzt Embeddings, um relevante Dokumente und Daten abzurufen. Die LLM-Orchestrierung nutzt ein großes Sprachmodell, um die Antwort zu formulieren und zu interpretieren. Beide Ansätze sind in der Lage, die Statusanfragen zu bearbeiten, aber sie unterscheiden sich in der Präzision, der Latenz und der Compliance. Die Entscheidung hängt davon ab, welche Prioritäten das Unternehmen setzt: Kontrolle über die Daten oder Flexibilität in der Antwortformulierung.

Kriterien für die Bewertung

Die Bewertung beider Ansätze erfolgt anhand von sechs Kriterien. Erstens: Latenz. Wie schnell wird die Antwort geliefert? Zweitens: Kosten. Was kostet die Infrastruktur und die Entwicklung? Drittens: Vendor Lock-in. Wie abhängig ist das System von einem bestimmten Anbieter? Viertens: Compliance. Bleiben die Daten auf der eigenen Hardware? Fünftens: Fehlerquote. Wie präzise sind die Antworten? Sechstens: Skalierbarkeit. Wie leicht lässt sich das System auf weitere Prozesse ausweiten? Diese Kriterien sind entscheidend für die Entscheidung. Sie werden im folgenden Vergleichstabelle konkretisiert. Die Zahlen basieren auf den Erfahrungen aus dem Pilot und den typischen Werten in der Branche. Die Kriterien sind so gewählt, dass sie die wichtigsten Aspekte der Automatisierung abdecken. Sie sind nicht beliebig, sondern reflektieren die realen Anforderungen eines Versicherers mit 51 bis 200 Mitarbeitern.

Vergleichstabelle: RAG mit pgvector vs. LLM-Orchestrierung

Kriterium RAG mit pgvector LLM-Orchestrierung
Latenz 80-150 ms 400-800 ms
Kosten (Pilot) 15 000 EUR 25 000 EUR
Vendor Lock-in Gering (eigene Hardware) Hoch (externe API)
Compliance Daten bleiben lokal Daten verlassen das Gebäude
Fehlerquote 3 % 5 %
Skalierbarkeit Mittel (manuelles Tuning) Hoch (automatisches Tuning)

Die Tabelle zeigt die konkreten Unterschiede. Die Latenz ist beim RAG-System niedriger, da es keine externe API aufruft. Die Kosten sind beim RAG-System geringer, da die Infrastruktur auf der eigenen Hardware läuft. Der Vendor Lock-in ist beim RAG-System gering, da es keine Abhängigkeit von einem externen Anbieter gibt. Die Compliance ist beim RAG-System gegeben, da die Daten lokal bleiben. Die Fehlerquote ist beim RAG-System niedriger, da es auf präzisen Daten basiert. Die Skalierbarkeit ist beim LLM-System höher, da es automatisch angepasst werden kann. Diese Zahlen sind die Grundlage für die Entscheidung. Sie zeigen, dass beide Ansätze ihre Stärken haben. Die Wahl hängt davon ab, welche Kriterien für das Unternehmen am wichtigsten sind.

Wann gewinnt das RAG-System?

Das RAG-System mit pgvector gewinnt, wenn die Kontrolle über die Daten und die niedrige Latenz im Vordergrund stehen. Das ist der Fall, wenn die Daten sensible Kundendaten enthalten und die Compliance-Anforderungen der Schweiz erfüllt werden müssen. Das RAG-System ist auch die richtige Wahl, wenn die Statusanfragen einfach und klar definiert sind, z. B. ‘Wo ist meine Sendung?’. In diesem Fall reicht ein präziser Abruf aus der Datenbank. Die LLM-Orchestrierung gewinnt, wenn die Antwortformulierung komplex ist und Nuancen erfordert. Das ist der Fall, wenn die Kunden Fragen stellen, die nicht direkt aus der Datenbank beantwortet werden können, z. B. ‘Warum ist meine Sendung verzögert?’. In diesem Fall ist ein LLM mit größerem Kontextfenster und Chain-of-Thought-Reasoning die bessere Wahl. Die LLM-Orchestrierung ist auch die richtige Wahl, wenn das System auf weitere Prozesse ausgeweitet werden soll, z. B. auf die Bearbeitung von Schadensfällen. In diesem Fall ist die Skalierbarkeit und die Flexibilität des LLM-Systems entscheidend.

Empfehlung für den Pilot

Die Empfehlung ist klar: Für den Pilot im Schweizer Versicherungsbereich ist das RAG-System mit pgvector die richtige Wahl. Die Gründe sind die Kontrolle über die Daten, die niedrige Latenz und die geringeren Kosten. Der Pilot läuft 8 Wochen und ist auf einen klar definierten Workflow beschränkt. Die Kosten sind fix kalkuliert: 15 000 EUR für die Entwicklung, 2 000 EUR/Monat für die Infrastruktur. Nach dem Pilot entscheidet das Management auf Basis der gemessenen Fehlerquote und Durchlaufzeit, ob der Rollout auf alle Kanäle und Prozesse folgt. Wenn der Rollout auf komplexere Prozesse ausgeweitet wird, z. B. auf die Bearbeitung von Schadensfällen, kann die LLM-Orchestrierung als Ergänzung hinzukommen. Die Architektur ist so gestaltet, dass beide Ansätze kombiniert werden können. Das RAG-System für die schnellen Faktenabfragen, das LLM für die Interpretation. Der Wechsel zwischen den beiden Modi erfolgt über eine einfache Routing-Logik in der Orchestrierungsschicht. Diese Kombination bietet die beste Balance zwischen Kontrolle, Präzision und Flexibilität.

Kommentare

Leave a Reply

Your email address will not be published. Required fields are marked *