{"id":229,"date":"2026-10-06T18:59:58","date_gmt":"2026-10-06T18:59:58","guid":{"rendered":"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/"},"modified":"2026-10-06T18:59:58","modified_gmt":"2026-10-06T18:59:58","slug":"rag-assistent-on-premise-llm-e-commerce-schweiz","status":"publish","type":"post","link":"https:\/\/blog.forfis.com\/blog\/de\/rag-assistent-on-premise-llm-e-commerce-schweiz\/","title":{"rendered":"RAG-Assistent im E-Commerce: Fehlerquote um 40 % senken"},"content":{"rendered":"<h2>Hintergrund: E-Commerce-Unternehmen in der Wachstumsphase<\/h2>\n<p>Dieser Fallbericht ist ein Komposit aus Mustern, die in der Praxis beobachtet wurden. Es werden keine realen Firmennamen genannt, um die Vertraulichkeit der Kunden zu wahren. Die beschriebenen Metriken und Prozesse basieren auf typischen Engagements in der Schweiz und in DACH-M\u00e4rkten.<\/p>\n<p><strong>Hintergrund:<\/strong><br \/>\nEin Schweizer E-Commerce-Unternehmen mit 320 Mitarbeitern, spezialisiert auf Outdoor-Ausr\u00fcstung, betreibt einen eigenen Online-Shop und ein B2B-Portal f\u00fcr Wiederverk\u00e4ufer. Der Support besteht aus 12 FTE, verteilt auf zwei Schichten. Die IT-Stack umfasst Salesforce als CRM, Zendesk als Helpdesk und Notion als zentrale Wissensdatenbank. Die Firma befindet sich in der Wachstumsphase und plant die Expansion in den DACH-Raum.<\/p>\n<p><strong>Herausforderung:<\/strong><br \/>\nDie Fehlerquote im Back-Office lag bei 18 %, gemessen an fehlerhaften Retourenbearbeitungen und falschen Produktzuordnungen. Die Hauptursache war die unklare Zuordnung von Tickets: 35 % der Anfragen wurden an die falsche Abteilung geroutet, was zu doppelten Bearbeitungen und verz\u00f6gerten Antworten f\u00fchrte. Zus\u00e4tzlich drohte der Verlust von Fachwissen durch den Abgang von drei erfahrenen Support-Leads. Die Compliance-Abteilung forderte eine L\u00f6sung, die keine Kundendaten an US-Cloud-Provider \u00fcbertr\u00e4gt, um die DSGVO und den Schweizer Datenschutz zu wahren.<\/p>\n<h2>Herausforderung: Fehlerquote und Compliance-Druck<\/h2>\n<p>Der Auftrag lautete: Reduzierung der Fehlerquote im Back-Office um mindestens 30 % innerhalb von drei Monaten, ohne die bestehende Infrastruktur zu ersetzen. Die operative Dr\u00e4nge resultierte aus der bevorstehenden Black-Friday-Saison, bei der das Ticketvolumen um 40 % steigt. Die Compliance-Abteilung verlangte eine On-Premise-L\u00f6sung, da Kundendaten (Namen, Adressen, Bestellhistorie) nicht den Schweizer Standort verlassen durften. Zudem musste das System den EU AI Act erf\u00fcllen, der ab August 2024 in Kraft tritt und Transparenzpflichten f\u00fcr KI-Systeme im Kundenkontakt vorsieht.<\/p>\n<p>Die technische Herausforderung bestand in der Integration eines RAG-Assistenten in das bestehende Zendesk-System, ohne die API-Endpunkte zu modifizieren. Die Wissensbasis in Notion war unstrukturiert: 1.200 Seiten mit gemischter Qualit\u00e4t, veralteten Preisen und widerspr\u00fcchlichen Retourenrichtlinien. Die Datenbereinigung war daher der kritischste Pfad im Projekt.<\/p>\n<h2>Ansatz: Integration-Sprint mit On-Premise-LLM<\/h2>\n<p>Forfis startete mit einem zweiw\u00f6chigen Prozess-Audit, der die Top-5-Ticket-Kategorien identifizierte: Retouren, Produktinformationen, Lieferstatus, Reklamationen und B2B-Abrechnungen. Der Pilot fokussierte sich auf Retouren und Produktinformationen, die 60 % des Volumens ausmachten.<\/p>\n<p><strong>Technische Architektur:<\/strong><\/p>\n<ul>\n<li><strong>Modell:<\/strong> Mistral Large 70B, On-Premise auf zwei NVIDIA A100 GPUs im Schweizer Rechenzentrum.<\/li>\n<li><strong>RAG-Pipeline:<\/strong> LangChain mit Weaviate als Vektor-Datenbank. Embeddings via BGE-M3 (multilingual, optimiert f\u00fcr Deutsch).<\/li>\n<li><strong>Integration:<\/strong> Webhook in Zendesk, der neue Tickets an das RAG-System sendet. Das System klassifiziert das Ticket, generiert einen Draft-Antwort und routet es an die zust\u00e4ndige Abteilung.<\/li>\n<li><strong>Human-in-the-Loop:<\/strong> Alle Antworten, die Geldbetr\u00e4ge oder Vertragsklauseln enthalten, erfordern eine manuelle Freigabe durch einen Support-Mitarbeiter.<\/li>\n<\/ul>\n<p>Die Notion-Dokumente wurden in Chunks von 512 Tokens aufgeteilt und in Weaviate indexiert. Ein Prompt-Template sicherte, dass das LLM nur auf Basis der abgerufenen Chunks antwortet und bei Unsicherheit den Menschen kontaktiert.<\/p>\n<h2>Ergebnis: Metriken nach drei Monaten<\/h2>\n<p>Nach zw\u00f6lf Wochen im Parallelbetrieb (KI-Entw\u00fcrfe neben menschlichen Antworten) zeigten die Messungen folgende Ergebnisse:<\/p>\n<ul>\n<li><strong>Fehlerquote:<\/strong> Von 18 % auf 11 % gesenkt (-39 %).<\/li>\n<li><strong>Routing-Genauigkeit:<\/strong> 92 % der Tickets wurden in die richtige Abteilung geroutet (vorher 65 %).<\/li>\n<li><strong>Bearbeitungszeit:<\/strong> Durchschnittliche Zeit pro Ticket von 14 Minuten auf 9 Minuten reduziert (-36 %).<\/li>\n<li><strong>Erstantwort-Zeit:<\/strong> Von 4 Stunden auf 45 Minuten verk\u00fcrzt.<\/li>\n<li><strong>Kosten:<\/strong> Keine zus\u00e4tzlichen Cloud-Kosten. Hardware-Investition von 45.000 EUR, amortisiert nach 14 Monaten durch reduzierte Personalkosten (2 FTE weniger in der Spitzenzeit).<\/li>\n<\/ul>\n<p>Die Compliance-Abteilung best\u00e4tigte, dass keine Daten den Standort verlassen haben. Der EU AI Act-Check ergab, dass das System unter \u201elimited risk\u201c f\u00e4llt, da es keine automatischen Entscheidungen \u00fcber Personen trifft, sondern nur Vorschl\u00e4ge generiert. Die Transparenzpflicht wurde durch einen Hinweis im Ticket erf\u00fcllt: \u201eDiese Antwort wurde von einer KI generiert und von einem Menschen gepr\u00fcft.\u201c<\/p>\n<h2>Lektionen: Skalierung \u00fcber Abteilungen hinweg<\/h2>\n<p>Die Skalierung auf weitere Abteilungen (B2B-Abrechnungen, Reklamationen) erforderte drei Anpassungen:<\/p>\n<ul>\n<li><strong>Datenqualit\u00e4t:<\/strong> Die Notion-Dokumente mussten monatlich aktualisiert werden. Ein automatisierter Job pr\u00fcft auf veraltete Preise und leitet \u00c4nderungsanfragen an die Produktmanager weiter.<\/li>\n<li><strong>Modell-Tuning:<\/strong> F\u00fcr B2B-Tickets wurde ein separater Prompt mit spezifischen Vertragsklauseln erstellt. Das generische Modell erreichte nur 85 % Genauigkeit, der spezialisierte Prompt 94 %.<\/li>\n<li><strong>Human-in-the-Loop-Prozess:<\/strong> Die Freigabe-Schleife wurde von 100 % auf 30 % der Tickets reduziert, da die Routing-Genauigkeit f\u00fcr einfache F\u00e4lle (z. B. Lieferstatus) \u00fcber 98 % lag. Kritische F\u00e4lle (Reklamationen \u00fcber 500 EUR) bleiben manuell.<\/li>\n<\/ul>\n<p><strong>Lektionen f\u00fcr \u00e4hnliche Teams:<\/strong><\/p>\n<ul>\n<li>Starte mit einem engen Scope (eine Ticket-Kategorie), nicht mit \u201eallem\u201c.<\/li>\n<li>Investiere in die Datenbereinigung vor dem Modell-Tuning.<\/li>\n<li>On-Premise ist in der Schweiz oft die einzige Compliance-Option f\u00fcr Kundendaten.<\/li>\n<li>Mische Open-Weight-Modelle (Kostenkontrolle) mit API-Modellen (Qualit\u00e4t) je nach Sensitivit\u00e4t der Daten.<\/li>\n<li>Dokumentiere den Human-in-the-Loop-Prozess f\u00fcr den EU AI Act-Compliance-Check.<\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>Wie ein Schweizer E-Commerce-Unternehmen mit 300 Mitarbeitern die Ticket-Fehlerquote um 40 % senkte. Ein Fallbeispiel zu RAG-Assistenten, On-Premise-LLMs und EU AI Act-Compliance.<\/p>\n","protected":false},"author":2,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"rank_math_title":"RAG-Assistent im E-Commerce: Fehlerquote um 40 % senken","rank_math_description":"Wie ein Schweizer E-Commerce-Unternehmen mit 300 Mitarbeitern die Ticket-Fehlerquote um 40 % senkte. Ein Fallbeispiel zu RAG-Assistenten, On-Premise-LLMs und EU AI Act-Compliance.","rank_math_focus_keyword":"reduce error rate in the back office ticket triage and routing","_yoast_wpseo_title":"","_yoast_wpseo_metadesc":"","_yoast_wpseo_focuskw":"","pll_lang":"de","geo_jsonld":"{\"@context\":\"https:\/\/schema.org\",\"@graph\":[{\"@id\":\"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/#article\",\"@type\":\"Article\",\"author\":{\"@id\":\"https:\/\/blog.forfis.com#org\"},\"dateModified\":\"2026-10-05T23:51:08.280747641+00:00\",\"datePublished\":\"2026-10-05T23:51:08.280747641+00:00\",\"description\":\"Wie ein Schweizer E-Commerce-Unternehmen mit 300 Mitarbeitern die Ticket-Fehlerquote um 40 % senkte. Ein Fallbeispiel zu RAG-Assistenten, On-Premise-LLMs und EU AI Act-Compliance.\",\"headline\":\"RAG-Assistent im E-Commerce: Fehlerquote um 40 % senken\",\"inLanguage\":\"en\",\"keywords\":[\"Scaling Across Departments\",\"Open-Weight Models On-Premise\",\"Retrieval-Augmented Knowledge Assistant\",\"Customer Support\",\"201-500\",\"EU AI Act\",\"Integration Sprint\",\"E-commerce and Retail\",\"Notion or Confluence\",\"German\",\"Reduce Error Rate in the Back Office\",\"Switzerland\",\"3 months\",\"Ticket Triage and Routing\"],\"mainEntityOfPage\":\"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/\",\"publisher\":{\"@id\":\"https:\/\/blog.forfis.com#org\"}},{\"@id\":\"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/#faq\",\"@type\":\"FAQPage\",\"mainEntity\":[{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Der EU AI Act klassifiziert KI-Systeme nach Risikoklasse. Ein internes Ticket-Triage-System f\u00e4llt in der Regel unter \u201eminimal risk\u201c oder \u201elimited risk\u201c (Transparenzpflichten). Es werden keine hohen Anforderungen wie bei Hochrisiko-Systemen (z. B. Kreditvergabe) gestellt. Dennoch muss der Anbieter sicherstellen, dass keine personenbezogenen Daten in unzureichend gesch\u00fctzte Cloud-APIs abflie\u00dfen, was bei On-Premise-L\u00f6sungen automatisch erf\u00fcllt ist. Die Dokumentation der Datenfl\u00fcsse und die Einholung der Einwilligung bei der Verarbeitung von Kundendaten bleiben Pflicht.\"},\"name\":\"Welche Pflichten des EU AI Act gelten f\u00fcr ein internes Ticket-Triage-System?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ein On-Premise-Deployment mit Open-Weight-Modellen (z. B. Llama 3 70B oder Mistral Large) auf eigener Hardware ist der sicherste Weg, um Datenhoheit zu wahren. Die Kosten liegen je nach Hardware-Ausstattung (z. B. 2x A100 GPUs) bei ca. 30.000\u201350.000 EUR Investition plus Strom und K\u00fchlung. Der Betrieb erfordert jedoch ein Team mit DevOps-Kompetenz. Alternativ bieten Managed-Hosting-Anbieter in der Schweiz (z. B. Swisscom oder lokale Cloud-Provider) isolierte Instanzen an, die die Daten nicht verlassen, aber die Infrastruktur abstrahieren.\"},\"name\":\"Wie implementiert man ein On-Premise-LLM-Deployment in der Schweiz?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Integration erfolgt \u00fcber die REST-APIs von Notion oder Confluence. Ein RAG-Pipeline-Tool (z. B. LangChain oder LlamaIndex) l\u00e4dt die Dokumente, teilt sie in Chunks auf (z. B. 512 Tokens) und speichert die Embeddings in einem Vektor-Datenbank wie Weaviate oder Qdrant. Bei der Anfrage wird das Ticket mit demselben Embedding-Modell verarbeitet, die \u00e4hnlichsten Chunks abgerufen und als Kontext in den Prompt des LLMs injiziert. Dies reduziert Halluzinationen und sichert die Aktualit\u00e4t der Antworten.\"},\"name\":\"Wie funktioniert die Anbindung an Notion oder Confluence technisch?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ein realistischer Zeitrahmen f\u00fcr einen Piloten mit festem Scope (eine Abteilung, ein Ticket-Typ) liegt bei 8\u201312 Wochen. Woche 1-2: Prozess-Audit und Datenbereinigung. Woche 3-4: Setup der Infrastruktur und RAG-Pipeline. Woche 5-8: Modell-Tuning, Prompt-Engineering und Integration in das Helpdesk-System. Woche 9-12: Parallelbetrieb, Feedback-Schleifen und Go-Live. L\u00e4ngere Zeitr\u00e4ume entstehen oft durch unklare Verantwortlichkeiten im Kundenunternehmen oder mangelnde Datenqualit\u00e4t in den Wissensquellen.\"},\"name\":\"Wie lange dauert ein typischer Integration-Sprint f\u00fcr ein RAG-System?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die Genauigkeit wird \u00fcber drei Metriken gemessen: 1. Routing-Genauigkeit (Prozent der Tickets, die in die richtige Kategorie gehen). 2. Antwort-N\u00fctzlichkeit (Bewertung durch Support-Mitarbeiter auf einer Skala von 1-5). 3. Zeitersparnis (Durchschnittliche Bearbeitungszeit vor\/nach). Zielwerte: >90% Routing-Genauigkeit und eine Reduktion der Bearbeitungszeit um 30-40%. Die Messung erfolgt \u00fcber A\/B-Tests im Parallelbetrieb \u00fcber mindestens zwei Wochen.\"},\"name\":\"Wie misst man den Erfolg eines RAG-Assistenten im Support?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Ja, aber nur wenn die Daten nicht den Standort verlassen. In der Schweiz gelten strenge Datenschutzvorschriften (DSG). Ein On-Premise-Deployment auf Schweizer Hardware oder in einem Schweizer Rechenzentrum mit ISO 27001-Zertifizierung ist die empfohlene L\u00f6sung. Cloud-L\u00f6sungen aus den USA oder der EU sind nur zul\u00e4ssig, wenn Standardvertragsklauseln (SCCs) vorliegen und ein Angemessenheitsbeschluss besteht. F\u00fcr sensible Kundendaten im E-Commerce ist On-Premise oft die einzig praktikable Compliance-Option.\"},\"name\":\"Ist die Verarbeitung von Kundendaten in der Schweiz mit einem On-Premise-LLM DSGVO-konform?\"},{\"@type\":\"Question\",\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Die h\u00e4ufigsten Stolperfallen sind: 1. Mangelnde Datenqualit\u00e4t in Notion\/Confluence (veraltete oder widerspr\u00fcchliche Dokumente). 2. Zu enger Scope (Versuch, alle Ticket-Typen gleichzeitig zu automatisieren). 3. Fehlende Human-in-the-Loop-Prozesse (Automatisierung ohne Freigabe durch Menschen bei kritischen F\u00e4llen). 4. Untersch\u00e4tzung der Integrationsaufw\u00e4nde in das bestehende Helpdesk-System (z. B. Zendesk oder Jira Service Management).\"},\"name\":\"Welche Stolperfallen treten bei der Skalierung von KI-Projekten \u00fcber Abteilungen hinweg auf?\"}]},{\"@id\":\"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/#breadcrumbs\",\"@type\":\"BreadcrumbList\",\"itemListElement\":[{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\",\"name\":\"Home\",\"position\":1},{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\/blog\/\",\"name\":\"Blog\",\"position\":2},{\"@type\":\"ListItem\",\"item\":\"https:\/\/blog.forfis.com\/blog\/rag-assistent-on-premise-llm-e-commerce-schweiz\/\",\"name\":\"RAG-Assistent im E-Commerce: Fehlerquote um 40 % senken\",\"position\":3}]},{\"@id\":\"https:\/\/blog.forfis.com#org\",\"@type\":\"Organization\",\"name\":\"Forfis\",\"url\":\"https:\/\/blog.forfis.com\"}]}","geo_content_hash":"536c87306d5cc10bad9c3c5dbe74aa496eec55cb59fd3d94c9b813625344c3f7","footnotes":""},"categories":[65],"tags":[49,43,51],"class_list":["post-229","post","type-post","status-publish","format-standard","hentry","category-e-commerce-and-retail","tag-reduce-error-rate-in-the-back-office","tag-switzerland","tag-ticket-triage-and-routing"],"_links":{"self":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts\/229","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/comments?post=229"}],"version-history":[{"count":0,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/posts\/229\/revisions"}],"wp:attachment":[{"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/media?parent=229"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/categories?post=229"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/blog.forfis.com\/blog\/wp-json\/wp\/v2\/tags?post=229"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}