Das Problem: Manuelle Rechnungsprüfung im E-Commerce
In deutschen E-Commerce-Unternehmen mit 51 bis 200 Mitarbeitern staut sich die Arbeit oft im Back-Office. Rechnungsprüfer müssen täglich hunderte PDFs manuell in das ERP-System übertragen. Dieser Prozess ist fehleranfällig und bindet wertvolle Kapazitäten. Die Folge: Langsame Zahlungszyklen und unzufriedene Lieferanten. Die Lösung ist kein komplettes ERP-Replace, sondern eine gezielte Automatisierungsschicht, die die manuelle Datenerfassung eliminiert. Ein Retrieval-Augmented Generation (RAG) Assistent, der auf der OpenAI API aufsetzt, kann hier den Unterschied machen. Er liest die Rechnung, extrahiert die relevanten Felder und legt sie strukturiert ab. Der Mensch prüft nur noch die Ausnahmen. Dieser Ansatz reduziert die Bearbeitungszeit pro Rechnung von 15 auf 2 Minuten und senkt die Fehlerquote um 80 Prozent. Die Integration erfolgt über die bestehenden Systeme, nicht durch deren Austausch.
Architektur: RAG-Pipeline mit OpenAI API
Die Architektur basiert auf drei Schichten. Erstens die Ingestions-Schicht: Rechnungen werden aus Gmail oder Google Drive abgerufen. Eine OCR-Pipeline (z. B. Tesseract oder Cloud Vision) wandelt das PDF in Text um. Zweitens die RAG-Schicht: Der Text wird in Chunks aufgeteilt und in eine Vektor-Datenbank (z. B. Weaviate) geschrieben. Die OpenAI API (gpt-4o) wird mit einem spezifischen Prompt angesprochen, der die Extraktion der Felder (Rechnungsnummer, Betrag, Fälligkeitsdatum) verlangt. Drittens die Integrations-Schicht: Die extrahierten Daten werden als JSON an das ERP-System (z. B. SAP B1 oder Odoo) gesendet. Die Google Workspace Integration erfolgt über die Gmail API und die Drive API. Der Assistent wird als Add-on in Gmail eingebunden, sodass der Mitarbeiter die Rechnung direkt in der Mail-App prüfen und freigeben kann. Die Architektur ist bewusst model-agnostic, aber für diesen Use Case ist die OpenAI API die erste Wahl wegen ihrer hohen Genauigkeit bei deutschen Texten.
Trade-offs: API-Zugang vs. On-Premise-Modelle
Die Entscheidung für die OpenAI API statt eines Open-Weight-Modells auf eigener Hardware ist ein bewusster Trade-off. Open-Weight-Modelle (z. B. Llama 3) sind datenschutzrechtlich vorteilhaft, wenn sensible Daten das Gebäude nicht verlassen dürfen. In diesem Szenario (Compliance: None) ist dieser Vorteil nicht zwingend. Die OpenAI API bietet dafür eine höhere Qualität bei der deutschen Sprachverarbeitung und der Einhaltung komplexer Anweisungen. Der Nachteil: Die Daten verlassen das eigene Netzwerk. Für ein Unternehmen ohne strenge Compliance-Vorgaben ist das akzeptabel. Die Kosten pro Token sind bei GPT-4o so gering, dass sie für die meisten Back-Office-Prozesse vernachlässigbar sind. Der eigentliche Trade-off liegt in der Abhängigkeit von einem externen Anbieter. Forfis plant daher eine Abstraktionsschicht, die es ermöglicht, bei Bedarf auf ein anderes Modell umzusteigen, ohne die gesamte Pipeline neu aufzubauen.
Roadmap: Vom Audit zum Piloten in 8 Wochen
Der Prozess-Audit ist der kritische erste Schritt. Er identifiziert die drei bis fünf Prozesse mit dem höchsten manuellen Aufwand und der höchsten Fehlerquote. Für den Piloten wird ein Prozess ausgewählt, der klar definierte Eingaben (z. B. eine Rechnung als PDF) und eine messbare Ausgabe (z. B. ein strukturiertes JSON-Objekt) hat. Die Roadmap plant dann die schrittweise Ausweitung auf weitere Dokumenttypen und die Anbindung an das ERP-System. Jede Phase hat ein festes Zeitfenster von zwei bis vier Wochen. Der Pilot läuft 8 Wochen. In Woche 1-2 wird der Audit durchgeführt und die Daten bereinigt. In Woche 3-4 wird die RAG-Pipeline aufgebaut und in Google Workspace integriert. In Woche 5-6 läuft der Pilotbetrieb mit einem kleinen Team. In Woche 7-8 erfolgt der Rollout auf den gesamten Bereich und die Übergabe an das Managed Operations Team. Diese Struktur minimiert das Risiko und stellt sicher, dass der Pilot messbare Ergebnisse liefert.
Mehrsprachigkeit und Google Workspace Integration
Die mehrsprachige Unterstützung ist ein entscheidender Faktor für den Erfolg. Der Assistent wird so trainiert, dass er auf der Sprache der Eingabe antwortet. Für die deutsche Sprache werden spezifische Prompts und Few-Shot-Beispiele verwendet, um die korrekte Verwendung von Fachbegriffen und die formelle Anrede sicherzustellen. Für die englische Sprache gelten ähnliche Regeln. Das System erkennt die Sprache automatisch über eine Sprachdetektions-Bibliothek (z. B. langdetect) und wählt den entsprechenden Prompt-Template aus. Die Google Workspace Integration ermöglicht es, dass der Assistent in der Sprache des Nutzers antwortet, unabhängig von der Sprache der Rechnung. Dies ist besonders wichtig, wenn internationale Lieferanten mit englischen Rechnungen arbeiten und das deutsche Team die Daten verarbeiten muss. Die mehrsprachige Unterstützung reduziert die Notwendigkeit, dass Mitarbeiter manuell übersetzen oder zwischen Systemen wechseln müssen.
Managed Operations: Kontinuierliche Verbesserung
Das Managed AI Operations Modell ist der Schlüssel zur langfristigen Skalierbarkeit. Es beinhalten das Monitoring der Modell-Antworten, die Aktualisierung der Vektor-Datenbank bei Dokumentänderungen, die Feinjustierung der Prompts und die Behandlung von Edge-Cases. Das Team von Forfis überwacht die Metriken wie Genauigkeit und Latenz und greift ein, wenn die Fehlerquote einen Schwellenwert überschreitet. Der Kunde muss sich nicht mit der Wartung der Infrastruktur oder der Modell-Updates beschäftigen. Die Kosten für das Managed Operations sind im Piloten enthalten und werden nach dem Rollout als monatlicher Service berechnet. Dieses Modell stellt sicher, dass der Assistent nicht nur einmalig funktioniert, sondern kontinuierlich verbessert wird. Es ist der Unterschied zwischen einem Projekt und einem Produkt. Für ein Unternehmen mit 51 bis 200 Mitarbeitern ist diese Entlastung von der IT-Wartung ein entscheidender Vorteil, da sie ihre Ressourcen auf das Kerngeschäft konzentrieren kann.
Leave a Reply