Ein mittelständischer Großhändler aus Köln verarbeitete jede Woche hunderte Lieferscheine, Rechnungen und Abrechnungen manuell. Durch den Einsatz einer OCR/LLM-Pipeline sank die Belegprüfzeit von 12 Min. auf 45 Sek.
Kurzantwort
Die Kombination aus OCR-Technologie und Large Language Models (LLMs) wie DeepSeek ermöglicht das strukturierte, automatisierte Auslesen unstrukturierter Dokumente (PDFs, Bilder, Scans). In der Praxis führt dies zu einer Senkung der Verarbeitungszeit von 12 Minuten auf 45 Sekunden pro Beleg und minimiert manuelle Tippfehler bei der anschließenden Übertragung in ERP-Systeme wie SAP.
Ausgangslage
Ein mittelständischer Großhändler aus Köln verarbeitete jede Woche hunderte Lieferscheine, Rechnungen und Abrechnungen. Die Dokumente kamen teilweise als PDF, Scan oder Foto per E-Mail herein. Mitarbeiter mussten die Dokumente manuell öffnen, relevante Informationen suchen und anschließend in SAP übertragen.
Dieser Prozess war zeitintensiv und fehleranfällig. Besonders bei großen Dokumentenmengen kam es zu Verzögerungen, Tippfehlern und Rückfragen zwischen Buchhaltung, Lager und Einkauf.
Pro Dokument dauerte die Bearbeitung im Durchschnitt rund 12 Minuten. Bei mehreren hundert Dokumenten pro Woche entstand dadurch ein erheblicher interner Aufwand.
Ziel des Projekts
Ziel war es, die Dokumentenverarbeitung weitgehend zu automatisieren. Lieferscheine und Abrechnungen sollten automatisch ausgelesen, geprüft, strukturiert und an SAP übergeben werden.
Dabei sollte die KI nicht blind Daten übernehmen, sondern unsichere Fälle markieren und zur manuellen Prüfung weiterleiten.
Technischer Stack
Dokumenteneingang
Dokumente könnten über mehrere Kanäle ins System gelangen:
- E-Mail-Postfach
- Upload-Portal
- internes Dashboard
- SFTP-Ordner
- SAP-Export
- Cloud-Speicher
Für ein modernes Upload-Portal wäre folgender Stack sinnvoll:
- Next.js mit TypeScript für das interne Dashboard.
- Supabase Storage für die sichere Speicherung von PDFs, Scans und Bildern.
- Supabase PostgreSQL für Dokumentenstatus, extrahierte Daten und Prüfprotokolle.
OCR-Erkennung
Für die Texterkennung könnten verschiedene OCR-Dienste eingesetzt werden:
- Google Document AI
- Azure AI Document Intelligence
- AWS Textract
- Mistral OCR
- Tesseract bei einfachen Anforderungen
Die OCR-Komponente erkennt Text, Tabellen, Rechnungsnummern, Lieferdaten, Artikelnummern, Mengen, Preise und Lieferanteninformationen.
LLM-Verarbeitung
Nach der OCR-Erkennung kann ein LLM wie DeepSeek LLM eingesetzt werden, um aus unstrukturiertem Text strukturierte Daten zu erzeugen.
Beispielhafte Aufgaben für DeepSeek:
- Erkennung des Dokumententyps
- Extraktion von Lieferant, Datum, Rechnungsnummer und Bestellnummer
- Zuordnung von Positionen zu Artikelnummern
- Erkennung von Abweichungen
- Zusammenfassung unklarer Dokumente
- Ausgabe als strukturiertes JSON
Ein Beispiel für eine strukturierte Ausgabe könnte so aussehen:
{
"document_type": "delivery_note",
"supplier": "Muster GmbH",
"delivery_date": "2026-06-12",
"delivery_note_number": "LS-45821",
"items": [
{
"sku": "A-10291",
"description": "Produkt A",
"quantity": 24
}
],
"confidence": 0.94
}Backend & Prüfprozess
Supabase Edge Functions könnten verwendet werden, um den Verarbeitungsprozess zu steuern: 1. Neues Dokument wird hochgeladen. 2. Dokument wird an OCR-Dienst übergeben. 3. OCR-Ergebnis wird gespeichert. 4. DeepSeek LLM extrahiert strukturierte Daten. 5. Daten werden gegen interne Regeln geprüft. 6. Ergebnis wird in PostgreSQL gespeichert. 7. Sichere Fälle werden automatisch weitergegeben. 8. Unklare Fälle landen in einer manuellen Review-Ansicht.
Datenbank
In Supabase könnten unter anderem folgende Tabellen entstehen:
documentsdocument_extractionssuppliersextraction_errorssap_sync_logsmanual_reviewsaudit_logs
Wichtig wäre ein vollständiges Audit-Log. Gerade bei Belegen und SAP-Prozessen muss nachvollziehbar bleiben, welches Dokument wann verarbeitet wurde, welche Daten extrahiert wurden und ob eine manuelle Prüfung stattgefunden hat.
SAP-Integration
Die Übergabe an SAP könnte je nach vorhandener Infrastruktur unterschiedlich erfolgen:
- SAP OData API
- SAP BAPI
- IDoc-Schnittstelle
- CSV/XML-Export
- Middleware wie n8n, Make oder eine eigene Integration
Bei komplexeren SAP-Systemen wäre eine direkte API-Integration ideal. Bei kleineren oder älteren Setups kann auch ein kontrollierter Exportprozess sinnvoll sein.
Validierung & Sicherheit
Vor der Übergabe an SAP sollten automatische Prüfregeln eingebaut werden:
- Ist die Lieferantennummer bekannt?
- Stimmen Bestellnummer und Lieferschein überein?
- Gibt es doppelte Belegnummern?
- Plausibilität der Liefermengen
- Fehlen Pflichtfelder?
- Ist die KI-Konfidenz hoch genug?
Nur Dokumente mit ausreichender Sicherheit werden automatisch verarbeitet. Alle anderen Fälle werden im Dashboard zur manuellen Prüfung angezeigt.
Umsetzung
Im ersten Schritt wurde analysiert, welche Dokumententypen verarbeitet werden und welche Felder für SAP wirklich benötigt werden. Danach wurden Beispielbelege gesammelt, um typische Layouts, Lieferantenformate und Fehlerfälle zu verstehen.
Anschließend wurde eine Pipeline aufgebaut: 1. Dokument wird hochgeladen oder automatisch aus einem Postfach gelesen. 2. Datei wird in Supabase Storage gespeichert. 3. Metadaten werden in PostgreSQL erfasst. 4. OCR extrahiert Text und Tabellen. 5. DeepSeek LLM wandelt das Ergebnis in strukturierte Daten um. 6. Validierungsregeln prüfen die Datenqualität. 7. Sichere Dokumente werden automatisch an SAP übertragen. 8. Unsichere Dokumente werden im Dashboard zur Prüfung markiert.
Das interne Dashboard zeigt Mitarbeitern, welche Dokumente verarbeitet wurden, welche noch geprüft werden müssen und bei welchen Belegen Fehler oder Unklarheiten erkannt wurden.
Dadurch bleibt der Mensch im Prozess, muss aber nur noch die Ausnahmefälle prüfen.
Ergebnis
Die manuelle Dokumentenprüfung wurde erheblich reduziert. Statt jedes Dokument vollständig zu lesen und Daten manuell zu übertragen, konzentrieren sich Mitarbeiter nur noch auf unklare Fälle.
Messbare Ergebnisse:
- Verarbeitungszeit pro Dokument von 12 Minuten auf 45 Sekunden gesenkt
- Deutlich weniger manuelle Eingabefehler
- Schnellere Übergabe an SAP
- Bessere Nachvollziehbarkeit durch lückenlose Audit-Logs
- Automatische Erkennung unvollständiger oder auffälliger Belege
- Entlastung von Buchhaltung, Einkauf und Lagerverwaltung
Aus einem manuellen, repetitiven Prozess wurde eine KI-gestützte Dokumentenpipeline mit OCR, LLM-Verarbeitung, Validierung und SAP-Anbindung.
Passende nächste Schritte
Vertiefen Sie das Thema mit den wichtigsten Service- und Projektseiten.



