PDF-Split für Sammel-Dokumente
Gescannte Sammel-PDFs (mehrere Dokumente in einer Datei) werden über die Split-Vorschaltstufe automatisch in Einzeldokumente zerlegt und anschließend regulär importiert. Die Stufe läuft vor der normalen Import-Pipeline.
Funktionsprinzip
Das Wurzelverzeichnis Split:SplitPath spiegelt die normale Import-Verzeichnisstruktur. Eine Sammel-PDF wird seitenweise analysiert; jedes erkannte Einzeldokument landet als eigenständige PDF im entsprechenden Unterverzeichnis von ImportPath:
C:\Archivimport-Split\ <- SplitPath
Belege\
Lieferschein\
sammel.pdf <- Sammel-PDF mit 3 Lieferscheinen
nach Split:
C:\Archivimport\ <- ImportPath
Belege\
Lieferschein\
12000-1.pdf <- Einzeldokument (Identifier aus Barcode/OCR)
20100-5.pdf
20100-5_2.pdf <- Duplikat-Identifier: Zähler-Suffix (_2, _3, ...)
C:\Archivimport-Split\
Belege\
Lieferschein\
Erfolgreich\
sammel.pdf <- die Sammel-PDF selbst, nach dem Zerlegen verschoben
Die Sammel-PDF wird wie eine regulär verarbeitete Datei behandelt: vor dem Zerlegen wandert sie
in das Arbeitsverzeichnis InArbeit (konfigurierbar via WorkFolder) — scheitert dieses Verschieben,
weil die Datei noch im Zugriff ist, wird sie nicht gesplittet und der nächste Lauf versucht es erneut
(verhindert doppelt importierte Einzeldokumente). Nach dem Zerlegen wandert sie innerhalb von
SplitPath in das Unterverzeichnis Erfolgreich bzw. bei einem Fehler nach Fehler
(dieselben Parameter SuccessFolder/ErrorFolder wie beim Import). Welche Dateien als Sammel-Dokument
aufgegriffen werden, entscheiden dieselben Dateifilter wie beim regulären Import — der globale
FileFilter und die Filter der Objekttypen.
Trennstrategien
| Strategie | Funktionsweise |
|---|---|
Barcode |
Eine Seite mit erkennbarem Barcode/QR-Code beginnt ein neues Dokument. Der dekodierte Wert ist der Identifier. Folgeseiten ohne Barcode gehören zum vorherigen Dokument. |
Ocr |
PaddleOCR erkennt den Seitentext; eine konfigurierte Regex trifft den Dokumentstart und liefert den Identifier über eine benannte Gruppe (nummer, belegkey, belegnummer) oder Gruppe 1. |
Wichtig: Seiten, die vor dem ersten erkannten Dokumentstart liegen (kein Barcode/Treffer), führen dazu, dass die gesamte Sammel-PDF in den Fehler-Ordner verschoben wird.
Verhalten im Demomodus
Erkannte Segmente werden protokolliert ([DEMO]), aber es werden keine Einzeldateien geschrieben und die Sammel-PDF wird nicht verschoben.
Keine Kommentare vorhanden
Keine Kommentare vorhanden