Direkt zum Hauptinhalt

PDF-Split für Sammel-Dokumente

Gescannte Sammel-PDFs (mehrere Dokumente in einer Datei) werden über die Split-Vorschaltstufe automatisch in Einzeldokumente zerlegt und anschließend regulär importiert. Die Stufe läuft vor der normalen Import-Pipeline.

Funktionsprinzip

Das Wurzelverzeichnis Split:SplitPath spiegelt die normale Import-Verzeichnisstruktur. Eine Sammel-PDF wird seitenweise analysiert; jedes erkannte Einzeldokument landet als eigenständige PDF im entsprechenden Unterverzeichnis von ImportPath:

C:\Archivimport-Split\          <- SplitPath
  Belege\
    Lieferschein\
      sammel.pdf                <- Sammel-PDF mit 3 Lieferscheinen

nach Split:

C:\Archivimport\                <- ImportPath
  Belege\
    Lieferschein\
      12000-1.pdf               <- Einzeldokument (Identifier aus Barcode/OCR)
      20100-5.pdf
      20100-5_2.pdf             <- Duplikat-Identifier: Zähler-Suffix (_2, _3, ...)

C:\Archivimport-Split\
  Belege\
    Lieferschein\
      Erfolgreich\
        sammel.pdf              <- die Sammel-PDF selbst, nach dem Zerlegen verschoben

Die Sammel-PDF wird wie eine regulär verarbeitete Datei behandelt: vor dem Zerlegen wandert sie in das Arbeitsverzeichnis InArbeit (konfigurierbar via WorkFolder) — scheitert dieses Verschieben, weil die Datei noch im Zugriff ist, wird sie nicht gesplittet und der nächste Lauf versucht es erneut (verhindert doppelt importierte Einzeldokumente). Nach dem Zerlegen wandert sie innerhalb von SplitPath in das Unterverzeichnis Erfolgreich bzw. bei einem Fehler nach Fehler (dieselben Parameter SuccessFolder/ErrorFolder wie beim Import). Welche Dateien als Sammel-Dokument aufgegriffen werden, entscheiden dieselben Dateifilter wie beim regulären Import — der globale FileFilter und die Filter der Objekttypen.

Trennstrategien

Strategie Funktionsweise
Barcode Eine Seite mit erkennbarem Barcode/QR-Code beginnt ein neues Dokument. Der dekodierte Wert ist der Identifier. Folgeseiten ohne Barcode gehören zum vorherigen Dokument.
Ocr PaddleOCR erkennt den Seitentext; eine konfigurierte Regex trifft den Dokumentstart und liefert den Identifier über eine benannte Gruppe (nummer, belegkey, belegnummer) oder Gruppe 1.

Wichtig: Seiten, die vor dem ersten erkannten Dokumentstart liegen (kein Barcode/Treffer), führen dazu, dass die gesamte Sammel-PDF in den Fehler-Ordner verschoben wird.

Verhalten im Demomodus

Erkannte Segmente werden protokolliert ([DEMO]), aber es werden keine Einzeldateien geschrieben und die Sammel-PDF wird nicht verschoben.