OCR Erkennung im ED

Wir haben durch Importe oder Einreichungen von externe (virtuelles Bauamt) vermehrt PDF Dokumente ohne OCR Ebene.

Zwar erkennt der OCR Microservice den Text und überführt diesen für die Volltextindizierung, leider ist er später nicht mehr zur Verfügung.

Optimal Systems bietet dafür eine extra Service über Foxxit an.

Ist es geplant einen OCR erkennung im Embedded Documents laufen zu lassen, so wie es z.B. im PDF XChange Viewer möglich ist?

Hallo @SDonath,

bisher hatten wir das noch nicht geplant. Technisch wäre es vielleicht umsetzbar (müsste ich noch genauer prüfen).

Da ich deinen Prozess nicht genau kenne, schreibe ich etwas allgemeiner.

Prinzipiell ist es in den meisten Fällen besser, dass OCR direkt beim Eingang/Import zu realisieren:

  • so haben alle Dokumente bereits mit dem passenden ins System bekommen
  • die Dokumente können sofort in den Volltext Index aufgenommen werden
  • OCR Layer brauchen relativ viel Rechenzeit. Insbesondere, wenn das Dokument viele Seiten besitzt. Diese Wartezeit müssten die Benutzer im ED explizit abwarten bevor sie weiterarbeiten können.
  • Aus Audit-Trail Sicht ist ein benutzerunabhängiger OCR-Schritt (Dokument wird in diesem Schritt verändert) besser zu dokumentierbar bzw. nachvollziehbar

OCR im Editor bzw. auf Anfrage hat natürlich den Vorteil, dass der OCR Layer nur erstellt wird, wenn der Benutzer dies explizit benötigt. Das ist Fällen, wo der Grossteil der Dokumente ohne OCR durchlaufen kann, natürlich ein grosser Vorteil.

Es gibt zum Beispiel das Projekt OCRMyPDF welches man automatisieren kann und auf Basis von GhostScript, Tesseract und Python auf das PDF einen OCRLayer legt. Dabei handelt es sich aber um ein Open-Source-Projekt das zwar weit verbreitet ist, aber für das es meines Wissens, keinen kommerziellen Support gibt.

Grüsse
Uli