OCRmyPDF - Vorsicht!

vorhergehende Artikel in: Linux Rants
13.12.2014

Ich habe voller Freude die Kunde von OCRmyPDF vernommen - eine Lösung, gescannte PDFs mit einer durchsuchbaren Textlage zu kombinieren. Leider muß ich nach meinen Tests zur Vorsicht raten...

Ich habe das Paket wie in diesem Artikel beschrieben installiert. Dabei traten keine Probleme auf - das machte mich zuversichtlich. Die probeweise Verarbeitung eines englischsprachigen Texts war auch sehr vertrauenerweckend.

Aber der deutsche Test zeigte die Grenzen der Lösung: Ich suchte mir im Netz der Netze PDF im Betrachter PDF im Betrachter mit selektiertem problematischen Bereich eine gescannte TIFF-Datei, wandelte diese in ein A4-PDF um und ließ die Lösung darauf los. Ergebnis: die Erkennung war nicht hundertprozentig zuverlässig: nicht jedes Vorkommen des Suchbegriffes wurde entdeckt. Das läßt sich auch sehr gut an den folgenden beiden Screenshots nachvollziehen: links das PDF im Betrachter, rechts das PDF im Betrachter: das problematische Wort wurde selektiert, dadurch wird die normalerweise unsichtbare Textlage sichtbar und man sieht, daß die Erkennung hier fehlerhaft war.

Der Vollständigkeit halber sei noch hinzugefügt, daß auch das Vergrößern des Dokuments auf A3 bei der Erzeugung keine Verbesserung brachte - jetzt wurden mit dem gleichen Testfall (Suche nach gemäß) sogar noch zwei Soll-Fundstellen weniger gefunden. Auch die Optionen -c und -d halfen nicht wesentlich weiter - im Vergleich zu A4 wurde nun nur noch eine Soll-Fundstelle weniger gefunden. Das zeigt aber auch, daß man diese beiden unbedingt benutzen sollte, auch wenn sich die Verarbeitungszeit dadurch nochmals verlängert.

Noch ein Tip: Rechner mit mehreren Kernen profitieren von diesen bei der Benutzung von OCRmyPDF nur, wenn das Werkzeug mehrfach nebeneinanderher gestartet wird. Das Werkzeug an sich benutzt nur einen Kern.

Fazit: Schönes Werkzeug, allerdings sollte man sich nicht darauf verlassen, daß wirklich alle Auftreten des gesuchten Begriffs gefunden werden.

Alle Artikel rss Wochenübersicht Monatsübersicht Codeberg Repositories Mastodon Über mich home xmpp


Vor 5 Jahren hier im Blog

  • Traceroute Visualisierung mittels GeoJSON

    29.05.2021

    Dieses Wochenende war es wieder einmal an der Zeit für ein Kaninchenbau-Projekt. Es gibt inzwischen einige kostenlose Geolocation-APIs im Netz und ich wurde - durch das Internet - auf die Idee gebracht, das Ergebnis eines Aufrufs von traceroute auf einer Landkarte zu visualisieren

    Weiterlesen

Neueste Artikel

  • Trusted Platform Module im Thin Client Fujitsu Futro nutzen

    Es geht hier speziell um das Modell s920. Bei Recherchen zu meinen letzten Experimenten hatte ich auch realisiert, dass ich einen solchen Thin Client mit montiertem TPM besitze - das musste natürlich ausprobiert werden!

    Weiterlesen
  • Hardwarebeschleunigung zur Berechnung des Mandelbrotfraktals mittels Nvidia

    Ich habe vor geraumer Zeit immer wieder einmal das Mandelbrotfraktal berechnet - auf der Kommandozeile genauso wie mittels Shadern auf der Graphikkarte. Nun bin ich dahin zurückgekehrt: Ich wollte wissen, ob dieser Code heute noch funktioniert und mit einer Nvidia-Karte ebenso funktioniert, wie damals mit meiner guten alten Radeon...

    Weiterlesen
  • Asymmetrische Kryptographie

    Ich habe mich mit der Idee schon länger getragen: Nochmal einen Rundumschlag zu asymmetrischer Kryptographie zu machen. Dabei werde ich mich auf Demonstrationen der einzelnen Konzepte und Operationen mit Beispielcode konzentrieren und zu jedem der vorgestellten Konzepte mehr oder weniger ausführlich bezüglich der Einsatzszenarien und Vor- und Nachteile Stellung beziehen

    Weiterlesen

Manche nennen es Blog, manche Web-Seite - ich schreibe hier hin und wieder über meine Erlebnisse, Rückschläge und Erleuchtungen bei meinen Hobbies.

Wer daran teilhaben und eventuell sogar davon profitieren möchte, muss damit leben, daß ich hin und wieder kleine Ausflüge in Bereiche mache, die nichts mit IT, Administration oder Softwareentwicklung zu tun haben.

Ich wünsche allen Lesern viel Spaß und hin und wieder einen kleinen AHA!-Effekt...

PS: Meine öffentlichen Codeberg-Repositories findet man hier.