Wenn Handarbeit schneller ist als Automatisierung – mein OCR-Versuch mit Tesseract

Veröffentlicht am 20. August 2026 · zuletzt aktualisiert am 20. August 2026 / in Digitale Archive

Inhaltsübersicht

Kurz gesagt

Nicht jeder manuelle Arbeitsschritt muss automatisiert werden. Bei einzelnen schwierigen historischen Dokumenten kann das eigene Lesen schneller und verlässlicher sein als Aufbau, Fehlersuche und Wartung eines zusätzlichen OCR-Workflows.

Eigentlich funktionierte Tesseract bereits

Meine Tesseract-Installation war nicht das Problem. Die Sprachmodelle deu, deu_latf, eng, enm und osd waren vorhanden. Mit deu_latf stand auch ein Modell für historische deutsche Druckschriften bereit. Für normale OCR-Aufgaben ließ sich das Werkzeug einsetzen.

Mein Ausgangspunkt war also kein kaputtes Programm, sondern eine kleine Optimierungsidee: Könnte ein anderes Modell aus einer schwierigen alten Seite noch etwas mehr herausholen?

OCR bleibt dabei eine Erschließungshilfe. Der sichtbare Scan oder das digitale Original ist die Quelle; der erkannte Text erleichtert Suche, Lesen und weitere Bearbeitung. Diese Trennung ist besonders im Mini-DMS und dateibasierten Dokumentenarchiv wichtig.

Die Idee: OCR noch etwas besser machen

Zusätzlich wollte ich tessdata_best erproben. Diese Modelle können mehr Rechenzeit gegen möglicherweise bessere Erkennung eintauschen. Das klingt zunächst nach einer überschaubaren Verbesserung: Modelldatei ergänzen, Aufruf anpassen, Ergebnis vergleichen.

Bei einem reproduzierbaren Arbeitsablauf reicht es jedoch nicht, dass ein einzelner Test zufällig funktioniert. Es muss klar sein, welches tessdata-Verzeichnis verwendet wird, welches Bild tatsächlich verarbeitet wird und wie aus dem Ergebnis eine nachvollziehbare Datei entsteht. Original und Ableitung dürfen nicht verwechselt werden.

Aus fünf Minuten Arbeit wird ein IT-Projekt

Die Ausgangsdatei war ein DNG. Für die OCR brauchte ich eine geeignete Bildfassung. Damit entstand Schritt für Schritt eine Kette:

DNG → temporäres JPEG → ExifTool → Tesseract → Sprachmodell → Text oder PDF → PowerShell → eigenes Skript

Jeder Baustein war technisch beherrschbar. Zusammen verlangten sie aber Entscheidungen: Welche Bildauflösung ist sinnvoll? Welche temporären Dateien entstehen? Welches Modell wird wirklich geladen? Wie werden Fehler protokolliert? Bleibt das Original unangetastet? Wie lässt sich ein Lauf später nachvollziehen?

Aus dem Lesen einer einzelnen Seite war unversehens ein kleines Integrationsprojekt geworden. Wer lange in der IT arbeitet, kennt diese Versuchung: Ein wiederholbarer Prozess wirkt eleganter als ein manueller Handgriff – auch wenn der Handgriff längst erledigt wäre, bevor das Skript zuverlässig läuft.

Der entscheidende Moment

Ich wollte eigentlich nur den Inhalt einer alten Seite erfassen. Während ich noch daran arbeitete, den Vorgang technisch zu perfektionieren, hätte ich die Seite längst selbst lesen und die relevanten Informationen übernehmen können.

Das war kein technisches Scheitern. Die zusätzliche Lösung wäre machbar gewesen. Ich habe trotzdem bewusst aufgehört, weil der Aufwand die konkrete Aufgabe überholt hatte.

Automatisierung braucht eine Mindestmenge

Ob Automatisierung sinnvoll ist, entscheidet nicht allein die technische Machbarkeit. Entscheidend sind Menge, Gleichartigkeit, Fehlerkosten und Wiederholungswahrscheinlichkeit.

Bestand Wahrscheinliche sinnvolle Methode
1.000 ähnlich aufgebaute Seiten OCR-Ablauf aufbauen, testen und protokollieren
100 wiederkehrende Formulare Automatisierung mit Stichproben prüfen
eine bis fünf schwierige historische Seiten manuell lesen oder gezielt transkribieren

Auch bei einer großen Menge ist ein Probelauf nötig. Bei wenigen Einzelstücken kann dagegen die direkte fachliche Arbeit wirtschaftlicher sein. Das gilt besonders, wenn Layout, Schrift, Beschädigung oder handschriftliche Ergänzungen von Seite zu Seite wechseln.

OCR ersetzt die inhaltliche Prüfung ohnehin nicht

Bei genealogischen und historischen Unterlagen sind einzelne Zeichen oft entscheidend. Namen, Geburts- und Sterbedaten, Orte, Verwandtschaftsbeziehungen, Randvermerke und handschriftliche Ergänzungen müssen am sichtbaren Dokument kontrolliert werden.

Eine gut lesbare OCR kann diese Prüfung beschleunigen. Sie wird dadurch aber nicht zur archivischen Wahrheitsquelle. Unsichere Lesarten gehören markiert, und eine Transkription bleibt eine getrennte fachliche Ableitung. Der Zusammenhang mit Originalen, Metadaten und dauerhafter Ablage wird im Beitrag Was ist ein digitales Familienarchiv? vertieft.

Meine Konsequenz

Ich nutze meine funktionierende Standard-OCR weiter. Für gleichartige Mengen kann ich einen zusätzlichen Ablauf entwickeln, wenn sein Nutzen vorher erkennbar ist. Schwierige historische Einzelstücke lese oder transkribiere ich bei Bedarf manuell.

Damit vermeide ich zusätzliche technische Komplexität, die später gepflegt, erklärt und bei Änderungen erneut getestet werden müsste. Das ist keine Absage an Tesseract, PowerShell oder Automatisierung. Es ist eine Entscheidung für das kleinste Werkzeug, das die konkrete Archivaufgabe verlässlich löst.

Fazit

Automatisierung lohnt sich, wenn sich Entwicklung und Wartung durch ausreichend viele Wiederholungen bezahlen. Bei einem historischen Einzelstück kann eine sorgfältige manuelle Bearbeitung schneller und zuverlässiger sein.

Die beste technische Lösung besteht manchmal darin, kein weiteres Tool zu bauen.

Weiterführend: Warum die OCR-Schicht im Mini-DMS entscheidend ist und Werkzeuge für PDF und OCR im kleinen Büro.

Persönliche Unterstützung

Dieser Artikel vermittelt die fachlichen Grundlagen. Wenn Sie die beschriebenen Methoden auf einen konkreten Bestand oder ein bestehendes System übertragen möchten, finden Sie ergänzende Informationen unter Dienstleistungen.