4.2. Installation von Tesseract und weiteren Werkzeugen#
Die Jupyter Notebooks in diesem Kapitel verwenden Tesseract OCR zur Texterkennung sowie einige weitere Werkzeuge. Bevor Sie die Notebooks ausführen können, müssen diese Werkzeuge auf Ihrem System installiert sein.
Cloud Mode (Colab)
Wenn Sie die Notebooks über Google Colab ausführen, müssen Sie nichts manuell installieren — die Notebooks erledigen die Installation automatisch.
Die folgenden Installationsanleitungen richten sich an Nutzer*innen im Local Mode, die die Notebooks auf dem eigenen Computer ausführen möchten.
4.2.1. Tesseract OCR#
Tesseract ist die eigentliche OCR-Engine, die im Hintergrund die Texterkennung durchführt. Das Python-Paket pytesseract ist lediglich ein Wrapper, der Tesseract aus Python heraus ansteuert. Daher muss Tesseract als eigenständiges Programm auf Ihrem System installiert sein.
Für diese Fallstudie benötigen wir zusätzlich das Fraktur-Modell deu_latf, da wir mit historischen deutschsprachigen Zeitungstexten in Frakturschrift arbeiten. Dieses Modell hieß früher frk; ältere Anleitungen (und teilweise ältere Installationen) verweisen noch auf diesen Namen. Da frk inzwischen aus dem offiziellen Modell-Repository entfernt wurde, verwenden wir durchgängig den Nachfolger deu_latf.
Windows#
Laden Sie den Installer von der Seite der UB Mannheim herunter: github.com/UB-Mannheim/tesseract/wiki
Führen Sie den Installer aus. Wählen Sie bei der Komponentenauswahl unter Additional language data (download) das German-Sprachpaket aus — es enthält das Fraktur-Modell
deu_latf(das früher als eigenständiges Modellfrkgeführt wurde).Merken Sie sich den Installationspfad (standardmäßig
C:\Program Files\Tesseract-OCR).
Falls das Fraktur-Modell fehlt
Sollte deu_latf nach der Installation nicht gefunden werden (z.\ B. Fehlermeldung, dass die Trainingsdaten fehlen), können Sie die Modelldatei manuell nachinstallieren: Laden Sie deu_latf.traineddata aus dem offiziellen Repository herunter (github.com/tesseract-ocr/tessdata) und legen Sie die Datei in den Unterordner tessdata Ihres Installationsverzeichnisses (standardmäßig C:\Program Files\Tesseract-OCR\tessdata).
PATH-Variable unter Windows
Damit pytesseract Tesseract finden kann, muss der Installationspfad in der PATH-Umgebungsvariable eingetragen sein. Der Installer bietet diese Option an (Add Tesseract to PATH bzw. Additional Tasks) — aktivieren Sie sie. Bei einer Installation ohne Administratorrechte wird dieser Schritt häufig übersprungen.
Pfad nachträglich hinzufügen: Drücken Sie die Windows-Taste, geben Sie Umgebungsvariablen ein und wählen Sie Umgebungsvariablen für dieses Konto bearbeiten. Markieren Sie unter Benutzervariablen den Eintrag Path, klicken Sie auf Bearbeiten → Neu und tragen Sie das Installationsverzeichnis ein (z.\ B. C:\Program Files\Tesseract-OCR oder C:\Users\IhrName\AppData\Local\Programs\Tesseract-OCR). Bestätigen Sie mit OK.
Wir raten davon ab, die PATH-Variable mit setx PATH "%PATH%;…" zu setzen: Der Befehl schneidet die Variable bei 1024 Zeichen ab und schreibt — in einer Eingabeaufforderung mit Administratorrechten ausgeführt — die zusammengesetzte System- und Benutzervariable in die Benutzervariable zurück. Beides kann die PATH-Variable dauerhaft beschädigen.
Die Notebooks dieser Fallstudie versuchen zusätzlich, tesseract.exe automatisch an den üblichen Installationsorten zu finden, falls es nicht über die PATH-Variable erreichbar ist:
C:\Program Files\Tesseract-OCR\(Installation für alle Benutzer*innen — Standard)C:\Program Files (x86)\Tesseract-OCR\%LOCALAPPDATA%\Programs\Tesseract-OCR\, also z.\ B.C:\Users\IhrName\AppData\Local\Programs\Tesseract-OCR\(Installation nur für die eigene Benutzerin bzw. den eigenen Benutzer — dies wählt der Installer, wenn er ohne Administratorrechte ausgeführt wird)
Falls Sie Tesseract an einem anderen Ort installiert haben, geben Sie den Pfad zu Beginn des Notebooks einmal manuell an (die Angabe gilt fĂĽr die aktuelle Python-Session):
import pytesseract
pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe'
Tesseract wird in Jupyter Notebook (Anaconda) nicht gefunden
Eine Änderung an der PATH-Variable wirkt sich nur auf neu gestartete Programme aus. Läuft Jupyter Notebook bereits — etwa über den Anaconda Navigator —, kennt es die alte Umgebung weiterhin, auch nach einem Neustart des Kernels.
Beenden Sie in diesem Fall Jupyter Notebook und den Anaconda Navigator vollständig und starten Sie beide neu. Erst dann steht Tesseract im Notebook zur Verfügung.
Da die Notebooks tesseract.exe bei Bedarf selbst an den oben genannten Orten suchen, ist dieser Schritt in der Regel nicht nötig — er hilft aber, wenn Sie Tesseract an einem anderen Ort installiert haben.
macOS#
Installieren Sie Tesseract ĂĽber Homebrew:
brew install tesseract
Für das Fraktur-Modell gibt es zwei Möglichkeiten:
Option A — Alle Sprachmodelle installieren (einfacher, aber größerer Download):
brew install tesseract-lang
Option B — Nur das Fraktur-Modell manuell herunterladen:
Laden Sie die Datei
deu_latf.traineddataaus dem offiziellen Repository herunter: github.com/tesseract-ocr/tessdataKopieren Sie die Datei in das Tesseract-Datenverzeichnis:
Apple Silicon (M1/M2/…):
/opt/homebrew/share/tessdata/Intel Mac:
/usr/local/share/tessdata/
Linux (Debian/Ubuntu)#
Installieren Sie zunächst die Tesseract-Engine:
sudo apt install tesseract-ocr
FĂĽr deu_latf gibt es kein eigenes apt-Paket. Laden Sie daher die Modelldatei deu_latf.traineddata aus dem offiziellen Repository (github.com/tesseract-ocr/tessdata) herunter und legen Sie sie in das Tesseract-Datenverzeichnis, z.\ B.:
sudo wget -q https://github.com/tesseract-ocr/tessdata/raw/main/deu_latf.traineddata \
-P "$(find /usr/share/tesseract-ocr -name tessdata -type d | head -1)"
4.2.2. Poppler (fĂĽr PDF-Verarbeitung)#
Das Python-Paket pdf2image, das wir zur Umwandlung von PDF-Seiten in Bilder verwenden, benötigt Poppler als Backend.
Windows#
Für Poppler gibt es unter Windows keinen Installer. Es gibt zwei Wege — Variante A ist unabhängig von Anaconda und erfahrungsgemäß der zuverlässigere.
Variante A — Vorkompilierte Binärdateien
Laden Sie das aktuelle Release (
Release-xx.xx.x-x.zip) herunter: github.com/oschwartz10612/poppler-windows/releasesEntpacken Sie das Archiv an einen festen Ort, z.\ B. nach
C:\poppler-24.08.0.FĂĽgen Sie den Unterordner
Library\bin(also z.\ B.C:\poppler-24.08.0\Library\bin) zur PATH-Umgebungsvariable hinzu — nicht den Ordnerpoppler-24.08.0selbst.
Variante B — Über Conda (wenn Sie Anaconda verwenden)
conda install -c conda-forge poppler
Conda unter Windows: zwei häufige Stolpersteine
conda wird nicht gefunden. In der normalen Eingabeaufforderung (cmd) ist conda in der Regel nicht verfügbar. Verwenden Sie stattdessen die Anaconda Prompt (Startmenü → Anaconda3 → Anaconda Prompt). Dort ist die Umgebung bereits korrekt gesetzt. Wir raten davon ab, die PATH-Variable für Anaconda von Hand zu setzen — Anaconda empfiehlt dies ausdrücklich nicht, und der Befehl setx PATH ... kann eine zu lange PATH-Variable abschneiden.
Die Installation bricht mit einem Solver-Fehler ab. Wechseln Sie in diesem Fall auf den klassischen Solver und wiederholen Sie die Installation:
conda config --set solver classic
conda install -c conda-forge poppler
Ganz ohne Kommandozeile geht es über den Anaconda Navigator: Menüpunkt Environments → Umgebung base (root) auswählen → in der Drop-down-Liste von Installed auf All wechseln → im Suchfeld poppler eingeben → Paket anhaken → Apply.
Automatische Suche in den Notebooks
Wie bei Tesseract versuchen die Notebooks auch bei Poppler, die Programme selbst zu finden, falls sie nicht über die PATH-Variable erreichbar sind: durchsucht werden das Conda-Environment, in dem das Notebook läuft (…\Library\bin), sowie Ordner der Form poppler*\Library\bin unter C:\, in C:\Program Files und in %LOCALAPPDATA%\Programs.
macOS#
brew install poppler
Linux (Debian/Ubuntu)#
sudo apt install poppler-utils
4.2.3. Python-Pakete#
Die benötigten Python-Pakete sind betriebssystemunabhängig und können mit pip installiert werden:
pip install pytesseract pillow pdf2image tqdm
Für das Notebook zur Messung der OCR-Qualität wird zusätzlich benötigt:
pip install Levenshtein
ĂśberprĂĽfung der Installation
Um zu prüfen, ob Tesseract korrekt installiert ist, können Sie folgenden Befehl im Terminal ausführen:
tesseract --version
Wenn eine Versionsnummer angezeigt wird, ist die Installation erfolgreich.