5.3. LLM-basierte OCR-Nachbearbeitung#
Natürlich gibt es auch intelligentere Methoden zur Nachbearbeitung von OCR-Ergebnissen. Diese Methoden basieren auf datengesteuerten maschinellen Lerntechniken. Zum Beispiel können große Sprachmodelle manchmal sehr gut bei der Nachkorrektur von OCR-Ergebnissen abschneiden. Es ist jedoch wichtig, sich ihrer Risiken und Einschränkungen bewusst zu sein.
Große Sprachmodelle erfordern viele Ressourcen (Rechenressourcen, Energieressourcen, Speicherressourcen) zum Betrieb. Sie können nicht auf einem Personalcomputer ausgeführt werden und werden typischerweise als Dienst mit eingeschränktem Zugriff angeboten. Sie haben auch technische Beschränkungen hinsichtlich der Größe von Eingabe und Ausgabe. Daher könnte es eine große Herausforderung sein, ein großes Korpus zu verarbeiten.
Ein ungenauer Prompt kann dazu führen, dass das Modell Text generiert, der im Original nicht vorhanden war. Im Folgenden verwenden wir GPT-4, um Beispiele zu generieren:
In diesem Fall haben wir das Modell einfach gebeten, zu „korrigieren“, und als Ergebnis erhielten wir einen Text, der erheblich verändert wurde. Dabei war unser Ziel eigentlich, nur die OCR-Fehler zu korrigieren, ohne den Originaltext zu ändern.
Versuchen Sie, detailliertere Anweisungen zu geben, um die gewünschten Ergebnisse zu erhalten.
Sprachmodelle sind von Natur aus nicht deterministisch, sodass die Ergebnisse von Zeit zu Zeit variieren können. Sogar geringfügige und scheinbar harmlose Änderungen des Prompts können dazu führen, dass sie Halluzinationen erzeugen.
5.3.1. 🚀 Your turn: Interaktives Beispiel#
The interactive widget below demonstrate the challenges of using LLMs for OCR correction we just saw above. You can also test different prompt strategies and see exactly how AI unpredictability affects the final text!
⚠️ Note: The widgets below are just simulations designed to replicate LLM behavior, and non-determinism based on pre-computed data.
🎯 Mini Demo: The LLM Prompt Simulator
Unlike rule-based scripts, LLMs are unpredictable. Select different prompt strategies from the dropdown below to see how the model reacts to the raw OCR text. Pay attention to the highlighted words to spot where the LLM makes good corrections (green) and where it "hallucinates" or alters the historical meaning (re/yellow).