4.5. Messung der OCR-QualitÀt#
In Bezug auf die optische Zeichenerkennung (OCR) werden PrÀzision, Recall und F-Maà zur Bewertung der Genauigkeit und Effizienz von OCR-Systemen verwendet. Diese Metriken helfen zu verstehen, wie gut ein OCR-System arbeitet, insbesondere in Bezug auf die korrekte Identifizierung von Zeichen, Wörtern oder spezifischen Informationen in Dokumenten. Hier ist, wie diese Metriken auf die QualitÀtsevaluation von OCR angewendet werden:
4.5.1. PrÀzision in der OCR#
Bei der OCR misst die PrÀzision die Genauigkeit des erkannten Textes im Vergleich zum tatsÀchlichen Text in den Dokumentenbildern. Sie berechnet den Anteil der korrekt erkannten Zeichen oder Wörter an allen Zeichen oder Wörtern, die vom OCR-System identifiziert wurden. Hohe PrÀzision bedeutet, dass die meisten vom OCR-System als vorhanden erkannten Texte tatsÀchlich korrekt sind, was auf weniger falsch-positive Erkennungen hinweist (d.h. falsch als vorhanden identifiziert).
4.5.2. Recall in der OCR#
Recall im Kontext der OCR misst die FÀhigkeit des OCR-Systems, alle relevanten Zeichen oder Wörter aus den Dokumentenbildern zu erfassen. Es ist das VerhÀltnis der korrekt identifizierten Zeichen oder Wörter zu allen Zeichen oder Wörtern, die tatsÀchlich in den Dokumenten vorhanden sind. Hoher Recall zeigt an, dass das OCR-System in der Lage ist, die meisten tatsÀchlich vorhandenen Texte zu erkennen, wodurch falsch-negative Erkennungen minimiert werden (d.h. das VersÀumnis, vorhandenen Text zu erkennen).
4.5.3. F1-Score in der OCR#
Der F1-Score in der OCR bietet eine einzelne Metrik, die sowohl PrĂ€zision als auch Recall kombiniert, um eine ausgewogene Ansicht der Gesamtleistung des OCR-Systems zu geben. Da PrĂ€zision und Recall einen Trade-off haben (die Verbesserung des einen kann oft zu einer Verringerung des anderen fĂŒhren), hilft der F1-Score dabei, die EffektivitĂ€t des OCR-Systems bei der genauen Texterkennung und der Minimierung sowohl von falsch-positiven als auch von falsch-negativen Erkennungen zu bewerten.
Diese Metriken sind entscheidend fĂŒr die Bewertung von OCR-Systemen, insbesondere in Anwendungen, bei denen die Genauigkeit der Texterkennung direkt das Ergebnis beeinflusst, wie z.B. bei der Dokumentenautomatisierung, der Datenerfassung aus gescannten Dokumenten und der automatisierten Verarbeitung handschriftlicher Formulare. Ein Gleichgewicht zwischen hoher PrĂ€zision und hohem Recall ist oft gewĂŒnscht, um sicherzustellen, dass das OCR-System sowohl genau als auch umfassend in seinen TexterkennungsfĂ€higkeiten ist.
4.5.4. Understanding Precision, Recall & F1 Intuitively#
The interactive visualization below serves as an operational demo of the introduced metrics of Precision, Recall, and F1-score at the character level within a controlled, simulated OCR setting. Rather than only considering aggregated metric values, the visualization shows how individual recognition errors (substitutions, deletions, and insertions) directly affect Precision, Recall, and F1.
The confusion matrix represents the distribution of correctly recognized characters (true positives), incorrectly recognized characters (false positives), and missed characters (false negatives). Based on this distribution, the corresponding evaluation metrics are calculated dynamically.
đŻ Mini Demo: Enter a string and and move the slider to see how each metrics change
(max 20 characters)At low recognition accuracy, a larger number of characters is typically missed leading to low recall, while precision may still remain relatively high if only few incorrect characters are inserted. As the recognition accuracy increases, recall generally improves and the operating point in the PrecisionâRecall diagram changes accordingly.
80%The visualization also illustrates that high precision alone does not necessarily imply high overall OCR quality if recall remains low. Conversely, improving recall can introduce additional false positives, which may reduce precision. The F1-score captures this balance between both tendencies. In this way, the visualization highlights that similar F1-scores can arise from different combinations of precision and recall, corresponding to distinct OCR error behaviors.