4.4. 🏆Selbsttest: Wissen und Praxis#
Hinweis
Mit diesen Übungsaufgaben können Sie sich selbst einschätzen und das im Kapitel Gelernte reflektieren.
Sie können die Fragen in beliebiger Reihenfolge beantworten und auch mehrfach versuchen.
So funktioniert es:
Wählen Sie bei jeder Frage die Antwort(en), die Sie für richtig halten
Lesen Sie das Feedback zu den einzelnen Antwortoptionen sorgfältig durch
Die Erklärungen helfen Ihnen, Ihr Verständnis zu vertiefen – auch bei korrekten Antworten
Ihre Ergebnisse werden weder bewertet noch gespeichert. Nutzen Sie dieses Assessment, um Wissenslücken zu identifizieren und gegebenenfalls die entsprechenden Abschnitte des Kapitels noch einmal zu bearbeiten.
Geschätzte Zeit: 60min
Viel Erfolg!
4.4.1. Frage 1#
4.4.2. Frage 2#
4.4.3. Frage 3#
4.4.4. Frage 4#
4.4.5. Frage 5#
4.4.6. Frage 6#
Analysieren Sie den folgenden Satz mit NLP-Methoden und beschreiben Sie die Ergebnisse:
Originaltext: “Die Forschenden untersuchten verschiedene deutsche Romane.”
Führen Sie eine Tokenisierung durch.
Bestimmen Sie die Lemmata der einzelnen Token.
Reflektieren Sie, wie diese Verarbeitung eine quantitative Analyse unterstützen würde.
Lösung
Beispiellösung zur Selbstbewertung:
Tokenisierung: [“Die”, “Forschenden”, “untersuchten”, “verschiedene”, “deutsche”, “Romane”, “.”]
Lemmatisierung: [“der”, “Forschende”, “untersuchen”, “verschieden”, “deutsch”, “Roman”, “.”]
Reflexion:
Die Tokenisierung ermöglicht die Analyse auf Wortebene und bereitet den Text für weitere Verarbeitung vor; der Punkt am Satzende wird dabei als eigenes Token abgetrennt
Die Lemmatisierung würde alle Formen von “untersuchen” zusammenfassen, was bei einer Frequenzanalyse hilfreich ist
Durch die Lemmatisierung werden verschiedene Flexionsformen (wie “deutsche” zu “deutsch” oder “Romane” zu “Roman”) vereinheitlicht (‘die’ wird standardmäßig zu ‘der’ lemmatisiert).
Bei einer größeren Textsammlung würden verschiedene grammatikalische Formen desselben Wortes nicht als unterschiedliche Begriffe gezählt
Diese Normalisierung verbessert die Qualität von Häufigkeitsanalysen, Keyword-Extraktion und thematischen Analysen
Die Informationen über die ursprüngliche Form bleiben erhalten und können für detailliertere linguistische Analysen genutzt werden
Bewertungskriterien für die Selbsteinschätzung:
Korrekte Tokenisierung mit Berücksichtigung von Satzzeichen als eigene Token
Korrekte Bestimmung der Grundformen bei der Lemmatisierung
Verständnis des Nutzens für quantitative Textanalyse, insbesondere für Häufigkeitsanalysen
Reflexion über die Vor- und Nachteile der Methoden für die spezifische Forschungsfrage
4.4.7. Frage 7#
(Wählen Sie alle zutreffenden Antworten aus)
4.4.8. Frage 8#
(Wählen Sie alle zutreffenden Antworten aus)
4.4.9. Frage 9#
4.4.10. Frage 10#
4.4.11. Frage 11#
4.4.12. Frage 12#
Bringen Sie die Verarbeitungsschritte in die richtige Reihenfolge, um einen Text mit spaCy zu annotieren. Ziehen Sie dazu die Schritte per Drag & Drop an die passende Position.
Lösung
Die Reihenfolge im Notebook ist: 1. Einlesen des Textes, 2. Laden des Sprachmodells, 3. Auswahl der Analysekomponenten, 4. Durchführung der Annotation mit nlp(text), 5. Speichern der Annotationen – sowohl im spaCy-eigenen Format (.spacy) als auch als Tabelle im CSV-Format.
4.4.13. Frage 13#
(Wählen Sie alle zutreffenden Antworten aus)