Für den letzten offiziellen Termin des Kolloquiums am 16.07.2026 hatten wir die Gelegenheit, trotz kurzfristigen Ausfalls des ursprünglich vorgesehenen Dozenten (Frederik Elwert aus Bochum), einen Vortrag zu dem Projekt “Metaphern der Religion” (kurz “MoRe”) zu hören. Da es sich hierbei um ein sehr umfangreiches Projekt handelt, an dem mehrere Forschungseinrichtungen beteiligt sind, unter anderem die Ruhr-Universität Bochum und das Karlsruher Institut für Technologie (KIT), lag der Fokus des Vortrags auf einem der vielen Teilprojekte. Um zu verstehen, wie sich das vorgestellte Teilprojekt in das Gesamtprojekt einfügt, ist es zunächst wichtig, die übergeordneten Ziele von MoRe zu verstehen.
Untersucht wird, wie die Sinnbildung in verschiedenen Religionen und Sprachen aus unterschiedlichen Traditionen durch die Verwendung von Metaphern funktioniert. Grund für die Verwendung von Metaphern in diesem Kontext ist, dass religiöse Inhalte meist nicht direkt beschrieben werden können und daher mithilfe von Sinnbildern ausgedrückt werden. Eine der möglichen Forschungsfragen ist hier, ob sich die verwendeten Sinnbilder in den verschiedenen Religionen und Sprachen ähneln, oder ob die Bedeutung hinter den Metaphern eine ganz andere ist.
Um diese und weitere Forschungsfragen beantworten zu können, müssen umfangreiche Textkorpora aus den verschiedenen Religionen und Sprachen annotiert und analysiert werden. Dafür wurden verschiedene computergestützte Methoden verwendet, mit dem Ziel, Teile der anstehenden Aufgaben zu automatisieren. Das von Sebastian Reimann vorgestellte Teilprojekt “Digitale Methoden in der Metaphernforschung” beschäftigt sich mit der automatisierten Metaphernerkennung in verschiedenen Textkorpora mithilfe unterschiedlicher Ansätze des maschinellen Lernens, welche im weiteren Verlauf dieses Blogposts genauer erläutert werden. Im Rahmen dieses Projektes promovierte Sebastian Reimann an der Ruhr-Universität Bochum und ist nun als Postdoc am Institut für Digital Humanities hier an der Universität zu Köln tätig.
Das erstellte Textkorpus
Grundvoraussetzung für die Anwendbarkeit der Methoden des maschinellen Lernens ist die Erstellung eines annotierten Korpus, welches als Trainings- und Testdatensatz für die Modelle dient. Dies ist jedoch keine triviale Aufgabe, da die Annotation von Metaphern selbst für menschliche Annotator:innen eine Herausforderung darstellt. Um eine einheitliche Annotation zu gewährleisten, wurde hierfür ein Annotationsleitfaden namens MIPVU (Steen et al., 2019) verwendet. MIPVU ist ein linguistisches Verfahren, um Metaphern systematisch in Texten zu identifizieren. Hier wird im ersten Schritt der Text in lexikalische Einheiten (Wörter/Phrasen) zerlegt und im zweiten Schritt wird geprüft, ob die Bedeutung der Einheit in dem Kontext mit der generellen/ursprünglichen Bedeutung übereinstimmt. Doch selbst mithilfe eines Leitfadens ist die Annotation der verschiedenen Arten der Metaphern stellenweise komplex. Ist “let’s meet at 5 p.m.” wirklich eine Metapher? Ist die Metapher relevant für das vorliegende Projekt? Die Aufgabe der automatisierten Annotation ist umso komplexer, wenn selbst die händische Annotation schwierig ist.
Angewandt wurde der Annotationsleitfaden auf Textkorpora religiöser Online-Foren, die im Rahmen des Projektes gesammelt wurden. Ausgewertet wurden hierfür verschiedene Reddit-Foren (bspw. r/OpenChristian, r/TrueChristian, …) und die Online-Foren Jesus.de und Mykath. Aufgrund des hohen Aufwands der händischen Annotation wurde zusätzlich der VUA Metaphor Corpus (kurz VUAMC) für verschiedene Experimente verwendet. Dieser Datensatz ist das Pendant zum MIPVU-Leitfaden und wurde im Rahmen des gleichen Projektes erstellt, welches auch den Leitfaden selbst hervorgebracht hat. Er enthält eine Vielzahl an annotierten Metaphern aus verschiedenen Domänen und ergänzt somit die vorhandenen Daten nahtlos.

Abbildung 1: Ausgewählte Online-Foren als Basis für das annotierte Korpus [Reimann 2026]
Nah beieinander, fern vom Sinn?
Wie bei so vielem im Bereich des maschinellen Lernens, muss man sich auch hier die Frage stellen, wie man die Aufgabe der Metaphernerkennung automatisieren kann. Wie erkennen wir Menschen überhaupt Metaphern? Meist geschieht dies intuitiv, aber wie kann man das Problem in eine Form bringen, die für ein Modell des maschinellen Lernens verständlich ist?
Der linguistische Kern einer Metapher ist die Übertragung eines Konzepts aus einer Domäne (der Quelldomäne) auf eine andere Domäne (die Zieldomäne). Ein bereits erwähntes, aber auch umstrittenes Beispiel ist der Satz “let’s meet at 5 p.m.”. Hierbei wird die Zeit als Raum dargestellt, als wäre die Uhrzeit ein Ort, an dem man sich treffen kann. Diese Übertragung lässt sich tatsächlich auch auf eine Weise ausdrücken, die für ein ML-Modell verständlich ist. Ein Wort und dessen Bedeutung kann durch sogenannte kontextuelle “Word Embeddings” als Vektor dargestellt werden (beispielsweise mithilfe von Transformer-Encoder-Modellen wie BERT). Diese Vektoren können anschließend miteinander verglichen werden. Kommt ein Wort also in einem Satz vor, in dem es kontextuell eine andere Bedeutung als gewöhnlich hat, kann man darauf schließen, dass es sich hierbei um eine Metapher handelt.

Um diese Methode zu testen, wurden ausgewählte Metaphern (Gott als Vater, Gott als Mutter und Menschen als Kinder) aus den Daten der Reddit-Foren r/TrueChristian und r/OpenChristian untersucht. Dafür wurden kontextuelle Word Embeddings für alle Sätze mit den ausgewählten Metaphern erstellt, diese Embeddings über ein Klassifizierungsverfahren (“k-Nearest-Neighbors”) eingeordnet und abschließend mit den händischen Annotationen verglichen. Die Ergebnisse zeigen, dass man mithilfe dieser Methode tatsächlich Metaphern zuverlässig erkennen kann, vor allem aber dann, wenn die Metaphern sehr geläufig sind. Die Metapher “Gott als Vater” konnte beispielsweise sehr zuverlässig erkannt werden, während die Metapher “Gott als Mutter” deutlich schwieriger zu erkennen war. Dies liegt vermutlich daran, dass die Metapher “Gott als Mutter” in den untersuchten Foren deutlich seltener, und auch nur in einem progressiven Umfeld verwendet wird. Dies zeigt, dass die Methode auf Basis der kontextuellen Word Embeddings durchaus Potenzial hat, aber auch, dass die Erkennung von Metaphern stark von den verwendeten Daten selbst abhängt.

Den Stein ins Rollen bringen
Nachdem dieser erste Versuch gezeigt hat, dass theoretisch Metaphern über ein Word-Embeddings erkannt werden können, ging es im nächsten Schritt darum, diesen Ansatz zu verfeinern. Das grundlegende Vorgehen hierbei war es, ein vortrainiertes Kontext-Embeddings Modell mittels Fine-Tuning zu spezialisieren, um damit die nicht-annotierten Reddit-Daten automatisch zu klassifizieren. Die verwendeten Modelle waren:
MelBERT (metaphor-aware late interaction over BERT): Ein auf BERT basierendes Sprachmodell zur Erkennung von Metaphern in Texten
DeepMet: Ein Deep-Learning-basiertes Modell zur automatischen Metaphernerkennung
Als Basis für den verwendeten Datensatz wurde, wie bereits erwähnt, VUAMC verwendet. Da der Reddit-Datensatz nur wenig annotierte Daten enthält, wurde dieser hauptsächlich für die Validierung verwendet und nur ein kleiner Teil für das Fine-Tuning.
Das Fine-Tuning wurde dreimal pro Modell durchgeführt mit unterschiedlichen Datensatz-Konstellationen (VUAMC, Reddit, VUAMC + Reddit). Da der VUAMC Datensatz nur allgemeine Metaphern beinhaltet, wurden im Vortrag die Ergebnisse als “Cross-Genre Metaphor Detection” bezeichnet. Das heißt, ein Modell welches hauptsächlich auf dem Genre “allgemeine Metaphern” trainiert wurde, wird für das Erkennen von Metaphern des Genres “religiöse Metaphern” verwendet.

Aus den Ergebnissen lässt sich zum einen erkennen, dass MelBERT und DeepMet ähnlich gut abschneiden, zum anderen, dass grundsätzlich die Kombination aus VUAMC (großer Datensatz, allgemeine Metaphern) und Reddit (kleiner Datensatz, religiöse Metaphern) am besten funktioniert. Die geringe Genauigkeit auf dem Reddit Datensatz liegt vermutlich daran, dass der Datensatz zu klein ist, um damit gut ein Modell zu spezialisieren.
Als weiteres Experiment wurde der “Cross-Lingual Transfer” getestet. Hier wurde als Datensatz einmal der (englisch-sprachige) VUAMC und einmal der englisch-sprachige Reddit Datensatz verwendet und auf deutsch-sprachigen Foren getestet. Hierbei wurde mit den Reddit-Daten, besonders bei religiösen Metaphern, eine bessere Performance gemessen. Andersherum (deutschsprachige Foren -> englischsprachiger Reddit Datensatz) erzielte ebenfalls gute Ergebnisse, was überraschend ist, angesichts der kleinen Datenmenge und der Unterschiede zwischen den beiden Sprachen.
Kein Meister fällt vom Himmel
An dem generell niedrigen F1-Score lässt sich erkennen, dass die trainierten Modelle Schwierigkeiten haben, bestimmte Arten metaphorischer Ausdrücke zuverlässig als Metaphern zu erkennen. Der F1-Score fasst zusammen, wie zuverlässig ein Modell Metaphern erkennt. Dabei wird die Precision (Anteil der korrekt erkannten Metaphern an allen als Metapher markierten Ausdrücken) mit dem Recall (Anteil der tatsächlich gefundenen Metaphern an allen vorhandenen) verrechnet. Ein niedriger F1-Score zeigt also, dass dem Modell entweder viele Metaphern entgehen, es zu viele falsche Treffer produziert, oder beides zugleich. Im Vortrag wurden hierfür drei mögliche Ursachen genannt.
Religiöse Metaphern, welche spezifisches religiöses Vokabular beinhalten, wie bspw. “Father”, “Spirit” oder “Kingdom” werden vom Modell oft nicht als Metaphern erkannt, was zu einer hohen Rate an “False Negatives” bzw. zu einem niedrigen Recall führt.

Eine weitere Herausforderung ergibt sich daraus, dass Metaphern nicht alle nach demselben Muster aufgebaut sind. Insbesondere die folgenden beiden Metaphern-Typen bereiten den Modellen Schwierigkeiten:
Konventionale (tote) Metaphern: Metaphern, welche so häufig im Sprachgebrauch vorkommen, dass sie nicht mehr bewusst als Metapher verwendet werden. Ein Beispiel hierfür ist, mal wieder, „let’s meet at 5p.m.“. Das ist eine Metapher, da at aus der räumlichen Domäne als Metapher für die zeitliche Domäne verwendet wird.
“Deliberate Metaphors” (“Bewusst eingesetzte” Metaphern): Ausgedehnte (“extended”) Metaphern, welche explizit als Metaphern kommuniziert und erklärt werden. Das heißt, um die Metapher zu erkennen, wird ein größerer Kontext benötigt. Ein Beispiel hierfür ist: “Promiscuity is like going to a birthday party and only eating the sweet part of the cake – the frosting. Then walking out. You ’re missing out on getting to know the others at the party which requires patience and time and unknowns which are scary”
- “Novel Metaphors” sind Metaphern, welche noch sehr neuartig sind und daher im allgemeinen Sprachgebrauch wenig verwendet werden oder unbekannt sind. Um diese besser zu erkennen, wurden im Vortrag zwei Methoden genannt. Eine Möglichkeit ist, den VUAMC Datensatz um einen “Novelty score” erweitert. Dieser geht von -1 (sehr konventionell) bis 1 (sehr neuartig). Der “Novelty Score” basiert auf den Bewertungen von Crowdworkern. Ein zweiter erwähnter Ansatz ist es, Wörterbücher als Quelle zur Bestimmung der Konventionalität zu verwenden.

Die trainierten Modelle haben, wie erwartet, einen geringeren Recall auf den “Novel Metaphors”, als auf den allgemeinen Metaphern. Naheliegend wäre daher, dass Annotator:innen auf diesen oft nicht übereinstimmen, da die Metaphern weniger geläufig und daher schwerer zu erkennen sind. Paradoxerweise trifft genau das Gegenteil zu: Die Annotator:innen des Projektes zeigen ein hohes Agreement in genau diesen Fällen. Erwähnte mögliche Gründe sind hier, wie zuvor, ähnliche Herausforderungen wie mit Genre-spezifischen Metaphern, aber auch potenzielle strukturelle Probleme der verwendeten Modellfamilie (encoder-only Modelle) selbst. Auf der einen Seite gibt es, da diese Metaphern neuartig sind, nicht genug Beispiele in den Trainingsdaten, um sie zuverlässig erkennen zu können. Auf der anderen Seite werden die Metaphern möglicherweise durch die Tokenisierung, eine grundsätzliche Eigenschaft der Modellfamilie, nicht korrekt verarbeitet.
Den Horizont erweitern
Als weiterer Ansatz zur automatischen Erkennung von religiösen Metaphern, wurden im Projekt auch LLMs getestet. Die getesteten Modelle waren LLaMa 3.1, Mistral und GPT-4o-mini. Als Prompt wurden drei unterschiedliche Templates verwendet:
Zero-Shot mit CMT (Conceptual Metaphor Theory): Eine Erklärung wie Metaphern funktionieren + Frage ob folgender Satz eine Metapher enthält
Zero-Shot ohne CMT: Nur die Frage ob folgender Satz eine Metapher enthält
Few-Shot: Mehrere Beispiele von Sätzen und ob diese Metaphern enthalten + Frage ob folgender Satz eine Metapher enthält
Zusätzlich wurde betrachtet, ob das MIPVU-Verfahren mit LLMs verwendet werden kann. Im Vortrag wurde argumentiert, dass der erste Schritt des MIPVU-Verfahrens (die Zerlegung des Textes in lexikalische Einheiten) unnötig ist und übersprungen werden kann, da die verwendeten Daten (VUAMC und das annotierte Reddit-Korpus) bereits in der vorangegangenen NLP-Pipeline tokenisiert wurden. Das LLM kann daher direkt mit der Bedeutungsanalyse fortfahren. Es ermittelt für jedes Token die kontextuelle Bedeutung sowie eine daraus abgeleitete Grundbedeutung und vergleicht beide auf Unterschiedlichkeit und Ähnlichkeit, um daraus zu bestimmen, ob eine Metapher vorliegt.

Abbildung 7: MIPVU-Verfahren mit LLMs [Reimann 2026]
Die Performance der Modelle war eher gering, da die Modelle stark zur Übergeneralisierung tendieren. Sie markieren fälschlicherweise normale, wörtlich gemeinte Sätze als Metaphern (“False Positives”). Zusätzlich wurden auch unterschiedliche Größen des LLaMa 3.1 Modells getestet, aber es konnte kein großer Unterschied in der Performance gemessen werden.
Der Kreis schließt sich
Es wurde grundsätzlich gezeigt, dass eine automatische Erkennung von religiösen Metaphern möglich ist, aber aufgrund der genannten Herausforderungen, konnte keine gute Performance erzielt werden. Encoder-Modelle verlassen sich zu stark auf ihre Trainingsdaten und haben Probleme bei der Generalisierung auf neue Textgenres (normale Metaphern -> religiöse Metaphern). Bei den untersuchten LLMs wiederum wird im Vortrag argumentiert, dass sie oft Schwierigkeiten damit haben zu erkennen, was eine Metapher eigentlich ausmacht: das Mapping über verschiedene Domänen hinweg.
Als mögliche Zukunftspläne des Projekts wurden fünf Punkte genannt:
Das “Cross-Domain Mapping” soll stärker in den Fokus gerückt werden
Extraktions Methoden: Das Modell soll nicht nur Metaphern erkennen, sondern auch bspw. die verwendeten Domänen extrahieren.
Unüberwachte Verfahren: Modelle die ohne manuell gelabelte Trainingsdaten trainiert werden.
Analogie- und Konzeptverständnis von LLMs: Untersuchung, inwieweit Sprachmodelle fähig sind, analoge Beziehungen zwischen Konzepten zu erkennen und konzeptuelle Strukturen intern abzubilden.
LLM-Fine-Tuning: Ein LLM-Modell mit bspw. dem VUAMC oder dem Reddit-Datensatz spezialisieren.
QuellenSteen, G. J., Dorst, A. G., Herrmann, J. B., Kaal, A. A., Krennmayr, T., \& Pasma, T. (2019). MIPVU: A manual for identifying metaphor-related words. In S. Nacey \& W. G. Reijnierse (Eds.), Converging Evidence in Language and Communication Research (pp. 23-40). Amsterdam: John Benjamins. Retrieved from https://hdl.handle.net/1887/3308917
Deutsche Forschungsgemeinschaft (DFG). (o. J.). SFB 1475: Metaphern der Religion. Religiöse Sinnbildung in sprachlichen Prozessen (Projektnummer 441126958) [Projektbeschreibung]. GEPRIS. https://gepris.dfg.de/gepris/projekt/441126958
Reimann, Sebastian. Vortragfoliensatz „Digitale Methoden in der Metaphernforschung“. 16.07.2026
Choi, M., Lee, S., Choi, E., Park, H., Lee, J., Lee, D., & Lee, J. (2021). MelBERT: Metaphor detection via contextualized late interaction using metaphorical identification theories. arXiv. arXiv:2104.13615
Su, C., Fukumoto, F., Huang, X., Li, J., Wang, R., & Chen, Z. (2020). DeepMet: A reading comprehension paradigm for token-level metaphor detection. Proceedings of the Second Workshop on Figurative Language Processing, 30–39. Association for Computational Linguistics. https://doi.org/10.18653/v1/2020.figlang-1.4
Zu den Autoren:- Peer Schäfer schloss den Dualen Bachelor Informatik an der Dualen Hochschule Baden-Württemberg in Karlsruhe im Jahr 2022 ab und studiert seit 2024 den Master Informatik an der Universität zu Köln
- Lukas Göbl schloss den Dualen Bachelor Informatik an der Dualen Hochschule Baden-Württemberg in Karlsruhe im Jahr 2020 ab und studiert seit 2024 den Master Informatik an der Universität zu Köln
Nur der Text ist unter der Lizenz Creative Commons Namensnennung 4.0 International nutzbar. Alle anderen Elemente (Abbildungen, importierte Anhänge) sind „Alle Rechte vorbehalten“, sofern nicht anders angegeben.
OpenEdition schlägt Ihnen vor, diesen Beitrag wie folgt zu zitieren:
dhstudi (13. August 2026). MoRe than Words: Metaphern der Religion und maschinelles Lernen. Digital Humanities Cologne. Abgerufen am 10. September 2026 von https://doi.org/10.58079/16nw2