Die häufige Nutzung von Em-Dashes in KI-generierten Texten
Der Em-Dash ist ein häufig genutztes Satzzeichen in KI-generierten Texten. Sein Einsatz könnte durch Trainingsdaten geprägt sein.
Die Rolle des Em-Dash in AI-Textdesign
In der Welt der KI-generierten Texte taucht ein Satzzeichen immer wieder auf: der Em-Dash. Doch warum nutzen Künstliche Intelligenzen dieses stilistische Mittel so häufig? Die Antworten sind komplex und vielschichtig.
Die häufige Verwendung von Em-Dashes
Eine der auffälligsten Eigenschaften von KI-generierten Texten ist ihre intensive Nutzung des Em-Dash. Diese Beobachtung wirft die Frage auf, ob Sprachemodelle einfach nur ein vorhandenes Muster aus ihren Trainingsdaten reproduzieren oder ob eine andere Dynamik im Spiel ist. Eine naheliegende Erklärung wäre, dass normale englische Texte viele Em-Dashes enthalten, was allerdings angezweifelt wird. Wenn dies zuträfe, wäre der Gebrauch von Em-Dashes in KI-Texten ebenso unauffällig wie die Verwendung anderer Interpunktionszeichen Quelle 1.
Flexibilität und Kürze
Ein weiterer Ansatz erklärt den verbreiteten Einsatz des Em-Dash durch seine Vielseitigkeit. Modelle könnten das Em-Dash als sicheren Platzhalter verwenden, während sie den nächsten Token vorhersagen, da es sowohl die Fortführung einer Argumentation als auch den Beginn eines neuen Gedankens signalisieren kann. Allerdings bieten auch andere Satzzeichen ähnliche Flexibilität, was diese Erklärung schwächt. Zudem wird die Theorie infrage gestellt, dass Modelle aus Gründen der Kürze auf Em-Dashes zurückgreifen. Em-Dashes sind nicht notwendigerweise effizienter als andere Interpunktionszeichen Quelle 1.
Einfluss der Trainingsdaten
Die signifikante Zunahme der Em-Dash-Verwendung zwischen den KI-Versionen GPT-3.5 und GPT-4.1 könnte durch eine Änderung der Trainingsdaten bedingt sein. In den Jahren 2022 bis 2024 haben viele AI-Labore ihre Trainingsdaten durch das Scannen von älteren Printmedien erweitert. Da Bücher aus dem späten 19. und frühen 20. Jahrhundert eine höhere Frequenz von Em-Dashes aufwiesen, könnte dies die intensive Nutzung in neueren Modellen erklären Quelle 1.
Dialekte und kulturelle Einflüsse
Es wurde auch untersucht, ob regionale Variationen im Englischen, etwa durch RLHF (Reinforcement Learning with Human Feedback) in afrikanischen Ländern, die Em-Dash-Nutzung prägen. Obwohl dieses Verfahren Einfluss auf die Nutzung bestimmter Worte, wie „delve“, haben könnte, zeigt die Datenanalyse, dass im Nigerianischen Englisch Em-Dashes weniger verbreitet sind als im allgemeinen englischen Sprachgebrauch. Diese Theorie wird daher als unwahrscheinlich erachtet Quelle 1.
Fazit
Zusammengefasst ergibt sich ein Bild, das darauf hindeutet, dass die häufige Nutzung von Em-Dashes in AI-Texten weniger auf spezifische Designentscheidungen oder kulturelle Akzente zurückzuführen ist. Vielmehr spielen die zugrundeliegenden historischen Eigenschaften der Trainingsdaten eine entscheidende Rolle. Die anhaltende Digitalisierung älterer Literatur, die bereitwillig auf Em-Dashes zurückgreift, scheint den Stil moderner KI-Modelle nachhaltig zu beeinflussen.