Zurück zu den Neuigkeiten
InnovationAI Understanding Briefing

Die deontische Lücke: Große Sprachmodelle und die modale Verpflichtungssprache

Modale Hilfsmittel wie „müssen“, „sollten“ und „haben“ kennzeichnen Notwendigkeit und Verpflichtung im Kontext der Autorität des Sprechers und der zwischenmenschlichen Haltung.

6 min readRead the primary source
Source-page capture accompanying The Deontic Gap: Large Language Models and the Modal Language of Obligation
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
arxiv.org
Quelllink
arxiv.orghttps://arxiv.org/abs/2608.18144
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

Großes Sprachmodell (LLM)
Ein Sprachmodell, das auf umfangreichen Textkorpora trainiert wurde, um Text zu generieren und zu analysieren.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Testen Sie sich selbstWas ist KI? Quiz

Was ist passiert?

Die Forscher untersuchten, ob große Sprachmodelle (LLMs) zeitgenössische menschliche Muster der deontischen Modalnutzung reproduzieren. Sie fanden heraus, dass KI-generierte Texte im Vergleich zu heutigen Menschen durchweg zu wenig positive deontische Modalitäten (müssen, sollten, müssen, mussten) verwenden. Ein historischer Vergleich mit dem Google Books Ngram-Korpus (1920–2022) zeigte, dass die Modalfrequenzen der KI im Bereich des formellen veröffentlichten Englisch liegen, während die aktuellen Modalraten des Menschen in informellen digitalen Kontexten häufig die Buchbasiswerte des 20. Jahrhunderts überschreiten.

Die Forscher analysierten drei Primärkorpora, einen externen , zwei kontrollierte Replikationen und eine naturalistische Replikation mit elf Modellen, um die modale Nutzung von LLM zu untersuchen. Dieses Design konzentriert den Vergleich auf die modale Nutzung in den angegebenen Quellen. Außerdem wird die Hauptanalyse vom Benchmark und den Replikationen getrennt, wodurch die festgelegte Struktur der Studie erhalten bleibt und die Beschreibung sich auf das Untersuchte konzentriert.

Sie fanden heraus, dass KI-generierte Texte im Vergleich zu heutigen Menschen durchweg zu wenig positive deontische Modalitäten (müssen, sollten, müssen, mussten) nutzen. Dieses Ergebnis wird als relatives Muster angegeben, wobei der Vergleich auf heutige Menschen gerichtet ist. Der Wortlaut identifiziert sowohl die Richtung des Unterschieds als auch die spezifische Familie der beteiligten Modalitäten und sorgt dafür, dass das Ergebnis an die zentrale Frage der Studie gebunden bleibt.

Ein historischer Vergleich mit dem Google Books Ngram-Korpus (1920–2022) zeigte, dass die Modalfrequenzen der KI im Bereich des formellen veröffentlichten Englisch liegen, während die aktuellen Modalraten des Menschen in informellen digitalen Kontexten häufig die Buchbasiswerte des 20. Jahrhunderts überschreiten. Der Vergleich stellt das KI-Muster daher neben zwei verschiedene Bezugspunkte: formelles veröffentlichtes Englisch und informelles digitales Schreiben. Der Kontrast ist Teil des berichteten Ergebnisses, das hier präsentiert wird, ohne dass sich weder der abgedeckte Zeitraum noch das von den Forschern benannte Korpus ändert.

Die Zerlegung auf Phrasenebene zeigte, dass sich die modale Lücke zwischen KI und Mensch auf Konstruktionen konzentriert, die für die zwischenmenschliche Haltung von zentraler Bedeutung sind (sollten, müssen, mussten), während die KI in Unterrichts- und Fragebeantwortungskontexten dem Menschen in Bezug auf die Notwendigkeit gleichkommt oder diese übertrifft, nicht jedoch beim überzeugenden Schreiben von Schülern. Durch diese Zerlegung wird die gemeldete Lücke auf die bereits identifizierten Konstruktionen verringert, während der separate Kontext, in dem die Notwendigkeit beschrieben wird, erhalten bleibt. Der Satz behält die Unterscheidung zwischen Unterrichts- und Frage-Antwort-Kontext und überzeugendem Schülerschreiben im Blick.

Die Ergebnisse deuten darauf hin, dass die modale Nutzung von LLM die formalen schriftlichen Ressourcen widerspiegelt, auf denen diese Modelle trainiert wurden, während gleichzeitig die modalen Konstruktionen, mit denen zeitgenössische menschliche Autoren unmittelbare, zwischenmenschliche Verpflichtungen markieren, unzureichend genutzt werden. Diese Interpretation verbindet das beobachtete Muster mit den in der Studie genannten Sprachressourcen und zwischenmenschlichen Funktionen. Es beschreibt das Ergebnis als eine Frage dessen, was mehr oder weniger häufig verwendet wird, wobei der Schwerpunkt auf der aktuellen Verpflichtung und den in den Ergebnissen identifizierten formalen schriftlichen Ressourcen liegt.

Quellenangaben: arxiv.org

Warum es wichtig ist

Die Ergebnisse deuten darauf hin, dass die modale Nutzung von LLM die formalen schriftlichen Ressourcen widerspiegelt, auf denen diese Modelle trainiert wurden, während gleichzeitig die modalen Konstruktionen, mit denen zeitgenössische menschliche Autoren unmittelbare, zwischenmenschliche Verpflichtungen markieren, unzureichend genutzt werden.

Die Ergebnisse der Studie haben Auswirkungen auf die Entwicklung und Bewertung von LLMs, insbesondere im Hinblick auf ihre Fähigkeit, den menschlichen Sprachgebrauch zu erfassen und zu reproduzieren. Diese Bedeutung ergibt sich aus dem berichteten Vergleich zwischen KI-generiertem Text und zeitgenössischen menschlichen Mustern. Dadurch bleibt die Bedeutung des Ergebnisses mit dem konkreten Sprachverhalten verknüpft, das zur Diskussion steht, anstatt es von der zentralen Beobachtung der Studie zu trennen.

Die Ergebnisse deuten darauf hin, dass LLMs möglicherweise nicht in der Lage sind, die Nuancen des menschlichen Sprachgebrauchs vollständig zu erfassen, insbesondere im Hinblick auf den deontischen Modalgebrauch. Die Bedeutung dieser Feststellung liegt in der Unterscheidung zwischen der Produktion von Sprache und der Reproduktion der modalen Entscheidungen, durch die Verpflichtung zum Ausdruck gebracht wird. Der Wortlaut behält den Schwerpunkt der Studie auf Nuancen bei und behält die deontische Modalverwendung als relevanten Vergleichspunkt bei.

Die Ergebnisse der Studie haben Auswirkungen auf die Entwicklung ausgefeilterer LLMs, die den menschlichen Sprachgebrauch besser erfassen und reproduzieren können. In diesem Zusammenhang ist Verfeinerung mit der gleichen Fähigkeit verbunden, die in der gesamten Studie identifiziert wurde: dem Erfassen und Reproduzieren des menschlichen Sprachgebrauchs. Die Implikation konzentriert sich weiterhin auf das gemeldete modale Muster, ohne dass sich das Ergebnis oder die ausgewertete Sprache ändert.

Die Ergebnisse deuten darauf hin, dass LLMs möglicherweise auf einer breiteren Palette von Sprachdaten, einschließlich informeller digitaler Kontexte, geschult werden müssen, um den menschenähnlichen Sprachgebrauch besser zu erfassen. Dies ist wichtig, da der berichtete Vergleich formale schriftliche Ressourcen von den informellen digitalen Kontexten unterscheidet, in denen zeitgenössische menschliche Modalraten beschrieben werden. Der Punkt bleibt die Beziehung zwischen Trainingsdaten und den Sprachmustern, die Modelle reproduzieren.

Die Ergebnisse der Studie haben Auswirkungen auf die Bewertung von LLMs, insbesondere im Hinblick auf ihre Fähigkeit, den menschlichen Sprachgebrauch zu erfassen und zu reproduzieren. Die Bewertung ist hier wichtig, da die Studie einen bestimmten Aspekt des Sprachgebrauchs identifiziert, der bei der Bewertung von Modellen berücksichtigt werden kann. Die Aussage wahrt den Bezug zum deontischen Modalgebrauch und zum bereits in den Befunden benannten menschenähnlichen Sprachgebrauch.

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
What is AI? Quiz

As use of AI scales up across an organization, what tends to matter most?

Was Sie als nächstes sehen sollten

Die Ergebnisse der Studie haben Auswirkungen auf die Entwicklung und Bewertung von LLMs, insbesondere im Hinblick auf ihre Fähigkeit, den menschlichen Sprachgebrauch zu erfassen und zu reproduzieren.

Die Ergebnisse der Studie haben Auswirkungen auf die Entwicklung und Bewertung von LLMs, insbesondere im Hinblick auf ihre Fähigkeit, den menschlichen Sprachgebrauch zu erfassen und zu reproduzieren. In der Praxis besteht die zentrale Frage darin, ob ein LLM die gleichen modalen Entscheidungen reproduzieren kann, die in den oben beschriebenen menschlichen Vergleichen auftauchen. Der Wortlaut hält diese Frage auf der Ebene des Sprachgebrauchs und verknüpft Entwicklung und Bewertung mit dem gemeldeten Muster, ohne ein separates Ergebnis hinzuzufügen.

Die Ergebnisse deuten darauf hin, dass LLMs möglicherweise nicht in der Lage sind, die Nuancen des menschlichen Sprachgebrauchs vollständig zu erfassen, insbesondere im Hinblick auf den deontischen Modalgebrauch. Die Sorge betrifft daher Nuancen innerhalb des bereits gemeldeten Nutzungsmusters. Dies identifiziert einen bestimmten Ort, an dem in der Studie gefragt wird, wie eng diese Produktion mit dem zeitgenössischen menschlichen Gebrauch übereinstimmt, wobei der Fokus weiterhin auf der deontischen modalen Unterscheidung liegt.

Die Ergebnisse der Studie haben Auswirkungen auf die Entwicklung ausgefeilterer LLMs, die den menschlichen Sprachgebrauch besser erfassen und reproduzieren können. Die vorgeschlagene Richtung ergibt sich direkt aus der dargelegten Implikation: Eine größere Komplexität wird in Bezug auf die Fähigkeit in Betracht gezogen, den in der Studie diskutierten menschenähnlichen Sprachgebrauch zu erfassen und zu reproduzieren. Der Fokus bleibt dieselbe modale Frage und führt keinen anderen ein.

Die Ergebnisse deuten darauf hin, dass LLMs möglicherweise auf einer breiteren Palette von Sprachdaten, einschließlich informeller digitaler Kontexte, geschult werden müssen, um den menschenähnlichen Sprachgebrauch besser zu erfassen. Die relevante Trainingsfrage orientiert sich an den Arten von Sprachdaten, die im Vergleich der Studie dargestellt werden. Die Betonung informeller digitaler Kontexte folgt dem berichteten Kontrast zum formellen veröffentlichten Englisch, während der Zweck weiterhin darin besteht, die fragliche Verwendung besser zu erfassen.

Die Ergebnisse der Studie haben Auswirkungen auf die Bewertung von LLMs, insbesondere im Hinblick auf ihre Fähigkeit, den menschlichen Sprachgebrauch zu erfassen und zu reproduzieren. Die Bewertung wird neben der Entwicklung einbezogen, da das gemeldete Muster sowohl für die Produktion der Modelle als auch dafür, wie diese Produktion bewertet wird, von Bedeutung ist. Die Aussage hält die Implikation an den deontischen Modalgebrauch und den in der Studie genannten menschenähnlichen Sprachgebrauch gebunden.

Verwandte Leitfäden und Quizze

Was ist KI?ChatGPT & LLMsKI-EthikKI-AgentenKI-Modelle erklärtTransformatorenZukunft der KIKI-TrainingPrompt EngineeringTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-Begriff
Fanden Sie das nützlich?