Vereinfachung von Deutschschweizer VerwaltungstextenEin interaktives Tool zur Evaluation der LLM-Outputs

Wie gut vereinfachen KI-Modelle Schweizer Verwaltungstexte? Ein Vergleich von Claude, DeepSeek, Mistral und Qwen mit einer regelbasierten, unabhängigen Prüfung neben der Selbstauskunft jedes Modells.

Eine repräsentative Auswahl von 14 der 60 Texte im Korpus. Der vollständige Korpus fliesst in den Modell-Vergleich-Tab und in data/results/ ein.

Text Fachbegriff entfernt Text Fachbegriff geblieben Text Wortersetzung
Original Verwaltungsdeutsch
Vereinfacht
WSTF (tiefer = einfacher)
LIX (tiefer = einfacher)
Sätze
⌀ Wörter pro Satz
Antwortzeit

LLM-Urteil (Richter: Qwen)

Treue
Einfachheit
Fluss

Regelbasierte Prüfung

Reproduzierbar, unabhängig vom LLM.

Passiv­konstruktionen
Fachbegriffe entfernt
Fachbegriffe geblieben
Wortersetzungen

Modell-Begründung Selbstauskunft

Was das Modell selbst über seine Änderungen berichtet, ungeprüft.

Qwen, eines der vier Modelle, dient als Richter.
Modell WSTF (tiefer = einfacher) LIX (tiefer = einfacher) Urteil (Treue / Einfachheit / Fluss) ⌀ Ersetzungen ⌀ Antwortzeit

WSTF (Wiener Sachtextformel) und LIX messen Lesbarkeit nach der Vereinfachung, tiefer ist einfacher. Das Urteil stammt von einem separaten LLM-Richter (Faithfulness/Simplicity/Fluency, Skala 1–5) und bewertet alle vier Modelle, inklusive sich selbst im Fall von Qwen. Klicken Sie auf eine Spaltenüberschrift, um zu sortieren.

Die vier Analysen unten funktionieren als Black-Box-Explainability: durch gezieltes Stören der Eingabe, durch einen unabhängigen Treue-Abgleich, durch wiederholtes Abfragen desselben Textes, und durch die Token-Konfidenz, die ausschliesslich DeepSeeks Backend tatsächlich zurückgibt. Diese Analysen laufen auf einer Stichprobe, nicht dem ganzen Korpus, siehe Hinweis je Abschnitt.

1 Satz-Ablation (en. sentence ablation)

6 Texte × 4 Modelle

Jeder Satz des Originals wird einzeln entfernt, der Text erneut vereinfacht. Wie stark sich die Ausgabe dadurch verändert, ist ein modellunabhängiges Mass dafür, wie stark dieser Satz das Ergebnis beeinflusst hat, das Grundprinzip von LIME/SHAP bei Modellen ohne Interna-Zugriff.

Einfluss des entfernten Satzes: gering → stark

#N = Position im Originaltext · Wert = Einfluss-Score beim Entfernen dieses Satzes (0–1). Bewegen Sie die Maus über eine Zeile, um den Satz links zu finden.

2 TF-IDF-Treue-Abgleich (en. TF-IDF faithfulness cross-check)

Alle 240 Zeilen

Ein unabhängiges, deterministisches Mass für lexikalische Überlappung zwischen Original und Vereinfachung, zum Vergleich mit der subjektiven Treue-Bewertung des LLM-Richters.

Pearson r = Ein moderater, aber unvollständiger Zusammenhang: der Richter bewertet mehr als reine Wortüberlappung.

3 Selbstkonsistenz (en. self-consistency)

6 Texte × 4 Modelle × 3 Wiederholungen

Derselbe Text, dreimal an dasselbe Modell geschickt. Hohe Übereinstimmung heisst verlässliches Verhalten; niedrige heisst, das Ergebnis hängt spürbar vom Zufall ab. Skala 0–1, höher = konsistenter.

4 DeepSeek-Tokenkonfidenz (en. DeepSeek token confidence)

60 Texte · nur DeepSeek

Einziges Signal aus echten Modellinterna in diesem Projekt, bestätigt empirisch als einziger der vier Anbieter, der Logprobs tatsächlich zurückgibt (Claude und Mistral lehnen den Parameter ab, Qwens Backend liefert ihn leer). Dunkler = das Modell war sich dieses Worts sicherer.

Konfidenz: niedrig → hoch