Wie gut vereinfachen KI-Modelle Schweizer Verwaltungstexte? Ein Vergleich von Claude, DeepSeek, Mistral und Qwen mit einer regelbasierten, unabhängigen Prüfung neben der Selbstauskunft jedes Modells.
Eine repräsentative Auswahl von 14 der 60 Texte im Korpus. Der vollständige Korpus fliesst in den Modell-Vergleich-Tab und in data/results/ ein.
Reproduzierbar, unabhängig vom LLM.
Was das Modell selbst über seine Änderungen berichtet, ungeprüft.
| Modell | WSTF (tiefer = einfacher) ↓ | LIX (tiefer = einfacher) ↓ | Urteil (Treue / Einfachheit / Fluss) ↓ | ⌀ Ersetzungen ↓ | ⌀ Antwortzeit ↓ |
|---|
WSTF (Wiener Sachtextformel) und LIX messen Lesbarkeit nach der Vereinfachung, tiefer ist einfacher. Das Urteil stammt von einem separaten LLM-Richter (Faithfulness/Simplicity/Fluency, Skala 1–5) und bewertet alle vier Modelle, inklusive sich selbst im Fall von Qwen. Klicken Sie auf eine Spaltenüberschrift, um zu sortieren.
Die vier Analysen unten funktionieren als Black-Box-Explainability: durch gezieltes Stören der Eingabe, durch einen unabhängigen Treue-Abgleich, durch wiederholtes Abfragen desselben Textes, und durch die Token-Konfidenz, die ausschliesslich DeepSeeks Backend tatsächlich zurückgibt. Diese Analysen laufen auf einer Stichprobe, nicht dem ganzen Korpus, siehe Hinweis je Abschnitt.
Jeder Satz des Originals wird einzeln entfernt, der Text erneut vereinfacht. Wie stark sich die Ausgabe dadurch verändert, ist ein modellunabhängiges Mass dafür, wie stark dieser Satz das Ergebnis beeinflusst hat, das Grundprinzip von LIME/SHAP bei Modellen ohne Interna-Zugriff.
#N = Position im Originaltext · Wert = Einfluss-Score beim Entfernen dieses Satzes (0–1). Bewegen Sie die Maus über eine Zeile, um den Satz links zu finden.
Ein unabhängiges, deterministisches Mass für lexikalische Überlappung zwischen Original und Vereinfachung, zum Vergleich mit der subjektiven Treue-Bewertung des LLM-Richters.
Derselbe Text, dreimal an dasselbe Modell geschickt. Hohe Übereinstimmung heisst verlässliches Verhalten; niedrige heisst, das Ergebnis hängt spürbar vom Zufall ab. Skala 0–1, höher = konsistenter.
Einziges Signal aus echten Modellinterna in diesem Projekt, bestätigt empirisch als einziger der vier Anbieter, der Logprobs tatsächlich zurückgibt (Claude und Mistral lehnen den Parameter ab, Qwens Backend liefert ihn leer). Dunkler = das Modell war sich dieses Worts sicherer.