31 Mar 2026

Der Autowaschtest für LLMs

Der Autowaschtest für LLMs

Die Menschen sind mehr als glücklich, wenn sie "beweisen" können, dass KI dumm ist.

Im Jahr 2024 fragten die ersten Nutzer von ChatGPT: "Wie viele Rs hat eine Erdbeere?" Jetzt sind wir bei "Gehst du zu Fuß oder bringst du dein Auto in die Waschanlage?

Diese Beiträge gehen immer wieder viral, weil die Fehler so menschlich wirken. Aber sie sind kein Beweis dafür, dass KI kaputt ist. Sie sind der Beweis dafür, dass die meisten Menschen noch nicht verstehen, mit wem sie eigentlich sprechen.

Es gibt einen Begriff dafür: ein stochastischer Papagei. Es ist eine Metapher, die LLMs als Systeme beschreibt, die Textmuster aus Trainingsdaten statistisch widerspiegeln, ohne die Bedeutung dahinter zu verstehen. Stellen Sie es sich so vor: Der Papagei hat jedes Buch in der Bibliothek gelesen, ist aber noch nie vor die Tür gegangen, um zu sehen, was ein "Auto" oder ein "Spaziergang" eigentlich bedeutet.

Diese Diskrepanz zwischen Rechenleistung und gesundem Menschenverstand ist genau die Ursache für diese viralen Momente.

Warum die Frage nach der Autowäsche nicht funktioniert

Der Mensch hat ein mentales Modell der physischen Welt im Kopf. Wir wissen, dass Objekte einen Raum einnehmen, dass ein Auto physisch in der Waschanlage stehen muss, um gereinigt zu werden, und dass es bei der Frage nicht wirklich um Gehen oder Fahren geht. Es geht um Logistik.

Ein LLM hat dieses Weltmodell nicht. Für die KI ist "Autowaschanlage" eine Zielbezeichnung, wie "der Park" oder "die Bibliothek". Sie versteht die Grammatik des Satzes perfekt, aber sie versteht nicht seinen Zweck.

Außerdem ist der Musterabgleich probabilistisch. Wenn die statistisch wahrscheinlichste Antwort auf eine Frage nach einer fünfminütigen Entfernung "zu Fuß gehen" ist, wird das Modell dies mit absoluter Sicherheit sagen, selbst wenn die Prämisse keinen Sinn ergibt.

Ist das "Intelligenz" oder nur "kalkuliertes Raten"?

Die meisten Modelle, mit denen man heute zu tun hat, sind "System 1"-Denker: schnell, intuitiv und anfällig für Bauchgefühlsfehler. Die Industrie liefert bereits Modelle mit "System 2"-Fähigkeiten aus, die ihre eigene Logik vor der Antwort anhand von Gedankengängen überprüfen. Für die meisten Nutzer ist dies jedoch noch nicht der Standard, und die Kluft zwischen dem, was möglich ist, und dem, was die Menschen tagtäglich erleben, ist noch groß.

Diese "Gotcha"-Momente sind nicht nur unterhaltsam. Sie sind einer der deutlichsten Gründe, warum wir die Schlüssel zu völlig autonomen Systemen noch nicht übergeben haben. Wenn eine KI nicht herausfinden kann, wie man ein Auto in die Waschanlage bringt, ist es schwer, ihr irgendetwas zuzutrauen, das mit der Logistik in der realen Welt zu tun hat.

Die Ironie des Jahres 2026

Wir geben Milliarden dafür aus, Modelle auf Hunderttausenden von Grafikprozessoren zu trainieren, um einer Maschine etwas beizubringen, was ein Vierjähriger intuitiv versteht: Man kann das Auto nicht waschen, wenn es noch in der Einfahrt steht.

Wenn man ein "denkendes" Modell richtig anleitet, erhält man ein anderes Ergebnis, vielleicht sogar mit einem bissigen Kommentar.

Maschinell aus dem Englischen übersetzt via DeepL, mit manuellen Korrekturen.

Möchten Sie das auf Ihr Unternehmen anwenden?

Wenn dieser Beitrag eine gute Frage ausgelöst hat, sprechen wir darüber, wo KI, Automatisierung oder Produktstrategie in Ihrer Organisation praktischen Hebel schaffen können.

Gespräch starten