Dunning-Kruger-Effekt

Veröffentlicht am:

von:

Dunning-Kruger-Effekt beim Prompting: Selbstvertrauen ist kein Skill

Drei Adjektive ins Chatfenster, einmal Enter, und schon sitzt im Meeting eine frisch ernannte Prompt-Ingenieurin. Der Text klingt ordentlich. Die Folien sehen teuer aus. Niemand fragt, ob die Antwort auch stimmt. Und genau dort beginnt das interessante Problem.

Der Dunning-Kruger-Effekt ist im KI-Alltag zu einem beliebten Etikett geworden. Jemand präsentiert einen hübschen Text als Beweis für technische Meisterschaft? Zack, Diagnose aus der Kommentarspalte. Mich stört daran weniger der Spott als die Bequemlichkeit: Wer andere vorschnell für ahnungslos erklärt, muss die eigene Kompetenz nicht mehr prüfen.

Was Dunning-Kruger beim Prompting erklärt – und was nicht

Der Dunning-Kruger-Effekt bezeichnet eine mögliche Fehleinschätzung der eigenen Leistung: Menschen mit schwacher Leistung in einer bestimmten Aufgabe können zugleich Schwierigkeiten haben, diese Schwäche zu erkennen.

In den ursprünglichen Untersuchungen von Kruger und Dunning ging es um Aufgaben zu Humor, Grammatik und logischem Denken – nicht um KI, Chatfenster oder den neuesten Titel auf einer LinkedIn-Bio.

Das Wort „möglich“ ist wichtig. Die bekannte Kurve, auf der Anfänger*innen erst einen Gipfel der Selbstüberschätzung erklimmen und dann ins Tal der Erkenntnis stürzen, ist keine Gebrauchsanweisung zur Ferndiagnose.

Eine statistische Gegenposition zeigt, dass ein ähnliches Muster unter bestimmten Bedingungen auch durch Eigenschaften der Messung entstehen kann. Andere Arbeiten finden wiederum Hinweise auf Unterschiede in der Selbsteinschätzung. Die Forschung ist interessanter als das Meme – leider deutlich schlechter für eine schnelle Pointe.

Keine Diagnose per Screenshot

Ich kann aus einem selbstbewussten Post nicht ablesen, ob jemand seine Fähigkeiten überschätzt. Vielleicht hat die Person getestet, verworfen, verglichen und nur das Ergebnis gezeigt. Vielleicht hat sie auch beim ersten Versuch Glück gehabt. Beides sieht im Feed erstaunlich ähnlich aus. Der Begriff Dunning-Kruger taugt hier als Frage an die eigene Urteilsfähigkeit, nicht als Stempel für fremde Stirnen.

Eine nähere Parallele zu unserem Thema liefert die Forschung über Selbstüberschätzung bei Anfänger*innen: In mehreren Studien nahm übermäßiges Zutrauen nach ersten Lernerfahrungen zu. Das beweist keine „Prompt-Überschätzung“ als eigenes psychologisches Phänomen. Es macht aber meine Vermutung plausibel, dass erste Erfolgserlebnisse ein besonders schlechter Zeitpunkt für ein endgültiges Kompetenzurteil sind.

Selbstüberschätzung ist keine Fremddiagnose

Ein selbstsicherer KI-Post verrät wenig über die tatsächliche Kompetenz der Person dahinter. Spannender ist, wie wir unsere eigene Leistung einschätzen, wenn das Ergebnis überzeugend aussieht. Die Unterscheidung zwischen Können und Glückstreffer beginnt bei einem ehrlichen Gegencheck.

Warum sich der erste gute Output wie Können anfühlt

Weil zwischen Eingabe und Ergebnis kaum Reibung liegt. Ihr schreibt „prägnant, emotional, professionell“, und Sekunden später steht ein Absatz da, für den früher jemand einen Redaktionsplan geöffnet hätte. Der sichtbare Anteil eurer Arbeit ist klein, das sichtbare Resultat groß. Mein Gehirn macht daraus gern eine Heldengeschichte über meine Eingabe. Den Beitrag des Modells schiebt es höflich hinter den Vorhang.

Prompt Engineering bedeutet, Anweisungen so zu gestalten und zu prüfen, dass ein Modell die Anforderungen möglichst verlässlich erfüllt. Die OpenAI-Dokumentation betont dafür Tests und Evaluationen, gerade wenn Prompts in Anwendungen eingesetzt oder Modelle gewechselt werden. Ein hübscher Einzeltext ist dagegen zunächst nur ein hübscher Einzeltext.

Der Glanz ersetzt keinen Maßstab

Im Marketing passiert die Verwechslung besonders elegant. Ein KI-Post hat einen flotten Einstieg, rhythmische Kurzsätze und eine entschlossene Schlussfrage. Wunderbar. Nur: Trifft er die Zielgruppe? Behauptet er etwas, das niemand belegen kann? Klingt die Marke darin wiedererkennbar – oder bloß wie der Durchschnitt aus tausend Business-Feeds? Ohne Kriterien lässt sich Glätte leicht für Qualität halten.

Beim Code ist das Problem weniger fotogen. Die Funktion läuft mit dem einen Testwert, also wird sie eingebaut. Was passiert bei leerer Eingabe, unerwarteten Daten oder einer Änderung der Anforderungen? Als Software Engineer traue ich einem schönen Codeblock ungefähr so weit wie einer Kaffeemaschine mit der Aufschrift „selbstreinigend“. Ich prüfe, was sie unter Reinigen versteht.

Hinzu kommt ein unangenehmer Gesprächseffekt: Sprachmodelle können Zustimmung erzeugen, wo Widerspruch hilfreicher wäre. In einer Untersuchung zu Sycophancy, also zum Anpassen von Antworten an vermutete Nutzeransichten statt an die sachlich bessere Antwort, zeigten getestete Assistenten entsprechendes Verhalten. Das heißt nicht, dass jede freundliche KI-Antwort falsch ist. Es heißt: Zustimmung ist kein Prüfverfahren.

Woran ihr Prompt-Kompetenz tatsächlich erkennt

Prompt-Kompetenz zeigt sich daran, ob ihr eine Aufgabe sauber beschreibt, gute Ergebnisse von schlechten unterscheidet und Fehler nach einem nachvollziehbaren Verfahren korrigiert. Wer nur einen Tonfall bestellt, bedient ein Werkzeug. Das ist völlig in Ordnung. Es ist bloß noch keine belastbare Methode.

Ich würde bei einem KI-gestützten Fachartikel zuerst festlegen, für wen er geschrieben wird, welche Frage er beantwortet und welche Behauptungen überprüft werden müssen. Erst dann formuliere ich den Prompt. Sonst ist „schreib mir etwas Fundiertes“ ungefähr so präzise wie „bau mir etwas Sicheres“ auf einer Baustelle. Man bekommt womöglich ein Haus. Die Statik bleibt eine Überraschung.

  • Aufgabe eingrenzen: Welches konkrete Ergebnis wird gebraucht, und was gehört ausdrücklich nicht dazu?
  • Material trennen: Welche Fakten sind vorgegeben, welche muss jemand recherchieren und prüfen?
  • Qualität definieren: Woran erkennt ihr einen brauchbaren Text, eine korrekte Antwort oder funktionierenden Code?
  • Grenzfälle testen: Was geschieht bei fehlenden Angaben, Widersprüchen oder ungewöhnlichen Eingaben?
  • Fehler dokumentieren: Welche Änderung verbessert Ergebnisse wiederholt – und welche verschönert nur einen Glückstreffer?

Das klingt weniger glamourös als „ultimativer Superprompt“, ist aber näher an professioneller Arbeit. Forschung zur Prompt-Sensitivität untersucht gerade, wie unterschiedlich Modelle auf Variationen von Eingaben reagieren können. Für mich folgt daraus kein Zauberspruch, sondern eine Pflicht zur Vorsicht: Wenn die Formulierung Einfluss hat, darf ich einen einzelnen Treffer nicht mit Zuverlässigkeit verwechseln.

Natürlich dürft ihr spielerisch anfangen. Ihr müsst keine Prompt-Ingenieur*innen sein, um euch einen Wochenplan, eine Bildidee oder eine Beschreibung für die Axt 2000 schreiben zu lassen. Überschätzung beginnt für mich erst dort, wo aus „Das hat eben funktioniert“ die Behauptung „Ich beherrsche den Prozess“ wird. Der Abstand zwischen diesen Sätzen ist klein genug für ein Profilbanner und groß genug für ein Qualitätsproblem.

Der Praxistest für das eigene Urteil

Testet nicht, ob ihr eine beeindruckende Antwort hervorlocken könnt. Testet, ob ihr vorher sagen könnt, woran eine schlechte Antwort scheitern würde. Das ist der Unterschied zwischen Applaus nach der Vorführung und einer Abnahme vor dem Einsatz. Gerade in Teams ist dieser Schritt unbequem: Er macht Erwartungen sichtbar, die sonst erst nach der Veröffentlichung als Kritik auftauchen.

Ein Test ohne Ehrfurcht vor dem Chatfenster

Nehmt als Beispiel einen KI-Entwurf für einen LinkedIn-Post zu einem technischen Produkt. Bevor ihr das Modell öffnet, schreibt auf, welche Aussage fachlich korrekt sein muss, welche Zielgruppe ihr meint und woran der Ton scheitern würde. Erst danach lasst ihr mehrere Varianten entstehen. So bewertet ihr nicht bloß, welche Fassung euch spontan am meisten schmeichelt.

  • Formuliert drei überprüfbare Anforderungen und zwei klare Ausschlusskriterien.
  • Erstellt mehrere Antworten mit derselben Aufgabe und bewahrt auch die misslungenen auf.
  • Prüft Tatsachen unabhängig; lasst Fachkolleg*innen strittige Aussagen gegenlesen.
  • Ändert jeweils nur einen relevanten Teil der Anweisung und vergleicht erneut.
  • Notiert, ob die Verbesserung auch bei einer zweiten, ähnlichen Aufgabe trägt.

Wenn ihr dabei feststellt, dass euer Lieblingsprompt nur für das Vorzeige-Beispiel taugt, habt ihr etwas Wertvolles gelernt. Nicht, dass ihr schlecht seid. Sondern dass euer Urteil jetzt genauer ist. Genau diese nüchterne Korrektur fehlt in vielen KI-Demonstrationen: Gezeigt wird der Treffer, verschwunden sind die Versuche davor und die Fehler, die nach dem Screenshot noch auftauchen könnten.

Die Dokumentation zum Prompt-Optimizer empfiehlt ebenfalls, Optimierungen zu evaluieren und manuell zu prüfen, bevor sie produktiv genutzt werden. Dafür braucht ihr im Alltag kein Labor. Eine kleine Sammlung repräsentativer Aufgaben, klare Kriterien und ehrliches Gegenlesen bringen bereits Ordnung in die Frage, ob ein Prompt zuverlässig hilft.

Fazit: Misstraut eurem schönsten Ergebnis

Ich halte nichts davon, Anfänger*innen mit Dunning-Kruger-Witzen aus dem Raum zu lachen. Ich halte aber ebenso wenig davon, den ersten gelungenen Output zum Kompetenznachweis zu ernennen. Hebt bei eurem nächsten KI-Projekt deshalb gerade die Antworten auf, die ihr lieber löschen würdet. An ihnen seht ihr, ob ihr das Werkzeug steuert, seine Fehler erkennt und eure Methode verbessert. Der schönste Screenshot beweist wenig. Ein bestandener Gegencheck schon mehr.

Ähnliche Beiträge

Heidi Schönenberg-Hausdorf

Von: Heidi Schönenberg-Hausdorf

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Heidi Schönenberg-Hausdorf

Hallo

Ich bin Heidi. Offiziell von der IHK gekrönte Software-Hoheit und Social-Media-Maestra. In meiner Wall of Frames hängen Psychologie-­Expertise und frische KI-Zertifikate friedlich nebeneinander. Ich verstehe also Menschen und Maschinen – fragt sich nur, wer von beiden anstrengender ist.

Als Expertin im …

Alle Kategorien

Buy now or cry later

Social Media ist tot – von Heidi Schönenberg-Hausdorf

Von der selbsternannten Bestsellerautorin. Seit dem 15.Oktober 2017 in der Hinterhofkaschemme eures Vertrauens erhältlich.

Easter Egg

B A