Ein Quiz nach der KI-Schulung beantwortet eine Frage zuverlässig: ob jemand die Begriffe kennt. Die Frage, die ein Unternehmen stellt, lautet anders. Setzt diese Person KI in ihrer Arbeit gut ein, wenn niemand zusieht und die Aufgabe nicht nach Lehrbuch aussieht? Zwischen beiden Fragen liegt der Unterschied zwischen Wissen und Verhalten, und er ist vermessen.
Das Quiz ist kein nutzloses Werkzeug. Es ist das Werkzeug für die falsche Frage. Genau deshalb wird es so oft eingesetzt: Es ist schnell gebaut, leicht auszuwerten und liefert ein Zertifikat für die Personalakte.
23 %
schlechter schnitten Berater mit KI bei einer Aufgabe außerhalb der Stärken des Modells ab als Kollegen ohne KI, obwohl sie vorher gewarnt worden waren.
Das Feldexperiment von Dell'Acqua und Kollegen2 zeigt, wie groß der Abstand ist. Bei Aufgaben innerhalb der Stärken des Modells lieferten dieselben Berater deutlich bessere Qualität. Die Autoren fassen es so zusammen: Menschen misstrauen der KI dort, wo sie stark ist, und vertrauen ihr zu sehr dort, wo sie schwach ist. Wissen über KI hat davor nicht geschützt.
Was misst ein Quiz, und was nicht?
Ein Quiz prüft, ob jemand einen Begriff wiedererkennt oder eine Definition gelernt hat: Was ist ein Prompt, was ein Kontextfenster, wann halluziniert ein Modell. Als Lernwerkzeug ist das sogar nützlich. Roediger und Karpicke1 zeigten, dass Abruftests Gelerntes besser verankern als wiederholtes Lesen. Nur ist Lernen nicht das Ziel, sondern der Weg. Das Kirkpatrick-Modell3 unterscheidet vier Ebenen, und das Quiz endet auf der zweiten.
Die vier Ebenen nach Kirkpatrick
Reaktion
Wie zufrieden die Teilnehmenden mit der Schulung waren.
Lernen
Begriffe, Regeln, Definitionen. Hier endet das Quiz.
Verhalten
Ob KI im Alltag für die richtige Aufgabe eingesetzt, geprüft und gesteuert wird.
Ergebnis
Zeit, Qualität, Fehler. Folgt aus der dritten Ebene.
KI-Kompetenz im Sinne des Unternehmens ist die dritte Ebene: beobachtbares Verhalten. Wird KI für die richtigen Teilaufgaben eingesetzt, und bewusst nicht dort, wo sie schadet? Wird die Ausgabe geprüft und eingeordnet, statt ungeprüft übernommen? Fließt eigenes Fachwissen erkennbar in die Steuerung ein? Keine dieser Fragen lässt sich mit Multiple Choice beantworten.
Wie macht eine Fallaufgabe den Unterschied sichtbar?
Deshalb arbeitet Proveo mit realistischen Fallaufgaben aus dem eigenen Arbeitsbereich statt mit Quizfragen. Mitarbeitende bearbeiten eine Aufgabe, etwa eine Kundenanfrage oder eine Angebotserstellung, in einem Workspace mit Editor und KI-Chat, genau wie im Alltag. Bewertet wird nicht das Ergebnis allein, sondern der Weg dorthin, entlang von vier Dimensionen: strategischer Tool-Einsatz, Interaktionsqualität, kritische Kontrolle und fachlich geführtes Prompting.
Ein Beispiel: dieselbe Person, zwei Ergebnisse
Stellen Sie sich eine Vertriebsmitarbeiterin vor, die das Quiz zu KI-Grundlagen mit voller Punktzahl besteht. Sie weiß, dass Sprachmodelle Fakten erfinden können, und kreuzt richtig an, dass Ausgaben vor dem Versand zu prüfen sind.
In der Fallaufgabe soll sie ein Angebot auf eine Kundenanfrage vorbereiten. Sie lässt das Modell einen Entwurf schreiben und gleicht die Preise korrekt mit der Liste ab. Die Lieferzeit von zehn Tagen, die in keinem Dokument steht, übernimmt sie jedoch, und die Sonderbedingung aus der Anfrage fehlt im Angebot.
Das Wissen war vorhanden, angewendet wurde es nur zum Teil. Das Quiz hätte ihr ein Zertifikat ausgestellt; die Fallaufgabe zeigt, wo das Coaching ansetzt: beim Abgleich jeder Zusage mit den Unterlagen.
Probieren Sie den Unterschied aus
1. Die Quizfrage
Was sollten Sie tun, bevor ein KI-Entwurf an einen Kunden geht?
2. Die Aufgabe
Die Kundenanfrage: 200 Stück Dichtung D-40, Lieferung bis 15. Oktober, Zahlung 30 Tage netto. Preis laut Liste: 4,80 Euro je Stück. Unten der KI-Entwurf. Welcher Satz sollte so nicht an den Kunden gehen?
Wofür bleibt ein Quiz sinnvoll?
Ein Quiz bleibt als Lernwerkzeug nützlich, etwa um Grundbegriffe nach einer Einführung zu festigen. Als Grundlage für Entscheidungen über Coaching, Budget oder den Nachweis reicht ein Wissensstand aber selten aus. Wie Umfrage, Quiz und Fallaufgabe im Vergleich abschneiden und sich kombinieren lassen, zeigt unser Beitrag KI-Kompetenz messen; was Teilnahmeliste und Zertifikat als Nachweis leisten, steht unter KI-Kompetenz nachweisen.
Fazit
Ein Quiz ist schnell gebaut und leicht auszuwerten. Genau deshalb wird es so oft eingesetzt, und genau deshalb wird es oft für eine Frage eingesetzt, die es nicht beantworten kann. Wer wissen will, wie kompetent ein Team mit KI arbeitet, erfährt mehr aus realistischen Arbeitsaufgaben als aus der Beantwortung von Definitionen.
Quellen
Methode, Stichprobe und weitere Zahlen lassen sich je Quelle aufklappen.
- Roediger und Karpicke, „Test-enhanced learning“, Psychological Science, 2006. ↩
Methode und Zahlen
Laborstudien mit Studierenden: Ein Abruftest verankerte den Stoff nach zwei Tagen und nach einer Woche deutlich besser als wiederholtes Lesen, obwohl das Wiederlesen das Gefühl von Sicherheit stärker steigerte.
- Dell'Acqua et al., „Navigating the Jagged Technological Frontier“, Harvard Business School / BCG, 2023. ↩
Methode und Zahlen
Feldexperiment mit 758 Beratern. Bei Aufgaben innerhalb der Fähigkeiten von GPT-4 rund 40 % bessere Qualität, bei einer Aufgabe knapp außerhalb 23 % schlechter als die Kontrollgruppe ohne KI.
- Kirkpatrick Partners, „The Kirkpatrick Model“. ↩
Methode und Zahlen
Die vier Ebenen der Wirkungsmessung von Weiterbildung: Reaktion, Lernen, Verhalten, Ergebnisse.