Stand: 16. September 2026. Dieser Beitrag ist eine Einordnung aus der Praxis, keine Rechtsberatung.
Das Wichtigste in Kürze
- Artikel 4 knüpft KI-Kompetenz an Vorwissen und Einsatzkontext. Ein Lernmodul, das für Buchhaltung, Einkauf und Pflege identisch ist, kann diesen Bezug nicht herstellen.
- Zwischen Branchen unterscheiden sich Ausgangsmaterial, Fallhöhe eines Fehlers und die Betroffenen. Deshalb braucht jede Branche ihre eigene Fallaufgabe.
- Vergleichbar bleibt es trotzdem: Das Material wechselt, der Maßstab nicht. Bewertet werden überall dieselben vier Dimensionen.
Ein generisches E-Learning-Modul mit Abschlussquiz belegt, dass ein Modul abgeschlossen wurde. Es belegt nicht, ob dieselbe Person eine KI-Ausgabe im eigenen Arbeitskontext prüfen und korrigieren kann, etwa eine erfundene Normbezeichnung in einem Angebot erkennt. Artikel 4 der KI-Verordnung knüpft KI-Kompetenz ausdrücklich an Vorwissen, Einsatzkontext und die Personen, auf die ein KI-System angewendet wird; seit dem 2. August 2026 überwacht in Deutschland die Bundesnetzagentur die Einhaltung. Ein Modul, das für die Buchhaltung, den technischen Einkauf und die Pflegedienstleitung identisch ist, kann diesen Bezug nicht herstellen, weil es keine dieser Rollen kennt. Wie groß die Lücke ist, zeigt der Bitkom-Studienbericht 2026: Nur eine Minderheit der Unternehmen ab 20 Beschäftigten hat feste Regeln für den KI-Einsatz. Aussagekräftig wird ein Nachweis, wenn Mitarbeitende an einer Fallaufgabe aus ihrem eigenen Arbeitsalltag zeigen, wie sie mit KI arbeiten. Die Anforderungen dahinter ordnet unser Leitfaden zur KI-Kompetenz ein.
Was sich zwischen Branchen wirklich unterscheidet: Daten, Risiko, Betroffene
Dass KI-Programme enttäuschen, liegt selten am Modell. Laut der BCG-Studie „Where's the Value in AI?“ (Oktober 2024, 1.000 Führungskräfte in 59 Ländern) haben 74 % der Unternehmen noch keinen greifbaren Wert aus KI gezogen, und BCG empfiehlt, rund 70 % des Aufwands in Menschen und Prozesse zu stecken. Eine Fallaufgabe wird von drei Variablen geprägt: dem Ausgangsmaterial, der regulatorischen Fallhöhe einer falschen Antwort und der Frage, wer weiter unten in der Prozesskette betroffen ist. Im Maschinenbau liegen Zeichnungen und Prüfprotokolle auf dem Tisch, in der Steuerberatung Verträge und Bescheide. Dasselbe Sprachmodell trifft damit auf völlig unterschiedliche Prüfpflichten.
Wie ungleich die Ausgangslage ist, zeigt die Unternehmensbefragung der Bundesnetzagentur (808 Unternehmen, veröffentlicht Juli 2025): Bei wissensintensiven Dienstleistern setzen 50 % KI ein, im Handel 26 %, im Bau 16 %. Nach der ifo-Konjunkturumfrage vom Mai 2026 nutzen inzwischen 54,5 % der Unternehmen in Deutschland KI in ihren Geschäftsprozessen. Eine Fallaufgabe muss also nicht nur die Branche treffen, sondern auch den Stand, an dem eine Abteilung gerade ist.
Der Prompt ist der kleinste Unterschied zwischen den Branchen, die Prüfpflicht der größte. Ein fehlerhafter Textbaustein in einer internen Notiz kostet Zeit, eine falsche Toleranzangabe in einer Fertigungsfreigabe kostet Ausschuss, eine unbelegte Aussage in einer Mandantenauskunft kostet Haftung. Genau hier trennt sich Critical Oversight von reiner Bedienkompetenz: Mitarbeitende müssen wissen, an welcher Stelle ihres Ergebnisses ein Beleg zwingend ist und wo eine Plausibilitätsprüfung genügt. Wie wir Fallaufgaben entlang echter Arbeitsergebnisse aufbauen, zeigen wir unter Fallaufgaben.
Vier Branchen, vier Fallaufgaben
Maschinenbau: Fehleranalyse zu einer Reklamation mit Messprotokoll und Servicebericht
Typisches Fehlermuster
Die plausible KI-Ursache wird übernommen, ohne das Messprotokoll gegenzulesen (kritische Kontrolle)
Steuerberatung: Mandantenschreiben zu einem unklaren Sachverhalt
Typisches Fehlermuster
Ein erfundener Paragraf oder veralteter Rechtsstand, weil Akte und Stichtag fehlen (fachlich geführtes Prompting)
Industrievertrieb: Antwort auf eine öffentliche Ausschreibung
Typisches Fehlermuster
Ein generischer Textbaustein, der Lose nicht trennt und ein Eignungskriterium übergeht
Personalwesen: Vorsortieren von Bewerbungen
Typisches Fehlermuster
Diskriminierende Filter und Bewerberdaten in einem nicht freigegebenen Werkzeug (strategischer Tool-Einsatz)
Maschinenbau: Eine Kundenreklamation zur Spindellagerung liegt unsortiert vor, mit Messprotokoll, Servicebericht und E-Mail-Verlauf. Die Aufgabe lautet, eine strukturierte Fehleranalyse für den Serviceleiter zu erstellen. Das Fehlermuster, das eine Führungskraft erkannt sehen will: Die KI liefert eine plausible Ursache, und der Mitarbeitende übernimmt sie, ohne das Messprotokoll gegenzulesen. Das ist Critical Oversight, und genau das misst eine Fallaufgabe. Wie viel in der Branche davon abhängt, hat die Studie von VDMA und Strategy& (April 2025, 247 Industrieunternehmen aus Deutschland, Österreich und der Schweiz) beziffert: 91 % der Unternehmen wollten 2025 in generative KI investieren, das Potenzial liegt bei 10,7 Prozentpunkten zusätzlicher Betriebsmarge, realisiert waren davon bislang 0,74 Prozentpunkte. Als einen der Hebel, diese Lücke zu schließen, nennt die Studie den Wandel der erforderlichen Kompetenzen.
Steuerberatung und Wirtschaftsprüfung: Ein Mandantenschreiben zu einem unklaren Sachverhalt soll entworfen werden. Das Risiko ist nicht schlechter Stil, sondern ein erfundener Paragraf oder ein veralteter Rechtsstand, souverän formuliert. Wer Mandantenakte, Stichtag und Prüfungsrahmen nicht in den Prompt gibt, scheitert an Domain-Steered Prompting. Die Bundessteuerberaterkammer hält in ihren FAQ zu KI fest: Steuerberater müssen KI-Ergebnisse kritisch bewerten, Kanzleiinhaber müssen aktiv für den Aufbau von KI-Kompetenz sorgen, und Mandantendaten gehören in der Regel nicht in öffentliche KI-Systeme. Laut DATEV-Seismograf (Juni 2025, 504 Kanzleien) setzen 25 % der Kanzleien generative KI regelmäßig ein, 2024 waren es 9 %.
Industrievertrieb: Eine öffentliche Ausschreibung liegt vor, Leistungsverzeichnis, Eignungskriterien, Fristen. Das typische Scheitern: ein generischer Textbaustein, der die Lose nicht trennt und ein Eignungskriterium übergeht. Ein Formfehler kostet hier nicht Qualität, sondern den Auftrag. Personalwesen: Bewerbungen sollen vorsortiert werden, ohne diskriminierende Abkürzungen. Das Fehlermuster ist doppelt, ein Prompt, der nach Lücken im Lebenslauf oder nach Namen filtert, und personenbezogene Daten, die in einem nicht freigegebenen Tool landen. Wie verbreitet das ist, zeigt die Studie von KPMG und University of Melbourne (2025, 48.340 Befragte in 47 Ländern): 48 % der Beschäftigten haben Unternehmensinformationen in öffentliche KI-Tools hochgeladen. Strategic Tool Use heißt hier vor allem: die richtige Umgebung wählen, bevor die erste Zeile getippt wird.
Dasselbe Muster wiederholt sich in Branchen, die hier nicht als Fallaufgabe ausgeführt sind. Bei den Banken stieg der Anteil mit generativer KI laut BaFin, „Risiken im Fokus 2026“ binnen weniger Monate von rund 40 % auf über 60 %; für KI-Systeme im direkten Zusammenhang mit einer regulierten Finanztätigkeit ist die BaFin zugleich Marktüberwachungsbehörde. In Arztpraxen kommt KI laut Bitkom und Hartmannbund (Mai 2025, 616 Ärztinnen und Ärzte) bei 15 % zum Einsatz, in Kliniken bei 18 %. In der öffentlichen Verwaltung nutzen nach dem ThemenRadar 2026 von Fraunhofer FOKUS und Behörden Spiegel nur noch 18 % der Beschäftigten generative KI gar nicht. Drei Branchen, drei Fallhöhen: Kreditentscheidung, Diagnose, Verwaltungsakt.
Die Konstante: vier Dimensionen, die überall gleich gemessen werden
Der gemeinsame Maßstab in jeder Branche
Strategischer Tool-Einsatz
War KI an dieser Stelle die richtige Wahl, und in der richtigen Umgebung?
Interaktionsqualität
Wurde der Dialog mit dem Modell zielgerichtet geführt?
Kritische Kontrolle
Wurden Ergebnisse geprüft statt übernommen?
Fachlich geführtes Prompting
Floss genug Fachwissen in die Anweisung?
Wer Fallaufgaben je Branche und Abteilung unterschiedlich zuschneidet, hört schnell den Einwand, am Ende sei nichts mehr vergleichbar. Unterschiedlich ist aber nur das Material, nicht der Maßstab. Bewertet werden immer dieselben vier Dimensionen. Ob jemand eine Reklamation zur Spindellagerung aufbereitet oder eine unklare Rechnungsabgrenzung prüft, die Fragen bleiben identisch: War der Einsatz eines KI-Werkzeugs an dieser Stelle die sinnvolle Entscheidung? Wurde der Dialog mit dem Modell zielgerichtet geführt? Wurden Ergebnisse geprüft statt übernommen? Ist genug Fachwissen in die Anweisung geflossen? Diese Trennung zwischen Inhalt und Maßstab macht es möglich, eine Fertigungsabteilung und ein Buchhaltungsteam in einem einzigen Nachweis nebeneinanderzustellen, bis hinunter auf die Frage, wo Critical Oversight schwach ausgeprägt ist und Schatten-KI deshalb ein reales Risiko bleibt. Ein Zertifikat verlangt dafür niemand: Die Europäische Kommission schreibt in ihren Fragen und Antworten zur KI-Kompetenz, dass sie interne Aufzeichnungen über Schulungen und andere Maßnahmen empfiehlt, warnt aber zugleich, dass ein bloßer Verweis auf die Gebrauchsanweisung wirkungslos bleiben kann.
Das Material wechselt mit der Branche, der Maßstab nicht. Deshalb lassen sich Fertigung und Buchhaltung in einem Nachweis nebeneinanderstellen.
Schatten-KI hat in jeder Branche ein anderes Gesicht
Wo genau verlassen unsere Daten eigentlich das Haus? Pauschal lässt sich das nicht beantworten, weil Schatten-KI kein einheitliches Phänomen ist. In der Konstruktion werden Lastenhefte in ein kostenloses Tool kopiert, im Backoffice landen Mandantendaten im privaten Chatverlauf, im Vertrieb sind es Preislisten und Angebotsentwürfe. Die Motive unterscheiden sich: Zeitdruck, fehlende Alternativen, Unklarheit darüber, was erlaubt ist. Das zweite Motiv ist messbar: Laut Bitkom (Oktober 2025, 604 Unternehmen ab 20 Beschäftigten) stellen nur 26 % der Unternehmen ihren Beschäftigten Zugang zu generativer KI bereit. Die Datenschutzkonferenz empfiehlt deshalb, betriebliche Accounts zu stellen und klare interne Weisungen zu dokumentieren, damit niemand mit dem privaten Konto arbeiten muss.
Deshalb wirkt ein einheitliches Verbot selten. Der KPMG-Vollbericht 2025 zeigt, dass der Umgang mit sensiblen Daten in öffentlichen KI-Tools in Organisationen mit einem Verbot generativer KI am häufigsten vorkommt; die Autoren folgern, dass Verbote ins Leere laufen können und klare Anleitung und Schulung nötig sind. Dazu passt der Bitkom-Studienbericht 2026, in dem fehlendes technisches Know-how und rechtliche Unklarheit die am häufigsten genannten Hürden sind. Wer nicht beurteilen kann, welche Eingabe unkritisch und welche heikel ist, entscheidet nach Gefühl. Wirksam wird die Gegenmaßnahme erst, wenn beides zusammenkommt: eine technische Umgebung, in der die Arbeit rechtssicher stattfinden kann, und Fallaufgaben, die den branchentypischen Grenzfall abbilden. Welche technischen Rahmenbedingungen dafür gelten, also EU-Hosting, Silo-Architektur und DSGVO-Konformität, sollten Sie klären, bevor die erste Fallaufgabe in die Abteilungen geht.
Coaching wirkt erst, wenn es die Sprache der Abteilung spricht
Vergleichen Sie zwei Rückmeldungen auf dieselbe schwache Bearbeitung. Die erste lautet: „Geben Sie mehr Kontext an und formulieren Sie Ihre Anweisung präziser.“ Die zweite lautet: „Sie haben das Messprotokoll nicht in den Prompt gegeben, deshalb bleibt die Ursachenhypothese unbelegt. Die Modellantwort muss außerdem gegen den Servicebericht geprüft werden, bevor sie an den Kunden geht.“ Beide Hinweise sind fachlich nicht falsch, aber nur der zweite verändert das Verhalten bei der nächsten Reklamation.
Hier liegt auch die Antwort auf den bekanntesten Einwand gegen KI-Programme: Laut der MIT-NANDA-Studie „The GenAI Divide“ (Juli 2025) sehen 95 % der Unternehmen trotz hoher Investitionen keinen messbaren Ertrag aus generativer KI, und die Autoren führen das nicht auf schwache Modelle zurück, sondern darauf, dass die Werkzeuge nicht lernen, sich nicht anpassen und nicht in die Abläufe integriert sind. Wer nur Lizenzen verteilt und Teilnahmequoten zählt, hat dem nichts entgegenzusetzen, weil nie erhoben wurde, wie gut vorher gearbeitet wurde. Wer dagegen dieselbe branchennahe Fallaufgabe vor dem Coaching und einige Wochen danach bearbeiten lässt, sieht die Veränderung in den vier Dimensionen. Genau diesen Ablauf, Abgabe, Beleg, Musterlösung, Tipp, zeigt die Seite zum Coaching.
Fazit: ein vergleichbarer Nachweis über Branchen hinweg
Die Frage nach dem Stand der KI-Kompetenz kommt heute aus mehreren Richtungen, etwa über den Lieferantenfragebogen eines Großkunden oder vom Wirtschaftsprüfer, zumal das Institut der Wirtschaftsprüfer empfiehlt, die Anforderungen des AI Act in bestehende Governance- und Compliance-Strukturen zu integrieren. Teilnahmelisten beantworten diese Frage nur zum Teil, weil sie wenig darüber sagen, wie gut mit Copilot oder ChatGPT tatsächlich gearbeitet wird. Diese Lücke verkleinern branchenspezifische Fallaufgaben: Die Aufgabe stammt aus dem Arbeitsalltag der jeweiligen Abteilung, bewertet wird sie entlang der immer gleichen vier Dimensionen.
Regulatorisch passt dieser Weg zur Maßnahmenpflicht nach Artikel 4, die seit dem Digital Omnibus kein bestimmtes Niveau, aber nachvollziehbare Maßnahmen verlangt; die Einzelheiten stehen in unserem Beitrag zu Geltungsbereich und Nachweis nach Artikel 4. Wo Ihr Unternehmen zwischen Teilnahmeliste und aussagekräftigem Nachweis steht, zeigt unser Selbstcheck mit 8 Fragen in 3 Minuten.
Drei Schritte für den Anfang
- Wählen Sie zwei Abteilungen mit täglicher KI-Nutzung und für jede ein echtes Arbeitsergebnis als Fallaufgabe, etwa eine Reklamation oder ein Mandantenschreiben.
- Legen Sie je Aufgabe fest, an welcher Stelle ein Beleg zwingend ist und wo eine Plausibilitätsprüfung genügt. Dort liegt das branchentypische Risiko.
- Bewerten Sie alle Abgaben entlang derselben vier Dimensionen und wiederholen Sie die Aufgabe nach dem Coaching. So entsteht ein vergleichbarer Nachweis.
Quellen
Alle Quellen mit direktem Link zum Original.
- AI Act Explorer, Artikel 4 KI-Kompetenz und Artikel 99 Sanktionen: konsolidierter Text nach der Omnibus-Änderung.
- Europäische Kommission, AI literacy Questions & Answers (Stand Juli 2026): kein Zertifikat nötig, interne Aufzeichnungen empfohlen, Aufsicht ab August 2026.
- Bundesnetzagentur, Pressemitteilung vom 29. Juli 2026 und BaFin, Pressemitteilung vom 29. Juli 2026: Zuständigkeiten der Marktüberwachung in Deutschland.
- Bitkom, Studienbericht „Künstliche Intelligenz in Deutschland“ 2026 (PDF): Regeln, Schulungen und Hemmnisse in Unternehmen ab 20 Beschäftigten.
- Bundesnetzagentur, „KI in Unternehmen: Einsatz, Ressourcen und Herausforderungen“ (Juli 2025, PDF): Branchensplits, Schwierigkeiten der Belegschaft, Kompetenzmaßnahmen.
- ifo Institut, Konjunkturumfrage Mai 2026: KI-Nutzung nach Branchen und Unternehmensgrößen.
- BCG, „Where's the Value in AI?“ (Oktober 2024): 74 % ohne greifbaren Wert, 70-20-10-Regel.
- VDMA und Strategy&, „GenAI im Maschinen- und Anlagenbau“ (April 2025, PDF): Margenpotenzial, Investitionsabsichten, Kompetenzwandel.
- Bundessteuerberaterkammer, FAQ „KI im steuerberatenden Berufsstand“ (Stand Januar 2026, PDF): Fortbildungspflicht, kritische Bewertung von KI-Ergebnissen, Mandantendaten.
- DATEV-Seismograf, 5. Welle (Juni 2025): KI-Nutzung und Hürden in 504 Steuerberatungskanzleien.
- KPMG und University of Melbourne, „Trust, attitudes and use of AI“ 2025 (Pressemitteilung) und Vollbericht (PDF): Datenuploads, Nutzung ohne Erlaubnis, Wirkung von Verboten.
- Bitkom, „Beschäftigte nutzen vermehrt Schatten-KI“ (Oktober 2025): Zugang zu generativer KI und private Tools in Unternehmen ab 20 Beschäftigten.
- Datenschutzkonferenz, Orientierungshilfe „KI und Datenschutz“ (Mai 2024, PDF): interne Weisungen, betriebliche Accounts.
- BaFin, „Risiken im Fokus 2026“, Trend Digitalisierung: generative KI bei Banken, aufsichtliche Erwartungen.
- Bitkom und Hartmannbund, „KI in fast jeder siebten Praxis“ (Mai 2025): KI-Einsatz in Praxen und Kliniken.
- Fraunhofer FOKUS und Behörden Spiegel, ThemenRadar 2026 (Wiedergabe bei Haufe): generative KI in der öffentlichen Verwaltung.
- MIT NANDA, „The GenAI Divide: State of AI in Business 2025“ (Wiedergabe): 95 % ohne messbaren Ertrag, These der Lernlücke. Originalbericht: MIT NANDA (PDF).
- Institut der Wirtschaftsprüfer, Knowledge Paper zum AI Act (August 2024): Integration in Governance, Compliance und Qualitätsmanagement.