Wer im Mittelstand nach laufenden KI-Anwendungen fragt, bekommt selten eine Liste, sondern zwei Antworten dicht nebeneinander. Die eine lautet: „Wir nutzen das täglich.“ Die andere, meist im selben Gespräch: „Und einmal haben wir es wieder abgeschaltet.“ Beide Sätze beschreiben dasselbe Haus, oft dieselbe Abteilung — und der Unterschied zwischen beiden liegt fast nie im Modell.
Cybersicherheit First!
Ihre IT-Sicherheit ist unsere oberste Priorität
Er liegt in der Frage, was mit dem Ergebnis passiert, bevor es wirkt. Dort, wo ein Mensch ohnehin hinsieht, weil er den Text unterschreibt, die Buchung freigibt oder die Auskunft weitergibt, laufen KI-Funktionen seit Jahren unauffällig. Dort, wo ein Ergebnis ungeprüft in einen nächsten Schritt fällt, entstehen die Abschaltungen. Diese Trennlinie ist schärfer als jede Branchen- oder Größenklasse — und sie ordnet die Anwendungsfälle besser als die Frage, welche Technologie dahintersteckt.
Tragfähige KI-Anwendungsfälle im Mittelstand sind heute vor allem: Texte entwerfen und umformulieren, Dokumente einlesen und Felder erkennen, Eingänge vorsortieren und zuordnen, sowie Auskunft aus den eigenen Dokumenten mit Angabe der Fundstelle. Alle vier haben dasselbe Merkmal — eine Person oder eine Regel prüft das Ergebnis, bevor es wirkt. Noch nicht tragfähig sind Rechnen und Fortschreiben ohne Gegenprobe, Entscheidungen mit rechtlicher Außenwirkung und Abläufe, die niemand im Haus vollständig beschreiben kann. Laut Statistischem Bundesamt nutzten 2025 26 Prozent der Unternehmen ab zehn Beschäftigten KI, bei 10 bis 49 Beschäftigten waren es 23 Prozent.
Was die Erhebungen zeigen — und warum ihre Zahlen auseinandergehen
Vier belastbare Quellen messen die KI-Nutzung deutscher Unternehmen, und sie kommen auf vier verschiedene Werte. Das Statistische Bundesamt weist für 2025 26 Prozent aus (Stand der Tabelle: 24. November 2025), gestaffelt nach Größe: 23 Prozent bei 10 bis 49 Beschäftigten, 36 Prozent bei 50 bis 249, 57 Prozent ab 250. KfW Research kommt über das Mittelstandspanel auf 20 Prozent für den Zeitraum 2022 bis 2024 — knapp 780.000 Unternehmen, gegenüber 4 Prozent in den Jahren 2016 bis 2018.
Der Bitkom meldete am 15. September 2025 auf Basis einer Befragung von 604 Unternehmen ab 20 Beschäftigten 36 Prozent, nach 20 Prozent im Vorjahr. Das ifo-Institut wiederum zählte in seiner Konjunkturumfrage vom Mai 2026 54,5 Prozent, nach 40,9 Prozent im Jahr zuvor.
Die Spanne ist kein Widerspruch, sondern eine Folge unterschiedlicher Grundgesamtheiten und Fragestellungen: Die KfW zählt auch Kleinstbetriebe unter fünf Beschäftigten mit, Destatis erfasst Unternehmen ab zehn, der Bitkom ab zwanzig, und das ifo fragt nach dem Einsatz in Geschäftsprozessen ohne Größenuntergrenze der Erhebung. Wer eine Zahl zitiert, sollte deshalb immer den Zuschnitt mitliefern. Gemeinsam ist allen vier Reihen nur die Richtung — und der stabile Größeneffekt.

Der gemeinsame Nenner der tragfähigen Fälle
Sortiert man die laufenden Anwendungen nicht nach Technologie, sondern nach ihrem Platz im Arbeitsablauf, entsteht ein klares Muster. Die Fälle, die sich halten, sitzen vor einem Schritt, den ohnehin ein Mensch ausführt. Das Modell liefert einen Entwurf, eine Zuordnung oder einen Fundstellenverweis; die Person, die ohnehin das Ergebnis verantwortet, sieht es an und entscheidet.
Damit ist die Prüfstelle keine zusätzliche Kontrollschleife, sondern ein Schritt, der vorher schon existierte. Genau das erklärt, warum diese Fälle keine Akzeptanzprobleme haben: Es kommt keine Arbeit hinzu, es fällt welche weg. Wo dagegen eine Prüfstelle erst neu eingebaut werden müsste, wird sie erfahrungsgemäß nicht eingebaut — und der Anwendungsfall kippt.
Die Konsequenz für die Auswahl ist unbequem, aber brauchbar: Nicht die Frage „Kann das Modell das?“ entscheidet über die Tragfähigkeit, sondern die Frage „Wer sieht das Ergebnis, bevor es wirkt, und woran erkennt diese Person einen Fehler?“. Lässt sich die zweite Frage nicht mit einem Namen und einem Kriterium beantworten, ist der Fall unabhängig von der Modellqualität nicht reif.
Trägt: Texte entwerfen und umformulieren
Die verbreitetste Klasse ist zugleich die unspektakulärste. Nach Destatis nutzten 2025 52 Prozent der KI-anwendenden Unternehmen Text Mining und ebenfalls 52 Prozent die Erzeugung von Bildern, Videos oder Ton; 35 Prozent erzeugen natürliche Sprache einschließlich Programmcode. Der Bitkom verortet den Einsatz zu 88 Prozent im Kundenkontakt und zu 57 Prozent in Marketing und Kommunikation.
Diese Fälle tragen, weil der Prüfpfad trivial ist: Wer eine Antwortmail verschickt, liest sie. Wer ein Angebot unterschreibt, sieht die Positionen an. Der Zeitgewinn entsteht nicht durch Wegfall der Prüfung, sondern durch Wegfall des leeren Blattes. Belastbare Einsparungen lassen sich hier nicht seriös in Prozent angeben — die Bandbreite je nach Textsorte ist zu groß.
Trägt: Dokumente einlesen und Felder erkennen
Belege, Lieferscheine und Frachtpapiere in Zahlen zu übersetzen, ist der Fall mit dem klarsten Nutzen und der klarsten Prüflogik. Erkannt werden Beträge, Positionen, Nummern und Daten; geprüft wird nicht durch erneutes Lesen, sondern durch Abgleich gegen vorhandene Stammdaten. Passt die Kundennummer nicht zum Namen, stimmt die Summe der Positionen nicht mit dem Rechnungsbetrag überein, existiert die Bestellnummer nicht — dann geht der Vorgang an einen Menschen.
Technisch ist das weniger eine Modellfrage als eine Anbindungsfrage. Entwicklungspartner wie das Hamburger Kaido Studios bauen deshalb KI-Anwendungen, die an bestehende Systeme andocken: ERP, Warenwirtschaft und Dokumentenablage bleiben führend, und die Gegenprobe läuft gegen deren Datenbestand. Für die meisten KI-Anwendungsfälle im Mittelstand entscheidet genau dieser Zugriff über die Trefferquote — ein Modell ohne Kenntnis der eigenen Stammdaten kann eine Zuordnung nur raten.
Trägt: Vorsortieren, zuordnen, weiterleiten
Eingehende Anfragen einer Kategorie, einer Zuständigkeit oder einer Priorität zuzuordnen, ist der stillste der tragfähigen Fälle. Die Prüfstelle ist hier eingebaut, ohne dass jemand sie einrichten müsste: Der Empfänger sieht die Zuordnung im Moment der Bearbeitung und korrigiert sie, wenn sie falsch ist. Eine falsche Zuordnung kostet einen Klick, keinen Schaden.
Diese Fehlertoleranz ist das eigentliche Auswahlkriterium. Anwendungsfälle, bei denen ein Fehler spätestens im nächsten Arbeitsschritt auffällt, vertragen Modellfehler; Fälle, in denen ein Fehler monatelang unbemerkt bliebe, vertragen sie nicht. Nach Destatis nutzen 27 Prozent der KI-anwendenden Unternehmen die Automatisierung von Arbeitsabläufen oder Entscheidungsfindung — der Begriff umfasst allerdings beides, das harmlose Sortieren und das riskante Entscheiden.
Trägt bedingt: Auskunft aus den eigenen Dokumenten
Firmenwissen durchsuchbar zu machen — Verträge, Handbücher, Protokolle — ist der Fall mit dem größten Zuspruch und der größten Enttäuschungsquote. Er trägt, wenn jede Antwort die Fundstelle mitliefert und der Lesende sie öffnen kann. Er trägt nicht, wenn die Antwort ohne Beleg erscheint, denn dann fehlt der Prüfstelle das Prüfmittel.
Wie groß der Unterschied ist, zeigt die von der Europäischen Rundfunkunion koordinierte Untersuchung „News Integrity in AI Assistants“ vom Oktober 2025: In 45 Prozent der geprüften Antworten fand sich mindestens ein erheblicher Mangel, in 31 Prozent lagen ernste Probleme bei den Quellenangaben vor — fehlende, irreführende oder falsche Belege. Die Untersuchung betraf Nachrichteninhalte, nicht Firmendokumente. Die Lehre überträgt sich trotzdem: Eine Antwort ohne nachprüfbare Fundstelle ist im Unternehmenseinsatz kein Ergebnis, sondern ein Vorschlag.

Die Klassen im Überblick
| Klasse | Was das System liefert | Wer prüft, bevor es wirkt | Reifegrad |
|---|---|---|---|
| Texte entwerfen und umformulieren | Rohfassung für Angebot, Bericht, Antwort | die Person, die den Text verantwortet — Schritt existiert bereits | trägt |
| Dokumente einlesen, Felder erkennen | Beträge, Positionen, Nummern, Daten aus PDF und Scan | Abgleich gegen Stammdaten; Zweifelsfälle an einen Menschen | trägt |
| Vorsortieren und zuordnen | Kategorie, Zuständigkeit, Priorität | Empfänger korrigiert die Zuordnung im Arbeitsschritt | trägt |
| Transkribieren und übersetzen | Protokoll, Untertitel, fremdsprachige Fassung | fachliche Durchsicht vor Weitergabe | trägt |
| Auskunft aus eigenen Dokumenten | Antwort mit Verweis auf die Fundstelle | Lesender öffnet die genannte Stelle — nur dann belastbar | trägt bedingt |
| Rechnen, buchen, fortschreiben | Summen, Salden, Hochrechnungen | keine wirksame — Rechenwege sind nicht nachvollziehbar | trägt nicht (Regel statt Modell) |
| Entscheidungen mit Außenwirkung | Preiszusage, Ablehnung, Kündigung | rechtlich zwingend ein Mensch, oft mit Begründungspflicht | trägt nicht |
| Abläufe ohne beschreibbare Regeln | Vorschlag ohne prüfbares Sollergebnis | niemand — es fehlt der Maßstab für „richtig“ | trägt nicht |
Was noch nicht trägt — und woran es liegt
Die drei unteren Zeilen der Tabelle scheitern aus drei verschiedenen Gründen, und keiner davon verschwindet mit dem nächsten Modell. Beim Rechnen liegt der Grund in der Bauart: Ein Sprachmodell erzeugt eine plausible Zeichenfolge, keinen nachvollziehbaren Rechenweg. Summen, Salden und Schwellenwerte gehören deshalb in Programmcode, dessen Ergebnis reproduzierbar ist — das Modell darf die Eingangsdaten aufbereiten, nicht das Ergebnis erzeugen.
Bei Entscheidungen mit Außenwirkung liegt der Grund im Recht: Eine Preiszusage, eine Kündigung oder eine Ablehnung bindet das Unternehmen gegenüber Dritten. Wer sie automatisiert, verlagert Haftung auf einen Prozess, der im Streitfall nicht erklären kann, warum er so entschieden hat.
Beim dritten Muster liegt der Grund in der Organisation. Ein Ablauf, den niemand vollständig beschreiben kann — weil eine einzelne Person die Ausnahmen im Kopf hat —, liefert keinen Maßstab, an dem sich ein Ergebnis messen ließe. Solche Fälle sind keine KI-Aufgaben, sondern Dokumentationsaufgaben. Sie werden erst danach zu Anwendungsfällen.
Die Prüfstelle ist keine Notlösung — sie ist Vorschrift
Was in tragfähigen Anwendungsfällen aus praktischen Gründen entsteht, schreibt die europäische KI-Verordnung für Hochrisiko-Systeme ausdrücklich vor. Artikel 14 der Verordnung (EU) 2024/1689 verlangt, dass solche Systeme so gebaut sind, dass natürliche Personen sie wirksam beaufsichtigen können. Absatz 4 zählt auf, was die aufsichtführende Person können muss: Fähigkeiten und Grenzen des Systems verstehen, Anomalien erkennen, die Ausgabe richtig interpretieren, sie außer Kraft setzen oder rückgängig machen — und den Betrieb über eine Stopptaste unterbrechen.
Bemerkenswert ist ein weiterer Punkt derselben Vorschrift, weil er ein psychologisches Problem benennt, das jeden Anwendungsfall betrifft, nicht nur Hochrisiko-Systeme:
„… sich einer möglichen Neigung zu einem automatischen oder übermäßigen Vertrauen in die von einem Hochrisiko-KI-System hervorgebrachte Ausgabe (‚Automatisierungsbias‘) bewusst zu bleiben, insbesondere wenn Hochrisiko-KI-Systeme Informationen oder Empfehlungen ausgeben, auf deren Grundlage natürliche Personen Entscheidungen treffen.“
Komplettservice
EDV & Telefonie aus einer Hand
Angebot anfordern:✉️ info@it-support-hamburg-24x7.de
Verordnung (EU) 2024/1689 über künstliche Intelligenz, Artikel 14 Absatz 4 Buchstabe b
Für die Auswahl von Anwendungsfällen heißt das: Eine Prüfstelle, die auf Zustimmen ausgelegt ist — ein Häkchen, das man setzt, um weiterzukommen —, ist keine. Wirksam ist sie erst, wenn die prüfende Person ein eigenes Kriterium hat, an dem sie den Vorschlag messen kann. Bei der Belegerkennung ist das der Stammdatenabgleich, bei der Dokumentenauskunft die Fundstelle, beim Textentwurf der Sachverhalt, den die Person selbst kennt.
Was Unternehmen tatsächlich aufhält
Die Hürden, die Unternehmen selbst nennen, sind überwiegend keine technischen. Nach der Destatis-Tabelle zu den Gründen gegen die Nutzung (Bezugsjahr 2025) nennen unter den Unternehmen, die KI erwogen, aber nicht eingeführt haben, 72 Prozent fehlendes Wissen, 62 Prozent Unklarheit über rechtliche Folgen, 60 Prozent Datenschutzbedenken, 45 Prozent Inkompatibilität mit dem vorhandenen Bestand an Geräten und Software und 44 Prozent Schwierigkeiten mit Verfügbarkeit oder Qualität der Daten. Zu hohe Kosten nennen 32 Prozent — der Preis steht also nicht an erster Stelle.
Die Bitkom-Erhebung vom September 2025 kommt zu einem ähnlichen Bild: je 53 Prozent rechtliche Unklarheiten und fehlendes technisches Know-how, 51 Prozent fehlende personelle Ressourcen, 38 Prozent mangelnde Nachvollziehbarkeit der Ergebnisse, 36 Prozent schlechte Ergebnisqualität. Bemerkenswert ist die Verteilung der Anwendungen: 24 Prozent der KI-nutzenden Unternehmen setzen genau eine Anwendung ein, 27 Prozent zwei, 24 Prozent drei — fünf oder mehr nur 2 Prozent. KI im Mittelstand ist damit kein Programm, sondern eine Handvoll einzelner Fälle.
Wie sich ein Anwendungsfall vorab prüfen lässt
Die Auswahl lässt sich ohne Werkzeug und ohne Anbietergespräch vornehmen. Fünf Fragen genügen, und sie sind bewusst in dieser Reihenfolge gestellt: Die ersten beiden schließen die meisten unreifen Fälle aus, bevor Aufwand entsteht.
- Wer sieht das Ergebnis, bevor es wirkt? Fällt hier kein Name, existiert keine Prüfstelle — der Fall ist unabhängig vom Modell nicht reif.
- Woran erkennt diese Person einen Fehler? Es braucht ein Kriterium außerhalb des Modells: ein Stammdatum, eine Fundstelle, eine Summe, die stimmen muss.
- Wie oft kommt der Fall vor? Was mindestens wöchentlich anfällt, rechtfertigt Einrichtung und Pflege. Was ein paarmal im Jahr vorkommt, nicht.
- Wann fällt ein Fehler auf? Im nächsten Arbeitsschritt ist unkritisch, nach Monaten nicht. Diese Frage entscheidet über die zulässige Fehlertoleranz.
- Liegen die Daten in einem System? Was nur in Köpfen und Einzeltabellen existiert, ist zuerst eine Aufgabe für Dokumentation und Stammdatenpflege.
Wer diese fünf Fragen auf die eigenen Abläufe anwendet, landet meist bei zwei bis drei Fällen — und damit ziemlich genau bei dem, was die Bitkom-Zahlen zur Zahl der eingesetzten Anwendungen ohnehin zeigen. Das ist kein Rückstand gegenüber größeren Häusern, sondern eine sinnvolle Größenordnung.

Häufige Fragen
Welche KI-Anwendungsfälle funktionieren im Mittelstand am zuverlässigsten?
Vier Klassen: Texte entwerfen und umformulieren, Dokumente einlesen und Felder erkennen, Eingänge vorsortieren und zuordnen sowie Auskunft aus eigenen Dokumenten mit Angabe der Fundstelle. Alle vier haben eine Prüfstelle, die im Arbeitsablauf bereits vorhanden ist — die Person, die den Text verantwortet, die Buchung freigibt oder den Vorgang bearbeitet.
Wie viele mittelständische Unternehmen nutzen überhaupt KI?
Das hängt vom Zuschnitt der Erhebung ab. Das Statistische Bundesamt weist für 2025 26 Prozent aller Unternehmen ab zehn Beschäftigten aus, davon 23 Prozent bei 10 bis 49 und 36 Prozent bei 50 bis 249 Beschäftigten. KfW Research kommt für 2022 bis 2024 auf 20 Prozent des Mittelstands einschließlich Kleinstbetrieben, der Bitkom im September 2025 auf 36 Prozent bei Unternehmen ab 20 Beschäftigten.
Was verlangt der EU AI Act konkret an menschlicher Aufsicht?
Artikel 14 der Verordnung (EU) 2024/1689 gilt für Hochrisiko-KI-Systeme und verlangt, dass natürliche Personen sie wirksam beaufsichtigen können. Sie müssen Fähigkeiten und Grenzen des Systems verstehen, Anomalien erkennen, die Ausgabe interpretieren, sie außer Kraft setzen oder rückgängig machen und den Betrieb über eine Stopptaste unterbrechen können. Absatz 5 verlangt für bestimmte biometrische Systeme sogar die getrennte Bestätigung durch zwei Personen.
Woran erkennt man einen Anwendungsfall, der nicht trägt?
An drei Mustern: Das Ergebnis ist eine Zahl, die gerechnet statt geschätzt werden muss. Das Ergebnis hat rechtliche Wirkung nach außen, etwa eine Preiszusage oder eine Ablehnung. Oder der Ablauf lässt sich im Haus nicht vollständig beschreiben, weil die Ausnahmen nur eine einzelne Person kennt. In allen drei Fällen fehlt der Maßstab, an dem sich ein Ergebnis prüfen ließe.
Muss wirklich jedes KI-Ergebnis von Hand geprüft werden?
Nein — geprüft werden muss, was wirkt. Prüfung heißt auch nicht zwangsläufig Lesen: Ein automatischer Abgleich gegen Stammdaten ist eine Prüfung, die nur die Zweifelsfälle an einen Menschen weiterreicht. Entscheidend ist, dass es überhaupt ein Kriterium außerhalb des Modells gibt. Eine Bestätigung per Häkchen ohne eigenes Kriterium erfüllt diese Funktion nicht.
Quellen
- Statistisches Bundesamt — KI-Nutzung nach Beschäftigtengrößenklassen, Berichtsjahr 2025 — Nutzungsquoten und Verteilung der Technologiearten
- Statistisches Bundesamt — Gründe gegen die Nutzung von KI-Technologien, 2025 — die genannten Hürden im Größenklassenvergleich
- KfW Research — Sonderauswertung des KfW-Mittelstandspanels — Zeitreihe 2016–2018 gegen 2022–2024, Branchen- und FuE-Unterschiede
- Bitkom — Befragung von 604 Unternehmen ab 20 Beschäftigten, 15.09.2025 — Einsatzfelder, Zahl der Anwendungen je Unternehmen, Hemmnisse
- Verordnung (EU) 2024/1689, Artikel 14 — Menschliche Aufsicht — Anforderungen an Aufsichtsfähigkeit, Automatisierungsbias und Stopptaste
- EBU/BBC — „News Integrity in AI Assistants“, Oktober 2025 — Fehler- und Quellenprobleme in Antworten von KI-Assistenten


