Daten aus PDFs mit KI extrahieren: wie man das Gelesene überprüft
Variable Dokumente in kontrollierbare Daten verwandeln, bevor sie in Systeme eingetragen werden.
SqualiOnline Redaktion · 2026-09-07
Ein System, das eine Rechnung liest und zehn ausgefüllte Felder liefert, macht einen guten Eindruck. Das Problem kommt später: Wie erkennt man bei zweitausend Dokumenten, welche zehn Felder falsch sind? Die automatische Extraktion wird nicht an der gelungenen Vorführung gemessen, sondern daran, was passiert, wenn sie lautlos falschliegt. Dieser Leitfaden dient dazu, die Kontrollen zu entwerfen, bevor diese Daten irgendwo eingetragen werden.
Erst die Felder, dann das Werkzeug
Die erste Entscheidung ist nicht technischer Natur: Es ist die Liste der benötigten Felder, mit Format und Regel für jedes davon, aufgeschrieben, bevor irgendein Werkzeug ausprobiert wird.
- Welche Felder. Nicht „alles, was im Dokument steht“: nur die Felder, die jemand tatsächlich nutzt. Jedes extrahierte Feld ist ein zu kontrollierendes Feld.
- Welches Format. Ein Datum ist ein genauer Tag, keine Textzeile; ein Betrag hat eine Währung und Dezimalstellen; ein Code hat eine Länge. Ohne Format gibt es keine automatische Kontrolle.
- Welche Dokumente zulässig sind. Eine von einem anderen System erzeugte Datei liest sich auf eine Weise, der schief gescannte gestempelte Bogen ist ein anderes Problem. „Wir akzeptieren alles“ zu sagen bedeutet, keine Qualitätsschwelle zu haben.
- Was zu tun ist, wenn ein Feld fehlt. Das ist der häufigste und am wenigsten durchdachte Fall: Das Dokument ist gültig, aber dieser Wert taucht nicht auf. Die Antwort darf kein aus dem Gefühl heraus rekonstruierter Wert sein.
Lässt sich diese Liste nicht aufstellen, liegt das Problem nicht bei der künstlichen Intelligenz: Der nachgelagerte Prozess ist nicht definiert, und niemand weiß, was mit den Daten geschehen soll.
Drei unterschiedliche Vorgänge, die „Lesen“ genannt werden
Im selben Satz werden drei Dinge vermischt, die auf unterschiedliche Weise falschliegen und auf unterschiedliche Weise überprüft werden müssen.
- Die Texterkennung: ein Bild in Zeichen umwandeln. Hier sind die Fehler materieller Art – eine als Drei gelesene Acht, eine durch die Knickfalte des Blatts abgeschnittene Zeile, ein Teil außerhalb des Bildausschnitts. Ein digital entstandenes Dokument überspringt diesen Schritt und ist deutlich zuverlässiger.
- Die Extraktion: entscheiden, welche der vorhandenen Zahlen der Gesamtbetrag ist und welches der drei Daten das Ausstellungsdatum ist. Hier sind die Fehler Interpretationsfehler, und sie sind die gefährlichsten, weil das Ergebnis immer plausibel wirkt.
- Die Kontrolle: feststellen, ob der extrahierte Wert mit dem Rest übereinstimmt. Das ist der einzige der drei Schritte, der bemerken kann, dass etwas nicht stimmt, und der, den fast niemand einplant.
Ein System, das den dritten Schritt überspringt, ist nicht automatisiert: Es hat die Kontrolle nur auf denjenigen verlagert, der die Daten empfängt, ohne es ihm zu sagen.
Die Feldtabelle
Das nützlichste Projektdokument ist eine Tabelle mit einer Zeile pro Feld. Ein Beispiel anhand einer von einem Lieferanten erhaltenen Rechnung.
| Feld | Wo es steht | Kontrolle | Wenn die Kontrolle fehlschlägt |
|---|---|---|---|
| Lieferant | Kopfzeile | Die USt-IdNr. existiert im Stammdatensatz | Zur Prüfung, mit Vorschlag für neuen Lieferanten |
| Belegnummer | Kopfzeile | Liegt für denselben Lieferanten noch nicht vor | Gesperrt: möglicherweise doppelt |
| Datum | Kopfzeile | Ist ein gültiges, nicht in der Zukunft liegendes Datum | Zur Prüfung |
| Nettobetrag | Zusammenfassung | Summe der Positionen, mit Rundungstoleranz | Zur Prüfung, mit hervorgehobener Differenz |
| Steuer | Zusammenfassung | Stimmig mit Nettobetrag und angegebenen Steuersätzen | Zur Prüfung |
| Gesamtbetrag | Zusammenfassung | Entspricht Nettobetrag plus Steuer | Gesperrt: Dokument stimmt nicht |
| Bestellreferenz | Text oder Anmerkungen | Entspricht einer offenen Bestellung | Läuft markiert weiter, ohne Referenz |
Die letzten beiden Spalten sind der eigentliche Leitfaden. Ein Feld ohne Kontrolle und ohne festgelegtes Ziel im Fehlerfall ist ein Feld, das niemand je überprüfen wird.
Die Kontrollen, die man von Hand festlegt
Die nützlichen Kontrollen sind nicht statistischer Natur: Sie sind rechnerisch und stammdatenbezogen, und genau deshalb zuverlässig.
- Innere Konsistenz: Die Summen stimmen, die Positionen addieren sich, die Prozentsätze lassen sich nachrechnen.
- Übereinstimmung mit dem bereits Bekannten: Der Lieferant existiert, die Bestellnummer existiert, dieser Kunde hat wirklich diesen Standort.
- Plausibilität: ein Datum aus dem vorigen Jahrhundert, ein um drei Größenordnungen zu hoher Betrag, eine negative Menge, wo das nicht sein kann.
- Duplikate: Dasselbe zweimal hochgeladene Dokument ist ein häufigerer Fehler als ein falsch gelesenes Feld – und ein teurerer.
Schlägt eine Kontrolle fehl, wird nicht automatisch korrigiert. Der Fall geht zur Prüfung: Einen Wert, bei dem sich das System bereits als unsicher gezeigt hat, selbstständig zu korrigieren, ist der direkteste Weg, unsichtbare Fehler zu erzeugen.
Wo die menschliche Prüfung ansetzt
Das realistische Ziel ist nicht, die Person abzuschaffen: Es ist, sie nur wenige Dokumente statt aller ansehen zu lassen – und zu wissen, welche.
- Dokumente, die alle Kontrollen bestehen, laufen mit ihrer Historie weiter.
- Dokumente mit fehlgeschlagener Kontrolle gehen in eine Prüfwarteschlange, mit hervorgehobenem problematischem Feld und dem Originaldokument daneben: Wer korrigiert, muss nicht suchen.
- Sperrende Dokumente – ein nicht stimmiger Gesamtbetrag, ein mögliches Duplikat – laufen unter keinen Umständen weiter, auch nicht bei Zeitdruck.
Die Prüfwarteschlange sollte als Kennzahl gelesen werden. Wächst sie immer bei derselben Dokumentart oder demselben Lieferanten, liegt die Lösung fast nie darin, die Extraktion zu verbessern: Sie liegt darin, dieses Dokument in einem anderen Format anzufordern.
Die Herkunft festhalten
Für jeden in ein System eingetragenen Wert muss sich nachvollziehen lassen, woher er stammt. Das ist keine Bürokratie: Es ist die Voraussetzung, um beanstanden, korrigieren und verstehen zu können.
- Das Originaldokument, aufbewahrt und mit dem Wert verknüpft.
- Die Stelle im Dokument, aus der der Wert extrahiert wurde, um sie wiederzufinden, ohne alles erneut zu lesen.
- Falls der Wert von Hand korrigiert wurde: von wem, wann, und wie der vorherige Wert lautete.
- Welche Kontrollen durchgeführt wurden und mit welchem Ergebnis.
Ohne diese vier Angaben lässt sich, wenn sich in einem Jahr eine Zahl als falsch herausstellt, nicht mehr feststellen, ob der Fehler beim Lesen, bei der Korrektur oder im Ausgangsdokument lag.
Was dieser Leitfaden nicht behandelt
Hier geht es um die assistierte Extraktion: was sich aus einem Dokument lesen lässt und wie man es überprüft. Es gibt keine Konfiguration, die vollständige Genauigkeit garantiert, und kein extrahierter Wert sollte ohne die beschriebenen Kontrollen in die Buchhaltung gelangen. Der Fall eines Systems, das nicht nur liest, sondern Daten in einer Verwaltungssoftware schreibt oder ändert, ist ein anderes Problem – eines der Berechtigungen und zulässigen Aktionen – und hat einen eigenen Leitfaden; auch die einmalige Übertragung von Daten aus Tabellenblättern oder einem alten System folgt einer eigenen Methode.
Häufig gestellte Fragen
Mit welchen Dokumenten sollte man beginnen?
Mit zahlreichen, wiederkehrenden Dokumenten, bei denen rechnerische Kontrollen möglich sind, wie erhaltenen Rechnungen oder Lieferscheinen. Das sind die Fälle, in denen sich der Fehler von selbst zeigt. Verträge und technische Dokumente, bei denen die Angabe erzählerisch und nicht mit einer Summe überprüfbar ist, sind der Zielpunkt, nicht der Ausgangspunkt.
Was unterscheidet ein regelbasiertes System von einem modellbasierten?
Ein regelbasiertes System sucht den Wert an einer festen Position: Es ist präzise, solange sich das Layout des Dokuments nicht ändert. Ein Modell verträgt Variabilität, produziert aber bei einem Fehler ein plausibles Ergebnis. In der Praxis kombiniert man beides, und in beiden Fällen braucht es dieselben nachgelagerten Kontrollen.
Wer haftet, wenn ein falsch extrahierter Wert einen Fehler verursacht?
Wer den Wert verwendet, nicht wer ihn gelesen hat. Das ist der Grund, warum automatische Kontrollen, Prüfwarteschlange und Rückverfolgbarkeit der Quelle keine Extras sind: Sie sind die Art, wie das Unternehmen die Kontrolle über das behält, was in seine Systeme gelangt.
Wir prüfen gemeinsam, welche Dokumente sich assistiert verarbeiten lassen.
Wenn Sie darüber sprechen möchten, ist dafür Künstliche Intelligenz zuständig.

