Belegerkennung: Datensatz, Textebene oder Bild
Der Unterschied zwischen strukturiertem Datensatz, Textebene und Bild, welche Fehler wo entstehen und wie sich die Belegqualität verbessern lässt.
Auf den Punkt
Es gibt drei Wege, an die Daten eines Belegs zu kommen, und sie unterscheiden sich in der Zuverlässigkeit erheblich. Der strukturierte Datensatz einer E-Rechnung liefert exakte Werte, die Textebene eines digital erzeugten PDF liefert korrekten Text in unklarer Anordnung, und ein Foto oder Scan muss erst in Text verwandelt werden. Nur beim dritten Weg entstehen Lesefehler. Am wirksamsten wirkt deshalb ein größerer Anteil der ersten beiden Wege, mehr als jede Verbesserung der Texterkennung selbst.
Über Belegerkennung wird meist gesprochen, als wäre sie ein einziges Verfahren, das mal besser und mal schlechter funktioniert. Tatsächlich sind es drei verschiedene Wege, und welcher greift, entscheidet sich lange bevor eine Software beteiligt ist.
Welche drei Wege gibt es, an Belegdaten zu kommen?
Der strukturierte Datensatz, die Textebene und das Bild. Nur beim dritten entstehen echte Lesefehler, und das erklärt den größten Teil aller Qualitätsunterschiede.
Weg eins: der strukturierte Datensatz. Bei einer E-Rechnung liegen Rechnungsnummer, Datum, Steuersätze, Beträge und Beteiligte als Felder vor. Es wird nichts gelesen und nichts geschätzt. Bei einer XRechnung liegt der Wert als reines XML vor, bei ZUGFeRD als XML in einer PDF-Datei. Der häufige Fehler dabei: Ein ZUGFeRD-PDF wird als Bild behandelt und durch die Texterkennung geschickt, obwohl das XML danebenliegt.
Weg zwei: die Textebene. Ein digital erzeugtes PDF enthält seinen Text bereits. Er muss nur ausgelesen werden, nicht erkannt. Fehler entstehen hier bei der Zuordnung, nicht beim Lesen der Zeichen.
Weg drei: das Bild. Ein Foto, ein Scan oder ein ausgedrucktes und wieder eingescanntes PDF hat keine Textebene. Typisch sind verwechselte Zeichen wie 1 und 7 oder 8 und 3, verlorene Trennzeichen, wodurch aus 1.234,56 leicht 123456 wird, zusammengezogene Zeilen und unlesbare Bereiche bei verblasstem Thermopapier. Ein Kassenbon, der drei Monate im Handschuhfach lag, ist unter Umständen für niemanden mehr lesbar, auch nicht für einen Menschen.
Warum ist die Zuordnung schwieriger als das Lesen?
Weil auf einer durchschnittlichen Rechnung zwischen zehn und dreißig Zahlen stehen und der Text vollständig lesbar sein kann, ohne dass klar ist, welche davon der Rechnungsbetrag ist. Kundennummer, Rechnungsnummer, Steuernummer, mehrere Datumsangaben, Einzelpreise, Mengen, Zwischensummen, Rabatte, Endsumme, Zahlungsziel.
Die Zuordnung gelingt über drei Wege, die sich ergänzen:
Schlüsselwörter in der Nähe. Steht neben einer Zahl das Wort Gesamtbetrag oder Zahlbetrag, ist die Sache meist klar. Problematisch wird es bei ungewöhnlichen Bezeichnungen.
Die Position im Dokument. Der Endbetrag steht typischerweise unten rechts, das Rechnungsdatum oben. Diese Heuristik trägt weit und scheitert bei ungewöhnlichen Layouts.
Plausibilität und Rechnung. Der Bruttobetrag ist der größte Betrag, das Leistungsdatum liegt nicht nach dem Rechnungsdatum, Netto plus Steuer ergibt Brutto. Diese Prüfungen sind die zuverlässigsten, weil sie unabhängig vom Layout funktionieren.
Ein Verfahren, das nur den ersten Weg nutzt, arbeitet bei Standardrechnungen gut und bei allem anderen schlecht. Für die Bewertung heißt das: die Rechnung eines kleinen Handwerksbetriebs mit selbstgebautem Layout vorlegen, nicht die eines Großlieferanten.
Welche Belegtypen sind am schwierigsten?
| Belegtyp | Schwierigkeit | Hauptproblem |
|---|---|---|
| E-Rechnung, XRechnung oder ZUGFeRD | sehr gering | keines, Daten liegen vor |
| digitale Rechnung eines Großlieferanten | gering | gleichbleibendes Layout, gut lernbar |
| digitale Rechnung, wechselnde Absender | mittel | Zuordnung der Felder |
| gescannte Rechnung, gute Qualität | mittel | Lesefehler bei Zahlen |
| Kassenbon, gedruckt | hoch | kleine Schrift, gemischte Steuersätze |
| Foto eines Belegs, schräg oder unscharf | hoch | Verzerrung, Teilbereiche unlesbar |
| Thermobon nach Wochen | sehr hoch | teils physisch nicht mehr lesbar |
| Beleg mit handschriftlicher Ergänzung | sehr hoch | Handschrift verändert den Betrag |
Die letzten drei Zeilen erklären, warum die Belegqualität beim Mandanten wichtiger ist als die Wahl der Software. Ein Verfahren kann aus einem unlesbaren Beleg nichts machen, und ein Mensch übrigens auch nicht.
Wie werden handschriftliche Ergänzungen behandelt?
Durch Aussteuern statt Raten, abgesichert durch den Zahlungsabgleich. Kritisch ist ihre Wirkung, nicht die Handschrift an sich: Ein handschriftlich ergänztes Trinkgeld steht direkt neben einer gedruckten Zahl und verändert den Gesamtbetrag. Wird es übersehen, stimmt die Buchung nicht mit der Zahlung überein, und die Differenz taucht erst beim Bankabgleich als unerklärte Abweichung auf.
Erkennt ein Verfahren handschriftliche Anteile im Bereich der Beträge, gehört der Beleg vorgelegt. Das ist ehrlicher als eine Zahl, die vielleicht stimmt. Solche Ergänzungen kommen häufiger vor als vermutet: Trinkgeld auf dem Bewirtungsbeleg, ein nachgetragener Betrag auf einer Quittung, eine Notiz zur Kostenstelle, die Unterschrift auf einem Eigenbeleg.
Welche Prüfung fängt Lesefehler ab?
Die rechnerische, und sie ist wirksamer als jede bessere Erkennung:
Netto + Steuerbetrag = Brutto
Netto × Steuersatz = Steuerbetrag
Stimmen beide Gleichungen, sind die drei Zahlen mit hoher Wahrscheinlichkeit richtig gelesen, denn ein Lesefehler zerstört die Beziehung zwischen ihnen fast immer. Ein Beispiel: Eine Rechnung lautet über 1.234,56 Euro netto, 234,57 Euro Umsatzsteuer und 1.469,13 Euro brutto. Beim Lesen wird aus der 3 im Nettobetrag eine 8.
| Feld | Erkannter Wert | Prüfung | Ergebnis |
|---|---|---|---|
| Netto | 1.284,56 | Netto plus Steuer gleich Brutto | 1.519,13 statt 1.469,13 |
| Steuer | 234,57 | Netto mal 19 Prozent | 244,07 statt 234,57 |
| Brutto | 1.469,13 | Vergleich mit der Zahlung | passt zur Überweisung |
Beide Prüfungen schlagen mit derselben Differenz von 50 Euro fehl. Damit ist nicht nur bekannt, dass ein Fehler vorliegt, sondern auch wo: Der Bruttobetrag stimmt mit der Zahlung überein, der Steuerbetrag passt zum ursprünglichen Netto, also ist das Nettofeld falsch gelesen.
Bei mehreren Steuersätzen muss die Probe je Steuersatz geführt werden. Eine Hotelrechnung über 205,00 Euro mit 180,00 Euro Übernachtung zu 7 Prozent und 25,00 Euro Verpflegung zu 19 Prozent enthält 15,77 Euro Umsatzsteuer. Wer den Gesamtbetrag pauschal mit dem Regelsteuersatz herausrechnet, kommt auf 32,73 Euro und liegt um 16,96 Euro daneben.
Was findet die Rechenprobe nicht?
Sie prüft die innere Stimmigkeit von drei Zahlen, nicht ihre Richtigkeit im Verhältnis zum Beleg. Drei Fehlerarten laufen ungehindert durch.
Der Periodenfehler. Rechnungs- und Leistungsdatum werden vertauscht oder das Jahr falsch gelesen. Alle Beträge stimmen, die Buchung liegt im falschen Monat, und die Voranmeldung ist betroffen.
Der falsche Beteiligte. Auf einer Rechnung stehen zwei Anschriften. Wird die des Empfängers als Aussteller gedeutet, ist der Beleg rechnerisch einwandfrei und dem falschen Lieferanten zugeordnet.
Die plausible Falschzahl. Werden Netto und Steuer aus einer Positionszeile statt aus der Endsumme gelesen, ist die Probe erfüllt und der Betrag trotzdem falsch. Dagegen hilft nur der Abgleich mit der Zahlung.
Welche Belege fallen aus der Form?
Neben der Frage, wie gut gelesen wird, entscheidet die Vorverarbeitung über das Ergebnis. Fünf Fälle treten in jedem Bestand auf und haben mit Zeichenerkennung nichts zu tun.
Mehrere Belege in einer Datei. Ein Sammelscan mit acht Kassenbons erzeugt ohne Trennung einen einzigen Vorgang mit acht Beträgen, von denen keiner der Rechnungsbetrag ist. Die Trennung muss vor allem anderen stattfinden.
Ein Beleg über mehrere Seiten. Rechnung, Lieferschein und Geschäftsbedingungen in einer Datei. Ein Verfahren, das nur die erste Seite auswertet, findet den falschen Betrag oder gar keinen.
Der doppelt eingereichte Beleg. Dieselbe Rechnung kommt per E-Mail und zusätzlich als Foto. Ohne Dublettenerkennung über Aussteller, Rechnungsnummer, Datum und Betrag wird sie zweimal gebucht. Das ist der Fehler, der am ehesten zu einer doppelten Zahlung führt.
Das Dokument, das gar kein Beleg ist. Angebote, Auftragsbestätigungen, Lieferscheine und Mahnungen sehen aus wie Rechnungen. Besonders heikel ist die Mahnung, weil sie Rechnungsbetrag und Rechnungsnummer trägt und bei reiner Feldauswertung wie das Original wirkt. Die Belegart gehört vor der Feldauswertung bestimmt.
Gutschriften und Stornos. Sie tragen dieselben Felder mit umgekehrter Wirkung. Wird das Vorzeichen nicht erkannt, ist der Fehler doppelt so groß wie der Betrag.
Diese Punkte erklären, warum zwei Systeme mit vergleichbarer Zeichenerkennung im Alltag sehr unterschiedliche Ergebnisse liefern. Der Unterschied entsteht vor und nach dem Lesen, nicht beim Lesen selbst. Wie sich diese Schritte einfügen, ist unter digitale Belegstrecke beschrieben.
Wo liegt der eigentliche Hebel?
Nicht bei der Qualität der Texterkennung, sondern beim Anteil der Belege, die überhaupt als Bild ankommen. Drei Maßnahmen wirken stärker als jede Softwareauswahl.
Rechnungen als Datei weiterleiten, nicht ausdrucken. Ein per E-Mail empfangenes PDF hat eine Textebene, der abfotografierte Ausdruck davon nicht mehr. Diese eine Gewohnheit verschiebt einen erheblichen Teil des Aufkommens von Weg drei auf Weg zwei.
Belege beim Entstehen erfassen. Ein Bon, der beim Kauf fotografiert wird, ist lesbar, derselbe nach drei Monaten möglicherweise nicht. Nebenbei erfüllt das die Anforderung an die zeitgerechte Sicherung.
Lieferanten auf E-Rechnung ansprechen. Bei wiederkehrenden Lieferanten mit hohem Belegaufkommen lohnt die Nachfrage. Mit der Ausstellungspflicht ab 2027 für größere Unternehmen erledigt sich ein Teil davon ohnehin.
Wie sind Konfidenzwerte zu bewerten?
Ein Wert je Beleg genügt nicht. Eine Angabe wie 92 Prozent für das gesamte Dokument ist nicht handhabbar, weil sie nicht sagt, welches Feld unsicher ist. Brauchbar wird sie erst je Feld, denn dann prüft der Bearbeiter ein Feld statt eines Belegs.
Die Angabe muss kalibriert sein. Gibt ein System für hundert Felder eine Sicherheit von 90 Prozent an, sollten etwa zehn davon falsch sein. Sind es dreißig, ist die Angabe wertlos. Das lässt sich prüfen, indem man über einen Monat die Korrekturen den angegebenen Sicherheiten gegenüberstellt.
Die Schwelle gehört dem Anwender und sollte betragsabhängig sein. Ein unsicher gelesener Betrag über 12 Euro und einer über 12.000 Euro verdienen nicht dieselbe Behandlung. Eine feste Schwelle über alle Belege erzeugt entweder zu viel Prüfarbeit im Kleinen oder zu wenig Kontrolle im Großen. Wo die grundsätzlichen Grenzen liegen, steht unter Grenzen der KI-Buchhaltung.
Welche Kennzahlen zählen?
Die in Verkaufsgesprächen genannte Trefferquote ist selten definiert. Tatsächlich sind es vier Größen.
| Kennzahl | Definition | Warum sie zählt |
|---|---|---|
| Feldgenauigkeit | Anteil korrekt erkannter Werte je Feld | zeigt, wo tatsächlich nachgearbeitet wird |
| Durchlaufquote | Anteil der Belege ohne jeden Eingriff | die Größe, die Zeit spart |
| Aussteuerungsgüte | Anteil der vorgelegten Belege, die tatsächlich fehlerhaft waren | misst, ob die Schwelle sinnvoll gewählt ist |
| Durchgeschlüpfte Fehler | Anteil der übernommenen Belege mit falschem Wert | die einzige Kennzahl, die Schaden misst |
Die vierte Zeile zählt am meisten, und sie wird am seltensten erhoben. Ein System lässt sich beliebig auf eine hohe Durchlaufquote einstellen, indem es die Schwelle senkt: Die Quote steigt, die Arbeit sinkt, und die Fehler wandern in die Buchführung. Ohne die vierte Kennzahl ist die zweite bedeutungslos. Zur Messung des Gesamtverfahrens siehe Automatisierungsquote messen.
Für einen belastbaren Vergleich genügt ein Testpaket von etwa fünfzig Belegen aus dem eigenen Bestand, in der Verteilung, in der sie tatsächlich anfallen. Aussagekräftig sind dabei die Fälle, an denen es hakt: ein verblasster Thermobon, ein schräg fotografierter Beleg, eine Hotelrechnung mit zwei Steuersätzen, ein Bewirtungsbeleg mit handschriftlichem Trinkgeld und eine Kreditkartenabrechnung.
Wie unterscheiden sich Erkennung, Kontierung und Prüfung?
Sie beantworten drei verschiedene Fragen und sind unterschiedlich zuverlässig, werden im Gespräch aber häufig als eine Leistung behandelt.
Die Erkennung beantwortet, was auf dem Beleg steht. Objektiv überprüfbar: Entweder der erkannte Betrag entspricht dem gedruckten oder nicht. Bei strukturierten Daten entfällt sie vollständig, siehe E-Rechnung in der KI-Buchhaltung.
Die Kontierung beantwortet, wohin der Vorgang gehört. Eine fachliche Entscheidung, die auch bei perfekt gelesenen Daten falsch ausfallen kann, siehe wie KI Belege kontiert.
Die Prüfung beantwortet, ob der Beleg trägt. Ob die Pflichtangaben vollständig sind und der Vorsteuerabzug in Betracht kommt. Ein perfekt gelesener und korrekt kontierter Beleg kann formell unzureichend sein.
Die Unterscheidung bestimmt, wo eine Fehlerquote gemessen und wo eine Verbesserung angesetzt wird. Wer über eine schlechte Erkennung klagt, meint häufig die Kontierung, und wer die Kontierung verbessern will, scheitert manchmal daran, dass die Erkennung die falschen Felder liefert.
Häufige Fragen
Wird bei einem ZUGFeRD-PDF die Texterkennung gebraucht?
Nein, und sie sollte auch nicht eingesetzt werden. Die Daten liegen als XML in der Datei. Wer stattdessen das Bild durch die Texterkennung schickt, ersetzt exakte Werte durch geschätzte. Das ist ein häufiger Fehler in der Praxis und lohnt eine gezielte Nachfrage beim Anbieter.
Warum werden Beträge manchmal falsch gelesen?
Bei Bildern entstehen Verwechslungen zwischen ähnlichen Zeichen, etwa 1 und 7 oder 8 und 3, und Trennzeichen gehen verloren. Bei niedriger Auflösung, schrägen Aufnahmen oder verblasstem Thermopapier steigt die Fehlerrate deutlich.
Wie lässt sich die Belegqualität beim Mandanten verbessern?
Am wirksamsten dadurch, dass Belege beim Entstehen erfasst werden statt Wochen später, und dass Rechnungen als Datei weitergeleitet werden statt als abfotografierter Ausdruck. Ein per E-Mail empfangenes PDF hat eine Textebene, der Ausdruck davon nicht mehr.
Welche Prüfung fängt Lesefehler ab?
Die rechnerische: Netto plus Steuer muss den Bruttobetrag ergeben, und der Steuerbetrag muss zum angegebenen Steuersatz passen. Stimmt die Rechnung nicht, ist mindestens eine der erkannten Zahlen falsch. Diese Prüfung fängt den größten Teil der Zahlenfehler ab.
Quellen und Stand
Stand August 2026.
Weiterlesen
E-Rechnung und KI-Buchhaltung: Warum beides zusammengehört
Wieso die E-Rechnungspflicht der Automatisierung mehr hilft als jede Texterkennung, welcher Schritt entfällt und was trotzdem zu prüfen bleibt.
KI-BuchhaltungBuchhaltung mit KI: der Ablauf vom Beleg zur Buchung
Wie eine KI-gestützte Buchhaltung im Alltag abläuft: von der Belegannahme über Erkennung und Kontierung bis zur geprüften Übergabe an die Finanzbuchführung.
VergleichFinmatics oder BuchhaltungsButler: Kanzlei kontiert oder Mandant
Wo Finmatics den Bestand der Kanzlei kontiert, wo BuchhaltungsButler im einzelnen Unternehmen vorkontiert, und was der Betreiber für Preis und Verantwortung bedeutet.