Belegerkennung: Datensatz, Textebene oder Bild

Der Unterschied zwischen strukturiertem Datensatz, Textebene und Bild, welche Fehler wo entstehen und wie sich die Belegqualität verbessern lässt.

Baktash Hossainzadeh··Aktualisiert am ·6 Minuten

Über Belegerkennung wird meist gesprochen, als wäre sie ein einziges Verfahren, das mal besser und mal schlechter funktioniert. Tatsächlich sind es drei verschiedene Wege, und welcher greift, entscheidet sich lange bevor eine Software beteiligt ist.

Der strukturierte Datensatz, die Textebene und das Bild. Nur beim dritten entstehen echte Lesefehler, und das erklärt den größten Teil aller Qualitätsunterschiede.

Weg eins: der strukturierte Datensatz. Bei einer E-Rechnung liegen Rechnungsnummer, Datum, Steuersätze, Beträge und Beteiligte als Felder vor. Es wird nichts gelesen und nichts geschätzt. Bei einer XRechnung liegt der Wert als reines XML vor, bei ZUGFeRD als XML in einer PDF-Datei. Der häufige Fehler dabei: Ein ZUGFeRD-PDF wird als Bild behandelt und durch die Texterkennung geschickt, obwohl das XML danebenliegt.

Weg zwei: die Textebene. Ein digital erzeugtes PDF enthält seinen Text bereits. Er muss nur ausgelesen werden, nicht erkannt. Fehler entstehen hier bei der Zuordnung, nicht beim Lesen der Zeichen.

Weg drei: das Bild. Ein Foto, ein Scan oder ein ausgedrucktes und wieder eingescanntes PDF hat keine Textebene. Typisch sind verwechselte Zeichen wie 1 und 7 oder 8 und 3, verlorene Trennzeichen, wodurch aus 1.234,56 leicht 123456 wird, zusammengezogene Zeilen und unlesbare Bereiche bei verblasstem Thermopapier. Ein Kassenbon, der drei Monate im Handschuhfach lag, ist unter Umständen für niemanden mehr lesbar, auch nicht für einen Menschen.

Weil auf einer durchschnittlichen Rechnung zwischen zehn und dreißig Zahlen stehen und der Text vollständig lesbar sein kann, ohne dass klar ist, welche davon der Rechnungsbetrag ist. Kundennummer, Rechnungsnummer, Steuernummer, mehrere Datumsangaben, Einzelpreise, Mengen, Zwischensummen, Rabatte, Endsumme, Zahlungsziel.

Die Zuordnung gelingt über drei Wege, die sich ergänzen:

Schlüsselwörter in der Nähe. Steht neben einer Zahl das Wort Gesamtbetrag oder Zahlbetrag, ist die Sache meist klar. Problematisch wird es bei ungewöhnlichen Bezeichnungen.

Die Position im Dokument. Der Endbetrag steht typischerweise unten rechts, das Rechnungsdatum oben. Diese Heuristik trägt weit und scheitert bei ungewöhnlichen Layouts.

Plausibilität und Rechnung. Der Bruttobetrag ist der größte Betrag, das Leistungsdatum liegt nicht nach dem Rechnungsdatum, Netto plus Steuer ergibt Brutto. Diese Prüfungen sind die zuverlässigsten, weil sie unabhängig vom Layout funktionieren.

Ein Verfahren, das nur den ersten Weg nutzt, arbeitet bei Standardrechnungen gut und bei allem anderen schlecht. Für die Bewertung heißt das: die Rechnung eines kleinen Handwerksbetriebs mit selbstgebautem Layout vorlegen, nicht die eines Großlieferanten.

BelegtypSchwierigkeitHauptproblem
E-Rechnung, XRechnung oder ZUGFeRDsehr geringkeines, Daten liegen vor
digitale Rechnung eines Großlieferantengeringgleichbleibendes Layout, gut lernbar
digitale Rechnung, wechselnde AbsendermittelZuordnung der Felder
gescannte Rechnung, gute QualitätmittelLesefehler bei Zahlen
Kassenbon, gedruckthochkleine Schrift, gemischte Steuersätze
Foto eines Belegs, schräg oder unscharfhochVerzerrung, Teilbereiche unlesbar
Thermobon nach Wochensehr hochteils physisch nicht mehr lesbar
Beleg mit handschriftlicher Ergänzungsehr hochHandschrift verändert den Betrag

Die letzten drei Zeilen erklären, warum die Belegqualität beim Mandanten wichtiger ist als die Wahl der Software. Ein Verfahren kann aus einem unlesbaren Beleg nichts machen, und ein Mensch übrigens auch nicht.

Durch Aussteuern statt Raten, abgesichert durch den Zahlungsabgleich. Kritisch ist ihre Wirkung, nicht die Handschrift an sich: Ein handschriftlich ergänztes Trinkgeld steht direkt neben einer gedruckten Zahl und verändert den Gesamtbetrag. Wird es übersehen, stimmt die Buchung nicht mit der Zahlung überein, und die Differenz taucht erst beim Bankabgleich als unerklärte Abweichung auf.

Erkennt ein Verfahren handschriftliche Anteile im Bereich der Beträge, gehört der Beleg vorgelegt. Das ist ehrlicher als eine Zahl, die vielleicht stimmt. Solche Ergänzungen kommen häufiger vor als vermutet: Trinkgeld auf dem Bewirtungsbeleg, ein nachgetragener Betrag auf einer Quittung, eine Notiz zur Kostenstelle, die Unterschrift auf einem Eigenbeleg.

Die rechnerische, und sie ist wirksamer als jede bessere Erkennung:

Netto + Steuerbetrag = Brutto
Netto × Steuersatz   = Steuerbetrag

Stimmen beide Gleichungen, sind die drei Zahlen mit hoher Wahrscheinlichkeit richtig gelesen, denn ein Lesefehler zerstört die Beziehung zwischen ihnen fast immer. Ein Beispiel: Eine Rechnung lautet über 1.234,56 Euro netto, 234,57 Euro Umsatzsteuer und 1.469,13 Euro brutto. Beim Lesen wird aus der 3 im Nettobetrag eine 8.

FeldErkannter WertPrüfungErgebnis
Netto1.284,56Netto plus Steuer gleich Brutto1.519,13 statt 1.469,13
Steuer234,57Netto mal 19 Prozent244,07 statt 234,57
Brutto1.469,13Vergleich mit der Zahlungpasst zur Überweisung

Beide Prüfungen schlagen mit derselben Differenz von 50 Euro fehl. Damit ist nicht nur bekannt, dass ein Fehler vorliegt, sondern auch wo: Der Bruttobetrag stimmt mit der Zahlung überein, der Steuerbetrag passt zum ursprünglichen Netto, also ist das Nettofeld falsch gelesen.

Bei mehreren Steuersätzen muss die Probe je Steuersatz geführt werden. Eine Hotelrechnung über 205,00 Euro mit 180,00 Euro Übernachtung zu 7 Prozent und 25,00 Euro Verpflegung zu 19 Prozent enthält 15,77 Euro Umsatzsteuer. Wer den Gesamtbetrag pauschal mit dem Regelsteuersatz herausrechnet, kommt auf 32,73 Euro und liegt um 16,96 Euro daneben.

Sie prüft die innere Stimmigkeit von drei Zahlen, nicht ihre Richtigkeit im Verhältnis zum Beleg. Drei Fehlerarten laufen ungehindert durch.

Der Periodenfehler. Rechnungs- und Leistungsdatum werden vertauscht oder das Jahr falsch gelesen. Alle Beträge stimmen, die Buchung liegt im falschen Monat, und die Voranmeldung ist betroffen.

Der falsche Beteiligte. Auf einer Rechnung stehen zwei Anschriften. Wird die des Empfängers als Aussteller gedeutet, ist der Beleg rechnerisch einwandfrei und dem falschen Lieferanten zugeordnet.

Die plausible Falschzahl. Werden Netto und Steuer aus einer Positionszeile statt aus der Endsumme gelesen, ist die Probe erfüllt und der Betrag trotzdem falsch. Dagegen hilft nur der Abgleich mit der Zahlung.

Neben der Frage, wie gut gelesen wird, entscheidet die Vorverarbeitung über das Ergebnis. Fünf Fälle treten in jedem Bestand auf und haben mit Zeichenerkennung nichts zu tun.

Mehrere Belege in einer Datei. Ein Sammelscan mit acht Kassenbons erzeugt ohne Trennung einen einzigen Vorgang mit acht Beträgen, von denen keiner der Rechnungsbetrag ist. Die Trennung muss vor allem anderen stattfinden.

Ein Beleg über mehrere Seiten. Rechnung, Lieferschein und Geschäftsbedingungen in einer Datei. Ein Verfahren, das nur die erste Seite auswertet, findet den falschen Betrag oder gar keinen.

Der doppelt eingereichte Beleg. Dieselbe Rechnung kommt per E-Mail und zusätzlich als Foto. Ohne Dublettenerkennung über Aussteller, Rechnungsnummer, Datum und Betrag wird sie zweimal gebucht. Das ist der Fehler, der am ehesten zu einer doppelten Zahlung führt.

Das Dokument, das gar kein Beleg ist. Angebote, Auftragsbestätigungen, Lieferscheine und Mahnungen sehen aus wie Rechnungen. Besonders heikel ist die Mahnung, weil sie Rechnungsbetrag und Rechnungsnummer trägt und bei reiner Feldauswertung wie das Original wirkt. Die Belegart gehört vor der Feldauswertung bestimmt.

Gutschriften und Stornos. Sie tragen dieselben Felder mit umgekehrter Wirkung. Wird das Vorzeichen nicht erkannt, ist der Fehler doppelt so groß wie der Betrag.

Diese Punkte erklären, warum zwei Systeme mit vergleichbarer Zeichenerkennung im Alltag sehr unterschiedliche Ergebnisse liefern. Der Unterschied entsteht vor und nach dem Lesen, nicht beim Lesen selbst. Wie sich diese Schritte einfügen, ist unter digitale Belegstrecke beschrieben.

Nicht bei der Qualität der Texterkennung, sondern beim Anteil der Belege, die überhaupt als Bild ankommen. Drei Maßnahmen wirken stärker als jede Softwareauswahl.

Rechnungen als Datei weiterleiten, nicht ausdrucken. Ein per E-Mail empfangenes PDF hat eine Textebene, der abfotografierte Ausdruck davon nicht mehr. Diese eine Gewohnheit verschiebt einen erheblichen Teil des Aufkommens von Weg drei auf Weg zwei.

Belege beim Entstehen erfassen. Ein Bon, der beim Kauf fotografiert wird, ist lesbar, derselbe nach drei Monaten möglicherweise nicht. Nebenbei erfüllt das die Anforderung an die zeitgerechte Sicherung.

Lieferanten auf E-Rechnung ansprechen. Bei wiederkehrenden Lieferanten mit hohem Belegaufkommen lohnt die Nachfrage. Mit der Ausstellungspflicht ab 2027 für größere Unternehmen erledigt sich ein Teil davon ohnehin.

Ein Wert je Beleg genügt nicht. Eine Angabe wie 92 Prozent für das gesamte Dokument ist nicht handhabbar, weil sie nicht sagt, welches Feld unsicher ist. Brauchbar wird sie erst je Feld, denn dann prüft der Bearbeiter ein Feld statt eines Belegs.

Die Angabe muss kalibriert sein. Gibt ein System für hundert Felder eine Sicherheit von 90 Prozent an, sollten etwa zehn davon falsch sein. Sind es dreißig, ist die Angabe wertlos. Das lässt sich prüfen, indem man über einen Monat die Korrekturen den angegebenen Sicherheiten gegenüberstellt.

Die Schwelle gehört dem Anwender und sollte betragsabhängig sein. Ein unsicher gelesener Betrag über 12 Euro und einer über 12.000 Euro verdienen nicht dieselbe Behandlung. Eine feste Schwelle über alle Belege erzeugt entweder zu viel Prüfarbeit im Kleinen oder zu wenig Kontrolle im Großen. Wo die grundsätzlichen Grenzen liegen, steht unter Grenzen der KI-Buchhaltung.

Die in Verkaufsgesprächen genannte Trefferquote ist selten definiert. Tatsächlich sind es vier Größen.

KennzahlDefinitionWarum sie zählt
FeldgenauigkeitAnteil korrekt erkannter Werte je Feldzeigt, wo tatsächlich nachgearbeitet wird
DurchlaufquoteAnteil der Belege ohne jeden Eingriffdie Größe, die Zeit spart
AussteuerungsgüteAnteil der vorgelegten Belege, die tatsächlich fehlerhaft warenmisst, ob die Schwelle sinnvoll gewählt ist
Durchgeschlüpfte FehlerAnteil der übernommenen Belege mit falschem Wertdie einzige Kennzahl, die Schaden misst

Die vierte Zeile zählt am meisten, und sie wird am seltensten erhoben. Ein System lässt sich beliebig auf eine hohe Durchlaufquote einstellen, indem es die Schwelle senkt: Die Quote steigt, die Arbeit sinkt, und die Fehler wandern in die Buchführung. Ohne die vierte Kennzahl ist die zweite bedeutungslos. Zur Messung des Gesamtverfahrens siehe Automatisierungsquote messen.

Für einen belastbaren Vergleich genügt ein Testpaket von etwa fünfzig Belegen aus dem eigenen Bestand, in der Verteilung, in der sie tatsächlich anfallen. Aussagekräftig sind dabei die Fälle, an denen es hakt: ein verblasster Thermobon, ein schräg fotografierter Beleg, eine Hotelrechnung mit zwei Steuersätzen, ein Bewirtungsbeleg mit handschriftlichem Trinkgeld und eine Kreditkartenabrechnung.

Sie beantworten drei verschiedene Fragen und sind unterschiedlich zuverlässig, werden im Gespräch aber häufig als eine Leistung behandelt.

Die Erkennung beantwortet, was auf dem Beleg steht. Objektiv überprüfbar: Entweder der erkannte Betrag entspricht dem gedruckten oder nicht. Bei strukturierten Daten entfällt sie vollständig, siehe E-Rechnung in der KI-Buchhaltung.

Die Kontierung beantwortet, wohin der Vorgang gehört. Eine fachliche Entscheidung, die auch bei perfekt gelesenen Daten falsch ausfallen kann, siehe wie KI Belege kontiert.

Die Prüfung beantwortet, ob der Beleg trägt. Ob die Pflichtangaben vollständig sind und der Vorsteuerabzug in Betracht kommt. Ein perfekt gelesener und korrekt kontierter Beleg kann formell unzureichend sein.

Die Unterscheidung bestimmt, wo eine Fehlerquote gemessen und wo eine Verbesserung angesetzt wird. Wer über eine schlechte Erkennung klagt, meint häufig die Kontierung, und wer die Kontierung verbessern will, scheitert manchmal daran, dass die Erkennung die falschen Felder liefert.

Häufige Fragen

Wird bei einem ZUGFeRD-PDF die Texterkennung gebraucht?

Nein, und sie sollte auch nicht eingesetzt werden. Die Daten liegen als XML in der Datei. Wer stattdessen das Bild durch die Texterkennung schickt, ersetzt exakte Werte durch geschätzte. Das ist ein häufiger Fehler in der Praxis und lohnt eine gezielte Nachfrage beim Anbieter.

Warum werden Beträge manchmal falsch gelesen?

Bei Bildern entstehen Verwechslungen zwischen ähnlichen Zeichen, etwa 1 und 7 oder 8 und 3, und Trennzeichen gehen verloren. Bei niedriger Auflösung, schrägen Aufnahmen oder verblasstem Thermopapier steigt die Fehlerrate deutlich.

Wie lässt sich die Belegqualität beim Mandanten verbessern?

Am wirksamsten dadurch, dass Belege beim Entstehen erfasst werden statt Wochen später, und dass Rechnungen als Datei weitergeleitet werden statt als abfotografierter Ausdruck. Ein per E-Mail empfangenes PDF hat eine Textebene, der Ausdruck davon nicht mehr.

Welche Prüfung fängt Lesefehler ab?

Die rechnerische: Netto plus Steuer muss den Bruttobetrag ergeben, und der Steuerbetrag muss zum angegebenen Steuersatz passen. Stimmt die Rechnung nicht, ist mindestens eine der erkannten Zahlen falsch. Diese Prüfung fängt den größten Teil der Zahlenfehler ab.

Quellen und Stand

Stand August 2026.

Weiterlesen

Fragen zur Umsetzung in der eigenen Kanzlei?

Im Gespräch klären wir, welcher Schritt bei Ihnen zuerst Sinn ergibt.

DSGVO-konform·Hosting in Deutschland·DATEV-Integration