PDF-Auftragserfassung
Die Leistung: Transportaufträge aus PDFs, Scans und Fotos ohne Vorlagen auslesen.
Zur Leistung →„Wir haben doch schon OCR“ – hören wir oft. Dieser Artikel erklärt, was klassische Texterkennung leistet, was KI-basierte Extraktion anders macht und warum in der Praxis meist beides zusammen gebraucht wird.
Kurz gesagt: Klassische OCR wandelt Bilder in Text um und ordnet Felder über Positionsvorlagen zu – präzise bei gleichbleibenden Formularen, wartungsintensiv bei Vielfalt. KI-Extraktion versteht den Inhalt und erkennt Felder unabhängig vom Layout – flexibel, aber probabilistisch. In der Praxis übernimmt OCR das Lesen von Scans und die KI die Interpretation; deterministische Prüfregeln sichern das Ergebnis.
OCR (Optical Character Recognition) erkennt Zeichen in Bildern und macht aus einem Scan durchsuchbaren Text. Das ist der erste Schritt – und für native PDFs, die bereits Text enthalten, gar nicht nötig. Der zweite Schritt, der in der Praxis „OCR-Lösung“ genannt wird, ist die Zuordnung dieses Textes zu Feldern: Rechnungsnummer, Betrag, Ladestelle. Klassisch geschieht das über Vorlagen (Templates): Für jedes Dokumentlayout wird definiert, an welcher Position welches Feld steht.
Das funktioniert gut, wenn Dokumente immer gleich aussehen – etwa die Rechnungen eines einzigen großen Lieferanten. Es funktioniert schlecht, wenn hundert Auftraggeber hundert verschiedene Formulare schicken, wenn ein Kunde sein Layout ändert oder wenn Angaben mal im Kopf, mal in der Fußzeile stehen.
Ein Sprachmodell, das Dokumentstrukturen versteht, sucht nicht nach Positionen, sondern nach Bedeutung. Es erkennt eine Ladestelle als Ladestelle, weil der Kontext es nahelegt – nicht, weil sie links oben steht. Es liest eine Positionstabelle als Tabelle, auch wenn sie über zwei Seiten geht. Neue Formulare brauchen keine neue Vorlage.
Der Preis für diese Flexibilität: Das Ergebnis ist probabilistisch. Die KI kann ein Feld falsch zuordnen oder in ungünstigen Fällen einen Wert ergänzen, der nicht im Dokument steht. Ohne nachgelagerte Validierung ist KI-Extraktion in produktiven Prozessen deshalb fahrlässig.
| Kriterium | Klassische OCR mit Vorlagen | KI-Extraktion |
|---|---|---|
| Neues Dokumentlayout | Neue Vorlage nötig | Meist ohne Anpassung |
| Layoutänderung beim Kunden | Erkennung fällt aus, bis Vorlage angepasst | In der Regel unproblematisch |
| Genauigkeit bei bekanntem Layout | Sehr hoch, deterministisch | Hoch, aber probabilistisch |
| Freitext und Bemerkungen | Kaum nutzbar | Werden verstanden und zugeordnet |
| Sammelaufträge, Tabellen über Seiten | Schwierig | Gut lösbar |
| Wartungsaufwand | Steigt mit Anzahl der Layouts | Gering; Regeln statt Vorlagen |
| Nachvollziehbarkeit | Vollständig | Über Konfidenz und Quellenverweis |
| Erfordert Validierung | Sinnvoll | Zwingend |
Die Trennung ist weniger scharf, als die Überschrift vermuten lässt. Bei gescannten Dokumenten braucht auch die KI-Extraktion zuerst eine Texterkennung – OCR bleibt also Teil der Kette. Und die Vorlagen-Logik hat einen Nachfolger: deterministische Prüfregeln. Statt „Feld X steht an Position Y“ heißt es „Feld X muss vorhanden sein, ein Datum enthalten und nach dem Abholdatum liegen“. Diese Regeln sind layoutunabhängig, aber genauso streng wie eine Vorlage.
Das Ergebnis ist eine Kette aus drei Schichten: OCR liest (wo nötig), KI interpretiert, Regeln prüfen. Genau so bauen wir Dokumentenautomatisierung – ausführlich beschrieben im Artikel Wie kann KI Transportaufträge aus PDFs auslesen?.
Meist eine gute Nachricht: Der Scan-Workflow existiert, die Dokumente kommen strukturiert an. Die KI-Extraktion setzt darauf auf und ersetzt nur die Vorlagenpflege durch inhaltliches Verstehen. Der bestehende Scanner, das Archiv und die Ablagestruktur bleiben.
KI und OCR sind keine Konkurrenten, sondern Schichten derselben Kette. Wer nur wenige, stabile Layouts hat, kommt mit Vorlagen aus. Wer – wie fast jede Spedition – mit Formularvielfalt und Freitext arbeitet, braucht KI-Extraktion, und zwar mit strengen Prüfregeln dahinter. Wie wir das für Transportaufträge umsetzen, zeigt die Seite PDF-Auftragserfassung.
Die Leistung: Transportaufträge aus PDFs, Scans und Fotos ohne Vorlagen auslesen.
Zur Leistung →Die komplette Prozesskette von der Erkennung bis zum TMS.
Artikel lesen →Dieselbe Frage auf Prozessebene: Regeln oder Sprachmodell?
Artikel lesen →