Hands-on: Texterkennung (OCR) durch lokale KI: Endlich Handschrift & Kassenbons erkennen?
Video Overview & Insights
Lerne, wie du deine eigene lokale KI betreibst: Hier geht es zur Masterclass:
Hier geht es zur Masterclass: https://www.digitalisierung-mit-kopf.de/products/videokurs-eigenen-ki-server-llm-selbst-hosten-und-betreiben
Bin ich der einzige, der das Thema aktuell so spannend findet? WĂ€re eine Anbindung an paperless-ngx fĂŒr euch interessant?
https://www.digitalisierung-mit-kopf.de/products/videokurs-eigenen-ki-server-llm-selbst-hosten-und-betreiben
In Ăber dieses Video: Klassische OCR (wie Tesseract) stöĂt oft an ihre Grenzen â besonders bei schlechten Scans, komplexen Kassenbons oder Handschrift. Doch lokale KI-Modelle ("Vision Models") werden immer mĂ€chtiger.
fĂŒr OCR brauch man gar keine KI
Ich zeige dir heute am Beispiel von Open Web UI und dem Modell qwen2.5vl:7b, was technisch bereits möglich ist. Wir wandeln ein Foto von einem Kassenbon direkt in eine strukturierte Tabelle um â ohne Cloud, zu 100% lokal.
â ïž Hinweis: Dies ist ein Experiment & Showcase, kein Schritt-fĂŒr-Schritt Tutorial. Ich möchte gemeinsam mit euch brainstormen, welches Potenzial diese Technologie fĂŒr unser Dokumentenmanagement hat.
Hab das versucht. Bei mir kann das LLM keine PDFs erkennen oder lesen, weder mit Text noch ohne Text. Nur Bilder funktionieren, wenn ich zuerst einen Screenshot vom PDF erstelle und den ĂŒbergebe. OCRmyPDF ist da einiges schneller und besser, und man kann das Ergebnis dann dem LLM zur Bearbeitung geben.
Ausser ich mache etwas falsch. Dann wĂŒrde ich gerne wissen, was.
Mein System Prompt aus dem Video: Du willst es selbst testen? Kopiere diesen Prompt in dein lokales LLM (z.B. in Open Web UI):
Extract line items from a receipt (image and/or OCR text).
Die eigentliche Herausforderung ist nicht zu verstehen, was LLMs können â sondern sie sinnvoll und zeitsparend in bestehende ArbeitsablĂ€ufe zu integrieren. Das ist die echte HĂŒrde.
Beispiel PaperlessNGX: Klar nutzen das viele Unternehmen, aber es gibt auch genug Privatpersonen, die Paperless im privaten Kontext einsetzen und mit LLMs auf ein neues Level bringen wollen. Und dafĂŒr muss man nicht zwingend neue Hardware kaufen â oft reicht der vorhandene PC, den man eh schon fĂŒr Videoproduktion, Gaming o. Ă. rumstehen hat.
Ich erprobe gerade genau solche Workflows:
- Lokales PaperlessNGX (z. B. auf einer Synology NAS)
- Lokale LLM-Integration auf vorhandener Hardware (idealerweise ab RTX 30er Serie)
- Das lokale LLM ĂŒbernimmt OCR â und der saubere Output kann dann z. B. per RAG weiterverarbeitet werden.
@DigitalisierungmitKopf Ich sehe mir gerne deine Videos an - sehr tolle Video- und AudioqualitÀt. Ruhig und sachlich -> finde ich prima weiter so.
Dennoch wĂŒrde ich mir wĂŒnschen, dass du den Blick nicht von deinen Masterclass-Produkten verlierst, die du so schön bewirbst. (Beispiel: "[In Prduktion] ...... (erscheint Februar 2026)" )
Rules:
Use ONLY what is explicitly visible.
Endlich mal jemand, der das Thema lokal und nicht nur Cloud-basiert zeigt đ
Ich habe bisher PDNob fĂŒr Rechnungen und VertrĂ€ge verwendet, klappt solide. Bin gespannt, wie sich lokale Modelle weiterentwickeln.
Do NOT guess, fix OCR, infer, normalize, or calculate.
If unclear or missing â null.
Sehr spannend, eine Anbindung an paperless-ngx kann ich mir gut vorstellen
Keep original spelling and number formats exactly.
Do NOT include totals, taxes, discounts, payment, or cashier lines.
Ich habe auch schon mit PaperlessGPT experimentiert. Funktioniert soweit auch echt gut nur was mich stört ist, dass es nicht in der Lage ist den gewonnen Text zurĂŒck in die PDF zu schreiben. Klar in Paperless ist er vorhanden aber wenn ich die PDF exportiere oder spĂ€ter doch einmal anderweitig nutzen möchte habe ich wieder den stantdard OCR in der PDF und nicht das optimierte durch ein LLM.
Output:
Output ONLY a Markdown table.
Tolles Brainstorming und in diesem Falle höchst interessant. Gerne mehr von dieser Art.
Endlich wĂŒrde der (eingescannte) Kassenzettel mit den einzeln aufgefĂŒhrten Positionen einen vollstĂ€ndigen Sinn ergeben, wenn alle Artikel mit Anzahl, Beschreibung und Preis durch das LLM digital in der Datenbank vorliegen - was fĂŒr eine wahnsinnige Zeitersparnis.
Aber nur Ăbergangsweise.
Denn, warum sollten nicht die Kassen bei IKEA, dem Baumarkt, oder generell dem Einzelhandel nicht gleich die Liste mit Artikeln, Anzahl und Preisen per NFC auf Dein Smartphone Beamen? Gleich in eine passende App - die Hardware dazu ist doch schon gröĂtenteils vorhanden.
Kein Papierbon, kein Scannen, keine KI - direkt in die Datenbank der App!
EXACT columns and order:
| Position | Beschreibung | Menge | Einzelpreis | Gesamtpreis |
Ich finde das ebenso super spannend. Ich bin gerade dabei einer Firma vom "green field" und Excel langsam durch die digitale Transformation zu fĂŒhren. Dabei mĂŒssen wir aus unterschiedlichen Quellen erst mal die Daten konsolidieren; hĂ€tte ich keine KI, keine Texterkennung usw., wir wĂŒrden Monate brauchen. Mit "Digital Lego in mind", und den nötigen Kenntnissen aus Fullstack, DevOps und eben alles rund um KI (Agenten, RAG, usw. ) können sich die kleineren Unternehmen viele nervige Zeit und Kosten mit ERP Anbietern sparen. Was wir heute zur VerfĂŒgung haben (with great power comes great responsibility) stehen uns Tor und TĂŒr offen. Danke fĂŒr Deinen Content.
Field rules:
Position: printed line/index or null
Das Brainstorming ist sehr interessant, gerne mehr von diesem Content, da fĂŒhlt man sich gleich als sĂ€Ăe man mit am Tisch :)
Beschreibung: item text only
Menge: explicit quantity or null
Cooles Video. Ich wĂŒrde gerne mehr sehen. Brainstorming ist gut.
Einzelpreis: explicit unit price or null
Gesamtpreis: explicit line total or null
Ich kann Deine Begeisterung absolut nachvollziehen. Ich bin gerade dabei in mein E-Mail-Programm (Safer Mail) eine Anbindung an eine lokale KI zu integrieren. Man kann eine Mail an die KI ĂŒbergeben und prĂŒfen lassen, ob es eine Phishing oder sonstige SPAM / Angriffsmail ist. Muss noch ein wenig am Prompt schrauben, aber funktioniert extrem gut, in den nĂ€chsten Tagen kommt das Release. Kennst Du evtl. ein Modell, welches sich schon auf eine solche Problematik spezialisiert hat?
Currency exactly as shown, otherwise null
Output nothing except the table.
Hallo,
ich teile deine EinschĂ€tzung. Privat arbeite ich gerade an einem Workflow, bei dem eingehende Papierrechnungen gescannt und ab diesem Moment vollstĂ€ndig automatisiert verarbeitet werden: Erkennung der Rechnungsdaten, Ablage mit passendem Namen, eintrag in einer Liste, sowie Vorbereitung einer Ăberweisung im Banking-Programm (mit manueller PrĂŒfung vor der AusfĂŒhrung).
Reines OCR hat bisher nur eingeschrĂ€nkt funktioniert, daher nutze ich das Projekt auch, um mich intensiver mit KI zu beschĂ€ftigen. Da ich meine privaten Daten nicht in der Cloud verteilen möchte, ist ein lokaler Ansatz fĂŒr mich besonders interessant.
Perspektivisch könnte ich mir vorstellen, den Schriftverkehr zusĂ€tzlich in einer lokalen KI auszuwerten â das hĂ€tte mir z. B. beim Hausbau sehr geholfen.
Bin gespannt, wie weit ich komme.
Die Vision: Integration in Paperless-ngx Der nĂ€chste logische Schritt wĂ€re eine direkte Schnittstelle zu Paperless-ngx. Man könnte z.B. via Pre-Consume-Script die Texterkennung von der KI ĂŒbernehmen lassen, bevor das Dokument archiviert wird.
Frage an dich: Siehst du hier auch riesiges Potenzial? WĂŒrdest du dir ein Tutorial wĂŒnschen, wie man so ein Skript fĂŒr Paperless baut, sobald der Workflow stabil ist? Schreib es mir gerne in die Kommentare!
AI uns nutzlos, wĂŒrde ich nicht sagen, vor allem fĂŒr Leute, die kaum oder nicht groĂ programmieren können, ein wertvolles Hilfsmittel, um sich kleine Programme schreiben zu lassen, die das Leben erleichtern können.
More User Perspectives
Wird das ganze nicht durch die bevorstehende EinfĂŒhrung der E-Rechnung ohnehin mittelfristig obsolet? Scheint mir nicht wirklich lohnenswert da viel zeit zu investieren.
@TheDirkules1Verwende derzeit einen Workflow der sicher nicht ganz optimiert ist aber sehr zuverlÀssig funktioniert.
Rechnungen kommen per Mailverarbeitung rein
OCR via Paperless GPT - mittels Mistral API (KI Modell = Mistral OCR 3)
Dokumentenverarbeitung via Paperless AI mittels Mistral Large
Das ganze funktioniert eigentlich sehr gut und hÀlt sich von den Kosten her sehr in grenzen.
Ich verwende fĂŒr die Vearbeitung Paperless AI da es finde ich hier die besseren Ergebnisse liefert / die Einstellungen besser getĂ€tigt werden können.
Was ist ja richtig klasse finden wĂŒrde, wĂ€re ein Video zur GoBD-KonformitĂ€t von Paperless-ngx und wie Du das Problem mit dem WORM-Speicher, also Objektspeicher mit "Object Lock" aus TrueNAS gelöst hast, sowie die Realisierung des revisionssicheren Backups.
@Der089UserWarum nicht einfach Paperless GPT nutzen? Macht genau das, was Du im Video beschreibst, ohne Paperless NGX verlassen zu mĂŒssen
@technickrDas ist das erste mal, dass ich sehe, dass sich jemand mit dem Thema befasst. Das Ergebnis ist echt verblĂŒffend. War das IKEA-Beleg eingescannt oder elektronisch?
Ich mache das ganze fĂŒr die eigene EinkĂ€ufe ĂŒber ein PYTHON-Script. Mit dabei habe ich ein paar Discounter. Bei den elektronischen Belegen lĂ€uft wunderbar. Die eingescannte Papierbelege sind problematisch mit mehr oder wenige Fehler. Das Ergebnis importiere ich in einer Cloud ORACLE-Datenbank worauf ich ĂŒber eine (ebenfalls eigene) Web App (React + node.js) zugreife.