Die Verarbeitung von PDFs als Bilder und die anschließende Einspeisung dieser Bilder in Gemma 4 beseitigt die Unterscheidung zwischen gescannten und digitalen Dokumenten, die jede Textextraktionspipeline anfällig macht.
Die Herausforderung bei der Verarbeitung von PDFs liegt oft in der Art und Weise, wie sie erstellt wurden. Bei der Verwendung von Tools wie pdfplumber auf gescannten Rechnungen erhält man keine Ergebnisse. Bei mehrspaltigen Forschungsarbeiten hingegen wird der Text in einer Weise zurückgegeben, die die räumlichen Beziehungen der ursprünglichen Layouts zerstört. Bei ausgefüllten PDF-Formularen werden die Feldbezeichnungen mit den Werten in der Lesereihenfolge zusammengefügt, ohne dass klar ist, welches Feld zu welchem Wert gehört.
Die meisten Textextraktionswerkzeuge setzen voraus, dass das PDF eine auswählbare Textebene enthält. Wenn diese Annahme nicht zutrifft – wie bei gescannten Dokumenten, bildbasierten PDFs oder komplexen Formularlayouts – versagen die Werkzeuge stillschweigend. Das Ergebnis sind leere Ausgaben oder unleserliche Texte, ohne dass eine klare Fehlermeldung erfolgt.
Die Bildverarbeitungsstrategie
Die Bildverarbeitungsstrategie umgeht dieses Problem vollständig. Jede PDF-Seite wird in ein hochauflösendes Bild umgewandelt und dieses Bild wird einem Vision-Language-Modell zugeführt. Man fragt das Modell in einfacher Sprache nach den benötigten Informationen. Es ist kein optisches Zeichenerkennungssystem (OCR), kein Layout-Parser und kein Template-Matching erforderlich. Das Modell liest die Seite so, wie ein Mensch eine gedruckte Seite liest.
Gemma 4, das am 2. April 2026 von Google DeepMind veröffentlicht wurde und unter einer vollständigen Apache 2.0-Lizenz steht, bietet die explizite Fähigkeit zur Dokumenten-/PDF-Verarbeitung neben OCR, Diagrammerkennung, Handschriftenerkennung und Bildschirmverständnis. Es läuft vollständig lokal, ohne API-Schlüssel, ohne Cloud-Anruf und ohne Daten, die Ihren Server verlassen.
Warum PDFs als Bilder behandeln?
Es gibt zwei unterschiedliche Welten von PDFs, und die meisten Dokumentenverarbeitungswerkzeuge funktionieren nur in einer von ihnen.
- Digitale PDFs haben eine eingebettete Textebene; der Text ist auswählbar, durchsuchbar und extrahierbar. Werkzeuge wie pdfplumber, PyPDF2 und pdfminer arbeiten hier. Sie erhalten einen sauberen, maschinell erzeugten PDF und sie geben den Text in Lesereihenfolge zurück. Für einfache einspaltige Dokumente ist das oft ausreichend.
- Scanned PDFs sind Bilder, die in einem PDF-Container gespeichert sind. Es gibt keine Textebene. Jedes Wort existiert als Pixel-Daten. pdfplumber gibt eine leere Zeichenkette zurück. Die Textextraktion von PyMuPDF liefert nichts. Der einzige Weg, den Inhalt zu lesen, besteht darin, das Bild zu lesen.
Das erste Argument für die Bildverarbeitungsstrategie ist die Vereinheitlichung beider Welten. Man rendert die Seite, unabhängig davon, ob der Inhalt von einem Scanner, einem Drucker oder einem PDF-Generator stammt, und man hat immer ein Bild. Das Modell muss nie wissen, mit welcher Art von PDF es arbeitet.
Das zweite Argument betrifft das Layout. Selbst für digitale PDFs mit auswählbarem Text geben Extraktionswerkzeuge den Text in Dokumentenreihenfolge zurück, was die Struktur zerstört. Eine zweispaltige Rechnung mit Positionen auf der linken und den Gesamtsummen auf der rechten Seite wird als abwechselnde Fragmente zurückgegeben: Text der linken Spalte, dann Text der rechten Spalte, in einer Weise, die die nachgelagerte Analyse stört. Tabellen mit zusammengeführten Zellen sind noch problematischer; der extrahierte Text verliert den gesamten Zeilen- und Spaltenkontext.
Ein Vision-Language-Modell liest das Bild als visuelles Artefakt. Es sieht die Tabelle als Tabelle, die Spalten als Spalten und das Formular als Formular. Es liest die Positionen zeilenweise, weil es die Zeilen sehen kann.
Gemma 4 im Detail
Gemma 4 kommt in vier Größen. Die Wahl zwischen ihnen ist hauptsächlich eine Frage der Hardware.
- E2B-it: 2.3B effektive Parameter, 128K Kontext, ~6 GB VRAM, Modalitäten: Text, Bild, Audio.
- E4B-it: 4.5B effektive Parameter, 128K Kontext, ~10 GB VRAM, Modalitäten: Text, Bild, Audio.
- 26B-A4B-it: 3.8B aktiv, 256K Kontext, ~14 GB VRAM, Modalitäten: Text, Bild.
- 31B-it: 30.7B effektive Parameter, 256K Kontext, ~62 GB VRAM, Modalitäten: Text, Bild.
OmniDocBench 1.5 ist der Benchmark für die Dokumentenverarbeitung; ein niedrigerer Editierabstand ist besser. Das 31B-Modell erzielt die besten Ergebnisse, aber für die meisten Rechnungs- und Formularverarbeitungsaufgaben liefert E4B-it produktionsfähige Ergebnisse bei einem Bruchteil der Hardwareanforderungen. In diesem Artikel wird durchgehend google/gemma-4-E4B-it verwendet, aber jedes Codebeispiel funktioniert identisch mit jeder anderen Größe; ändern Sie einfach die Modell-ID.
Architektonische Merkmale von Gemma 4
Zwei architektonische Merkmale machen Gemma 4 besonders stark im Verständnis von Dokumenten.
- 2D Rotary Position Embedding (RoPE): Standardtransformatoren kodieren Positionen in einer Dimension: der Reihenfolge der Token. Gemma 4 dreht unabhängig die Dimensionen der Aufmerksamkeitsköpfe für die x- und y-Achsen, was dem Modell ein echtes räumliches Verständnis verleiht. Es weiß, was „oberhalb“, „unterhalb“, „links von“ und „rechts von“ im visuellen Sinne bedeutet. Bei einer zweispaltigen Rechnung bedeutet dies, dass das Modell jede Spalte unabhängig liest, anstatt sie zu vermischen.
- Per-Layer Embeddings (PLE): Anstatt sich auf eine einzige gemeinsame Token-Einbettung am Eingang zu verlassen, speist Gemma 4 ein zusätzliches Residualsignal in jede Decoder-Schicht ein. Diese Architektur, die in den E2B- und E4B-Modellen verwendet wird, ermöglicht es kleineren effektiven Parameterzahlen, bei strukturierten visuellen Aufgaben über ihre Gewichtung hinauszuwirken. Der Unterschied zwischen E2B (0.290) und E4B (0.181) im OmniDocBench spiegelt wider, wie viel PLE zur höheren Parameter-Effizienz beiträgt.
Voraussetzungen und Installation
Die Hardwareanforderungen sind wie folgt:
- GPU VRAM (E4B-it): 10 GB (empfohlen: 12 GB+)
- GPU VRAM (E2B-it): 6 GB (empfohlen: 8 GB+)
- System RAM: 16 GB (empfohlen: 32 GB)
- Apple Silicon: M2 Pro 16 GB (M3 Max 36 GB)
- Festplatte: 15 GB frei (empfohlen: 30 GB+ SSD)
Die Inferenz nur mit CPU funktioniert, ist jedoch langsam; man sollte mit 30–90 Sekunden pro Seite rechnen, abhängig vom Token-Budget und der Maschine. Wenn kein lokaler GPU vorhanden ist, kann man Google Colabs kostenlosen T4 GPU (15 GB VRAM) verwenden.
Der Zugriff auf Hugging Face ist erforderlich. Die Gemma 4-Modelle sind gesperrt. Man muss ein kostenloses Konto bei huggingface.co erstellen, die Seite google/gemma-4-E4B-it oder google/gemma-4-E2B-it besuchen und die Modellbedingungen akzeptieren. Danach kann man ein Lesetoken unter huggingface.co/settings/tokens generieren.
Die Pipeline zur Rechnungsverarbeitung
Die Pipeline zur Verarbeitung von Lieferantenrechnungen extrahiert den Namen des Anbieters, die Rechnungsnummer, die Positionen, die Gesamtsummen und das Fälligkeitsdatum und gibt strukturierte JSON-Daten aus. Sie funktioniert sowohl mit gescannten als auch mit digitalen PDFs.
Die vorgestellte Pipeline ist vollständig lokal und benötigt keine API-Schlüssel oder Cloud-Anrufe. Dies ist besonders wichtig für die Verarbeitung von Finanzdokumenten.
Fazit
Die Behandlung von PDFs als Bilder und die Einspeisung dieser Bilder in Gemma 4 beseitigt die Unterscheidung zwischen gescannten und digitalen Dokumenten, die jede Textextraktionspipeline anfällig macht. Die vorgestellte Pipeline funktioniert sowohl mit hochauflösenden Rechnungen als auch mit niedrig aufgelösten Faxscans, ohne dass Konfigurationsänderungen erforderlich sind. Wenn Sie mehr über die Nutzung von KI-Tools zur Codeverständnis und Dokumentation erfahren möchten, schauen Sie sich diese hilfreichen Ressourcen an.
Die räumlichen Positionsembeddings von Gemma 4 und das variable Token-Budget geben Ihnen die direkte Kontrolle über den Kompromiss zwischen Genauigkeit und Geschwindigkeit. Beginnen Sie mit 560 Token und aktivieren Sie thinking=False. Fügen Sie die zweiphasige Klassifikation für mehrseitige Dokumente hinzu. Steigern Sie auf den Denkmodus und 1120 Token für die spezifischen Seiten, bei denen die low_confidence_fields Unsicherheiten signalisieren.
Die Pipeline läuft vollständig lokal unter Apache 2.0. Es sind keine API-Schlüssel erforderlich, es gibt keine Nutzungsmessung und keine Daten verlassen Ihren Server, was für alles, was mit Finanzdokumenten zu tun hat, von Bedeutung ist.
„`
Quellen: kdnuggets
Bildquelle: KI generiert