IBM veröffentlicht Granite 4.0 3B Vision für Dokumentverarbeitung

IBM hat Granite 4.0 3B Vision als kompaktes multimodales Modell für Enterprise-Dokumente vorgestellt. Es ist auf Aufgaben wie Tabellenextraktion aus Dokumentbildern, Chart Understanding und semantische Key-Value-Pair-Extraktion über unterschiedliche Dokumentlayouts ausgelegt. Das Modell unterstützt weiterhin allgemeine Vision-Language-Aufgaben wie detaillierte Bildbeschreibungen und kann eigenständig oder zusammen mit Docling in Dokumentverarbeitungspipelines genutzt werden.

Bereitgestellt wird Granite 4.0 3B Vision als LoRA-Adapter auf Basis von Granite 4.0 Micro, einem dichten Sprachmodell. Dadurch bleiben Vision und Sprache modular, sodass bei textbasierten Workloads auf das Basismodell zurückgefallen werden kann. Nach Angaben von IBM soll das die Integration in gemischte Pipelines vereinfachen, ohne das Modell als vollständig separates System bereitstellen zu müssen.

Die Leistung des Modells führt IBM auf drei Punkte zurück: ein eigens entwickeltes Datenset für Chart Understanding, das mit einem code-guided Data-Augmentation-Ansatz erzeugt wurde, eine neue Variante der DeepStack-Architektur zur Einspeisung hochauflösender visueller Merkmale und ein modulares Design für den praktischen Einsatz in Unternehmen.

Für Chart Understanding hat IBM ChartNet entwickelt, ein multimodales Datenset im Millionenmaßstab, das für Interpretation und Reasoning über Diagramme gedacht ist. ChartNet umfasst 1,7 Millionen synthetische Beispiele aus 24 Diagrammtypen und 6 Plotting-Bibliotheken. Jedes Beispiel enthält fünf aufeinander bezogene Komponenten: Plotting-Code, gerendertes Bild, Datentabelle, natürlichsprachige Zusammenfassung und QA-Paare. Hinzu kommen laut IBM menschlich annotierte und reale Teilmengen, die nach visueller Qualität, semantischer Genauigkeit und Diversität gefiltert wurden.

Architektonisch setzt Granite 4.0 3B Vision auf DeepStack Injection. Anders als bei vielen Vision-Language-Modellen, die visuelle Information an einer einzelnen Stelle in das Sprachmodell einspeisen, werden hier abstrakte visuelle Merkmale in frühere Schichten für semantisches Verständnis geleitet, während hochauflösende räumliche Merkmale in spätere Schichten eingehen, um Details zu erhalten. Das soll insbesondere bei layoutsensitiven Aufgaben wie Tabellenextraktion, Chart Understanding und KVP-Parsing helfen.

Bei Diagrammen erreicht Granite 4.0 3B Vision auf dem menschlich verifizierten ChartNet-Benchmark laut IBM mit LLM-as-a-judge den höchsten Chart2Summary-Wert unter den evaluierten Modellen mit 86,4 Prozent. Beim Benchmark Chart2CSV liegt das Modell mit 62,1 Prozent auf Rang zwei hinter Qwen3.5-9B mit 63,4 Prozent, das laut Quelle mehr als doppelt so groß ist.

Für Tabellenextraktion wurde das Modell in zwei Szenarien getestet: mit zugeschnittenen Tabellen und mit vollständigen Dokumentseiten, in denen Tabellen in komplexe Layouts eingebettet sind. Verwendet wurden die Benchmarks TableVQA-extract, OmniDocBench-tables und PubTables-v2. Die Modelle mussten Tabellen im HTML-Format extrahieren; bewertet wurde mit TEDS, einer Metrik für Struktur- und Inhaltsgenauigkeit. IBM gibt an, dass Granite 4.0 3B Vision unter den evaluierten Modellen die besten Werte auf PubTablesV2 für Cropped Tables mit 92,1 und Full-Page mit 79,3 sowie auf OmniDocBench mit 64,0 und TableVQA mit 88,1 erreicht.

Für semantische KVP-Extraktion wurde VAREX verwendet, ein Benchmark mit 1.777 US-Behördenformularen von einfachen bis zu verschachtelten und tabellarischen Layouts. Bewertet wurde mit Exact Match, also einer strikten Übereinstimmung der extrahierten Schlüssel-Wert-Paare mit dem Ground Truth. Granite 4.0 3B Vision erreicht hier laut IBM zero-shot eine EM-Genauigkeit von 85,5 Prozent.

Das Modell kann direkt auf Einzelbildern für gezielte visuelle Extraktion eingesetzt werden, etwa in bestehenden Automatisierungs-Workflows für Form Parser oder Chart Analyzer. Alternativ lässt es sich mit Docling zu einer End-to-End-Pipeline für Dokumentverständnis kombinieren. Die Quelle nennt dabei unter anderem die Verarbeitung mehrseitiger PDFs, automatische Erkennung, Segmentierung und das Zuschneiden visueller Elemente mit Docling sowie die Weiterleitung bereinigter Ausschnitte an das Granite-Vision-Modell für feinere Extraktion. Genannt werden außerdem geringere Gesamtkosten für Rechenaufwand, höherer Durchsatz sowie höhere Genauigkeit und Effizienz bei großen Dokumentbeständen.

Als Beispiele nennt IBM die Extraktion strukturierter Felder aus Rechnungen, Formularen und Belegen, die Analyse von Finanzberichten mit chart2csv, chart2code und Tabellenfunktionen sowie die Verarbeitung wissenschaftlicher PDFs, bei der Docling OCR und Layout Parsing übernimmt und visuelle Inhalte in einer gemeinsamen Pipeline zugänglich macht.

Granite 4.0 3B Vision ist auf Hugging Face verfügbar und wird unter der Apache-2.0-Lizenz veröffentlicht. Weitere technische Details, Trainingsmethoden und Benchmark-Ergebnisse sind in der Model Card beschrieben.

Quelle

Originalquelle: Hugging Face Blog

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang