Granite 4.1 umfasst dichte Decoder-only-LLMs in den Größen 3B, 8B und 30B, die von Grund auf auf etwa 15 Billionen Tokens trainiert wurden. Die Modelle nutzen eine mehrstufige Trainingspipeline mit fünf Vortrainingsphasen und einer Long-Context-Erweiterung bis 512K Tokens. Laut IBM vergleicht sich das 8B-Instruct-Modell dabei mit dem früheren Granite 4.0-H-Small (32B-A9B MoE) und erreicht auf mehreren Benchmarks ähnliche oder höhere Werte, obwohl es eine einfachere dichte Architektur mit weniger Parametern verwendet.
Die Architektur basiert bei allen drei Modellgrößen auf einem dichten Decoder-only-Transformer mit Grouped Query Attention, Rotary Position Embeddings, SwiGLU, RMSNorm sowie geteilten Ein- und Ausgabe-Embeddings. Unterschiede zwischen den Varianten betreffen laut Beitrag nur die Architekturdimensionen; Trainingspipeline und Datenstrategie bleiben gleich.
Das Vortraining ist in fünf Phasen aufgeteilt. Phase 1 dient dem allgemeinen Sprachverständnis mit einem breiten Datensatzmix, darunter CommonCrawl, Code, Mathematik, technische Inhalte, mehrsprachige Daten und domänenspezifische Inhalte. In Phase 2 steigt der Anteil von Mathematik- und Code-Daten deutlich, um Reasoning-Fähigkeiten zu stärken. Die Phasen 3 und 4 beschreiben ein Mid-Training mit stärker kuratierten Daten, darunter Synthetic Data, Long Chain-of-Thought sowie Sprach- und Code-Instructions. Phase 5 erweitert das Kontextfenster schrittweise von 4K auf 32K, 128K und schließlich 512K Tokens. Für die 512K-Stufe bei 8B und 30B wird ein Mix aus 80 Prozent Büchern und 20 Prozent Code-Repository-Daten verwendet. Nach jeder Stufe der Long-Context-Erweiterung wird ein Model Merge durchgeführt, um die Kurzkontext-Leistung zu erhalten.
Für das Supervised Fine-Tuning kuratiert IBM die Daten mit einem LLM-as-Judge-Framework und regelbasierten Filtern. Bewertet werden ausschließlich Assistant-Antworten entlang gewichteter Dimensionen wie Instruction Following, Korrektheit, Vollständigkeit, Knappheit, Natürlichkeit und Kalibrierung; in bestimmten Fällen kommen Prüfungen zu kritischem Denken hinzu. Harte Ausschlussgründe wie Halluzinationen, falsche Prämissen oder fehlerhafte Berechnungen übersteuern die Punktzahl. Ergänzend werden Textnormalisierung, Trunkierung, Längenfilter, Schema-Validierung, Leakage-Erkennung und globale Deduplizierung eingesetzt. Auf dieser Grundlage werden die Basismodelle mit rund 4,1 Millionen hochwertigen Samples feinabgestimmt.
Nach dem SFT folgt eine mehrstufige Reinforcement-Learning-Pipeline mit On-policy GRPO und DAPO-Loss. Dynamisches Sampling aus DAPO wird wegen des Rechenaufwands in den Trainingsläufen deaktiviert. Die Abfolge umfasst Multi-domain RL, RLHF, ein kurzes Stadium für Identity- und Knowledge-Calibration sowie Math RL. Laut IBM soll diese Reihenfolge Catastrophic Forgetting begrenzen und die Leistung über mehrere Domänen hinweg stabilisieren. Für Multi-domain RL wurden im Mittel 45.504 einzigartige Prompts mit einer Lernrate von 5e-7 und einem KL-Koeffizienten von 0,05 verwendet. Im RLHF-Stadium mit durchschnittlich 17.920 Prompts und konservativerer Konfiguration berichtet IBM einen mittleren Zugewinn von rund 18,9 Punkten in Alpaca-Eval gegenüber den SFT-Checkpoints. Das kurze Kalibrierungsstadium nutzt etwa 1.728 Prompts. Das anschließende Math RL mit im Mittel 13.504 Prompts soll Einbußen aus dem RLHF-Stadium auf Mathematik-Benchmarks ausgleichen und über die SFT-Leistung hinausheben, im Mittel um etwa 3,8 Punkte auf GSM8K und 23,48 Punkte auf DeepMind-Math.
Als unterstützte Sprachen nennt IBM Englisch, Deutsch, Spanisch, Französisch, Japanisch, Portugiesisch, Arabisch, Tschechisch, Italienisch, Koreanisch, Niederländisch und Chinesisch. Die Modelle sollen Instruction Following und Tool Calling ohne lange Chain-of-Thought-Spuren erreichen, was laut Beitrag vorhersehbare Latenz, stabilen Token-Verbrauch und geringere Betriebskosten ermöglicht.
Im Benchmark-Vergleich hebt IBM besonders Granite 4.1-8B hervor: Das dichte 8B-Modell erreiche gegenüber Granite 4.0-H-Small 32B-A9B ähnliche oder bessere Werte unter anderem auf IFEval, AlpacaEval, MMLU-Pro, BBH, GSM8K, DeepMind-Math, Evalplus, ArenaHard, BFCL V3 und MBPP(+). Innerhalb der Modellfamilie steigt die Leistung den Angaben zufolge erwartbar mit der Modellgröße, wobei 30B über alle Benchmarks hinweg führt.
Zusätzlich stellt IBM fp8-quantisierte Varianten für die Inferenz mit vLLM bereit. Die Reduktion von 16-Bit auf 8-Bit senkt den Speicherbedarf auf Datenträgern und im GPU-Speicher laut Beitrag jeweils um ungefähr 50 Prozent. Quantisiert werden nur Gewichte und Aktivierungen linearer Operatoren in den Transformer-Blöcken mit LLM Compressor; andere Schichten behalten ihre ursprüngliche Präzision.
Das Training der Granite-4.1-Sprachmodelle lief auf einem NVIDIA-GB200-NVL72-Cluster bei CoreWeave mit 72-GPU-NVLink-Domänen innerhalb eines Racks, einer nicht blockierenden Fat-Tree-NDR-400-Gb/s-InfiniBand-Vernetzung zwischen Racks und einer Skalierung über tausende GPUs. Alle Granite-4.1-Modelle werden unter der Apache-2.0-Lizenz veröffentlicht. Der Beitrag zeigt außerdem ein Tool-Calling-Beispiel für das 30B-Instruct-Modell über Transformers.
