NVIDIA Nemotron 3 Nano Omni ist ein omni-modales Modell für Dokumente, Bilder, Video und Audio. Es ist auf lange Kontexte, multimodales Reasoning, Spracherkennung und agentische GUI-Aufgaben ausgelegt und wird mit offenen Checkpoints auf Hugging Face bereitgestellt.
Granite 4.1 ist eine Familie dichter Decoder-only-LLMs mit 3B, 8B und 30B Parametern, die auf rund 15 Billionen Tokens in fünf Vortrainingsphasen bis zu einem Kontextfenster von 512K Tokens trainiert wurden. IBM ergänzt das Vortraining durch kuratiertes Supervised Fine-Tuning mit rund 4,1 Millionen Samples, mehrstufiges Reinforcement Learning sowie Apache-2.0-Veröffentlichung aller Modelle.
OpenAI hat mit Symphony eine offene Spezifikation für die Orchestrierung von Codex-Agenten vorgestellt. Das System verbindet einen Task-Tracker wie Linear mit dauerhaft laufenden Agenten-Workspaces und soll wiederkehrende Implementierungsarbeit vom direkten Sitzungsmanagement entkoppeln.
Die aktuelle Version von NVIDIA FLARE soll föderiertes Lernen ohne tiefgreifendes Refactoring bestehender Trainingsskripte ermöglichen. Dafür teilt die Plattform den Ablauf in eine minimale Client-Integration und portable, Python-basierte Job Recipes für Simulation, PoC und Produktion auf.
TII stellt mit Falcon Perception ein 0,6B-Parameter-Modell für open-vocabulary Grounding und Segmentierung sowie mit Falcon OCR ein 0,3B-Parameter-Modell für OCR vor. Beide nutzen eine Early-Fusion-Transformer-Architektur mit gemeinsamem Tokenraum für Bild- und Texteingaben und werden im Beitrag mit Benchmarks, Trainingsaufbau und Inferenz-Stack beschrieben.
Hugging Face stellt Gemma 4 als Apache-2-lizenzierte Modellfamilie vor, die Bild-, Text- und teils auch Audioeingaben unterstützt und in mehreren Größen verfügbar ist. Der Beitrag beschreibt Architekturmerkmale, multimodale Fähigkeiten, Benchmark-Werte sowie die Unterstützung in Werkzeugen wie transformers, llama.cpp, MLX, transformers.js und mistral.rs.