Open Source

NVIDIA stellt Nemotron 3 Nano Omni für lange multimodale Kontexte vor

NVIDIA Nemotron 3 Nano Omni ist ein omni-modales Modell für Dokumente, Bilder, Video und Audio. Es ist auf lange Kontexte, multimodales Reasoning, Spracherkennung und agentische GUI-Aufgaben ausgelegt und wird mit offenen Checkpoints auf Hugging Face bereitgestellt.

IBM beschreibt Aufbau und Training der Granite-4.1-LLMs

Granite 4.1 ist eine Familie dichter Decoder-only-LLMs mit 3B, 8B und 30B Parametern, die auf rund 15 Billionen Tokens in fünf Vortrainingsphasen bis zu einem Kontextfenster von 512K Tokens trainiert wurden. IBM ergänzt das Vortraining durch kuratiertes Supervised Fine-Tuning mit rund 4,1 Millionen Samples, mehrstufiges Reinforcement Learning sowie Apache-2.0-Veröffentlichung aller Modelle.

OpenAI veröffentlicht Symphony als Open-Source-Spezifikation für die Orchestrierung von Codex-Agenten

OpenAI hat mit Symphony eine offene Spezifikation für die Orchestrierung von Codex-Agenten vorgestellt. Das System verbindet einen Task-Tracker wie Linear mit dauerhaft laufenden Agenten-Workspaces und soll wiederkehrende Implementierungsarbeit vom direkten Sitzungsmanagement entkoppeln.

NVIDIA FLARE vereinfacht föderiertes Lernen mit Client-API und Job Recipes

Die aktuelle Version von NVIDIA FLARE soll föderiertes Lernen ohne tiefgreifendes Refactoring bestehender Trainingsskripte ermöglichen. Dafür teilt die Plattform den Ablauf in eine minimale Client-Integration und portable, Python-basierte Job Recipes für Simulation, PoC und Produktion auf.

Falcon Perception und Falcon OCR: Early-Fusion-Transformer für Grounding, Segmentierung und OCR

TII stellt mit Falcon Perception ein 0,6B-Parameter-Modell für open-vocabulary Grounding und Segmentierung sowie mit Falcon OCR ein 0,3B-Parameter-Modell für OCR vor. Beide nutzen eine Early-Fusion-Transformer-Architektur mit gemeinsamem Tokenraum für Bild- und Texteingaben und werden im Beitrag mit Benchmarks, Trainingsaufbau und Inferenz-Stack beschrieben.

Gemma 4 erscheint als offene multimodale Modellfamilie mit breiter Laufzeitunterstützung

Hugging Face stellt Gemma 4 als Apache-2-lizenzierte Modellfamilie vor, die Bild-, Text- und teils auch Audioeingaben unterstützt und in mehreren Größen verfügbar ist. Der Beitrag beschreibt Architekturmerkmale, multimodale Fähigkeiten, Benchmark-Werte sowie die Unterstützung in Werkzeugen wie transformers, llama.cpp, MLX, transformers.js und mistral.rs.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img