Open Source

NVIDIA veröffentlicht Nemotron 3 Nano Omni als offenes multimodales Modell

NVIDIA stellt mit Nemotron 3 Nano Omni ein offenes multimodales Modell für Bild-, Audio-, Video- und Textverarbeitung in einem gemeinsamen Agenten-Loop vor. Laut NVIDIA soll es getrennte Modellketten für Vision, Audio und Text ersetzen und dabei Durchsatz, Kosten und Kontextkonsistenz verbessern.

OpenClaw mit offenen Modellen über Hugging Face oder lokal weiterbetreiben

Hugging Face beschreibt zwei Wege, OpenClaw-, Pi- oder Open Code-Agenten nach einer Unterbrechung auf offene Modelle umzustellen: über Inference Providers oder vollständig lokal auf eigener Hardware. Die gehostete Variante soll der schnellste Weg sein, während der lokale Betrieb mehr Privatsphäre, keine API-Kosten und volle Kontrolle bietet.

Hugging Face veröffentlicht TRL v1.0 als stabile Bibliothek für Post-Training

TRL v1.0 markiert den Übergang der Hugging-Face-Bibliothek zu einem expliziten Stabilitätsmodell für Post-Training-Verfahren. Die Bibliothek trennt einen semantisch versionierten stabilen Kern von einem experimentellen Bereich, um neue Methoden schneller aufnehmen zu können, ohne Downstream-Projekte unnötig zu brechen.

IBM veröffentlicht Granite 4.0 3B Vision für Dokumentverarbeitung

Granite 4.0 3B Vision ist ein kompaktes multimodales Modell für Enterprise-Dokumente, das als LoRA-Adapter auf Granite 4.0 Micro bereitgestellt wird. Es zielt auf Tabellenextraktion, Chart Understanding und semantische Key-Value-Pair-Extraktion und kann allein oder zusammen mit Docling eingesetzt werden.

NVIDIA stellt Nemotron 3 Nano Omni als offenes multimodales Modell vor

NVIDIA hat mit Nemotron 3 Nano Omni ein offenes multimodales Modell angekündigt, das Vision, Audio und Sprache in einem System zusammenführt. Laut NVIDIA soll es dadurch multimodale AI-Agents mit höherem Durchsatz, geringeren Kosten und zusammenhängenderem Kontext für Video-, Audio-, Bild- und Textverarbeitung ermöglichen.

Gradio Server verbindet eigene Frontends mit Gradio-Backend

Mit gradio.Server lässt sich ein eigenes Frontend, etwa in React, Svelte oder plain HTML/JS, mit Gradio-Funktionen wie Queuing, Concurrency Control, SSE-Streaming, gradio_client und ZeroGPU auf Spaces kombinieren. Der Beitrag zeigt das an einer Bildbearbeitungs-App, die den Hintergrund per Modell entfernt und das Ergebnis in ein frei gestaltetes Web-Frontend einbindet.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img