OpenAI führt die auffällige Häufung von „goblin“- und „gremlin“-Metaphern in neueren GPT-Modellen auf kleine Trainingsanreize zurück, insbesondere auf die Optimierung der früheren „Nerdy“-Persönlichkeit. Die Untersuchung zeigt, wie sich ein belohnter Sprachstil über Reinforcement Learning und nachgelagerte Trainingsdaten auch außerhalb des ursprünglichen Kontexts verbreiten kann.
DeepSeek hat mit DeepSeek-V4-Pro und DeepSeek-V4-Flash zwei neue Flaggschiffmodelle für Inferenz mit bis zu 1 Million Tokens Kontext vorgestellt. NVIDIA beschreibt dafür Unterstützung über Blackwell-Systeme, gehostete Endpoints, NIM sowie Serving-Setups mit SGLang und vLLM.
NVIDIA stellt mit Nemotron 3 Nano Omni ein offenes multimodales Modell für Bild-, Audio-, Video- und Textverarbeitung in einem gemeinsamen Agenten-Loop vor. Laut NVIDIA soll es getrennte Modellketten für Vision, Audio und Text ersetzen und dabei Durchsatz, Kosten und Kontextkonsistenz verbessern.
NVIDIA stellt mit BioNeMo ein Context-Parallelism-Framework für biomolekulare Architekturen wie Boltz vor, das ein einzelnes großes Molekülsystem über mehrere GPUs verteilt. Dadurch sollen sich deutlich längere Sequenzen und größere Komplexe verarbeiten lassen, ohne den globalen Kontext durch Fragmentierung oder aggressives Chunking zu verlieren.
TRL v1.0 markiert den Übergang der Hugging-Face-Bibliothek zu einem expliziten Stabilitätsmodell für Post-Training-Verfahren. Die Bibliothek trennt einen semantisch versionierten stabilen Kern von einem experimentellen Bereich, um neue Methoden schneller aufnehmen zu können, ohne Downstream-Projekte unnötig zu brechen.
Granite 4.0 3B Vision ist ein kompaktes multimodales Modell für Enterprise-Dokumente, das als LoRA-Adapter auf Granite 4.0 Micro bereitgestellt wird. Es zielt auf Tabellenextraktion, Chart Understanding und semantische Key-Value-Pair-Extraktion und kann allein oder zusammen mit Docling eingesetzt werden.