DeepInfra ist jetzt als Inference Provider auf dem Hugging Face Hub eingebunden. Damit erweitert sich das Angebot für serverless Inference direkt auf den Modellseiten des Hub sowie in den Client-SDKs für JavaScript und Python.
DeepInfra ist eine serverless AI-Inference-Plattform mit einem Katalog von mehr als 100 Modellen. Nach Angaben von Hugging Face unterstützt DeepInfra verschiedene Modelltypen, darunter LLMs, Text-to-Image, Text-to-Video und Embeddings. In der ersten Ausbaustufe auf Hugging Face werden zunächst Gesprächs- und Textgenerierungsaufgaben unterstützt. Genannt werden unter anderem offene Modelle wie DeepSeek V4, Kimi-K2.6 und GLM-5.1. Unterstützung für weitere Aufgaben soll in Kürze folgen.
Nutzer können in ihren Kontoeinstellungen eigene API-Schlüssel für die gebuchten Provider hinterlegen und Provider nach Präferenz sortieren. Wenn kein eigener Schlüssel gesetzt ist, werden Anfragen über Hugging Face weitergeleitet. Es gibt damit zwei Nutzungsarten: direkte Aufrufe mit einem eigenen Schlüssel des jeweiligen Providers oder über Hugging Face geroutete Aufrufe mit einem Hugging Face Token.
Bei direkten Aufrufen erfolgt die Abrechnung über den jeweiligen Inference Provider, bei einem DeepInfra-Schlüssel also über das DeepInfra-Konto. Bei gerouteten Aufrufen über den Hugging Face Hub fallen laut Hugging Face nur die regulären API-Preise des Providers an, ohne zusätzlichen Aufschlag durch Hugging Face. Modellseiten zeigen kompatible Drittanbieter-Provider an, sortiert nach den hinterlegten Nutzerpräferenzen.
DeepInfra ist über die Hugging Face SDKs huggingface_hub ab Version 1.11.2 für Python sowie @huggingface/inference für JavaScript verfügbar. Gezeigt werden außerdem Beispiele für Aufrufe über die OpenAI-kompatible Schnittstelle mit dem Modellnamen deepseek-ai/DeepSeek-V4-Pro:deepinfra und dem Endpunkt https://router.huggingface.co/v1, wobei die Authentifizierung mit einem Hugging Face Token erfolgt und die Anfrage automatisch an DeepInfra weitergeleitet wird.
Die Inference Providers von Hugging Face sind zudem in mehrere Agent-Frameworks integriert, darunter Pi, OpenCode, Hermes Agents und OpenClaw. Dadurch lassen sich von DeepInfra gehostete Modelle in diesen Tools ohne zusätzliche Anpassungen verwenden.
Für PRO-Nutzer nennt Hugging Face monatlich 2 US-Dollar an Inference-Guthaben, das providerübergreifend einsetzbar ist. Auch für kostenlose angemeldete Nutzer gibt es eine kleine Freimenge.
