Modelle
Infercom Inference Service Modelle Übersicht und Spezifikationen
Alle verfügbaren Modelle auf Infercom. EU-gehostete und Global-Catalog-Modelle mit Kontextlängen, Funktionen und Rate Limits.
Der Infercom Inference Service bietet Zugang zu einer breiten Auswahl an KI-Modellen über den Global Model Catalog. Modelle sind in zwei Kategorien verfügbar: EU-gehostete Modelle, die auf Infercoms souveräner Infrastruktur in Deutschland laufen, sowie zusätzliche Modelle über globale Infrastruktur.
EU-gehostete Modelle
Abschnitt betitelt „EU-gehostete Modelle“Die folgenden Modelle laufen auf Infercoms EU-Infrastruktur in Deutschland. Für diese Modelle findet die gesamte Datenverarbeitung innerhalb der EU statt — keine Daten verlassen die EU-Gerichtsbarkeit, mit vollständiger DSGVO-Konformität und ohne Zugriff nach US CLOUD Act.
Textgenerierungsmodelle
Abschnitt betitelt „Textgenerierungsmodelle“| Entwickler | Modell-ID | Kontextlänge | Fähigkeiten | Region | HF Link |
|---|---|---|---|---|---|
| MiniMax | MiniMax-M2.7 |
192k Tokens | Text, Reasoning | EU | Modellkarte |
| OpenAI | gpt-oss-120b |
128k Tokens | Text, Reasoning | EU | Modellkarte |
gemma-4-31B-it |
128k Tokens | Text, Vision | EU | Modellkarte |
Embedding-Modell
Abschnitt betitelt „Embedding-Modell“| Entwickler | Modell-ID | Kontextlänge | Fähigkeiten | Region | HF Link |
|---|---|---|---|---|---|
| Mistral | E5-Mistral-7B-Instruct |
4k Tokens | Embeddings | EU | Modellkarte |
Audio-Modell
Abschnitt betitelt „Audio-Modell“| Entwickler | Modell-ID | Max. Audiolänge | Fähigkeiten | Region | HF Link |
|---|---|---|---|---|---|
| OpenAI | Whisper-Large-v3 |
25 MB | Transkription, Übersetzung | EU | Modellkarte |
Global Model Catalog
Abschnitt betitelt „Global Model Catalog“Zusätzlich zu den EU-gehosteten Modellen bietet der Infercom Inference Service über den Global Model Catalog Zugang zu einer breiteren Auswahl an Modellen. Modelle, die nicht in unseren EU-Rechenzentren gehostet sind, werden über globale Infrastruktur bereitgestellt. Die Hosting-Region jedes Modells können Sie jederzeit über die API oder den Playground prüfen.
| Entwickler | Modell-ID | Kontextlänge | Region | Fähigkeiten | HF Link |
|---|---|---|---|---|---|
| DeepSeek | DeepSeek-V3.1 |
128k Tokens | US oder JP | Text, Reasoning | Modellkarte |
| DeepSeek | DeepSeek-V3.2 |
32k Tokens | US oder JP | Text, Reasoning | Modellkarte |
| Meta | Meta-Llama-3.3-70B-Instruct |
128k Tokens | US oder JP | Text | Modellkarte |
Siehe Modellregionen identifizieren unten, um zu prüfen, wo jedes Modell läuft.
Empfohlene Sampling-Parameter
Abschnitt betitelt „Empfohlene Sampling-Parameter“Sampling-Parameter sind modellspezifisch. Verwenden Sie die Werte, die der jeweilige Modellanbieter empfiehlt, statt einer einheitlichen Einstellung für alle Modelle. Die folgende Tabelle gibt die Empfehlung des jeweiligen Anbieters wieder, mit Link zur Quelle.
| Modell-ID | temperature | top_p | top_k | Empfehlung des Anbieters |
|---|---|---|---|---|
MiniMax-M2.7 |
1.0 | 0.95 | 40 | MiniMax-AI/MiniMax-M2.7 |
gpt-oss-120b |
1.0 | 1.0 | - | openai/gpt-oss |
gemma-4-31B-it |
1.0 | 0.95 | 64 | Modellkarte |
DeepSeek-V3.2 |
1.0 | 0.95 | - | Modellkarte |
DeepSeek-V3.1 |
- | - | - | Keine veröffentlicht |
Meta-Llama-3.3-70B-Instruct |
- | - | - | Keine veröffentlicht |
Ein Strich bedeutet, dass der Anbieter für diesen Parameter keinen Wert veröffentlicht. Wo keine Empfehlung vorliegt, beginnen Sie bei temperature 1.0 und optimieren Sie für Ihren eigenen Anwendungsfall. DeepSeek-V3.1 veröffentlicht keine Empfehlung im Fließtext, die mitgelieferte Generation-Config verwendet jedoch standardmäßig temperature 0.6 und top_p 0.95.
Die Infercom API akzeptiert eine temperature zwischen 0 und 2. temperature=1.0 bedeutet nicht “maximale Zufälligkeit” - es bedeutet, dass die Wahrscheinlichkeitsverteilung des Modells exakt so verwendet wird, wie sie trainiert wurde. Werte unter 1.0 schärfen sie, Werte über 1.0 flachen sie ab. Passen Sie temperature, top_p oder top_k an, in der Regel jedoch nicht mehr als einen davon gleichzeitig.
Wenn Sie temperature weglassen
Abschnitt betitelt „Wenn Sie temperature weglassen“Die Infercom API wendet keinen dienstweiten Standardwert an. Das Ergebnis hängt vom Modell ab.
| Modell-ID | Verhalten ohne temperature |
|---|---|
gemma-4-31B-it |
Greedy-Decoding. Identisch zu temperature 0. |
gpt-oss-120b |
Greedy-Decoding. Identisch zu temperature 0. |
DeepSeek-V3.2 |
Greedy-Decoding. |
Meta-Llama-3.3-70B-Instruct |
Greedy-Decoding. |
MiniMax-M2.7 |
Sampling. Kein Greedy-Decoding. |
Greedy-Decoding bedeutet, dass das Modell immer das Token mit der höchsten Wahrscheinlichkeit wählt. Für reproduzierbare Ausgaben ist das eine sinnvolle Wahl. Es ist zugleich die Einstellung, die die unten beschriebene Wiederholungsschleife am ehesten auslöst.
/v1/responses und /v1/messages verhalten sich genauso. Setzen Sie temperature bei jeder Anfrage.
Standardwerte der übrigen Sampling-Parameter
Abschnitt betitelt „Standardwerte der übrigen Sampling-Parameter“Wenn Sie einen Sampling-Parameter weglassen, wendet die Plattform den unten genannten Wert an. Diese Werte gelten für jedes Modell außer der MiniMax-Familie - siehe Warum MiniMax-Modelle sich anders verhalten.
| Parameter | Wert ohne Angabe | Wirkung |
|---|---|---|
temperature |
0.0 | Jeder effektive Wert unter 0.001 wird gekappt, was Greedy-Decoding erzwingt |
top_p |
1.0 | Keine Einschränkung |
top_k |
1048576 | Praktisch keine Einschränkung. Dies ist ein Platzhalterwert, keine Vokabulargröße - gemma-4-31B-it meldet ein Vokabular von 262.144 |
repetition_penalty |
1.0 | Keine Strafe |
Wie top_k mit temperature zusammenwirkt
Abschnitt betitelt „Wie top_k mit temperature zusammenwirkt“Die folgende Anfrage fordert Sampling über 40 Kandidaten-Tokens an. Sie erhält stattdessen Argmax, weil temperature fehlt:
{ "model": "gemma-4-31B-it", "messages": [{"role": "user", "content": "Write one sentence about the sea."}], "top_k": 40}Bei gemma-4-31B-it mit identischem Prompt:
| Anfrage | Ergebnis |
|---|---|
top_k: 40, ohne temperature |
Greedy. Bei jeder Anfrage derselbe Text, top_k ignoriert |
top_k: 40, temperature: 1.0 |
Sampling. Die Antwort variiert bei jeder Anfrage |
Ohne top_k, ohne temperature |
Greedy. Byte-identisch zur ersten Zeile |
Zulässiger Wertebereich für top_k
Abschnitt betitelt „Zulässiger Wertebereich für top_k“Senden Sie top_k mit einem Wert von 1 oder größer. Anders als bei manchen anderen Anbietern werden -1 und 0 nicht akzeptiert, um den Parameter abzuschalten.
| Gesendeter Wert | /v1/chat/completions und /v1/messages |
/v1/responses |
|---|---|---|
-1 |
HTTP 400 Invalid value for 'top_k': -1 is less than the minimum of 1. |
HTTP 200. Keine Prüfung |
0 |
HTTP 400 Invalid value for 'top_k': 0 is less than the minimum of 1. |
HTTP 200. Keine Prüfung |
1 |
HTTP 200 | HTTP 200 |
1048576 |
HTTP 200 | HTTP 200 |
2000000 |
HTTP 200. Es wird keine Obergrenze durchgesetzt | HTTP 200 |
Um top_k nicht einzuschränken, lassen Sie den Parameter weg oder senden Sie einen Wert, der größer ist als das Vokabular des Modells.
Warum MiniMax-Modelle sich anders verhalten
Abschnitt betitelt „Warum MiniMax-Modelle sich anders verhalten“Die oben genannten Standardwerte gelten nicht für die MiniMax-Familie. Auf den MiniMax-Bundles, und nur dort, wird jeder nicht gesetzte Sampling-Parameter aus der generation_config.json des Modell-Checkpoints ergänzt.
Deshalb liefert ein weggelassenes temperature bei gemma-4-31B-it, gpt-oss-120b, DeepSeek-V3.2 und Meta-Llama-3.3-70B-Instruct greedy, byte-identische Ausgaben, während MiniMax-M2.7 Sampling verwendet. Der Unterschied ist beabsichtigt und kein Fehler.
Die Maßnahme ist in beiden Fällen dieselbe: Setzen Sie temperature bei jeder Anfrage explizit.
Standard-System-Prompt für MiniMax-M2.7
Abschnitt betitelt „Standard-System-Prompt für MiniMax-M2.7“MiniMax veröffentlicht einen Standard-System-Prompt für MiniMax-M2.7. Verwenden Sie ihn unverändert, sofern Sie keinen Grund haben, ihn zu ersetzen (der Prompt bleibt auf Englisch, wie vom Anbieter veröffentlicht):
You are a helpful assistant. Your name is MiniMax-M2.7 and is built by MiniMax.Modellregionen identifizieren
Abschnitt betitelt „Modellregionen identifizieren“Sie können über die API oder den Playground feststellen, wo ein Modell gehostet wird.
Über die API
Abschnitt betitelt „Über die API“Der /v1/models-Endpunkt enthält ein sn_metadata-Objekt für jedes Modell. Verwenden Sie das region-Feld, um festzustellen, wo ein Modell gehostet wird: "EU" für souveräne Modelle auf Infercoms EU-Infrastruktur, oder eine Nicht-EU-Region (z.B. "US", "JP") für Modelle auf globaler Infrastruktur.
Verwenden Sie den ?verbose=true-Abfrageparameter, um detaillierte Modell-Metadaten einschließlich Souveränitätsinformationen abzurufen:
curl -s "https://api.infercom.ai/v1/models?verbose=true" \ -H "Authorization: Bearer $INFERCOM_API_KEY" | \ jq '.data[] | {id, region: .sn_metadata.region}'from openai import OpenAIimport requests
# Verwendung von requests für Metadaten-Inspektionheaders = {"Authorization": f"Bearer {api_key}"}response = requests.get( "https://api.infercom.ai/v1/models?verbose=true", headers=headers)
for model in response.json()["data"]: region = model.get("sn_metadata", {}).get("region", "Global") print(f"{model['id']}: {region}")Beispielantwort für ein EU-gehostetes Modell:
{ "id": "MiniMax-M2.7", "object": "model", "sn_metadata": { "is_external": false, "region": "EU" }}Beispielantwort für ein global geroutetes Modell:
{ "id": "DeepSeek-V3.1", "object": "model", "sn_metadata": { "is_external": true, "region": "JP" }}Über den Playground
Abschnitt betitelt „Über den Playground“Im Infercom Playground werden Regionsflaggen neben jedem Modellnamen angezeigt, sodass Sie auf einen Blick sehen können, wo jedes Modell läuft.
Datensouveränität
Abschnitt betitelt „Datensouveränität“Für EU-gehostete Modelle bietet Infercom:
- EU-Datenresidenz — Inferenz läuft in unseren EU-Rechenzentren
- DSGVO-Konformität — vollständige Einhaltung der EU-Datenschutzverordnung
- Kein US CLOUD Act-Zugriff — Ihre Inferenzdaten unterliegen nicht der US-Gerichtsbarkeit
- AI Act-Bereitschaft — konzipiert für die Einhaltung des EU AI Act