Zum Inhalt springen
InfercomInfercomInfercom Documentation

Modelle

Infercom Inference Service Modelle Übersicht und Spezifikationen

Alle verfügbaren Modelle auf Infercom. EU-gehostete und Global-Catalog-Modelle mit Kontextlängen, Funktionen und Rate Limits.

Der Infercom Inference Service bietet Zugang zu einer breiten Auswahl an KI-Modellen über den Global Model Catalog. Modelle sind in zwei Kategorien verfügbar: EU-gehostete Modelle, die auf Infercoms souveräner Infrastruktur in Deutschland laufen, sowie zusätzliche Modelle über globale Infrastruktur.

Die folgenden Modelle laufen auf Infercoms EU-Infrastruktur in Deutschland. Für diese Modelle findet die gesamte Datenverarbeitung innerhalb der EU statt — keine Daten verlassen die EU-Gerichtsbarkeit, mit vollständiger DSGVO-Konformität und ohne Zugriff nach US CLOUD Act.

Entwickler Modell-ID Kontextlänge Fähigkeiten Region HF Link
MiniMax MiniMax-M2.7 192k Tokens Text, Reasoning EU Modellkarte
OpenAI gpt-oss-120b 128k Tokens Text, Reasoning EU Modellkarte
Google gemma-4-31B-it 128k Tokens Text, Vision EU Modellkarte
Entwickler Modell-ID Kontextlänge Fähigkeiten Region HF Link
Mistral E5-Mistral-7B-Instruct 4k Tokens Embeddings EU Modellkarte
Entwickler Modell-ID Max. Audiolänge Fähigkeiten Region HF Link
OpenAI Whisper-Large-v3 25 MB Transkription, Übersetzung EU Modellkarte

Zusätzlich zu den EU-gehosteten Modellen bietet der Infercom Inference Service über den Global Model Catalog Zugang zu einer breiteren Auswahl an Modellen. Modelle, die nicht in unseren EU-Rechenzentren gehostet sind, werden über globale Infrastruktur bereitgestellt. Die Hosting-Region jedes Modells können Sie jederzeit über die API oder den Playground prüfen.

Entwickler Modell-ID Kontextlänge Region Fähigkeiten HF Link
DeepSeek DeepSeek-V3.1 128k Tokens US oder JP Text, Reasoning Modellkarte
DeepSeek DeepSeek-V3.2 32k Tokens US oder JP Text, Reasoning Modellkarte
Meta Meta-Llama-3.3-70B-Instruct 128k Tokens US oder JP Text Modellkarte

Siehe Modellregionen identifizieren unten, um zu prüfen, wo jedes Modell läuft.

Sampling-Parameter sind modellspezifisch. Verwenden Sie die Werte, die der jeweilige Modellanbieter empfiehlt, statt einer einheitlichen Einstellung für alle Modelle. Die folgende Tabelle gibt die Empfehlung des jeweiligen Anbieters wieder, mit Link zur Quelle.

Modell-ID temperature top_p top_k Empfehlung des Anbieters
MiniMax-M2.7 1.0 0.95 40 MiniMax-AI/MiniMax-M2.7
gpt-oss-120b 1.0 1.0 - openai/gpt-oss
gemma-4-31B-it 1.0 0.95 64 Modellkarte
DeepSeek-V3.2 1.0 0.95 - Modellkarte
DeepSeek-V3.1 - - - Keine veröffentlicht
Meta-Llama-3.3-70B-Instruct - - - Keine veröffentlicht

Ein Strich bedeutet, dass der Anbieter für diesen Parameter keinen Wert veröffentlicht. Wo keine Empfehlung vorliegt, beginnen Sie bei temperature 1.0 und optimieren Sie für Ihren eigenen Anwendungsfall. DeepSeek-V3.1 veröffentlicht keine Empfehlung im Fließtext, die mitgelieferte Generation-Config verwendet jedoch standardmäßig temperature 0.6 und top_p 0.95.

Die Infercom API akzeptiert eine temperature zwischen 0 und 2. temperature=1.0 bedeutet nicht “maximale Zufälligkeit” - es bedeutet, dass die Wahrscheinlichkeitsverteilung des Modells exakt so verwendet wird, wie sie trainiert wurde. Werte unter 1.0 schärfen sie, Werte über 1.0 flachen sie ab. Passen Sie temperature, top_p oder top_k an, in der Regel jedoch nicht mehr als einen davon gleichzeitig.

Die Infercom API wendet keinen dienstweiten Standardwert an. Das Ergebnis hängt vom Modell ab.

Modell-ID Verhalten ohne temperature
gemma-4-31B-it Greedy-Decoding. Identisch zu temperature 0.
gpt-oss-120b Greedy-Decoding. Identisch zu temperature 0.
DeepSeek-V3.2 Greedy-Decoding.
Meta-Llama-3.3-70B-Instruct Greedy-Decoding.
MiniMax-M2.7 Sampling. Kein Greedy-Decoding.

Greedy-Decoding bedeutet, dass das Modell immer das Token mit der höchsten Wahrscheinlichkeit wählt. Für reproduzierbare Ausgaben ist das eine sinnvolle Wahl. Es ist zugleich die Einstellung, die die unten beschriebene Wiederholungsschleife am ehesten auslöst.

/v1/responses und /v1/messages verhalten sich genauso. Setzen Sie temperature bei jeder Anfrage.

Wenn Sie einen Sampling-Parameter weglassen, wendet die Plattform den unten genannten Wert an. Diese Werte gelten für jedes Modell außer der MiniMax-Familie - siehe Warum MiniMax-Modelle sich anders verhalten.

Parameter Wert ohne Angabe Wirkung
temperature 0.0 Jeder effektive Wert unter 0.001 wird gekappt, was Greedy-Decoding erzwingt
top_p 1.0 Keine Einschränkung
top_k 1048576 Praktisch keine Einschränkung. Dies ist ein Platzhalterwert, keine Vokabulargröße - gemma-4-31B-it meldet ein Vokabular von 262.144
repetition_penalty 1.0 Keine Strafe

Die folgende Anfrage fordert Sampling über 40 Kandidaten-Tokens an. Sie erhält stattdessen Argmax, weil temperature fehlt:

{
"model": "gemma-4-31B-it",
"messages": [{"role": "user", "content": "Write one sentence about the sea."}],
"top_k": 40
}

Bei gemma-4-31B-it mit identischem Prompt:

Anfrage Ergebnis
top_k: 40, ohne temperature Greedy. Bei jeder Anfrage derselbe Text, top_k ignoriert
top_k: 40, temperature: 1.0 Sampling. Die Antwort variiert bei jeder Anfrage
Ohne top_k, ohne temperature Greedy. Byte-identisch zur ersten Zeile

Senden Sie top_k mit einem Wert von 1 oder größer. Anders als bei manchen anderen Anbietern werden -1 und 0 nicht akzeptiert, um den Parameter abzuschalten.

Gesendeter Wert /v1/chat/completions und /v1/messages /v1/responses
-1 HTTP 400 Invalid value for 'top_k': -1 is less than the minimum of 1. HTTP 200. Keine Prüfung
0 HTTP 400 Invalid value for 'top_k': 0 is less than the minimum of 1. HTTP 200. Keine Prüfung
1 HTTP 200 HTTP 200
1048576 HTTP 200 HTTP 200
2000000 HTTP 200. Es wird keine Obergrenze durchgesetzt HTTP 200

Um top_k nicht einzuschränken, lassen Sie den Parameter weg oder senden Sie einen Wert, der größer ist als das Vokabular des Modells.

Die oben genannten Standardwerte gelten nicht für die MiniMax-Familie. Auf den MiniMax-Bundles, und nur dort, wird jeder nicht gesetzte Sampling-Parameter aus der generation_config.json des Modell-Checkpoints ergänzt.

Deshalb liefert ein weggelassenes temperature bei gemma-4-31B-it, gpt-oss-120b, DeepSeek-V3.2 und Meta-Llama-3.3-70B-Instruct greedy, byte-identische Ausgaben, während MiniMax-M2.7 Sampling verwendet. Der Unterschied ist beabsichtigt und kein Fehler.

Die Maßnahme ist in beiden Fällen dieselbe: Setzen Sie temperature bei jeder Anfrage explizit.

MiniMax veröffentlicht einen Standard-System-Prompt für MiniMax-M2.7. Verwenden Sie ihn unverändert, sofern Sie keinen Grund haben, ihn zu ersetzen (der Prompt bleibt auf Englisch, wie vom Anbieter veröffentlicht):

You are a helpful assistant. Your name is MiniMax-M2.7 and is built by MiniMax.

Sie können über die API oder den Playground feststellen, wo ein Modell gehostet wird.

Der /v1/models-Endpunkt enthält ein sn_metadata-Objekt für jedes Modell. Verwenden Sie das region-Feld, um festzustellen, wo ein Modell gehostet wird: "EU" für souveräne Modelle auf Infercoms EU-Infrastruktur, oder eine Nicht-EU-Region (z.B. "US", "JP") für Modelle auf globaler Infrastruktur.

Verwenden Sie den ?verbose=true-Abfrageparameter, um detaillierte Modell-Metadaten einschließlich Souveränitätsinformationen abzurufen:

Terminal-Fenster
curl -s "https://api.infercom.ai/v1/models?verbose=true" \
-H "Authorization: Bearer $INFERCOM_API_KEY" | \
jq '.data[] | {id, region: .sn_metadata.region}'

Beispielantwort für ein EU-gehostetes Modell:

{
"id": "MiniMax-M2.7",
"object": "model",
"sn_metadata": {
"is_external": false,
"region": "EU"
}
}

Beispielantwort für ein global geroutetes Modell:

{
"id": "DeepSeek-V3.1",
"object": "model",
"sn_metadata": {
"is_external": true,
"region": "JP"
}
}

Im Infercom Playground werden Regionsflaggen neben jedem Modellnamen angezeigt, sodass Sie auf einen Blick sehen können, wo jedes Modell läuft.

Für EU-gehostete Modelle bietet Infercom:

  • EU-Datenresidenz — Inferenz läuft in unseren EU-Rechenzentren
  • DSGVO-Konformität — vollständige Einhaltung der EU-Datenschutzverordnung
  • Kein US CLOUD Act-Zugriff — Ihre Inferenzdaten unterliegen nicht der US-Gerichtsbarkeit
  • AI Act-Bereitschaft — konzipiert für die Einhaltung des EU AI Act