11. September 2026
Korrektur: Fünf Funktionen, die wir als nicht unterstützt geführt haben, funktionierenn,logprobsundtop_logprobsfunktionieren bei jedem Modell.n: 2liefert zwei Choices.logprobs: truemittop_logprobs: 3liefert befüllte Token-Logprobs samt Alternativenseedundlogit_biasfunktionieren beigpt-oss-120b,DeepSeek-V3.2undMeta-Llama-3.3-70B-Instruct. Beitemperature1.0 legt ein Seed dort die Antwort fest: derselbe Seed liefert jedes Mal denselben Text, ein anderer Seed einen anderen. Ohne Seed variiert derselbe Prompt bei nahezu jeder Anfrageseedgrenzt die Ausgabe beiMiniMax-M2.7ein, legt sie aber nicht fest. Es bleiben zwei Varianten statt einer, während derselbe Prompt ohne Seed bei jeder Anfrage variiert. Beigemma-4-31B-ithat der Parameter überhaupt keine Wirkung- Diese Funktionen kamen mit einem Plattform-Release im Mai 2026, unsere Dokumentation wurde nicht nachgezogen. Die Liste der nicht unterstützten Funktionen enthält jetzt nur noch die beiden Parameter, die tatsächlich nicht unterstützt werden
- Ein Parameter ohne Wirkung auf ein Modell wird dennoch akzeptiert. Nichts in der Antwort weist darauf hin, dass er verworfen wurde. Siehe Unterstützt, aber nicht bei jedem Modell
frequency_penalty bewirkt nichts, repetition_penalty ist der wirksame Parameter
frequency_penaltyundpresence_penaltywerden bei jedem Modell akzeptiert und ignoriert. Bei allen fünf Modellen undtemperature0 liefern beide eine Ausgabe, die byte-identisch zu einer Anfrage ohne diese Parameter ist.frequency_penalty: 99liegt außerhalb des dokumentierten Bereichs, wird nicht abgelehnt und ebenfalls ignoriert.presence_penalty: 99gibt dagegen einen400zurück- Die API-Referenz beschrieb beide mit der vollständigen OpenAI-Semantik und ohne Hinweis. Sie stellt jetzt klar, dass sie aus Kompatibilitätsgründen akzeptiert und ignoriert werden
repetition_penaltyist der Parameter, der wirkt. Er fehlte in der API-Referenz und ist jetzt dort sowie auf der Seite zur OpenAI-Kompatibilität nebentop_kdokumentiert. Der zulässige Bereich ist 1 bis 2, Werte außerhalb geben einen400zurück- Er wird auf
gpt-oss-120b,MiniMax-M2.7undgemma-4-31B-itangewendet und aufDeepSeek-V3.2sowieMeta-Llama-3.3-70B-Instructignoriert - Hohe Werte kürzen die Antwort. Bei
gpt-oss-120bundtemperature0 kürzt 1.3 die Antwort mitfinish_reason: "length", und 1.8 liefert überhaupt keinen Inhalt mehr, weil das gesamte Budget in das Reasoning fließt. Beginnen Sie bei 1.05 und bleiben Sie bei höchstens 1.2 - Maßnahme: Wenn Sie
frequency_penaltysetzen, um eine Wiederholungsschleife zu stoppen, bewirkt das nichts. Korrigieren Sie zuersttemperatureund verwenden Sie dannrepetition_penalty
10. September 2026
Dokumentationskorrektur: Ein abgeschaltetes Modell liefert eine 410 im Klartext- Eine Anfrage an ein veraltetes Modell auf
/v1/chat/completionsgibt HTTP 410 mitcontent-type: text/plain; charset=utf-8zurück. Der Body ist kein JSON. Es gibt weder einerror-Objekt noch einerequest_id, sodass das Parsen einen Decode-Fehler auslöst - Offizielle SDKs verkraften dies. Das OpenAI Python SDK löst
openai.APIStatusErrormitstatus_code410 aus und legt den Satz in.bodyab. Clients, die.json()selbst auf der rohen Antwort aufrufen, tun das nicht - Derselbe Fall liefert auf
/v1/responsesJSON (Hülle,typeundcodejeweilsinternal_error) und auf/v1/messagesebenfalls JSON (Anthropic-Struktur,not_found_error) - Die Seite zu den Fehlercodes nannte zwei Antworten ohne Fehlerhülle. Es sind drei. Die Seite, die Hilfsfunktion zum defensiven Parsen und die OpenAPI-Referenz decken jetzt alle drei ab
model_deprecatedist als Code für die 410 dokumentiert, wird derzeit aber von keinem Endpunkt zurückgegeben. Die Tabellenzeile weist nun darauf hin. Eine Korrektur ist bei unserem Plattformanbieter in Arbeit- Wiederholen Sie eine 410 nicht. Der Zustand ist dauerhaft. Ändern Sie die Modell-ID. Siehe API-Fehlercodes
9. September 2026
Dokumentationskorrektur:top_k wird bei niedriger temperature stillschweigend abgeschaltet
top_khat keine Wirkung, solangetemperaturenicht mindestens 0.001 beträgt. Unterhalb dieser Schwelle, auch wenn Sietemperatureganz weglassen, wirdtop_kauf 1 gesetzt und die Dekodierung ist greedy. Eine Anfrage mittop_k: 40und ohnetemperatureliefert Argmax, ohne dass die Antwort auf den ignorierten Wert hinweist- Bei
gemma-4-31B-itlieferttop_k: 40ohnetemperaturebei jeder Anfrage denselben Text. Dieselbe Anfrage mittemperature: 1.0variiert bei jeder Anfrage - Die Standardwerte bei weggelassenen Sampling-Parametern sind jetzt dokumentiert:
temperature0.0,top_p1.0,top_k1048576,repetition_penalty1.0 top_kmuss 1 oder größer sein.-1und0werden auf/v1/chat/completionsund/v1/messagesmit einem 400 abgelehnt. Auf/v1/responseswerden sie akzeptiert, da dieser Endpunkt die Untergrenze nicht prüft, bedeuten dort aber ebenfalls nicht “keine Einschränkung”. Die API-Referenz nannte fürtop_kein Maximum von 100; es wird keine Obergrenze durchgesetzt- Die byte-identische Ausgabe ohne
temperatureist kein fest gesetzter Seed. Sie entsteht durch das erzwungenetop_kvon 1. Verlassen Sie sich nicht über Releases hinweg darauf - Dokumentiert ist jetzt auch, warum
MiniMax-M2.7Sampling verwendet, während die übrigen Modelle greedy dekodieren: nur auf den MiniMax-Bundles werden nicht gesetzte Sampling-Parameter aus dergeneration_config.jsondes Checkpoints ergänzt - Maßnahme: Setzen Sie
temperatureexplizit, bevor Sietop_kanpassen. Siehe Wie top_k mit temperature zusammenwirkt
- Vision-Anfragen unterstützen jetzt Tools und strukturierte Ausgabe.
gemma-4-31B-ithälttools,tool_choiceundresponse_formatauch bei Anfragen mit Bild ein. Die Einschränkung wird während der Generierung angewendet. Siehe Vision - Reasoning-Token werden bei jedem EU-Modell gemeldet. Lesen Sie
usage.completion_tokens_details.reasoning_tokens, um Reasoning getrennt von der sichtbaren Antwort zu budgetieren und abzurechnen. Beigemma-4-31B-itwar der Wert zuvornull. Siehe Reasoning-Tokens auslesen - Fehlerhafte Bilddaten geben HTTP 400 zurück, nicht 500. Dies ist ein permanenter Fehler. Wiederholen Sie die Anfrage nicht
- Fehler verwenden eine einheitliche JSON-Hülle, mit zwei Ausnahmen. Die Antwort enthält eine
request_id, die Sie in jeder Support-Meldung angeben sollten. Ein fehlerhaftes Bild und ein nicht eingehaltenes erzwungenestool_choicegeben weiterhin eine flache Struktur zurück, in dererrorein String ist. Siehe API-Fehlercodes - Streaming von Tool-Aufrufen bei
gpt-oss-120bist sauber. Indelta.contentgelangt kein Reasoning-Gerüst mehr. Beachten Sie, dass dasselbe Modell bei Streams ohne Tools ein Feldchannelim Delta ergänzt - ignorieren Sie Delta-Felder, die Sie nicht kennen. Siehe Tool-Aufrufe streamen - Dokumentationskorrekturen: Die Audio-Seite führte
stream_optionsals akzeptierten Parameter. Der Endpunkt lehnt ihn mit HTTP 400 ab.response_formatsetzt nurjsonundtextum;verbose_json,srtundvttwerden akzeptiert, liefern aber reinen Text. Siehe Audio
18. August 2026
Dokumentationskorrektur:temperature hat keinen Standardwert
- Die API-Referenz nannte einen Standardwert von 0.7 für
temperatureauf/v1/chat/completionsund/v1/responses. Diesen Standardwert gibt es nicht. Die Angabe wurde aus der OpenAPI-Spezifikation und aus allen Seiten entfernt, die sie wiederholt haben - Ohne
temperaturedekodierengemma-4-31B-it,gpt-oss-120b,DeepSeek-V3.2undMeta-Llama-3.3-70B-Instructgreedy.MiniMax-M2.7nutzt Sampling. Das gilt gleichermaßen für/v1/chat/completions,/v1/responsesund/v1/messages - Greedy-Decoding ist die Einstellung, die ein Reasoning-Modell am ehesten in eine nicht endende Wiederholungsschleife führt. Anfragen ohne Sampling-Parameter waren damit genau dem Fehler ausgesetzt, vor dem die Dokumentation warnt
/v1/messagesweicht von der Anthropic API ab, die fürtemperatureeinen Standardwert von 1.0 dokumentiert. Code aus dem Anthropic SDK wechselt zu Greedy-Decoding, sofern Sie den Parameter nicht setzen- Maßnahme: Setzen Sie
temperaturebei jeder Anfrage explizit. Siehe Wenn Sie temperature weglassen
16. Juli 2026
Veraltung: MiniMax-M2.5 abgeschaltetMiniMax-M2.5wird zum 16. Juli 2026, 21:00 Uhr MESZ abgeschaltet. Nach diesem Wechsel geben Anfragen anMiniMax-M2.5einen Fehler zurück- Migrieren Sie zu
MiniMax-M2.7(192k Kontext) odergemma-4-31B-it(kosteneffizient, vision-fähig) - Modellübersicht, Ratenbegrenzungen und Veraltungen aktualisiert
3. Juli 2026
Bevorstehende Veraltung: MiniMax-M2.5MiniMax-M2.5wird am 16. Juli 2026 um 21:00 Uhr MESZ abgeschaltet- Empfohlene Nachfolger:
MiniMax-M2.7(komplexes Reasoning, 192k Kontext) odergemma-4-31B-it(kosteneffizient, vision-fähig) - Beide Nachfolgemodelle sind bereits verfügbar - migrieren Sie vor dem 16. Juli, um Serviceunterbrechungen zu vermeiden
- Hinweise zur Migration finden Sie unter Veraltungen
20. Juni 2026
Modell-Update: Gemma 4 ersetzt Gemma 3gemma-3-12b-itwurde entfernt und in einem einzigen Wechsel durchgemma-4-31B-itersetzt. Anfragen angemma-3-12b-itwerden nicht mehr bedient - aktualisieren Sie Ihre Integrationen auf die Modell-IDgemma-4-31B-it- Gemma 4 ist EU-gehostet auf Infercoms souveräner Infrastruktur mit vollständiger Datensouveränität, bietet ein 128k-Kontextfenster und verbesserte Leistung bei gleichzeitiger Beibehaltung der Vision-Unterstützung
- Vision-Leitfaden mit
gemma-4-31B-it-Beispielen aktualisiert - Ratenbegrenzungen und Veraltungen aktualisiert
5. Juni 2026
Neue Modelle: Whisper-Large-v3 und E5-Mistral-7B-Instruct- Whisper-Large-v3 ist jetzt für Audio-Transkription und -Übersetzung verfügbar - OpenAIs hochmodernes ASR-Modell, EU-gehostet mit vollständiger Datensouveränität
- E5-Mistral-7B-Instruct ist jetzt für die Generierung von Embeddings verfügbar - hochwertige Vektordarstellungen für RAG-, Such- und Klassifizierungs-Workflows
- Beide Modelle laufen auf EU-souveräner Infrastruktur, keine Daten verlassen die EU-Gerichtsbarkeit
- Ratenbegrenzungen für beide Modelle aktualisiert
- Modellübersicht mit neuen Embedding- und Audio-Modell-Abschnitten aktualisiert
24. Mai 2026
Anthropic SDK-Kompatibilität- Neuer
/v1/messages-Endpunkt für Anthropic SDK-Kompatibilität - Verwenden Sie das Anthropic Python SDK mit Infercom-Modellen - ändern Sie nur die Base-URL
- Unterstützt Streaming, System-Prompts, mehrteilige Konversationen und Tool-Verwendung
- Dokumentation
22. Mai 2026
Neues Modell: MiniMax-M2.7- MiniMax-M2.7 ist jetzt als EU-gehostetes Modell mit einem Kontextfenster von 192K verfügbar
- Empfohlen für agentenbasierte Coding-Workflows - ersetzt M2.5 als Standardempfehlung
- MiniMax-M2.5 (160K Kontext) bleibt verfügbar, wird aber in einem künftigen Release abgeschaltet
- Ratenbegrenzungen für MiniMax-M2.7 aktualisiert
15. Mai 2026
Responses API- Neuer
POST /v1/responsesEndpunkt für agentenbasierte Workflows - unterstützt Function Tools, Streaming und Reasoning-Effort-Steuerung - Kompatibel mit OpenAI Responses API Standard
- Unterstützte Modelle:
MiniMax-M2.5,gpt-oss-120b - Dokumentation
gemma-3-12b-itauf EU-souveräne Infrastruktur verschoben - erstes vision-fähiges Modell mit vollständiger EU-Datensouveränität- Vision-Leitfaden
- Codex CLI jetzt über Responses API unterstützt
- Cline und OpenCode Anleitungen mit Plan/Execute-Konfigurationsmuster aktualisiert
24. April 2026
Modellkatalog-Updates- DeepSeek-V3.1 in Global Model Catalog verschoben: Wird jetzt via Proxy (US-Region) statt EU-gehosteter Infrastruktur bereitgestellt
- gemma-3-12b-it hinzugefügt: Googles Gemma 3 12B-Modell jetzt über den Global Model Catalog verfügbar (Japan). Dies ist das erste vision-fähige Modell auf Infercom — siehe Vision-Leitfaden
- DeepSeek-V3.2 Kontextlänge korrigiert: Von 8k auf 32k Tokens aktualisiert
- EU-gehostete Modelle: MiniMax-M2.5 und gpt-oss-120b bleiben als souveräne EU-Optionen
- Vision-Leitfaden mit gemma-3-12b-it-Beispielen und Souveränitätshinweis aktualisiert
- Fähigkeiten-Spalte zu Modellübersicht-Tabellen hinzugefügt
6. April 2026
Neue Dokumentation: Agentic Coding- Agentic Coding-Bereich mit Anleitungen für 9 KI-Coding-Tools hinzugefügt
- Terminal-Tools: Aider, OpenCode, Goose, Warp
- IDE-Tools: Cursor, Cline, Continue, Windsurf
- Fortgeschritten: Claude Code via ccproxy
- Tool-Vergleichsanleitung - Empfehlungen zur Tool-Auswahl
3. April 2026
Global Model Catalog optimiert- Global Model Catalog auf 2 Modelle reduziert:
Meta-Llama-3.3-70B-Instruct(128k) undDeepSeek-V3.2(8k) - 8 Modelle eingestellt: Qwen3-32B, Qwen3-235B, DeepSeek-R1-0528, DeepSeek-R1-Distill-Llama-70B, DeepSeek-V3-0324, DeepSeek-V3.1-Terminus, Llama-4-Maverick-17B-128E-Instruct, Meta-Llama-3.1-8B-Instruct
- Siehe Veraltungen für Migrationsinformationen
- MiniMax-M2.5 Kontextlänge auf 160k korrigiert (war fälschlicherweise als 164k gelistet)
12. März 2026
Modellaktualisierung: MiniMax M2.5 ersetzt Meta-Llama-3.3-70B-Instruct- MiniMax M2.5 ist jetzt als EU-gehostetes Modell auf Infercoms souveräner Infrastruktur in Deutschland verfügbar
- Meta-Llama-3.3-70B-Instruct wurde eingestellt und von der Plattform entfernt. Siehe Veraltungen für Migrationsinformationen
- Ratenbegrenzungen für MiniMax M2.5 aktualisiert
27. Februar 2026
Global Model Catalog Launch- 9 neue Modelle über den Global Model Catalog verfügbar, darunter DeepSeek-R1-0528, Qwen3-235B, Llama-4-Maverick und weitere
- EU-gehostete und global geroutete Modelle sind jetzt klar getrennt in der Modellübersicht
- Ratenbegrenzungen für alle 12 Modelle über Free und Developer Tier aktualisiert
- API
sn_metadatagibt jetztis_external- undregion-Felder für alle Modelle zurück
14. Februar 2026
Neue Dokumentation- Performance & Latenz-Leitfaden hinzugefügt mit Themen zu Connection Pooling, Performance-Metadaten in der API-Antwort, Streaming-Optimierung und Best Practices zur Latenzreduzierung
5. Februar 2026
Dokumentation für Global Model Catalog- Dokumentation für den Global Model Catalog hinzugefügt, mit EU-gehosteten und global gerouteten Modellen
- Dokumentiert wie man Modellregionen identifiziert über die API (
sn_metadata.region) und den Playground - API-Referenz mit
sn_metadata-Schema und?verbose=true-Abfrageparameter aktualisiert - Souveränitätsaussagen in der Dokumentation überprüft und für den Global Model Catalog präzisiert
23. Januar 2026
Modell-Update- DeepSeek-Modell von
DeepSeek-V3-0324-cbaufDeepSeek-V3.1mit erweitertem 128k-Kontextfenster aktualisiert - Das vorherige Modell wurde als veraltet markiert und ist auf der Veraltungsseite aufgeführt
- Ratenbegrenzungen für alle Modelle aktualisiert
13. Januar 2026
Neu- Hugging Face Spaces Chat-Demo - Interaktiver Chat mit Modellauswahl und Echtzeit-Performance-Metriken
- Dokumentationsbereinigung und Link-Korrekturen
30. Dezember 2025
Aktualisierung des Modellkatalogs mit den aktuell verfügbaren Modellen auf Infercom Inference Service. Die Modellliste und die Ratenbegrenzungen wurden entsprechend aktualisiert.17. November 2025
Wir freuen uns, die Einführung des Infercom-Dokumentationsportals bekannt zu geben. Diese umfassende Dokumentation wurde auf Basis der SambaNova-Dokumentation (Stand: 7. Oktober 2025) erstellt und für die EU-souveräne AI-Inferenz-Plattform von Infercom angepasst. Wichtigste Funktionen- Vollständige API-Referenzdokumentation mit OpenAI-kompatiblen Endpunkten.
- Entwicklerhandbücher für die Integration mit der Infercom-Inferenz-Plattform.
- Modellkatalog- und Konfigurationsdokumentation für alle unterstützten Modelle.
- Plattformarchitektur- und Bereitstellungsanleitungen.
- Anwendungsbeispiele in Python und TypeScript, unterstützt durch OpenAI-kompatible SDKs.