Reasoning-Modelle auf Infercom
Die folgenden Modelle unterstützen Reasoning. Prüfen Sie immer Unterstützte Modelle für aktuelle Verfügbarkeit und Regionen.reasoning_effortsteuert, wie vielgpt-oss-120breasoniert. Reasoning lässt sich damit nicht abschalten.enable_thinkingschaltet Reasoning fürgemma-4-31B-itein oder aus. Dieses Modell reasoniert nur, wenn Sie es anfordern.
Wie Reasoning in der Antwort erscheint
Reasoning-fähige Modelle geben ihre Gedankenkette in einem dediziertenreasoning-Feld der Nachricht zurück, getrennt von der endgültigen Antwort in content:
reasoning für Transparenz oder Debugging und content für die Antwort, die Sie Nutzern anzeigen.
content des Modells zurück in den Nachrichtenverlauf ein - geben Sie vorheriges reasoning nicht an die nächste Runde weiter.Token-Budget für Reasoning
Dies ist die häufigste Ursache für “leere” oder “fehlerhafte” Antworten von Reasoning-Modellen. Da die Gedankenkette zuerst generiert wird und auf Ihr Token-Limit angerechnet wird, wird ein niedrigermax_tokens-Wert vom Reasoning aufgebraucht, bevor eine Antwort erzeugt wird.
Als Faustregel gilt: Planen Sie je nach Aufgabenkomplexität einige Hundert bis einige Tausend Tokens Spielraum über die erwartete Antwortlänge hinaus ein. Bei schwierigen Mathematik-, Programmier- oder Planungsaufgaben kann das Reasoning lang sein - budgetieren Sie entsprechend.
Reasoning steuern
Modelle mit reasoning_effort
gpt-oss-120b akzeptiert einen reasoning_effort-Parameter (low, medium, high), der Latenz und Token-Verbrauch gegen Antwortqualität abwägt. Wenn Sie ihn weglassen, verwendet das Modell medium.
gpt-oss-120b nicht deaktivieren. low ist das Minimum und erzeugt weiterhin eine kurze Gedankenkette. Werte wie "none" oder "off" werden mit einem 400 abgelehnt. Wenn Sie ein Modell benötigen, das ohne Reasoning antwortet, verwenden Sie gemma-4-31B-it, bei dem Thinking standardmäßig ausgeschaltet ist.Modelle mit konfigurierbarem Thinking (enable_thinking)
gemma-4-31B-it verfügt über einen konfigurierbaren Thinking-Modus, den Sie über chat_template_kwargs ein- oder ausschalten. Setzen Sie enable_thinking auf true, damit das Modell vor der Antwort nachdenkt, oder auf false für eine direkte Antwort.
Thinking ist standardmäßig ausgeschaltet. Wenn Sie enable_thinking weglassen, antwortet das Modell direkt und das Feld reasoning bleibt leer - das Weglassen verhält sich exakt wie false. Sie müssen true übergeben, um eine Gedankenkette zu erhalten.
chat_template_kwargs innerhalb von extra_body, wie oben gezeigt. Beim direkten Aufruf der API (cURL) fügen Sie chat_template_kwargs auf der obersten Ebene des Anfrage-Bodys ein.Modelle, die standardmäßig reasonen
MiniMax-M2.7 und die DeepSeek-Modelle reasonen standardmäßig - es ist kein zusätzlicher Parameter erforderlich. Senden Sie einfach Ihre Anfrage und lesen Sie die Felder reasoning und content aus der Antwort.
Diese Modelle bieten keine Steuerung dafür, wie viel sie reasonen. Sie akzeptieren reasoning_effort aus Gründen der OpenAI-Kompatibilität, der Parameter ändert ihr Verhalten jedoch nicht. Kalkulieren Sie stattdessen max_tokens großzügig, wie oben beschrieben.
Fehlerbehebung: leere oder abgeschnittene Antworten
Wenn ein Reasoning-Modell ein leerescontent, eine mitten im Satz abgebrochene Antwort oder scheinbar rohes Thinking in der Ausgabe zurückgibt, liegt die Ursache meist an einem unzureichenden Token-Budget - nicht an einem Modellfehler. Eine zweite, weniger offensichtliche Ursache ist eine Temperatur deutlich unter dem vom Anbieter empfohlenen Wert, die das Modell in eine Wiederholungsschleife führen kann.
finish_reason prüfen
choices[0].finish_reason in der Antwort an. Der Wert "length" bedeutet, dass das Modell Ihr max_tokens-Limit erreicht hat, bevor es fertig war. "stop" bedeutet, dass es normal abgeschlossen wurde.max_tokens erhöhen
finish_reason "length" ist, erhöhen Sie max_tokens (bzw. max_completion_tokens) und wiederholen Sie die Anfrage. Geben Sie dem Modell genügend Raum sowohl für das Reasoning als auch für die endgültige Antwort.Temperatur prüfen, wenn ein höheres max_tokens nicht hilft
usage.completion_tokens_details.reasoning_tokens mit Ihrem max_tokens. Wenn das Reasoning auch bei einem höheren Limit erneut das gesamte Budget verbraucht, liegt wahrscheinlich eine Wiederholungsschleife vor. Erhöhen Sie die Temperatur in Richtung des Werts, den der Anbieter für dieses Modell empfiehlt.reasoning- und content-Felder überprüfen
reasoning die Gedankenkette und content die endgültige Antwort enthält. Bei ausreichendem Budget und sinnvoller Temperatur sind beide sauber getrennt.Prompting von Reasoning-Modellen
- Halten Sie System-Prompts minimal. Übermäßige Anweisungen können den Reasoning-Spielraum des Modells einschränken und die Qualität verringern.
- Verzichten Sie auf eigenes “Denke Schritt für Schritt”-Chain-of-Thought-Prompting - das Modell reasont bereits intern. Verwenden Sie klare Zero-Shot- oder Einzelanweisungs-Prompts.
- Verwenden Sie die Sampling-Parameter, die der Modellanbieter empfiehlt. Sie unterscheiden sich je Modell und sind unter Empfohlene Sampling-Parameter aufgeführt. Für
MiniMax-M2.7empfiehlt der Anbietertemperature1.0,top_p0.95 undtop_k40. temperature=1.0bedeutet nicht “maximale Zufälligkeit”. Es bedeutet, dass die Wahrscheinlichkeitsverteilung des Modells exakt so verwendet wird, wie sie trainiert wurde. Werte unter 1.0 schärfen sie, Werte über 1.0 flachen sie ab. Die Infercom API akzeptiert Werte von 0 bis 2.
Anwendungsfälle
Berichterstellung
Reasoning-Modelle eignen sich gut zur Verarbeitung unstrukturierter Informationen - Rechtsverträge, Finanzberichte oder wissenschaftliche Arbeiten - und erkennen Muster über mehrere Facetten der Eingabe hinweg, bevor sie diese zu einer umfassenden Zusammenfassung verdichten.Planung für Workflows und Agenten
Reasoning-Modelle sind hervorragend für mehrdeutige, komplexe Aufgaben geeignet. Sie können komplizierte Probleme zerlegen, Lösungen strategisch planen und Entscheidungen über große Mengen unsicherer Informationen treffen - was sie zu effektiven Planern und Orchestratoren in agentenbasierten Systemen macht.Programmierung und Mathematik
Diese Modelle sind effektiv beim Überprüfen und Verbessern von Code, beim Erkennen subtiler Probleme, die bei flüchtigem Lesen übersehen werden, und beim Zerlegen von Mathematikaufgaben in überprüfbare Schritte.Best Practices
Tokens für Reasoning budgetieren
Tokens für Reasoning budgetieren
max_tokens angerechnet. Setzen Sie das Limit hoch genug für sowohl die Gedankenkette als auch die endgültige Antwort. Wenn Antworten leer oder abgeschnitten zurückkommen, prüfen Sie finish_reason - der Wert "length" bedeutet, dass Sie max_tokens erhöhen müssen.Latenz und Kosten
Latenz und Kosten
Streaming
Streaming
stream=True zu Ihrer Anfrage hinzu, um Tokens anzuzeigen, sobald sie verfügbar sind.FAQs
Warum erhalte ich eine leere oder abgeschnittene Antwort mit finish_reason: length?
Warum erhalte ich eine leere oder abgeschnittene Antwort mit finish_reason: length?
max_tokens angerechnet, sodass das Budget aufgebraucht sein kann, bevor eine sichtbare Antwort erzeugt wird - erhöhen Sie max_tokens. Zweitens kann das Modell bei niedriger Temperatur in eine Wiederholungsschleife geraten, die nie endet - ein höheres max_tokens hilft dann nicht, und Sie sollten die Temperatur in Richtung des vom Anbieter empfohlenen Werts für dieses Modell bewegen.Um beides zu unterscheiden, prüfen Sie usage.completion_tokens_details.reasoning_tokens. Entspricht der Wert exakt Ihrem max_tokens, egal wie hoch Sie das Limit setzen, liegt vermutlich eine Schleife vor.Welche temperature und top_p sollte ich verwenden?
Welche temperature und top_p sollte ich verwenden?
temperature=1.0 bedeutet, dass die Verteilung des Modells exakt wie trainiert verwendet wird, nicht “maximale Zufälligkeit”.Was ist der Unterschied zwischen reasoning_effort und enable_thinking?
Was ist der Unterschied zwischen reasoning_effort und enable_thinking?
gpt-oss-120b verwendet reasoning_effort (low/medium/high), um zu steuern, wie viel es reasont; der Standard ist medium und Reasoning lässt sich nicht abschalten. gemma-4-31B-it verwendet chat_template_kwargs: {"enable_thinking": true/false}, um Reasoning ein- oder auszuschalten; standardmäßig ist es aus. Wenn Sie einen der Parameter an ein Modell senden, das ihn nicht implementiert, wird er akzeptiert und stillschweigend ignoriert - prüfen Sie daher die Tabelle oben, bevor Sie sich darauf verlassen.Wie schalte ich Reasoning vollständig aus?
Wie schalte ich Reasoning vollständig aus?
gemma-4-31B-it kann ohne Reasoning antworten - und tut dies bereits standardmäßig, da enable_thinking ausgeschaltet ist, sofern Sie es nicht setzen. Bei gpt-oss-120b, MiniMax-M2.7 und den DeepSeek-Modellen lässt sich Reasoning nicht deaktivieren; reasoning_effort: "none" ist kein gültiger Wert und führt zu einem 400. Die niedrigste verfügbare Einstellung ist reasoning_effort: "low" bei gpt-oss-120b, die weiterhin eine kurze Gedankenkette erzeugt.Ich habe einen 400-Fehler zur maximalen Kontextlänge erhalten. Wo kann ich das Limit prüfen?
Ich habe einen 400-Fehler zur maximalen Kontextlänge erhalten. Wo kann ich das Limit prüfen?
Wo werden diese Modelle gehostet?
Wo werden diese Modelle gehostet?