Skip to main content
Reasoning-Modelle verarbeiten Informationen systematisch, um logische Schlussfolgerungen zu ziehen und komplexe Probleme Schritt für Schritt zu lösen. Bevor sie eine endgültige Antwort erzeugen, generieren sie eine interne Gedankenkette - sie durchdenken das Problem, prüfen Alternativen und korrigieren sich selbst. Das macht sie besonders geeignet für Mathematik, Programmierung, mehrstufige Planung und die Analyse mehrdeutiger oder komplexer Eingaben.

Reasoning-Modelle auf Infercom

Die folgenden Modelle unterstützen Reasoning. Prüfen Sie immer Unterstützte Modelle für aktuelle Verfügbarkeit und Regionen. Die beiden Steuerungen sind nicht austauschbar und gelten jeweils nur für ein Modell:
  • reasoning_effort steuert, wie viel gpt-oss-120b reasoniert. Reasoning lässt sich damit nicht abschalten.
  • enable_thinking schaltet Reasoning für gemma-4-31B-it ein oder aus. Dieses Modell reasoniert nur, wenn Sie es anfordern.
Wenn Sie einen dieser Parameter an ein Modell senden, das ihn nicht implementiert, wird er akzeptiert und stillschweigend ignoriert - Sie erhalten keinen Fehler und keine Verhaltensänderung.

Wie Reasoning in der Antwort erscheint

Reasoning-fähige Modelle geben ihre Gedankenkette in einem dedizierten reasoning-Feld der Nachricht zurück, getrennt von der endgültigen Antwort in content:
Verwenden Sie reasoning für Transparenz oder Debugging und content für die Antwort, die Sie Nutzern anzeigen.
Fügen Sie bei mehrteiligen Konversationen nur den endgültigen content des Modells zurück in den Nachrichtenverlauf ein - geben Sie vorheriges reasoning nicht an die nächste Runde weiter.

Token-Budget für Reasoning

Reasoning-Tokens zählen zu Ihrem Token-Limit. Bei Reasoning-Modellen wird die Gedankenkette (Chain-of-Thought), die das Modell vor seiner endgültigen Antwort generiert, auf max_tokens (bzw. max_completion_tokens) angerechnet. Wenn Sie dieses Limit zu niedrig setzen, kann das Modell das gesamte Budget für das Denken verbrauchen und wird abgeschnitten, bevor es eine sichtbare Antwort erzeugt.In diesem Fall kommt die Antwort leer oder abgeschnitten zurück und finish_reason ist "length". Prüfen Sie immer finish_reason: Ist der Wert "length", erhöhen Sie max_tokens und wiederholen Sie die Anfrage. Planen Sie bei Reasoning-Modellen großzügig - lassen Sie genügend Spielraum sowohl für das Reasoning als auch für die endgültige Antwort.
Dies ist die häufigste Ursache für “leere” oder “fehlerhafte” Antworten von Reasoning-Modellen. Da die Gedankenkette zuerst generiert wird und auf Ihr Token-Limit angerechnet wird, wird ein niedriger max_tokens-Wert vom Reasoning aufgebraucht, bevor eine Antwort erzeugt wird. Als Faustregel gilt: Planen Sie je nach Aufgabenkomplexität einige Hundert bis einige Tausend Tokens Spielraum über die erwartete Antwortlänge hinaus ein. Bei schwierigen Mathematik-, Programmier- oder Planungsaufgaben kann das Reasoning lang sein - budgetieren Sie entsprechend.
Eine niedrige Temperatur kann zu nicht endendem Reasoning führen. Reasoning-Modelle können in eine Wiederholungsschleife geraten und denselben Punkt in leicht abgewandelten Worten wiederholen, bis max_tokens aufgebraucht ist. Sie sehen dann finish_reason: "length", eine sehr hohe Anzahl an reasoning_tokens und keine brauchbare Antwort.Je niedriger die Temperatur, desto wahrscheinlicher ist dies, am ausgeprägtesten bei temperature=0. Ein höheres max_tokens hilft hier nicht - die Schleife läuft dann lediglich länger.Eine niedrige Temperatur bleibt eine legitime Wahl für reproduzierbare oder strukturierte Ausgaben. Wenn Sie jedoch eine niedrige Temperatur verwenden und abgeschnittene Antworten sehen, erhöhen Sie zuerst die Temperatur in Richtung des vom Modellanbieter empfohlenen Werts, bevor Sie max_tokens weiter erhöhen. Siehe Empfohlene Sampling-Parameter.

Reasoning steuern

Modelle mit reasoning_effort

gpt-oss-120b akzeptiert einen reasoning_effort-Parameter (low, medium, high), der Latenz und Token-Verbrauch gegen Antwortqualität abwägt. Wenn Sie ihn weglassen, verwendet das Modell medium.
Reasoning lässt sich bei gpt-oss-120b nicht deaktivieren. low ist das Minimum und erzeugt weiterhin eine kurze Gedankenkette. Werte wie "none" oder "off" werden mit einem 400 abgelehnt. Wenn Sie ein Modell benötigen, das ohne Reasoning antwortet, verwenden Sie gemma-4-31B-it, bei dem Thinking standardmäßig ausgeschaltet ist.

Modelle mit konfigurierbarem Thinking (enable_thinking)

gemma-4-31B-it verfügt über einen konfigurierbaren Thinking-Modus, den Sie über chat_template_kwargs ein- oder ausschalten. Setzen Sie enable_thinking auf true, damit das Modell vor der Antwort nachdenkt, oder auf false für eine direkte Antwort. Thinking ist standardmäßig ausgeschaltet. Wenn Sie enable_thinking weglassen, antwortet das Modell direkt und das Feld reasoning bleibt leer - das Weglassen verhält sich exakt wie false. Sie müssen true übergeben, um eine Gedankenkette zu erhalten.
reasoning_effort hat bei gemma-4-31B-it keine Wirkung. Die Anfrage ist erfolgreich, die Ausgabe bleibt jedoch unverändert, ob Sie low, medium oder high senden. Verwenden Sie stattdessen enable_thinking.
Übergeben Sie beim OpenAI Python SDK nicht-standardmäßige Parameter wie chat_template_kwargs innerhalb von extra_body, wie oben gezeigt. Beim direkten Aufruf der API (cURL) fügen Sie chat_template_kwargs auf der obersten Ebene des Anfrage-Bodys ein.

Modelle, die standardmäßig reasonen

MiniMax-M2.7 und die DeepSeek-Modelle reasonen standardmäßig - es ist kein zusätzlicher Parameter erforderlich. Senden Sie einfach Ihre Anfrage und lesen Sie die Felder reasoning und content aus der Antwort. Diese Modelle bieten keine Steuerung dafür, wie viel sie reasonen. Sie akzeptieren reasoning_effort aus Gründen der OpenAI-Kompatibilität, der Parameter ändert ihr Verhalten jedoch nicht. Kalkulieren Sie stattdessen max_tokens großzügig, wie oben beschrieben.

Fehlerbehebung: leere oder abgeschnittene Antworten

Wenn ein Reasoning-Modell ein leeres content, eine mitten im Satz abgebrochene Antwort oder scheinbar rohes Thinking in der Ausgabe zurückgibt, liegt die Ursache meist an einem unzureichenden Token-Budget - nicht an einem Modellfehler. Eine zweite, weniger offensichtliche Ursache ist eine Temperatur deutlich unter dem vom Anbieter empfohlenen Wert, die das Modell in eine Wiederholungsschleife führen kann.
1

finish_reason prüfen

Sehen Sie sich choices[0].finish_reason in der Antwort an. Der Wert "length" bedeutet, dass das Modell Ihr max_tokens-Limit erreicht hat, bevor es fertig war. "stop" bedeutet, dass es normal abgeschlossen wurde.
2

max_tokens erhöhen

Wenn finish_reason "length" ist, erhöhen Sie max_tokens (bzw. max_completion_tokens) und wiederholen Sie die Anfrage. Geben Sie dem Modell genügend Raum sowohl für das Reasoning als auch für die endgültige Antwort.
3

Temperatur prüfen, wenn ein höheres max_tokens nicht hilft

Vergleichen Sie usage.completion_tokens_details.reasoning_tokens mit Ihrem max_tokens. Wenn das Reasoning auch bei einem höheren Limit erneut das gesamte Budget verbraucht, liegt wahrscheinlich eine Wiederholungsschleife vor. Erhöhen Sie die Temperatur in Richtung des Werts, den der Anbieter für dieses Modell empfiehlt.
4

reasoning- und content-Felder überprüfen

Bestätigen Sie, dass reasoning die Gedankenkette und content die endgültige Antwort enthält. Bei ausreichendem Budget und sinnvoller Temperatur sind beide sauber getrennt.
Häufige Fehlersignaturen:

Prompting von Reasoning-Modellen

  • Halten Sie System-Prompts minimal. Übermäßige Anweisungen können den Reasoning-Spielraum des Modells einschränken und die Qualität verringern.
  • Verzichten Sie auf eigenes “Denke Schritt für Schritt”-Chain-of-Thought-Prompting - das Modell reasont bereits intern. Verwenden Sie klare Zero-Shot- oder Einzelanweisungs-Prompts.
  • Verwenden Sie die Sampling-Parameter, die der Modellanbieter empfiehlt. Sie unterscheiden sich je Modell und sind unter Empfohlene Sampling-Parameter aufgeführt. Für MiniMax-M2.7 empfiehlt der Anbieter temperature 1.0, top_p 0.95 und top_k 40.
  • temperature=1.0 bedeutet nicht “maximale Zufälligkeit”. Es bedeutet, dass die Wahrscheinlichkeitsverteilung des Modells exakt so verwendet wird, wie sie trainiert wurde. Werte unter 1.0 schärfen sie, Werte über 1.0 flachen sie ab. Die Infercom API akzeptiert Werte von 0 bis 2.

Anwendungsfälle

Berichterstellung

Reasoning-Modelle eignen sich gut zur Verarbeitung unstrukturierter Informationen - Rechtsverträge, Finanzberichte oder wissenschaftliche Arbeiten - und erkennen Muster über mehrere Facetten der Eingabe hinweg, bevor sie diese zu einer umfassenden Zusammenfassung verdichten.

Planung für Workflows und Agenten

Reasoning-Modelle sind hervorragend für mehrdeutige, komplexe Aufgaben geeignet. Sie können komplizierte Probleme zerlegen, Lösungen strategisch planen und Entscheidungen über große Mengen unsicherer Informationen treffen - was sie zu effektiven Planern und Orchestratoren in agentenbasierten Systemen macht.

Programmierung und Mathematik

Diese Modelle sind effektiv beim Überprüfen und Verbessern von Code, beim Erkennen subtiler Probleme, die bei flüchtigem Lesen übersehen werden, und beim Zerlegen von Mathematikaufgaben in überprüfbare Schritte.

Best Practices

Tokens für Reasoning budgetieren

Reasoning wird auf max_tokens angerechnet. Setzen Sie das Limit hoch genug für sowohl die Gedankenkette als auch die endgültige Antwort. Wenn Antworten leer oder abgeschnitten zurückkommen, prüfen Sie finish_reason - der Wert "length" bedeutet, dass Sie max_tokens erhöhen müssen.
Reasoning-Ausgaben haben aufgrund des Chain-of-Thought-Prozesses eine höhere Latenz und einen höheren Token-Verbrauch. Erwägen Sie für einfachere Aufgaben ein Nicht-Reasoning-Modell (oder deaktivieren Sie Thinking, sofern das Modell dies unterstützt), um Budget und Antwortzeit zu optimieren.
Das Aktivieren von Streaming verbessert die wahrgenommene Reaktionsfähigkeit, da Reasoning-Modelle länger für eine vollständige Antwort benötigen. Fügen Sie stream=True zu Ihrer Anfrage hinzu, um Tokens anzuzeigen, sobald sie verfügbar sind.

FAQs

Dafür gibt es zwei häufige Ursachen. Erstens werden Reasoning-Tokens auf max_tokens angerechnet, sodass das Budget aufgebraucht sein kann, bevor eine sichtbare Antwort erzeugt wird - erhöhen Sie max_tokens. Zweitens kann das Modell bei niedriger Temperatur in eine Wiederholungsschleife geraten, die nie endet - ein höheres max_tokens hilft dann nicht, und Sie sollten die Temperatur in Richtung des vom Anbieter empfohlenen Werts für dieses Modell bewegen.Um beides zu unterscheiden, prüfen Sie usage.completion_tokens_details.reasoning_tokens. Entspricht der Wert exakt Ihrem max_tokens, egal wie hoch Sie das Limit setzen, liegt vermutlich eine Schleife vor.
Verwenden Sie die Werte, die der Modellanbieter empfiehlt - sie unterscheiden sich je Modell und sind unter Empfohlene Sampling-Parameter aufgeführt. Es gibt keinen einzelnen Wert, der für jedes Modell passt. Die Infercom API akzeptiert eine Temperatur von 0 bis 2, und temperature=1.0 bedeutet, dass die Verteilung des Modells exakt wie trainiert verwendet wird, nicht “maximale Zufälligkeit”.
Es sind zwei verschiedene Steuerungen für zwei verschiedene Modelle, und keine wirkt beim Modell der jeweils anderen. gpt-oss-120b verwendet reasoning_effort (low/medium/high), um zu steuern, wie viel es reasont; der Standard ist medium und Reasoning lässt sich nicht abschalten. gemma-4-31B-it verwendet chat_template_kwargs: {"enable_thinking": true/false}, um Reasoning ein- oder auszuschalten; standardmäßig ist es aus. Wenn Sie einen der Parameter an ein Modell senden, das ihn nicht implementiert, wird er akzeptiert und stillschweigend ignoriert - prüfen Sie daher die Tabelle oben, bevor Sie sich darauf verlassen.
Nur gemma-4-31B-it kann ohne Reasoning antworten - und tut dies bereits standardmäßig, da enable_thinking ausgeschaltet ist, sofern Sie es nicht setzen. Bei gpt-oss-120b, MiniMax-M2.7 und den DeepSeek-Modellen lässt sich Reasoning nicht deaktivieren; reasoning_effort: "none" ist kein gültiger Wert und führt zu einem 400. Die niedrigste verfügbare Einstellung ist reasoning_effort: "low" bei gpt-oss-120b, die weiterhin eine kurze Gedankenkette erzeugt.
Siehe die Seite Unterstützte Modelle für die Kontextlänge jedes Modells.
Mit EU gekennzeichnete Modelle laufen in Infercoms EU-Rechenzentren in Deutschland mit vollständiger Datensouveränität. Prüfen Sie die Seite Unterstützte Modelle, um die Region jedes Modells zu verifizieren.