Skip to main content
Die Infercom KI-Inferenz-APIs sind für die Kompatibilität mit OpenAI-Client-Bibliotheken konzipiert, um die Einführung unserer Inferenz-Technologien zur Verbesserung Ihrer KI-Anwendungen zu vereinfachen.

Bibliothek herunterladen

Führen Sie den folgenden Befehl aus, um die Bibliothek herunterzuladen.

Infercom APIs mit OpenAI-Client-Bibliotheken verwenden

Die Konfiguration Ihrer OpenAI-Client-Bibliotheken für die Verwendung der Infercom KI-Inferenz-APIs ist so einfach wie das Festlegen von zwei Werten: der base_url und Ihres api_key, wie unten dargestellt.
Sie haben noch keinen Infercom API-Schlüssel? Holen Sie sich Ihren von der Seite API-Schlüssel und URLs.
Jetzt können Sie eine API-Anfrage an ein Modell stellen und wählen, wie Sie Ihre Ausgabe erhalten möchten.

Beispiel ohne Streaming

Der folgende Code demonstriert die Verwendung des OpenAI Python-Clients für Vervollständigungen ohne Streaming.

Beispiel mit Streaming

Der folgende Code demonstriert die Verwendung des OpenAI Python-Clients für Vervollständigungen mit Streaming.
Im Streaming-Modus gibt die API Chunks zurück, die mehrere Tokens enthalten. Bei der Berechnung von Metriken wie Tokens pro Sekunde oder Zeit pro Ausgabe-Token stellen Sie sicher, dass Sie alle Tokens in jedem Chunk berücksichtigen.

Akzeptiert und ignoriert

Zwei OpenAI-Parameter werden aus Gründen der API-Kompatibilität akzeptiert und haben bei keinem Modell eine Wirkung:
  • presence_penalty
  • frequency_penalty
Verwenden Sie stattdessen repetition_penalty, um Wiederholungen zu steuern.
frequency_penalty akzeptiert zudem Werte außerhalb des dokumentierten Bereichs von -2.0 bis 2.0 ohne Fehler und ignoriert auch diese. presence_penalty lehnt sie dagegen mit einem 400 ab.

Unterstützt, aber nicht bei jedem Modell

Diese Parameter funktionieren. Welche Modelle sie anwenden, ist unterschiedlich. Prüfen Sie daher die Tabelle, bevor Sie sich auf einen verlassen.
seed grenzt die Ausgabe bei MiniMax-M2.7 ein, legt sie aber nicht fest. Bei temperature 1.0 grenzt ein Seed die Antwort auf zwei Varianten ein statt auf eine, während derselbe Prompt ohne Seed bei jeder Anfrage variiert. Bei gpt-oss-120b, DeepSeek-V3.2 und Meta-Llama-3.3-70B-Instruct legt ein Seed die Antwort fest: derselbe Seed liefert jedes Mal denselben Text, ein anderer Seed einen anderen. Verlassen Sie sich bei byte-reproduzierbaren Evaluierungsläufen nicht auf MiniMax-M2.7.
Ein Parameter ohne Wirkung auf ein Modell wird dennoch akzeptiert. Nichts in der Antwort weist darauf hin, dass er verworfen wurde. Prüfen Sie ihn gegen Ihr eigenes Modell, bevor Sie sich darauf verlassen.

Funktionsunterschiede

temperature: Die Infercom API akzeptiert Werte zwischen 0 und 2, denselben Bereich wie OpenAI. Werte über 2 werden mit einem 400 abgelehnt. Anders als OpenAI wendet die Infercom API keinen Standardwert an. Ohne temperature dekodieren die meisten Modelle greedy, was sich wie temperature 0 verhält. Setzen Sie den Parameter bei jeder Anfrage. Siehe Wenn Sie temperature weglassen.

Infercom API-Funktionen, die von OpenAI-Clients nicht unterstützt werden

Die Infercom API unterstützt zwei Parameter, die die OpenAI-Client-Bibliotheken nicht kennen:
  • top_k - beschränkt das Sampling auf die K wahrscheinlichsten Token. Der Parameter hat keine Wirkung, solange temperature nicht mindestens 0.001 beträgt. Siehe Wie top_k mit temperature zusammenwirkt.
  • repetition_penalty - die einzige Wiederholungskontrolle, die diese API anwendet. Verwenden Sie ihn anstelle von frequency_penalty, das akzeptiert und ignoriert wird. Der zulässige Bereich ist 1 bis 2. Setzen Sie zuerst ein passendes temperature und halten Sie repetition_penalty dann bei höchstens 1.2.
Die OpenAI-SDKs lehnen unbekannte Top-Level-Argumente ab. Senden Sie beide daher über extra_body.