Bibliothek herunterladen
Führen Sie den folgenden Befehl aus, um die Bibliothek herunterzuladen.Infercom APIs mit OpenAI-Client-Bibliotheken verwenden
Die Konfiguration Ihrer OpenAI-Client-Bibliotheken für die Verwendung der Infercom KI-Inferenz-APIs ist so einfach wie das Festlegen von zwei Werten: derbase_url und Ihres api_key, wie unten dargestellt.
Sie haben noch keinen Infercom API-Schlüssel? Holen Sie sich Ihren von der Seite API-Schlüssel und URLs.
Beispiel ohne Streaming
Der folgende Code demonstriert die Verwendung des OpenAI Python-Clients für Vervollständigungen ohne Streaming.Beispiel mit Streaming
Der folgende Code demonstriert die Verwendung des OpenAI Python-Clients für Vervollständigungen mit Streaming.Im Streaming-Modus gibt die API Chunks zurück, die mehrere Tokens enthalten. Bei der Berechnung von Metriken wie Tokens pro Sekunde oder Zeit pro Ausgabe-Token stellen Sie sicher, dass Sie alle Tokens in jedem Chunk berücksichtigen.
Akzeptiert und ignoriert
Zwei OpenAI-Parameter werden aus Gründen der API-Kompatibilität akzeptiert und haben bei keinem Modell eine Wirkung:presence_penaltyfrequency_penalty
repetition_penalty, um Wiederholungen zu steuern.
Unterstützt, aber nicht bei jedem Modell
Diese Parameter funktionieren. Welche Modelle sie anwenden, ist unterschiedlich. Prüfen Sie daher die Tabelle, bevor Sie sich auf einen verlassen.seed grenzt die Ausgabe bei MiniMax-M2.7 ein, legt sie aber nicht fest. Bei temperature 1.0 grenzt ein Seed die Antwort auf zwei Varianten ein statt auf eine, während derselbe Prompt ohne Seed bei jeder Anfrage variiert. Bei gpt-oss-120b, DeepSeek-V3.2 und Meta-Llama-3.3-70B-Instruct legt ein Seed die Antwort fest: derselbe Seed liefert jedes Mal denselben Text, ein anderer Seed einen anderen. Verlassen Sie sich bei byte-reproduzierbaren Evaluierungsläufen nicht auf MiniMax-M2.7.Funktionsunterschiede
temperature: Die Infercom API akzeptiert Werte zwischen 0 und 2, denselben Bereich wie OpenAI. Werte über 2 werden mit einem 400 abgelehnt. Anders als OpenAI wendet die Infercom API keinen Standardwert an. Ohne temperature dekodieren die meisten Modelle greedy, was sich wie temperature 0 verhält. Setzen Sie den Parameter bei jeder Anfrage. Siehe Wenn Sie temperature weglassen.
Infercom API-Funktionen, die von OpenAI-Clients nicht unterstützt werden
Die Infercom API unterstützt zwei Parameter, die die OpenAI-Client-Bibliotheken nicht kennen:top_k- beschränkt das Sampling auf die K wahrscheinlichsten Token. Der Parameter hat keine Wirkung, solangetemperaturenicht mindestens 0.001 beträgt. Siehe Wie top_k mit temperature zusammenwirkt.repetition_penalty- die einzige Wiederholungskontrolle, die diese API anwendet. Verwenden Sie ihn anstelle vonfrequency_penalty, das akzeptiert und ignoriert wird. Der zulässige Bereich ist 1 bis 2. Setzen Sie zuerst ein passendestemperatureund halten Sierepetition_penaltydann bei höchstens 1.2.
extra_body.