Modelle
Infercom Modell-Ratenbegrenzungen
Rate Limits nach Modell und Tarif für die Infercom API. Anfragen pro Minute, Token pro Minute und Umgang mit Rate-Limit-Fehlern.
Ratenbegrenzungen sind ein Mechanismus zur Verwaltung der Infercom API-Nutzung, um stabile Leistung und zuverlässigen Service zu gewährleisten. Sie begrenzen, wie oft jeder Benutzer die Infercom API innerhalb eines bestimmten Zeitraums aufrufen kann.
Ratenbegrenzungen werden gemessen in:
- RPM: Anfragen pro Minute (Requests per minute)
- RPD: Anfragen pro Tag (Requests per day)
Grundlagen
- Eine Anfrage wird durch einen Aufruf unserer API definiert
- Sie können entweder die RPM- oder RPD-Grenze erreichen, je nachdem, welche Sie zuerst erreichen
- Sie werden in jeder Antwort über den Status Ihrer Ratenbegrenzungen informiert (siehe Ratenbegrenzungs-Response-Header für weitere Informationen)
- Wenn Sie eine Ratenbegrenzung erreichen, erhalten Sie eine Fehlermeldung in Ihrer Antwort (siehe API-Fehlercodes)
- Prüfen Sie die Infercom Status-Seite für Echtzeit-Plattform- und Modellverfügbarkeit
Infercom Inference Service Ratenbegrenzungs-Stufen
Abschnitt betitelt „Infercom Inference Service Ratenbegrenzungs-Stufen“Es gibt verschiedene Ratenbegrenzungs-Stufen, die wir anbieten:
- Free Tier: Wird angewendet, wenn keine Zahlungsmethode mit Ihrem Konto verknüpft ist
- Developer Tier: Wird angewendet, wenn eine Zahlungsmethode mit Ihrem Konto verknüpft ist
- Enterprise Tier: Höhere Limits für Produktions-Workloads
Nachfolgend finden Sie unsere Ratenbegrenzungen nach Stufe.
Modell-Ratenbegrenzungen
Abschnitt betitelt „Modell-Ratenbegrenzungen“EU-gehostete Modelle (souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| MiniMax | MiniMax-M2.7 |
EU | 20 | 20 |
| OpenAI | gpt-oss-120b |
EU | 20 | 20 |
gemma-4-31B-it |
EU | 20 | 20 | |
| OpenAI | Whisper-Large-v3 |
EU | 20 | 20 |
| Mistral | E5-Mistral-7B-Instruct |
EU | 20 | 20 |
Global Model Catalog (nicht-souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| DeepSeek | DeepSeek-V3.1 |
US oder JP | 20 | 20 |
| DeepSeek | DeepSeek-V3.2 |
US oder JP | 20 | 20 |
| Meta | Meta-Llama-3.3-70B-Instruct |
US oder JP | 20 | 20 |
EU-gehostete Modelle (souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| MiniMax | MiniMax-M2.7 |
EU | 80 | 20.000 |
| OpenAI | gpt-oss-120b |
EU | 150 | 50.000 |
gemma-4-31B-it |
EU | 80 | 20.000 | |
| OpenAI | Whisper-Large-v3 |
EU | 150 | 50.000 |
| Mistral | E5-Mistral-7B-Instruct |
EU | 150 | 50.000 |
Global Model Catalog (nicht-souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| DeepSeek | DeepSeek-V3.1 |
US oder JP | 30 | 15.000 |
| DeepSeek | DeepSeek-V3.2 |
US oder JP | 60 | 12.000 |
| Meta | Meta-Llama-3.3-70B-Instruct |
US oder JP | 120 | 30.000 |
Standard-Limits für Enterprise Tier. Individuelle Limits basierend auf Workload-Anforderungen verfügbar - kontaktieren Sie den Vertrieb.
EU-gehostete Modelle (souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| MiniMax | MiniMax-M2.7 |
EU | 250 | 50.000 |
| OpenAI | gpt-oss-120b |
EU | 500 | 100.000 |
gemma-4-31B-it |
EU | 250 | 50.000 | |
| OpenAI | Whisper-Large-v3 |
EU | 500 | 100.000 |
| Mistral | E5-Mistral-7B-Instruct |
EU | 500 | 100.000 |
Global Model Catalog (nicht-souverän)
| Entwickler | Modell-ID | Region | Anfragen pro Minute (RPM) | Anfragen pro Tag (RPD) |
|---|---|---|---|---|
| DeepSeek | DeepSeek-V3.1 |
US oder JP | 70 | 30.000 |
| DeepSeek | DeepSeek-V3.2 |
US oder JP | 80 | — |
| Meta | Meta-Llama-3.3-70B-Instruct |
US oder JP | 400 | 75.000 |
Ratenbegrenzungs-Response-Header
Abschnitt betitelt „Ratenbegrenzungs-Response-Header“Diese Header sind in jeder Antwort enthalten und geben Informationen über den aktuellen Status der Ratenbegrenzungsnutzung.
RPM (Anfragen pro Minute):
x-ratelimit-limit-requests- Die maximale Anzahl an Anfragen, die pro Minute erlaubt sind.
x-ratelimit-remaining-requests- Die Anzahl der verbleibenden Anfragen in der aktuellen Minute, bevor die Ratenbegrenzung erreicht wird.
x-ratelimit-reset-requests- Zeit in Epoch-Zeit, bis das Minutenkontingent zurückgesetzt wird.
RPD (Anfragen pro Tag):
x-ratelimit-limit-requests-day- Die maximale Anzahl an Anfragen, die pro Tag erlaubt sind.
x-ratelimit-remaining-requests-day- Die Anzahl der verbleibenden Anfragen am aktuellen Tag, bevor die Ratenbegrenzung erreicht wird.
x-ratelimit-reset-requests-day- Zeit in Epoch-Zeit, bis das Tageskontingent zurückgesetzt wird.