Skip to main content
Für Entwickler, die Audio-Unterstützung benötigen, bietet Infercom das Whisper large-v3 Modell von OpenAI, das Echtzeit-Transkriptionen und Übersetzungen ermöglicht.

Whisper-Large-v3

  • Modell: Whisper-Large-v3
  • Beschreibung: Hochmodernes automatisches Spracherkennungs- (ASR) und Übersetzungsmodell. Entwickelt von OpenAI und trainiert auf über 5 Millionen Stunden gelabeltem Audio. Hervorragend geeignet für mehrsprachige und Zero-Shot-Sprachaufgaben in verschiedenen Bereichen.
  • Modell-ID: Whisper-Large-v3
  • Unterstützte Sprachen: Mehrsprachig

Kernfähigkeiten

  • Transkribiert und übersetzt erweiterte Audio-Eingaben (bis zu 25 MB).
  • Zeigt hohe Genauigkeit bei Spracherkennungs- und Übersetzungsaufgaben.
  • Bietet OpenAI-kompatible Endpunkte für Transkriptionen und Übersetzungen.

Anfrageparameter

Ausgabeformate

response_format akzeptiert fünf Werte, aber nur zwei ändern die Ausgabe.
verbose_json, srt und vtt werden akzeptiert und geben HTTP 200 zurück, der Endpunkt ignoriert sie jedoch und liefert reinen Text. Es gibt keine Zeitstempel, Segmente oder Untertitel-Cues. Verwenden Sie json, wenn Sie eine strukturierte Antwort benötigen.

Nutzungsdaten

Nicht-gestreamte Antworten enthalten ausschließlich das Feld text. Es gibt kein usage-Objekt. Sie können daher weder Token- noch Dauerwerte aus einer Transkriptions- oder Übersetzungsantwort auslesen.
stream_options: {"include_usage": true} umgeht dies nicht. Der Endpunkt lehnt den Parameter mit HTTP 400 ab.

Beispielverwendung