Für Entwickler, die Audio-Unterstützung benötigen, bietet Infercom das Whisper large-v3 Modell von OpenAI, das Echtzeit-Transkriptionen und Übersetzungen ermöglicht.
Whisper-Large-v3
- Modell: Whisper-Large-v3
- Beschreibung: Hochmodernes automatisches Spracherkennungs- (ASR) und Übersetzungsmodell. Entwickelt von OpenAI und trainiert auf über 5 Millionen Stunden gelabeltem Audio. Hervorragend geeignet für mehrsprachige und Zero-Shot-Sprachaufgaben in verschiedenen Bereichen.
- Modell-ID:
Whisper-Large-v3
- Unterstützte Sprachen: Mehrsprachig
Kernfähigkeiten
- Transkribiert und übersetzt erweiterte Audio-Eingaben (bis zu 25 MB).
- Zeigt hohe Genauigkeit bei Spracherkennungs- und Übersetzungsaufgaben.
- Bietet OpenAI-kompatible Endpunkte für Transkriptionen und Übersetzungen.
Anfrageparameter
response_format akzeptiert fünf Werte, aber nur zwei ändern die Ausgabe.
verbose_json, srt und vtt werden akzeptiert und geben HTTP 200 zurück, der Endpunkt ignoriert sie jedoch und liefert reinen Text. Es gibt keine Zeitstempel, Segmente oder Untertitel-Cues. Verwenden Sie json, wenn Sie eine strukturierte Antwort benötigen.
Nutzungsdaten
Nicht-gestreamte Antworten enthalten ausschließlich das Feld text. Es gibt kein usage-Objekt. Sie können daher weder Token- noch Dauerwerte aus einer Transkriptions- oder Übersetzungsantwort auslesen.
stream_options: {"include_usage": true} umgeht dies nicht. Der Endpunkt lehnt den Parameter mit HTTP 400 ab.
Beispielverwendung