Unterstützte Modelle
gemma-4-31B-it läuft auf Infercoms souveräner Infrastruktur in Deutschland. Ihre Bilddaten verlassen niemals die EU.Eine Anfrage mit einem Bild stellen
Bei Infercom folgt die Vision-Modellanfrage dem multimodalen Eingabeformat von OpenAI, das sowohl Text- als auch Bildeingaben in einer strukturierten Payload akzeptiert. Während der Aufruf ähnlich der Textgenerierung ist, unterscheidet er sich durch die Einbeziehung einer kodierten Bilddatei, die über die Variableimage_path referenziert wird. Eine Hilfsfunktion wird verwendet, um dieses Bild in einen Base64-String zu konvertieren, wodurch es zusammen mit dem Text in der Anfrage übergeben werden kann.
1
Schritt 1
Erstellen Sie eine neue Python-Datei und kopieren Sie den unten stehenden Code.
Dieses Beispiel verwendet
gemma-4-31B-it, Googles vision-fähiges Gemma 4-Modell, gehostet auf Infercoms EU-souveräner Infrastruktur.2
Schritt 2
Verwenden Sie Ihren Infercom API-Schlüssel von der Seite API-Schlüssel und URLs, um den Platzhalter
"ihr-infercom-api-schluessel" in der Konstruktion des Clients zu ersetzen.3
Schritt 3
Wählen Sie ein Bild aus und verschieben Sie es zu einem geeigneten Pfad, den Sie in den Zeilen angeben können.
4
Schritt 4
Überprüfen Sie den Prompt, der mit dem Bild im
content-Teil des user-Prompts gepaart werden soll.5
Schritt 5
Führen Sie die Python-Datei aus, um die Textausgabe zu erhalten.
Tools und strukturierte Ausgabe mit Bildern
Vision-Anfragen unterstützen dieselben Optionentools, tool_choice und response_format wie reine Textanfragen. Die Einschränkung wird während der Generierung angewendet. Ein erzwungener Tool-Aufruf oder ein striktes JSON-Schema wird daher auch bei einer Anfrage mit Bild eingehalten.
Fehler
Fehlerhafte Bilddaten
Wenn die API Ihr Bild nicht dekodieren kann, gibt sie HTTP 400 zurück. Dies ist ein permanenter Fehler. Wiederholen Sie die Anfrage nicht. Prüfen Sie, ob der Base64-String vollständig ist und ob der MIME-Typ in derdata:-URL zur Datei passt.
Bild-Tokens zählen zum Kontextlimit
Bilder verbrauchen Prompt-Tokens. Ein großes Bild zusammen mit einem langen Prompt kann das Kontextlimit des Modells von 128K überschreiten und einencontext_length_exceeded-Fehler zurückgeben. Prüfen Sie usage.prompt_tokens in der Antwort, um zu sehen, wie viele Tokens ein Bild kostet.