Skip to main content
Infercom bietet Zugang zu vision-fähigen Modellen auf unserer EU-souveränen Infrastruktur, die es Ihnen ermöglicht, sowohl Text als auch Bilder mit vollständiger Datensouveränität zu verarbeiten. Diese Modelle analysieren Bilder und generieren kontextbewusste Textantworten.

Unterstützte Modelle

gemma-4-31B-it läuft auf Infercoms souveräner Infrastruktur in Deutschland. Ihre Bilddaten verlassen niemals die EU.

Eine Anfrage mit einem Bild stellen

Bei Infercom folgt die Vision-Modellanfrage dem multimodalen Eingabeformat von OpenAI, das sowohl Text- als auch Bildeingaben in einer strukturierten Payload akzeptiert. Während der Aufruf ähnlich der Textgenerierung ist, unterscheidet er sich durch die Einbeziehung einer kodierten Bilddatei, die über die Variable image_path referenziert wird. Eine Hilfsfunktion wird verwendet, um dieses Bild in einen Base64-String zu konvertieren, wodurch es zusammen mit dem Text in der Anfrage übergeben werden kann.
1

Schritt 1

Erstellen Sie eine neue Python-Datei und kopieren Sie den unten stehenden Code.
Dieses Beispiel verwendet gemma-4-31B-it, Googles vision-fähiges Gemma 4-Modell, gehostet auf Infercoms EU-souveräner Infrastruktur.
2

Schritt 2

Verwenden Sie Ihren Infercom API-Schlüssel von der Seite API-Schlüssel und URLs, um den Platzhalter "ihr-infercom-api-schluessel" in der Konstruktion des Clients zu ersetzen.
3

Schritt 3

Wählen Sie ein Bild aus und verschieben Sie es zu einem geeigneten Pfad, den Sie in den Zeilen angeben können.
4

Schritt 4

Überprüfen Sie den Prompt, der mit dem Bild im content-Teil des user-Prompts gepaart werden soll.
5

Schritt 5

Führen Sie die Python-Datei aus, um die Textausgabe zu erhalten.

Tools und strukturierte Ausgabe mit Bildern

Vision-Anfragen unterstützen dieselben Optionen tools, tool_choice und response_format wie reine Textanfragen. Die Einschränkung wird während der Generierung angewendet. Ein erzwungener Tool-Aufruf oder ein striktes JSON-Schema wird daher auch bei einer Anfrage mit Bild eingehalten.
Den vollständigen Ablauf für Tool-Aufrufe finden Sie unter Function Calling und JSON-Modus.

Fehler

Fehlerhafte Bilddaten

Wenn die API Ihr Bild nicht dekodieren kann, gibt sie HTTP 400 zurück. Dies ist ein permanenter Fehler. Wiederholen Sie die Anfrage nicht. Prüfen Sie, ob der Base64-String vollständig ist und ob der MIME-Typ in der data:-URL zur Datei passt.
Diese Antwort verwendet nicht die standardmäßige Fehlerhülle. Das Feld error ist ein String, kein Objekt, und es gibt keine request_id. Ein Client, der error.message liest, erhält hier undefined.
Die standardmäßige Fehlerhülle und die beiden Pfade, die sie nicht verwenden, finden Sie unter API-Fehlercodes.

Bild-Tokens zählen zum Kontextlimit

Bilder verbrauchen Prompt-Tokens. Ein großes Bild zusammen mit einem langen Prompt kann das Kontextlimit des Modells von 128K überschreiten und einen context_length_exceeded-Fehler zurückgeben. Prüfen Sie usage.prompt_tokens in der Antwort, um zu sehen, wie viele Tokens ein Bild kostet.