AI on Demandpowered by Google

Gemma-4-31B-it – ein multimodales Open-Weights-Modell von Google DeepMind für Text- und Bildverständnis, Schlussfolgerungen, Programmierung und agentenbasierte Arbeitsabläufe, das von stepping stone ausschliesslich auf Schweizer Infrastruktur betrieben wird.

Gemma-4-31B-it ist ein instruktionsoptimiertes, multimodales Open-Weights-Modell von Google DeepMind. Das dichte Modell mit 30,7 Milliarden Parametern verarbeitet Text und Bilder und erzeugt Textausgaben. Mit einem Kontextfenster von bis zu 160'000 Tokens kann es umfangreiche Dokumente, lange Gesprächsverläufe und grössere Codebasen im Zusammenhang bearbeiten.

Das Modell unterstützt einen konfigurierbaren Thinking-Modus für anspruchsvolle Schlussfolgerungen sowie native Function Calls für die strukturierte Einbindung externer Werkzeuge. Gemma-4 ist auf Textgenerierung, visuelles Verstehen, Programmierung, mehrsprachige Kommunikation und agentenbasierte Anwendungen ausgerichtet. Google gibt Unterstützung für mehr als 35 Sprachen sowie Vortraining auf mehr als 140 Sprachen an.

stepping stone betreibt gemma-4-31B-it vollständig auf Schweizer Infrastruktur. Kunden greifen über eine OpenAI-kompatible API auf das Modell zu und können es direkt in bestehende Anwendungen, Wissenssysteme, Entwicklungsumgebungen und agentenbasierte Workflows integrieren.

Gemma-4-31B-it eignet sich für Organisationen, die Text- und Bildinhalte mit einem leistungsfähigen Modell verarbeiten möchten, ohne ihre Daten an proprietäre KI-Plattformen mit Sitz in den USA zu übertragen.

Typische Anwendungsfälle sind die Analyse umfangreicher Dokumente, die Auswertung von Bildern und Benutzeroberflächen, mehrsprachige Assistenz, Softwareentwicklung, strukturierte Informationsgewinnung sowie agentenbasierte Arbeitsabläufe.

Offene Gewichtung. Multimodale Verarbeitung. Schweizer Infrastruktur.

Gemma-4-31B-it verbindet Text- und Bildverständnis mit einem grossen Kontextfenster, konfigurierbarem Schlussfolgern und nativer Unterstützung für Function Calling. Dadurch lässt sich ein breites Spektrum von dokumentenbasierten und technischen Anwendungen mit einem einzigen Modell abdecken.

Der Betrieb durch stepping stone sorgt dafür, dass die Datenverarbeitung auf Schweizer Infrastruktur stattfindet, und bietet Kunden eine standardisierte API, einen planbaren Betrieb sowie persönliche Unterstützung durch unser Team in Bern.

Leistungsumfang

KI-Modell auf Abruf

Zugriff auf gemma-4-31B-it für Text- und Bildverständnis, Analyse, Schlussfolgerungen, Programmierung und agentenbasierte Arbeitsabläufe über eine OpenAI-kompatible API.

GPU-Leistung nach Bedarf

Skalierbare GPU-Infrastruktur in Schweizer Rechenzentren für anspruchsvolle Inferenz-Workloads, ohne dass eine dedizierte KI-Infrastruktur intern aufgebaut und betrieben werden muss.

Betreuter Betrieb

Bereitstellung, Überwachung, Wartung und Support durch stepping stone. Wir betreiben das Modell und die Infrastruktur, damit sich Kunden auf die Integration von KI in ihre Anwendungen und Arbeitsabläufe konzentrieren können.

Einsatzgebiete

Dokumenten- und Bildanalyse

Gemma-4-31B-it verarbeitet Text und Bilder gemeinsam und eignet sich damit für multimodale Analyseaufgaben.

Das Modell kann unter anderem Dokumente und Screenshots auswerten, Inhalte über optische Zeichenerkennung erschliessen sowie Diagramme, Benutzeroberflächen und visuelle Zusammenhänge beschreiben. Text- und Bildinformationen lassen sich innerhalb einer Anfrage kombinieren, damit das Modell beide Modalitäten gemeinsam berücksichtigt.

Analyse und Schlussfolgerungen

Gemma-4-31B-it unterstützt anspruchsvolle Analysen und mehrstufige Schlussfolgerungen über lange Kontexte hinweg.

Der konfigurierbare Thinking-Modus ermöglicht es, je nach Aufgabe zwischen direkter Antwortgenerierung und zusätzlicher Rechenzeit für komplexe Problemstellungen zu wählen. Das Kontextfenster von bis zu 160'000 Tokens unterstützt die Verarbeitung umfangreicher Unterlagen, längerer Gesprächsverläufe und zusammenhängender Informationsbestände.

Softwareentwicklung und agentenbasierte Workflows

Gemma-4-31B-it verbindet Programmierfähigkeiten mit nativer Unterstützung für Function Calling.

Das Modell kann Code erzeugen, ergänzen, analysieren und korrigieren. In Kombination mit einem Agent-Harness und geeigneten Tools kann es externe Funktionen aufrufen, Zwischenergebnisse auswerten und Aufgaben in mehreren Schritten bearbeiten.

Benchmark

Die Benchmarks werden mit dem Serving-Benchmark von vLLM durchgeführt. Bei einer festgelegten Anzahl von Input- und Output-Tokens werden unter anderem Durchsatz und End-to-End-Latenz gemessen. Da die Resultate von Prompt-Länge, Ausgabelänge, Parallelität und Systemauslastung abhängen, können unterschiedliche Konfigurationen getestet und miteinander verglichen werden. Eine Schritt-für-Schritt-Anleitung und die benötigten Benchmark-Skripte können in GitHub heruntergeladen werden.

 

Aufruf

# Persönlichen Schlüssel festlegen:
STONEY_KEY=sk-...

# Schlüssel für das Bench-Skript sichtbar machen:
export OPENAI_API_KEY=$STONEY_KEY

# Benchmark starten:
vllm bench serve \
 --backend openai-chat \
 --model "google/gemma-4-31B-it" \
 --base-url llm.stoney-cloud.com \
 --endpoint /v1/chat/completions \
 --dataset-name random \
 --random-input-len 1024 \
 --random-output-len 256 \
 --num-prompts 50 \
 --max-concurrency 1 \
 --percentile-metrics e2el

 

Resultat

============ Serving Benchmark Result ============
Successful requests:                     50        
Failed requests:                         0         
Maximum request concurrency:             1         
Benchmark duration (s):                  231.27    
Total input tokens:                      51870     
Total generated tokens:                  12800     
Request throughput (req/s):              0.22      
Output token throughput (tok/s):         55.35     
Peak output token throughput (tok/s):    119.00    
Peak concurrent requests:                2.00      
Total token throughput (tok/s):          279.63    
----------------End-to-end Latency----------------
Mean E2EL (ms):                          4625.01   
Median E2EL (ms):                        4589.86   
P99 E2EL (ms):                           6077.83   
==================================================

 

Legende

  • Successful requests: Erfolgreiche Prompt-Anfragen.
  • Failed requests: Nicht erfolgreiche Prompt-Anfragen.
  • Maximum request concurrency: Maximale Anzahl gleichzeitig verarbeiteter Anfragen.
  • Benchmark duration (s): Dauer des Benchmarkdurchlaufs in Sekunden.
  • Total input tokens: Gesamtanzahl der eingegebenen Tokens.
  • Total generated tokens: Gesamtanzahl der generierten Tokens.
  • Request throughput (req/s): Anzahl der pro Sekunde verarbeiteten Anfragen.
  • Output token throughput (tok/s): Durchschnittliche Anzahl der pro Sekunde generierten Tokens.
  • Peak output token throughput (tok/s): Höchste gemessene Anzahl generierter Tokens pro Sekunde.
  • Peak concurrent requests: Höchste gemessene Anzahl gleichzeitig verarbeiteter Anfragen.
  • Total token throughput (tok/s): Durchschnittliche Anzahl aller pro Sekunde verarbeiteten Input- und Output-Tokens.
  • Mean End-to-End Latency (E2EL) (ms): Durchschnittliche Zeit zwischen Anfrage und vollständiger Ausgabe.
  • Median E2EL (ms): Median der Zeit zwischen Anfrage und vollständiger Ausgabe.
  • p99 E2EL (ms): Latenzwert, der von 99 Prozent der erfolgreichen Anfragen nicht überschritten wurde.

Preistabelle

ModellKontextlängeInput/MTokOutput/MTok
Gemma-4-31B-it160k0.25001.0000
Alle Preise in CHF/MTok exkl. Mehrwertsteuer.

Wir verwenden Cookies, um unsere Website und unseren Service zu optimieren. Weitere Informationen findest du in unserer Datenschutzerklärung.