AI on Demand powered by OpenAI

Whisper Large V3 von OpenAI: das weltweit meistgenutzte Open-Source-Modell für automatische Spracherkennung, trainiert auf über 5 Millionen Stunden Audiomaterial. Rund 100 Sprachen, robust bei Akzenten und Fachsprache — betrieben von stepping stone auf Schweizer Infrastruktur.

Mit Whisper Large V3 und GPT-OSS-120B stellt stepping stone zwei leistungsfähige OpenAI-Modelle für unterschiedliche Anwendungsbereiche auf Schweizer Infrastruktur bereit.

Whisper Large V3 ist auf automatische Spracherkennung spezialisiert. Es transkribiert gesprochene Sprache zuverlässig in rund 100 Sprachen und unterstützt Zeitstempel sowie die direkte Übersetzung gesprochener Inhalte ins Englische.

GPT-OSS-120B ist ein leistungsfähiges Open-Weight-Sprachmodell für komplexe Textgenerierung, Analyse, Reasoning, Coding und agentische Workflows. Dank seiner Mixture-of-Experts-Architektur verbindet es hohe Modellkapazität mit effizienter Inference.

Die OpenAI-Modelle eignen sich für unterschiedliche AI-Workloads — von Sprache und Transkription bis zu komplexen Text-, Coding- und Agent-Anwendungen.

Whisper Large V3: Transkription von Meetings, Interviews und Kundengesprächen, Untertitelung, Übersetzung und Barrierefreiheit.

GPT-OSS-120B: Textgenerierung, Analyse, Reasoning, Coding, RAG, Tool Calling und agentische Workflows.

Für Aufgaben mit höherer logischer Komplexität oder mehrstufigen Abläufen empfehlen wir GPT-OSS-120B als leistungsfähige Basis.

Open Weights. Schweizer Rechenzentren. Keine bei US-Anbietern.

Spezialisierte Modelle für unterschiedliche Aufgaben: Whisper Large V3 für Sprache und GPT-OSS-120B für anspruchsvolle Text-, Reasoning- und agentische Anwendungen. OpenAI-kompatible Schnittstellen ermöglichen eine einfache Integration in bestehende Systeme. Persönliche Beratung und Betrieb durch stepping stone aus Bern.

Leistungsumfang

AI-Modelle auf Abruf

Zugriff auf Whisper Large V3 für Spracherkennung und Übersetzung sowie GPT-OSS-120B für Textgenerierung, Analyse, Reasoning, Coding und agentische Workflows.

GPU-Leistung nach Bedarf

Skalierbare Rechenleistung für einzelne Aufnahmen oder grosse Audioarchive. Von der Einzeltranskription bis zur Massenverarbeitung — Sie zahlen nach Verbrauch.

Betreuter Betrieb

Bereitstellung, Monitoring, Wartung und Support auf Schweizer Infrastruktur mit persönlicher Beratung. stepping stone kümmert sich um den Betrieb, damit Sie sich auf den Nutzen konzentrieren können.

Einsatzgebiete

Transkription

Whisper Large V3 ist der Industriestandard für automatische Spracherkennung — erprobt in tausenden Produktionsumgebungen weltweit.

Teams nutzen es für die Transkription von Meetings, Interviews, Kundengesprächen und Telefonaten. Mit Zeitstempeln auf Wort- und Satzebene lassen sich Inhalte präzise referenzieren und in nachgelagerte Prozesse einspeisen.

Untertitelung & Übersetzung

Über rund 100 Sprachen hinweg transkribiert Whisper zuverlässig — auch bei Hintergrundgeräuschen, Akzenten und Fachsprache.

Medienproduzenten und Plattformbetreiber nutzen es für Untertitelung, automatische Übersetzung gesprochener Inhalte ins Englische und barrierefreie Sprache-zu-Text-Lösungen. Alles auf Schweizer Infrastruktur, ohne Daten an US-Dienste abzugeben.

Reasoning, Coding & Agents

GPT-OSS-120B eignet sich für komplexere Aufgaben, bei denen Analyse, Reasoning, Coding oder mehrere Arbeitsschritte zusammenspielen.

Typische Einsatzbereiche sind Wissensassistenten, RAG, Code-Analyse und -Generierung, strukturierte Datenverarbeitung, Tool Calls sowie agentische Workflows.

Benchmark

Gemessen mit dem vllm bench tool gegen den produktiven API gateway. Pro Anfrage wurden 1,024 Tokens Input verwendet. Dies entspricht ungefähr 2–3 Buchseiten bzw. 500–750 Wörtern.

Call

# Persönlichen Schlüssel festlegen:
STONEY_KEY=sk-...

# Schlüssel für das Bench-Skript sichtbar machen:
export OPENAI_API_KEY=$STONEY_KEY

# Benchmark starten
vllm bench serve \
  --backend openai-embeddings \
  --model "BAAI/bge-m3" \
  --base-url llm.stoney-cloud.com \
  --endpoint /v1/embeddings \
  --dataset-name random \
  --tokenizer "BAAI/bge-m3" \
  --random-input-len 512 \
  --random-batch-size 1 \
  --num-prompts 100 \
  --max-concurrency 1

Result

============ Serving Benchmark Result ============
Successful requests:                     50        
Failed requests:                         0         
Maximum request concurrency:             1         
Benchmark duration (s):                  75.64     
Total input tokens:                      51468     
Total generated tokens:                  3300      
Request throughput (req/s):              0.66      
Output token throughput (tok/s):         43.63     
Peak output token throughput (tok/s):    248.00    
Peak concurrent requests:                2.00      
Total token throughput (tok/s):          724.06    
----------------End-to-end Latency----------------
Mean E2EL (ms):                          1512.53   
Median E2EL (ms):                        1502.29   
P99 E2EL (ms):                           2889.83   
==================================================

 

Legende

Successful requests: Erfolgreiche Prompt Anfragen
Failed requests: Nicht erfolgreiche Prompts
Maximum request concurrency: Wie viele Anfragen verarbeitet das Model gleichzeitig.
Benchmark duration (s): Die Dauer des Benchmarkdurchlaufs in Sekunden.
Total input tokens: Die Gesamtanzahl der eingegeben Tokens.
Total generated tokens: Die Summe der vom Modell generierten Tokens.
Request throughput (req/s): Die Anzahl Anfragen welche pro Sekunde verarbeitet werden.
Output token throughput (tok/s): Die durchschnittliche Anzahl der Tokens, welche pro Sekunde generiert werden.
Peak output token throughput (tok/s): Die maximale gemessene Anzahl der Output tokens pro Sekunde.
Peak concurrent requests: Die maximale gemessene Anzahl der gleichzeitig verarbeiteten Anfragen.
Total token throughput (tok/s): Der Durchschnitt aller verarbeiteten Tokens während der Messung.
Mean End to End Latency (E2EL) (ms): Der Durchschnitt der vergangenen Zeit zwischen Eingabe und vollendeter Ausgabe.
Median E2EL (ms): Die zuerwartende Zeit zwischen Eingabe und vollendeter Ausgabe.
p99 E2EL (ms): Die im "worst case" vergangene Zeit bis zur vollendeten Ausgabe.

Preise

ModellMTok
whisper-large-v30.0020

ModellKontextlängeInput/MTokOutput/MTok
gpt-oss-120b128k0.40001.6000
Alle Preise in CHF/MTok exkl. Mehrwertsteuer.

Wir verwenden Cookies, um unsere Website und unseren Service zu optimieren. Weitere Informationen findest du in unserer Datenschutzerklärung.