AI on Demandpowered by DeepSeek

DeepSeek-V4-Flash-0731 – ein Mixture-of-Experts-Modell mit hoher Kapazität und offenem Gewicht für Kodierung, Schlussfolgerungen und agentenbasierte Arbeitsabläufe, das von Stepping Stone ausschliesslich auf Schweizer Infrastruktur betrieben wird.

DeepSeek-V4-Flash-0731 ist ein Sprachmodell mit offener Gewichtung, das für anspruchsvolle Aufgaben in den Bereichen Programmierung, logisches Schlussfolgern und agentenbasierte Verarbeitung entwickelt wurde. Seine «Mixture-of-Experts»-Architektur verbindet eine grosse Gesamtmodellkapazität mit effizienter Inferenz, indem für jedes Token nur ein Teil des Modells aktiviert wird.

Die Version 0731 legt besonderen Wert auf agentische Fähigkeiten. Sie kann mit Werkzeugen arbeiten, mehrstufige Aufgaben bearbeiten und Arbeitsabläufe unterstützen, bei denen das Modell Zwischenergebnisse analysieren und entscheiden muss, wie es weitergeht. DeepSeek verzeichnet eine starke Leistung bei Benchmarks für Codierungsagenten, Terminals und den Einsatz von Werkzeugen.

stepping stone betreibt DeepSeek-V4-Flash-0731 vollständig auf Schweizer Infrastruktur. Kunden greifen über eine OpenAI-kompatible API auf das Modell zu und können es direkt in bestehende Anwendungen, Entwicklungsumgebungen und agentische Systeme integrieren.

DeepSeek-V4-Flash-0731 eignet sich für Organisationen, die ein leistungsfähiges Modell für komplexe technische Arbeitslasten benötigen, ohne ihre Daten an proprietäre KI-Plattformen mit Sitz in den USA zu übertragen.

Zu den typischen Anwendungsfällen zählen unter anderem Softwareentwicklung, Debugging, agentenbasierte Arbeitsabläufe und technische Unterstützung, um nur einige zu nennen.

Offene Gewichtung. Schweizer Infrastruktur. Leistungsstarke agentische Fähigkeiten.

DeepSeek-V4-Flash-0731 vereint eine hohe Modellkapazität mit einer Architektur, die auf effiziente Inferenz ausgelegt ist. Dank seiner Stärken in den Bereichen Kodierung, Tool-Einsatz und mehrstufige Arbeitsabläufe eignet es sich besonders gut als Grundlage für agentische Anwendungen.

Der Betrieb über «Stepping Stone» sorgt dafür, dass die Datenverarbeitung auf Schweizer Infrastruktur stattfindet, und bietet den Kunden eine standardisierte API, einen vorhersehbaren Betrieb sowie persönliche Unterstützung durch unser Team in Bern.

Leistungsumfang

KI-Modell auf Abruf

Zugriff auf DeepSeek-V4-Flash-0731 für Programmierung, Analyse, Schlussfolgerungen und agentenbasierte Arbeitsabläufe über eine OpenAI-kompatible API.

GPU-Leistung nach Bedarf

Skalierbare GPU-Infrastruktur in Schweizer Rechenzentren für anspruchsvolle Inferenz-Workloads, ohne dass eine dedizierte KI-Infrastruktur intern aufgebaut und betrieben werden muss.

Betreuter Betrieb

Bereitstellung, Überwachung, Wartung und Support durch Stepping Stone. Wir betreiben das Modell und die Infrastruktur, damit sich die Kunden auf die Integration von KI in ihre Anwendungen und Arbeitsabläufe konzentrieren können.

Einsatzgebiete

Softwareentwicklung

DeepSeek-V4-Flash-0731 eignet sich besonders gut für anspruchsvolle Arbeitsabläufe in der Softwareentwicklung.

Das Modell kann bestehenden Code analysieren, repositoryübergreifend arbeiten, beim Debugging helfen und mehrstufige Entwicklungsaufgaben unterstützen. In Kombination mit einem Agent-Harness und geeigneten Tools kann es Dateien iterativ überprüfen, Code ändern, Tests ausführen und auf die Ergebnisse reagieren.

Agentenbasierte Workflows

DeepSeek-V4-Flash-0731 ist für Workflows konzipiert, bei denen das Modell mehr tut, als nur eine einzige Antwort zu generieren.

Durch den Aufruf von Tools kann das Modell mit externen Funktionen und Systemen interagieren, Zwischenergebnisse auswerten und eine Aufgabe in mehreren Schritten bearbeiten. Dadurch eignet es sich für technische Agenten, automatisierte Analyse-Workflows und andere Anwendungen, die eine autonome Ausführung erfordern. Die aktuelle API-Dokumentation von DeepSeek listet die Unterstützung für Tool-Aufrufe beim Flash-Modell auf.

Analyse und Schlussfolgerungen

Für Aufgaben, die über das einfache Extrahieren oder Erstellen von Texten hinausgehen, bietet DeepSeek-V4-Flash-0731 eine leistungsstarke Option für technische Analysen, strukturierte Problemlösungen und komplexe, mehrstufige Schlussfolgerungen.

Dadurch eignet es sich für Anwendungsfälle, bei denen kleinere Allzweckmodelle keine ausreichende Zuverlässigkeit mehr bieten, während das Modell weiterhin innerhalb einer kontrollierten Schweizer Infrastruktur betrieben werden kann.

Benchmark


Die Benchmarks wurden mit einem Python Skript gemessen.
Dabei wird zu einer festgelegten Auflösung die Zeit pro Bild gemessen, welche für die Generierung benötigt wird.
Weil die benötigte Zeit sowohl von der Auflösung, als auch der Anzahl Durchläufe abhängig ist, können verschiedene Konfigurationen angeschaut werden.
Eine Schritt für Schritt Anleitung und das benötigte Python Script können in GitHub heruntergeladen werden.


Aufruf

# Set your personal key:
STONEY_KEY=sk-...

# Make key visible for vllm bench:
export OPENAI_API_KEY=$STONEY_KEY

# Start the benchmark
vllm bench serve \
 --backend openai-chat \
 --model "deepseek-ai/DeepSeek-V4-Flash-0731" \
 --base-url llm.stoney-cloud.com \
 --endpoint /v1/chat/completions \
 --dataset-name random \
 --random-input-len 1024 \
 --random-output-len 256 \
 --num-prompts 50 \
 --max-concurrency 1 \ 
 --tokenizer-mode deepseek_v4 \
 --percentile-metrics e2el


Resultat

============ Serving Benchmark Result ============
Successful requests:                     50        
Failed requests:                         0         
Maximum request concurrency:             1         
Benchmark duration (s):                  118.57    
Total input tokens:                      55350     
Total generated tokens:                  12800     
Request throughput (req/s):              0.42      
Output token throughput (tok/s):         107.96    
Peak output token throughput (tok/s):    173.00    
Peak concurrent requests:                2.00      
Total token throughput (tok/s):          574.79    
----------------End-to-end Latency----------------
Mean E2EL (ms):                          2371.00   
Median E2EL (ms):                        2288.91   
P99 E2EL (ms):                           3317.25   
==================================================


Legende

  • Successful requests: Erfolgreiche Prompt Anfragen
  • Failed requests: Nicht erfolgreiche Prompts
  • Maximum request concurrency: Wie viele Anfragen verarbeitet das Model gleichzeitig.
  • Benchmark duration (s): Die Dauer des Benchmarkdurchlaufs in Sekunden.
  • Total input tokens: Die Gesamtanzahl der eingegeben Tokens.
  • Total generated tokens: Die Summe der vom Modell generierten Tokens.
  • Request throughput (req/s): Die Anzahl Anfragen welche pro Sekunde verarbeitet werden.
  • Output token throughput (tok/s): Die durchschnittliche Anzahl der Tokens, welche pro Sekunde generiert werden.
  • Peak output token throughput (tok/s): Die maximale gemessene Anzahl der Output tokens pro Sekunde.
  • Peak concurrent requests: Die maximale gemessene Anzahl der gleichzeitig verarbeiteten Anfragen.
  • Total token throughput (tok/s): Der Durchschnitt aller verarbeiteten Tokens während der Messung.
  • Mean End to End Latency (E2EL) (ms): Der Durchschnitt der vergangenen Zeit zwischen Eingabe und vollendeter Ausgabe.
  • Median E2EL (ms): Die zuerwartende Zeit zwischen Eingabe und vollendeter Ausgabe.
  • p99 E2EL (ms): Die im "worst case" vergangene Zeit bis zur vollendeten Ausgabe.

Preis

ModellInput/MTokOutput/MTok
DeepSeek-V4-Flash-07310.4500   1.8000
Alle Preise in CHF/MTok exkl. Mehrwertsteuer.

Wir verwenden Cookies, um unsere Website und unseren Service zu optimieren. Weitere Informationen findest du in unserer Datenschutzerklärung.