AI on Demandpowered by Swiss AI Initiative

Apertus — das vollständig offene Sprachmodell der Swiss AI Initiative: entwickelt von ETH Zürich, EPFL und CSCS, 8 Milliarden Parameter, über 1000 Sprachen. Modellgewichte, Trainingsdaten und Methoden sind vollständig dokumentiert — betrieben von stepping stone auf Schweizer Infrastruktur.

Apertus ist ein Sprachmodell, das im Rahmen der Schweizer KI-Initiative von ETH Zürich, EPFL und dem Swiss National Supercomputing Centre (CSCS) entwickelt wurde. Es ist vollständig offen — nicht nur die Modellgewichte, sondern auch die Trainingsdaten, der Code und die Methoden sind dokumentiert und reproduzierbar.

Mit 8 Milliarden Parametern und Unterstützung für über 1000 Sprachen ist Apertus ein vielseitiges Allzweckmodell für Text, Analyse und agentische Workflows. Es wurde gezielt so trainiert, dass es die Anforderungen des EU AI Act erfüllt: Opt-out-Wünsche werden respektiert, persönliche Daten entfernt, Memorierung vermieden. stepping stone betreibt Apertus auf Schweizer Infrastruktur — Schweizer KI, betrieben in der Schweiz.

Unternehmen, Behörden und Organisationen, die ein leistungsfähiges Sprachmodell brauchen und Wert auf maximale Transparenz, Compliance und digitale Souveränität legen. Besonders geeignet für regulierte Branchen und den öffentlichen Sektor.

Typische Einsatzbereiche: Textgenerierung, Zusammenfassung und Analyse in über 1000 Sprachen, agentische Workflows mit Tool-Anbindung, Assistenzsysteme für mehrsprachige Organisationen, KI-Anwendungen mit erhöhten Compliance-Anforderungen (EU AI Act, Datenschutz).

Vollständig offen (Apache 2.0). Schweizer Forschung. Schweizer Rechenzentren. EU AI Act-konform.

Apertus ist das einzige vollständig offene Sprachmodell aus Schweizer Forschung — entwickelt von ETH Zürich, EPFL und CSCS. Über 1000 Sprachen, 65'536 Token Kontextfenster, Tool-Unterstützung für agentische Workflows. Trainiert auf 15 Billionen Tokens mit vollständig dokumentierten Daten und Methoden. Persönliche Beratung und Betrieb durch stepping stone aus Bern.

Persönliche Beratung

Leistungsumfang

Schweizer KI auf Abruf

Zugriff auf Apertus für Textgenerierung, Analyse und agentische Workflows. Über 1000 Sprachen, 65'536 Token Kontextfenster, vollständig offen und EU AI Act-konform.

GPU-Leistung nach Bedarf

Skalierbare Rechenleistung auf Schweizer Infrastruktur. Effizient und transparent — Sie zahlen nach Verbrauch.

Betreuter Betrieb

Bereitstellung, Monitoring, Wartung und Support auf Schweizer Infrastruktur mit persönlicher Beratung. stepping stone kümmert sich um den Betrieb, damit Sie sich auf den Nutzen konzentrieren können.

Einsatzgebiete

Compliance & Regulierung

Apertus ist das einzige vollständig offene Sprachmodell, das von Grund auf für EU AI Act-Konformität entwickelt wurde.

Behörden und regulierte Unternehmen setzen es dort ein, wo Transparenz, Nachvollziehbarkeit und Datenschutz nicht verhandelbar sind. Opt-out-Wünsche werden respektiert, persönliche Daten entfernt, Memorierung aktiv vermieden.

Mehrsprachige Anwendungen

Mit über 1000 Sprachen und 65'536 Token Kontextfenster deckt Apertus nahezu jeden mehrsprachigen Einsatz ab.

Organisationen mit internationalen Teams oder mehrsprachigen Dokumentenbeständen nutzen es für Textgenerierung, Zusammenfassung und Analyse. Tool-Unterstützung ermöglicht agentische Workflows — vollständig offen, reproduzierbar und auf Schweizer Infrastruktur betrieben.

Benchmark

Die Benchmarks wurden mit dem vllm-Benchmark-Tool am produktiven API-Gateway gemessen. Die Standardgrössen für die Eingabe betrugen 1'024 Token und für die Ausgabe 256 Token, was etwa 2–3 Buchseiten oder 500–750 Wörtern entspricht.

Bei Bedarf können grössere Eingabemengen festgelegt werden.

 

Aufruf

# Persönlichen Schlüssel festlegen:
STONEY_KEY=sk-...

# Schlüssel für das Bench-Skript sichtbar machen:
export OPENAI_API_KEY=$STONEY_KEY

# Benchmark starten:
vllm bench serve \
  --backend openai-chat  \
  --model apertus-ai/Apertus-v1.5-8B \
  --base-url llm.stoney-cloud.com \
  --endpoint /v1/chat/completions \
  --dataset-name random \
  --random-input-len 1024 \
  --random-output-len 256 \
  --num-prompts 100 \
  --max-concurrency 1 \
  --tokenizer swiss-ai/Apertus-v1.5-8B \
  --percentile-metrics e2el

 

Resultat

============ Serving Benchmark Result ============
Successful requests:                     100        
Failed requests:                         0         
Maximum request concurrency:             1         
Benchmark duration (s):                  298.11    
Total input tokens:                      167181    
Total generated tokens:                  24576     
Request throughput (req/s):              0.32      
Output token throughput (tok/s):         82.44     
Peak output token throughput (tok/s):    257.00    
Peak concurrent requests:                2.00      
Total token throughput (tok/s):          643.24    
----------------End-to-end Latency----------------
Mean E2EL (ms):                          2982.49   
Median E2EL (ms):                        2975.00   
P99 E2EL (ms):                           3078.40   
==================================================

 

Legende

  • Successful requests: Erfolgreiche Prompt Anfragen
  • Failed requests: Nicht erfolgreiche Prompts
  • Maximum request concurrency: Wie viele Anfragen verarbeitet das Model gleichzeitig.
  • Benchmark duration (s): Die Dauer des Benchmarkdurchlaufs in Sekunden.
  • Total input tokens: Die Gesamtanzahl der eingegeben Tokens.
  • Total generated tokens: Die Summe der vom Modell generierten Tokens.
  • Request throughput (req/s): Die Anzahl Anfragen welche pro Sekunde verarbeitet werden.
  • Output token throughput (tok/s): Die durchschnittliche Anzahl der Tokens, welche pro Sekunde generiert werden.
  • Peak output token throughput (tok/s): Die maximale gemessene Anzahl der Output tokens pro Sekunde.
  • Peak concurrent requests: Die maximale gemessene Anzahl der gleichzeitig verarbeiteten Anfragen.
  • Total token throughput (tok/s): Der Durchschnitt aller verarbeiteten Tokens während der Messung.
  • Mean End to End Latency (E2EL) (ms): Der Durchschnitt der vergangenen Zeit zwischen Eingabe und vollendeter Ausgabe.
  • Median E2EL (ms): Die zuerwartende Zeit zwischen Eingabe und vollendeter Ausgabe.
  • p99 E2EL (ms): Die im "worst case" vergangene Zeit bis zur vollendeten Ausgabe.

Preise

ModellKontextlängeInput/MTokOutput/MTok
Apertus-v1.5-8B256k0.12000.5800
Alle Preise in CHF/MTok exkl. Mehrwertsteuer.

Wir verwenden Cookies, um unsere Website und unseren Service zu optimieren. Weitere Informationen findest du in unserer Datenschutzerklärung.