AI on Demandpowered by BAAI

bge-m3 und bge-reranker-v2-m3 von BAAI: zwei spezialisierte Modelle für Embedding und Reranking, über 100 Sprachen und bis zu 8192 Tokens. stepping stone betreibt beide auf Schweizer Infrastruktur — als Grundlage für Such- und RAG-Architekturen ohne US-Abhängigkeit.

stepping stone stellt zwei Modelle der Beijing Academy of Artificial Intelligence (BAAI) bereit: bge-m3 für Embedding und bge-reranker-v2-m3 für Reranking.

Das Embedding-Modell wandelt Texte in Vektoren um und ermöglicht so eine leistungsfähige, sprachübergreifende Suche — über 100 Sprachen, von kurzen Anfragen bis zu Dokumenten mit 8192 Tokens. Das Reranking-Modell sortiert die Ergebnisse nach Relevanz und verbessert die Trefferqualität.

Kombiniert mit einem der LLM-Angebote von stepping stone entsteht eine Retrieval-Augmented Generation (RAG) Pipeline: Ihre internen Daten werden im Kontext jeder Anfrage verfügbar — präzise, effizient und ohne das Land zu verlassen.

Entwicklungsteams und Unternehmen, die eine intelligente Suche über interne Daten aufbauen oder bestehende KI-Anwendungen mit eigenem Wissen anreichern wollen. Besonders geeignet für Organisationen mit mehrsprachigen Dokumentenbeständen oder Compliance-Anforderungen.

Typische Einsatzbereiche: semantische Suche über Wissensdatenbanken und Archive, RAG-Pipelines für Chatbots und Assistenzsysteme, mehrsprachige Dokumentensuche, Qualitätsverbesserung bestehender Suchlösungen durch Reranking.

Open Source (MIT / Apache 2.0). Schweizer Rechenzentren. Keine Daten bei US-Anbietern.

Embedding und Reranking benötigen deutlich weniger Rechenleistung als ein LLM, das dieselbe Aufgabe übernehmen müsste — das spart Tokens und Kosten. Moderne API mit umfangreicher Dokumentation und verständlichen Beispielen. Persönliche Beratung und Betrieb durch stepping stone aus Bern.

Leistungsumfang

Embedding und Reranking auf Abruf

Zugriff auf bge-m3 für mehrsprachige Vektorsuche und bge-reranker-v2-m3 für präzises Reranking. Über 100 Sprachen, bis zu 8192 Tokens pro Dokument.

RAG-fähige Infrastruktur

Kombinierbar mit den LLM-Angeboten von stepping stone zu einer vollständigen RAG-Pipeline. Ihre internen Daten werden im Kontext jeder Anfrage verfügbar, ohne das Land zu verlassen.

Betreuter Betrieb

Bereitstellung, Monitoring, Wartung und Support auf Schweizer Infrastruktur mit persönlicher Beratung. stepping stone kümmert sich um den Betrieb, damit Sie sich auf den Nutzen konzentrieren können.

Einsatzgebiete

Semantische Suche

BAAI-Modelle ermöglichen eine Suche, die Bedeutung versteht — nicht nur Schlüsselwörter abgleicht.

Unternehmen nutzen bge-m3, um Wissensdatenbanken, Dokumentenarchive und interne Ablagen semantisch durchsuchbar zu machen. Das Reranking-Modell verbessert die Trefferqualität anschliessend durch präzise Relevanzgewichtung — mehrsprachig, effizient und auf Schweizer Infrastruktur.

RAG-Pipelines

Embedding und Reranking sind die Kernbausteine jeder Retrieval-Augmented Generation Pipeline.

In Kombination mit einem der LLM-Angebote von stepping stone entstehen RAG-Systeme, die interne Daten kontextgenau in jede Anfrage einbinden. Kompatibel mit LangChain und LlamaIndex — ohne das Land zu verlassen.

Benchmark

bge-m3

Gemessen mit dem vllm bench Tool gegen den produktiven API-Gateway. Pro Anfrage wurden 512 Tokens Input verwendet. Dies entspricht ungefähr 350-400 Wörtern.

 

Aufruf

# Persönlichen Schlüssel festlegen:
STONEY_KEY=sk-...

# Schlüssel für das Bench-Skript sichtbar machen:
export OPENAI_API_KEY=$STONEY_KEY

# Benchmark starten:
vllm bench serve \
  --backend openai-embeddings \
  --model "BAAI/bge-m3" \
  --base-url llm.stoney-cloud.com \
  --endpoint /v1/embeddings \
  --dataset-name random \
  --tokenizer "BAAI/bge-m3" \
  --random-input-len 512 \
  --random-batch-size 1 \
  --num-prompts 100 \
  --max-concurrency 1

 

Resultat

============ Serving Benchmark Result ============
Successful requests:                     100
Failed requests:                         0
Maximum request concurrency:             1
Benchmark duration (s):                  1.29
Total input tokens:                      51200
Request throughput (req/s):              77.61
Total token throughput (tok/s):          39734.80
----------------End-to-end Latency----------------
Mean E2EL (ms):                          12.39
Median E2EL (ms):                        12.48
P99 E2EL (ms):                           14.66
==================================================

bge-reranker-v2-m3

Gemessen mit dem vllm bench Tool gegen den produktiven API-Gateway. Pro Anfrage wurden 512 Tokens Input mit einer Batch-Grösse von 5 Dokumenten pro Suchanfrage verwendet.

 

Aufruf

# Persönlichen Schlüssel festlegen:
STONEY_KEY=sk-...

# Schlüssel für das Bench-Skript sichtbar machen:
export OPENAI_API_KEY=$STONEY_KEY

# Benchmark starten:
vllm bench serve \
  --backend vllm-rerank \
  --model BAAI/bge-reranker-v2-m3 \
  --base-url llm.stoney-cloud.com \
  --endpoint /v1/rerank \
  --dataset-name random-rerank \
  --tokenizer BAAI/bge-reranker-v2-m3 \
  --random-input-len 512 \
  --num-prompts 500 \
  --random-batch-size 1

Resultat

============ Serving Benchmark Result ============
Successful requests:                     100
Failed requests:                         0
Benchmark duration (s):                  1.25
Total input tokens:                      256500
Request throughput (req/s):              80.13
Total token throughput (tok/s):          205531.35
----------------End-to-end Latency----------------
Mean E2EL (ms):                          1025.72
Median E2EL (ms):                        1214.52
P99 E2EL (ms):                           1235.71
==================================================

 

Legende

  • Successful requests: Erfolgreiche Prompt Anfragen.
  • Failed requests: Nicht erfolgreiche Prompts.
  • Maximum request concurrency: Wie viele Anfragen verarbeitet das Model gleichzeitig.
  • Benchmark duration (s): Die Dauer des Benchmarkdurchlaufs in Sekunden.
  • Total input tokens: Die Gesamtanzahl der eingegeben Tokens.
  • Request throughput (req/s): Die Anzahl Anfragen welche pro Sekunde verarbeitet werden.
  • Total token throughput (tok/s): Der Durchschnitt aller verarbeiteten Tokens während der Messung.
  • Mean End to End Latency (E2EL) (ms): Der Durchschnitt der vergangenen Zeit zwischen Eingabe und vollendeter Ausgabe.
  • Median E2EL (ms): Die zuerwartende Zeit zwischen Eingabe und vollendeter Ausgabe.
  • p99 E2EL (ms): Die im "worst case" vergangene Zeit bis zur vollendeten Ausgabe.
  • Batch-size: Bei Reranking die Anzahl Dokumente, die pro Anfrage gegen eine Suchanfrage bewertet werden.

Preise

ModellKontextlängeMTok
bge-m3                    8k0.1000

ModellKontextlängeMTok
bge-reranker-v2-m38k0.1000
Alle Preise in CHF/MTok exkl. Mehrwertsteuer.