cloudscaleKnowledge Base

GPULLMToken
Aktualisiert am 24. Juli 2026

Model Performance auf unseren GPUs – zu erwartende Token/s

Es gibt keinen festen Wert – die Token-Geschwindigkeit hängt vom Modell, seiner Grösse und der Art und Weise ab, wie du es ausführst.

Die ehrliche Antwort: Es hängt von vielen Faktoren ab – und wir meinen wirklich viele: vom Modell, seiner Architektur und Modellfamilie, seiner Grösse, der Quantisierung (fp8, int4, ...), der Länge deiner Prompts und Ausgaben, der Anzahl der gleichzeitig ausgeführten Anfragen (Batching), dem Kontextfenster, der Inference-Software, den KV-Cache-Einstellungen und der Anzahl unserer GPUs, auf die du das Modell verteilst. Ändert sich auch nur einer dieser Faktoren, ändert sich die Zahl – manchmal sogar ziemlich drastisch.

Anstatt also eine einzige Zahl zu nennen, die für die meisten Leute falsch wäre, empfehlen wir dir den kostenlosen Rechner eines Drittanbieters, bei dem du alle Parameter selbst einstellen kannst. Es handelt sich um ein unabhängiges Community-Tool (wir betreiben es nicht und stehen in keiner Verbindung dazu), mit dem du eine gute Plausibilitätsprüfung durchführen kannst.

Unser Angebot umfasst 1–4× NVIDIA RTX PRO 6000 Max-Q (mit je 96 GB VRAM), verbunden über PCIe. Wir haben zwei Beispiele mit dieser Hardware vorausgefüllt, sodass du dir einige Beispiele ansehen kannst:

Öffne die beiden Links, passe die Einstellungen an deinen Anwendungsfall an, und du erhältst eine realistische Schätzung.

Wichtig: Hierbei handelt es sich lediglich um Schätzungen; der tatsächliche Durchsatz hängt von deinem konkreten Anwendungsfall und dem Software-Stack ab. Bitte führe einen allfälligen Benchmark direkt auf unserer Hardware durch.

Noch nicht fündig
geworden?

API-Dokumentation

In unserer API-Dokumentation findest du konkrete Anwendungsbeispiele und diverse Hilfestellungen.

Zur API-Doku

Engineering Blog

Im Engineering Blog findest du von unseren Engineers verfasste Beiträge zu technischen Themen.

Zum Blog

In Kontakt treten