cloudscaleKnowledge Base
Model Performance auf unseren GPUs – zu erwartende Token/s
Es gibt keinen festen Wert – die Token-Geschwindigkeit hängt vom Modell, seiner Grösse und der Art und Weise ab, wie du es ausführst.
Die ehrliche Antwort: Es hängt von vielen Faktoren ab – und wir meinen wirklich viele: vom Modell, seiner Architektur und Modellfamilie, seiner Grösse, der Quantisierung (fp8, int4, ...), der Länge deiner Prompts und Ausgaben, der Anzahl der gleichzeitig ausgeführten Anfragen (Batching), dem Kontextfenster, der Inference-Software, den KV-Cache-Einstellungen und der Anzahl unserer GPUs, auf die du das Modell verteilst. Ändert sich auch nur einer dieser Faktoren, ändert sich die Zahl – manchmal sogar ziemlich drastisch.
Anstatt also eine einzige Zahl zu nennen, die für die meisten Leute falsch wäre, empfehlen wir dir den kostenlosen Rechner eines Drittanbieters, bei dem du alle Parameter selbst einstellen kannst. Es handelt sich um ein unabhängiges Community-Tool (wir betreiben es nicht und stehen in keiner Verbindung dazu), mit dem du eine gute Plausibilitätsprüfung durchführen kannst.
Unser Angebot umfasst 1–4× NVIDIA RTX PRO 6000 Max-Q (mit je 96 GB VRAM), verbunden über PCIe. Wir haben zwei Beispiele mit dieser Hardware vorausgefüllt, sodass du dir einige Beispiele ansehen kannst:
- Ein Gemma-Modell auf einer einzelnen Karte: Ein MoE-Design, das schnell und reaktionsschnell bleibt, da pro Token nur ein kleiner Teil davon ausgeführt wird. Es beansprucht hier etwa ein Drittel des Speichers einer Karte, sodass noch reichlich Platz übrig bleibt.
- Ein grosses Qwen-Modell, das sich über vier Karten erstreckt: Leistungsfähiger, aber jede Antwort erfolgt um ein Mehrfaches langsamer.
Öffne die beiden Links, passe die Einstellungen an deinen Anwendungsfall an, und du erhältst eine realistische Schätzung.
Wichtig: Hierbei handelt es sich lediglich um Schätzungen; der tatsächliche Durchsatz hängt von deinem konkreten Anwendungsfall und dem Software-Stack ab. Bitte führe einen allfälligen Benchmark direkt auf unserer Hardware durch.