Inference

Serving-Stacks, Durchsatz und Latenz - gemessen an realen Lasten.

Messungen
ModellHardwareRuntimeParalleltok/sTTFT (ms)ScoreDatum
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×1 150.162192% 2026-08-29
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×2 225.5105790% 2026-08-29
Qwen 3.8 MaxNVIDIA DGX Spark (2× GB10)vLLM ×4 269.4126388% 2026-08-29

Hier erscheinen in Kürze die ersten Beiträge zu diesem Bereich.