- Hardware
- 1× NVIDIA GeForce RTX 5090
- Decoding method
- Speculative decoding
- Workload
- 1024 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 583.9 | 233.7 ms | 20.52 ms | 5,364.7 ms | 0 | run_5u3G5xljYyHUsW3A | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 579.8 | 173 ms | 20.83 ms | 5,445.9 ms | 0 | run_lv3SFf3eDuiyzKbj | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 585.4 | 232.3 ms | 20.46 ms | 5,361.8 ms | 0 | run_A3x-PKoAIV6BLxE_ | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 316.7 | 167.9 ms | 19.03 ms | 4,961.9 ms | 0 | run_fuWVMLGSo7C5zAke | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 88.6 | 80.1 ms | 17.43 ms | 4,514.7 ms | 0 | run_kGHHDR1xyuT-Wybv | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 637.7 | 3,503.9 ms | 21.27 ms | 8,447.2 ms | 0 | run_5vMWKLn4mcUSzGiI |
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 583.9
- p95 TTFT / TPOT
- 233.7 ms / 20.52 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 579.8
- p95 TTFT / TPOT
- 173 ms / 20.83 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 585.4
- p95 TTFT / TPOT
- 232.3 ms / 20.46 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 316.7
- p95 TTFT / TPOT
- 167.9 ms / 19.03 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 88.6
- p95 TTFT / TPOT
- 80.1 ms / 17.43 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 637.7
- p95 TTFT / TPOT
- 3,503.9 ms / 21.27 ms