- Hardware
- 1× NVIDIA GeForce RTX 5090
- Decoding method
- Speculative decoding
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 522.4 | 206.1 ms | 22.9 ms | 23,515 ms | 0 | run_1HS2Qf9AConHL79C | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 541.7 | 213.7 ms | 22.84 ms | 23,448.9 ms | 0 | run_EItd-9xO8XRsbVnV | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 537 | 221.4 ms | 22.82 ms | 23,434.4 ms | 0 | run_5Qn5nlibOdhxe6SX | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 279.2 | 86.5 ms | 22.33 ms | 22,930.2 ms | 0 | run_wtuj79jt4Vjm_Z68 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 76.9 | 56.3 ms | 20.65 ms | 21,173.2 ms | 0 | run_xQC-LxfFcNzm1KYD | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 822.1 | 3,865.7 ms | 26.51 ms | 27,471.6 ms | 0 | run_BnfrcK3El_dNFoz2 |
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 522.4
- p95 TTFT / TPOT
- 206.1 ms / 22.9 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 541.7
- p95 TTFT / TPOT
- 213.7 ms / 22.84 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 537
- p95 TTFT / TPOT
- 221.4 ms / 22.82 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 279.2
- p95 TTFT / TPOT
- 86.5 ms / 22.33 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 76.9
- p95 TTFT / TPOT
- 56.3 ms / 20.65 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 822.1
- p95 TTFT / TPOT
- 3,865.7 ms / 26.51 ms