- Hardware
- 1× NVIDIA GeForce RTX 5090
- Decoding method
- Speculative decoding
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 576.6 | 101.1 ms | 17.84 ms | 18,314.2 ms | 0 | run_OpmYrrUSfdj2ebxm | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 575.2 | 130.8 ms | 17.83 ms | 18,306.6 ms | 0 | run_3fk4K9Ig4bfl7k32 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 578.3 | 98.1 ms | 17.79 ms | 18,266 ms | 0 | run_UeB5ytUp-kIr2xJ1 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 294.8 | 64.6 ms | 17.47 ms | 17,933.7 ms | 0 | run_oibdkF5ODm6f1LiS | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 80.8 | 46.6 ms | 16.56 ms | 16,970.6 ms | 0 | run_Ax841n8vtQ-5QCL8 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 837 | 5,010.7 ms | 25.1 ms | 26,407.8 ms | 0 | run_CUB80RbpKM0BL_6P |
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 576.6
- p95 TTFT / TPOT
- 101.1 ms / 17.84 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 575.2
- p95 TTFT / TPOT
- 130.8 ms / 17.83 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 578.3
- p95 TTFT / TPOT
- 98.1 ms / 17.79 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 294.8
- p95 TTFT / TPOT
- 64.6 ms / 17.47 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 80.8
- p95 TTFT / TPOT
- 46.6 ms / 16.56 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 837
- p95 TTFT / TPOT
- 5,010.7 ms / 25.1 ms