- Hardware
- 1× NVIDIA GeForce RTX 5090
- Decoding method
- Speculative decoding
- Workload
- 8192 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 108.2 | 16,554.2 ms | 26.68 ms | 22,242.3 ms | 0 | run_F8dA9WhR0aKxkSTr | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 108.3 | 7,587.2 ms | 26.98 ms | 11,853.3 ms | 0 | run_miuLewM6zZB00mBP | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 64.5 | 702.5 ms | 21.34 ms | 6,139.9 ms | 0 | run_nHWgEfbii12SwXf7 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 64.5 | 702.5 ms | 21.35 ms | 6,140.3 ms | 0 | run_MzxyZ1RYLi8O29jg | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 63.9 | 702.3 ms | 21.36 ms | 6,140.9 ms | 0 | run_3gCzHWXBIiRANi3T | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 108.2 | 35,898.8 ms | 27.01 ms | 40,422.9 ms | 0 | run_NOUWNxg5Gb-4NBJW |
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 108.2
- p95 TTFT / TPOT
- 16,554.2 ms / 26.68 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 108.3
- p95 TTFT / TPOT
- 7,587.2 ms / 26.98 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 64.5
- p95 TTFT / TPOT
- 702.5 ms / 21.34 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 64.5
- p95 TTFT / TPOT
- 702.5 ms / 21.35 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 63.9
- p95 TTFT / TPOT
- 702.3 ms / 21.36 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 108.2
- p95 TTFT / TPOT
- 35,898.8 ms / 27.01 ms