- Hardware
- 1× NVIDIA GeForce RTX 5090
- Decoding method
- Speculative decoding
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 1,436.2 | 56.5 ms | 9.35 ms | 9,599.1 ms | 0 | run_esWUo9CST3MGMHZ8 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 828.2 | 37.6 ms | 8.6 ms | 8,828.6 ms | 0 | run_kwpRO_STjjE9Sz47 | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 233.9 | 25.5 ms | 7.88 ms | 8,084.8 ms | 0 | run_w_FQNY70DvqZ6wRe | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,487.3 | 128.5 ms | 10.25 ms | 10,546.7 ms | 0 | run_PAFgf6AWVUOSsYML | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,532.2 | 130.7 ms | 10.09 ms | 10,431.1 ms | 0 | run_Gc86zz2D9nox5WCh | |
vllm 0.28.0Speculative | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,535.8 | 122.5 ms | 10.14 ms | 10,415.2 ms | 0 | run_50pjM5e6rynjy6Bx |
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,436.2
- p95 TTFT / TPOT
- 56.5 ms / 9.35 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 828.2
- p95 TTFT / TPOT
- 37.6 ms / 8.6 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 233.9
- p95 TTFT / TPOT
- 25.5 ms / 7.88 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,487.3
- p95 TTFT / TPOT
- 128.5 ms / 10.25 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,532.2
- p95 TTFT / TPOT
- 130.7 ms / 10.09 ms
- Runtime
- vllm 0.28.0Speculative decoding
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,535.8
- p95 TTFT / TPOT
- 122.5 ms / 10.14 ms