- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 3,053.7 | 127 ms | 6.01 ms | 6,200.7 ms | 0 | run_aWm8AoNgodtYiUZ2 | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 1,968.1 | 54.2 ms | 4.87 ms | 5,035.4 ms | 0 | run_Fswyxt0znFesC5BD | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 760.8 | 17.6 ms | 3.34 ms | 3,436.4 ms | 0 | run_I0YaAH4pTAsLLpj5 | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 4,182.4 | 214.9 ms | 8.2 ms | 8,545.1 ms | 0 | run_ct4jMDkN4n0DjthI | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 4,190.8 | 222.3 ms | 7.76 ms | 8,071.5 ms | 0 | run_vb2CuK5K0ZpY4H88 | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 4,231.6 | 217.5 ms | 8.11 ms | 8,406.1 ms | 0 | run_oNrvbSwfaMBWVrYY |
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 3,053.7
- p95 TTFT / TPOT
- 127 ms / 6.01 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 1,968.1
- p95 TTFT / TPOT
- 54.2 ms / 4.87 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 760.8
- p95 TTFT / TPOT
- 17.6 ms / 3.34 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 4,182.4
- p95 TTFT / TPOT
- 214.9 ms / 8.2 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 4,190.8
- p95 TTFT / TPOT
- 222.3 ms / 7.76 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 4,231.6
- p95 TTFT / TPOT
- 217.5 ms / 8.11 ms