- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 2,172.1 | 253.9 ms | 10.5 ms | 2,767.2 ms | 0 | run_YBadRmJytl7d1TgN | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 1,518.4 | 90.4 ms | 7.54 ms | 1,998.6 ms | 0 | run_n3TknEdAoRY8mvIb | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 670.2 | 43.8 ms | 4.45 ms | 1,176.3 ms | 0 | run_goIaFr_Qgj0kdTst | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,724 | 517.1 ms | 13.74 ms | 3,572.3 ms | 0 | run_vJqiTBJHe1YjkpoT | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,717 | 550.1 ms | 13.83 ms | 3,597.9 ms | 0 | run_xvVibzjOPHIsbYHd | |
vllm 0.28.0Speculative · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,698.4 | 513 ms | 14.62 ms | 3,844.1 ms | 0 | run_bemnDkPX5tAmQMs7 |
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 2,172.1
- p95 TTFT / TPOT
- 253.9 ms / 10.5 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 1,518.4
- p95 TTFT / TPOT
- 90.4 ms / 7.54 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 670.2
- p95 TTFT / TPOT
- 43.8 ms / 4.45 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,724
- p95 TTFT / TPOT
- 517.1 ms / 13.74 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,717
- p95 TTFT / TPOT
- 550.1 ms / 13.83 ms
- Runtime
- vllm 0.28.0Speculative · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,698.4
- p95 TTFT / TPOT
- 513 ms / 14.62 ms