- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 2,432.2 | 119.7 ms | 8.99 ms | 9,256.2 ms | 0 | run_zibeZ2Nv5x9cwBq5 | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 1,504.5 | 69.4 ms | 7.14 ms | 7,379 ms | 0 | run_-32mTiWNVl85G6QU | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 556.3 | 19.3 ms | 5.07 ms | 5,206.4 ms | 0 | run_2gqaWlkvthlx-A4P | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 3,583.3 | 194.3 ms | 11.35 ms | 11,668.9 ms | 0 | run_73YNwtO9ST3Ato8a | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 3,513.2 | 221.6 ms | 11.33 ms | 11,658.1 ms | 0 | run_MsQypIw6xrxOnrhb | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 3,566.9 | 292.9 ms | 10.86 ms | 11,172.7 ms | 0 | run_YU6G5_Z0LYBxsQ5g |
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 2,432.2
- p95 TTFT / TPOT
- 119.7 ms / 8.99 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 1,504.5
- p95 TTFT / TPOT
- 69.4 ms / 7.14 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 556.3
- p95 TTFT / TPOT
- 19.3 ms / 5.07 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 3,583.3
- p95 TTFT / TPOT
- 194.3 ms / 11.35 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 3,513.2
- p95 TTFT / TPOT
- 221.6 ms / 11.33 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 3,566.9
- p95 TTFT / TPOT
- 292.9 ms / 10.86 ms