- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 686.1 | 1,340.3 ms | 27.69 ms | 7,449.7 ms | 0 | run_8kimbI29D2VmipKS | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 589.8 | 558.6 ms | 16 ms | 4,431.5 ms | 0 | run_fCbdP8B8dG3_yExJ | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 589.6 | 552.8 ms | 15.18 ms | 4,386.3 ms | 0 | run_IFhiBPHhCWe0L9ll | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 583.8 | 560.9 ms | 16.38 ms | 4,506.8 ms | 0 | run_q5AE-teZfGbi4p7H | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 345.2 | 283.4 ms | 5.53 ms | 1,686.9 ms | 0 | run_5f9xt25U4ZcL88lj | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 728.4 | 2,986.6 ms | 38.21 ms | 11,288 ms | 0 | run_t50JJDa2r9nTYmA7 |
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 686.1
- p95 TTFT / TPOT
- 1,340.3 ms / 27.69 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 589.8
- p95 TTFT / TPOT
- 558.6 ms / 16 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 589.6
- p95 TTFT / TPOT
- 552.8 ms / 15.18 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 583.8
- p95 TTFT / TPOT
- 560.9 ms / 16.38 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 345.2
- p95 TTFT / TPOT
- 283.4 ms / 5.53 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 728.4
- p95 TTFT / TPOT
- 2,986.6 ms / 38.21 ms