- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 498.4 | 1,796.4 ms | 15 ms | 4,355.5 ms | 0 | run_8Ced01m-zqw5EIM_ | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 720.1 | 6,854.6 ms | 41.37 ms | 15,925.8 ms | 0 | run_MAB2jInmH7SirpY- | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 233.3 | 529.7 ms | 7.55 ms | 2,204.9 ms | 0 | run_uaXfxL9APnL55fCl | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 625 | 3,029.4 ms | 24.32 ms | 7,313.3 ms | 0 | run_1X4kpIOhVAK3GEF6 | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 154.4 | 280.1 ms | 5.42 ms | 1,661.1 ms | 0 | run_UtKxcDEm_98K8GgM | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 365.9 | 1,025.1 ms | 9.93 ms | 2,820.1 ms | 0 | run_t6SjCZwezRLNVbXi |
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 498.4
- p95 TTFT / TPOT
- 1,796.4 ms / 15 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 720.1
- p95 TTFT / TPOT
- 6,854.6 ms / 41.37 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 233.3
- p95 TTFT / TPOT
- 529.7 ms / 7.55 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 625
- p95 TTFT / TPOT
- 3,029.4 ms / 24.32 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 154.4
- p95 TTFT / TPOT
- 280.1 ms / 5.42 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 server_variant=baseline enable_prefix_caching=false enable_chunked_prefill=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 365.9
- p95 TTFT / TPOT
- 1,025.1 ms / 9.93 ms