- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 22 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 517.2 | 1,404.8 ms | 14.52 ms | 4,228.9 ms | 0 | run_0ev7P4GeOWLs_m62 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 521.1 | 1,418.2 ms | 14.42 ms | 4,195.1 ms | 0 | run_KTK-Amc3Aiaikyo0 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 356.8 | 942.2 ms | 10.32 ms | 3,073 ms | 0 | run_1oFE7AvKzrY44oL9 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 357.2 | 942.3 ms | 10.3 ms | 3,072 ms | 0 | run_XzGffOQR7Nq50OXh | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 356.8 | 946.8 ms | 10.33 ms | 2,920.6 ms | 0 | run_ZFEhJpeNeX446vm2 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 145.8 | 257.2 ms | 5.93 ms | 1,765.6 ms | 0 | run_BiRk0mNJhABdt3UH | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 661.9 | 2,593.5 ms | 22.43 ms | 7,055.9 ms | 0 | run_jzNnA40CG_fZeX_W | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 427.4 | 1,973.4 ms | 17.5 ms | 5,066.8 ms | 0 | run_n2sOjqer3hI_4sPo | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 441.9 | 2,136.4 ms | 16.85 ms | 4,950.5 ms | 0 | run_K5x47IoCipiOQYpS | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 441.9 | 2,070.8 ms | 16.84 ms | 4,696.3 ms | 0 | run_h2k5qLlXM38D_bJE | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 442 | 2,071.4 ms | 16.85 ms | 4,919.5 ms | 0 | run_SzSzrf6m4zCyxSvZ | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 441.6 | 2,072.5 ms | 16.92 ms | 4,962.8 ms | 0 | run_fzNlvr7gkcxeaBNA | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 295.9 | 1,879.5 ms | 25.74 ms | 7,291.9 ms | 0 | run_M84cqVLu1unP9nQ7 | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 439.7 | 1,500.2 ms | 16.92 ms | 4,930.3 ms | 0 | run_Orr1njfPfCR-2rmQ | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 441.5 | 2,073.4 ms | 16.88 ms | 4,902.5 ms | 0 | run_fNYUxNJdPqizEmAh | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 306.5 | 1,200.7 ms | 11.89 ms | 3,405 ms | 0 | run_JSiA-ksRrXJoHBot | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 637.1 | 8,045.3 ms | 47.57 ms | 18,126.9 ms | 0 | run_Bi4oD5zDVQQrhQtS | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 200.8 | 612.7 ms | 8.82 ms | 2,586.8 ms | 0 | run_KhFf16YWKJMPHReT | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 200.9 | 613.2 ms | 8.82 ms | 2,585.9 ms | 0 | run_gQFNxnoIVQ3fCvid | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 200.7 | 613.8 ms | 8.83 ms | 2,589.9 ms | 0 | run_31EZhVxCkfKQwAzl | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 126.1 | 324 ms | 6.73 ms | 2,037.5 ms | 0 | run_5oSPUMap5ntW9ZaR | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 553.6 | 3,309.1 ms | 27.46 ms | 7,996.3 ms | 0 | run_rZgOPHFTHsvaPA4n |
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 517.2
- p95 TTFT / TPOT
- 1,404.8 ms / 14.52 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 521.1
- p95 TTFT / TPOT
- 1,418.2 ms / 14.42 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 356.8
- p95 TTFT / TPOT
- 942.2 ms / 10.32 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 357.2
- p95 TTFT / TPOT
- 942.3 ms / 10.3 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 356.8
- p95 TTFT / TPOT
- 946.8 ms / 10.33 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 145.8
- p95 TTFT / TPOT
- 257.2 ms / 5.93 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 661.9
- p95 TTFT / TPOT
- 2,593.5 ms / 22.43 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 427.4
- p95 TTFT / TPOT
- 1,973.4 ms / 17.5 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 441.9
- p95 TTFT / TPOT
- 2,136.4 ms / 16.85 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 441.9
- p95 TTFT / TPOT
- 2,070.8 ms / 16.84 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 442
- p95 TTFT / TPOT
- 2,071.4 ms / 16.85 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 441.6
- p95 TTFT / TPOT
- 2,072.5 ms / 16.92 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 295.9
- p95 TTFT / TPOT
- 1,879.5 ms / 25.74 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 439.7
- p95 TTFT / TPOT
- 1,500.2 ms / 16.92 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 441.5
- p95 TTFT / TPOT
- 2,073.4 ms / 16.88 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 306.5
- p95 TTFT / TPOT
- 1,200.7 ms / 11.89 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 637.1
- p95 TTFT / TPOT
- 8,045.3 ms / 47.57 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 200.8
- p95 TTFT / TPOT
- 612.7 ms / 8.82 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 200.9
- p95 TTFT / TPOT
- 613.2 ms / 8.82 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 200.7
- p95 TTFT / TPOT
- 613.8 ms / 8.83 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 126.1
- p95 TTFT / TPOT
- 324 ms / 6.73 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 553.6
- p95 TTFT / TPOT
- 3,309.1 ms / 27.46 ms