- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 4096 → 1
- Runs
- 13 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192 | c=16 | 2.8 | 5,801.2 ms | 0 ms | 5,801.2 ms | 0 | run_nhl0lq4M7zMog-5d | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048 | c=16 | 2.8 | 5,647 ms | 0 ms | 5,647 ms | 0 | run_kEzv-CyYzjwbFLr4 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 2.7 | 5,902.9 ms | 0 ms | 5,902.9 ms | 0 | run_YkKQ8BGwQb-TG2z3 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 2.7 | 5,905.3 ms | 0 ms | 5,905.3 ms | 0 | run_S2IwINCj6GI8Oyds | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 2.7 | 2,926 ms | 0 ms | 2,926 ms | 0 | run_Ci4yh0brPF5LNFR8 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=64 | 2.7 | 23,600.2 ms | 0 ms | 23,600.2 ms | 0 | run_E0yvte6DTqZAFfJO | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 2.8 | 1,454.1 ms | 0 ms | 1,454.1 ms | 0 | run_ia-q20D3XySMhbuf | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 2.7 | 11,802.8 ms | 0 ms | 11,802.8 ms | 0 | run_eSqh0cm1G0zWWv4P | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 2.8 | 721.5 ms | 0 ms | 721.5 ms | 0 | run_9r9bLOWZICk5HCh3 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 2.8 | 721.8 ms | 0 ms | 721.8 ms | 0 | run_ru3-pldXjwU9fK_7 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 2.8 | 721.5 ms | 0 ms | 721.5 ms | 0 | run_IXtxWD5jy-o_YLLk | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 2.7 | 367.9 ms | 0 ms | 367.9 ms | 0 | run_jdFEbq6F0d2MRgxf | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 2.7 | 5,900.6 ms | 0 ms | 5,900.6 ms | 0 | run_hkL6LXZoY3fZ7hL7 |
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192- Test load
- c=16
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 5,801.2 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048- Test load
- c=16
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 5,647 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 5,902.9 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 5,905.3 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 2,926 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 23,600.2 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 1,454.1 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 11,802.8 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 721.5 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 721.8 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 2.8
- p95 TTFT / TPOT
- 721.5 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 367.9 ms / 0 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2.7
- p95 TTFT / TPOT
- 5,900.6 ms / 0 ms