- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 34 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 196.1 | 877.5 ms | 40.55 ms | 10,500.2 ms | 0 | run_CLR-g8H9yC2C41by | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 196.9 | 877.3 ms | 40.28 ms | 10,516.1 ms | 0 | run_CwSw25tLowbEw2I8 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 194.6 | 876.8 ms | 40.91 ms | 10,602.4 ms | 0 | run_a0pk4mKBwUBHmaHn | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=64 | 452.8 | 26,291.5 ms | 45.36 ms | 36,941.9 ms | 0 | run_0evI2JocYd2B1oqK | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 103.4 | 404.1 ms | 38.6 ms | 10,027.7 ms | 0 | run_CZeGb8kvrTCmiIdE | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 27.5 | 101.8 ms | 36.72 ms | 9,464.2 ms | 0 | run_QqFEtloCGtxkSHLj | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 357.8 | 1,802.1 ms | 44.08 ms | 11,547.3 ms | 0 | run_e91MMwTnLumOaOYA | |
| vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 200.7 | 869.2 ms | 39.54 ms | 10,316.6 ms | 0 | run_nNx-l8nHa-I-E6yr | |
| vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 199.7 | 869.6 ms | 39.86 ms | 10,324.9 ms | 0 | run_4-PUEdtiWinXqShE | |
| vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 198.1 | 869.2 ms | 40.14 ms | 10,410.8 ms | 0 | run_FyK7qznFVYbBh7ZZ | |
| vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 105 | 400.4 ms | 37.96 ms | 9,837.3 ms | 0 | run_Pcp_AFebl4zE4IQo | |
| vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 27.8 | 98.1 ms | 36.07 ms | 9,295.2 ms | 0 | run_8pivK0NCzjf-OeyO | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 407.5 | 704.1 ms | 19.3 ms | 5,027.5 ms | 0 | run_vrU-xRDsORs1dvnZ | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192 | c=8 | 420.9 | 714.5 ms | 18.63 ms | 4,867.9 ms | 0 | run_wXAyOwjQQuNcHQD2 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=32768 | c=8 | 423.2 | 713.5 ms | 18.53 ms | 4,841.5 ms | 0 | run_i8fQVS0OoIxBExGA | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048 | c=8 | 420.6 | 446.5 ms | 18.59 ms | 4,926.6 ms | 0 | run_iJOT0dJ3x7zeMLRl | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 376.5 | 720.9 ms | 20.86 ms | 5,441.4 ms | 0 | run_XeUTL-h0ITb5FZok | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 200.9 | 897.8 ms | 39.37 ms | 10,296.2 ms | 0 | run_rF9JXzLs1PKkGtKM | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 384 | 720 ms | 20.44 ms | 5,333.9 ms | 0 | run_GIkxM5zWpKCn4Fga | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 376.4 | 720 ms | 20.86 ms | 5,441.5 ms | 0 | run_AbbjecJk3__Tqolp | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 376.4 | 719.8 ms | 20.86 ms | 5,442.1 ms | 0 | run_9jI5XKqrH6d-rSP_ | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=64 | 751.3 | 21,576.5 ms | 21.89 ms | 26,964 ms | 0 | run_Gj4lEnJwN751esg0 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 197.1 | 364.6 ms | 19.9 ms | 5,197.3 ms | 0 | run_2p_taQ3E3OqiBJq- | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 752.4 | 7,814.2 ms | 22.65 ms | 13,469.3 ms | 0 | run_xbmz6Ej0JLYfn44k | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 56.3 | 90.8 ms | 17.49 ms | 4,551 ms | 0 | run_EAsnutWcYbIcaPlq | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 652.5 | 1,450 ms | 24.13 ms | 6,283.9 ms | 0 | run_pbO5otSeyWNSEja- | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=64 | 612.4 | 22,564.4 ms | 18.85 ms | 26,874.8 ms | 0 | run_OtKDYvoQb5pkSPzk | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=16 | 605.7 | 5,337.6 ms | 19.98 ms | 10,232.2 ms | 0 | run_GV5rcoyhkNI_f_kW | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=4 | 227.1 | 349.3 ms | 16.8 ms | 4,510.7 ms | 0 | run_bsnkPBboAyCxvfPA | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=2 | 120.9 | 186.7 ms | 16.04 ms | 4,237.4 ms | 0 | run_QtmoRzJUpBXMlUTm | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=128 | 612.2 | 49,461.2 ms | 20.62 ms | 53,773.5 ms | 0 | run_wVEeCEFKlTbhUYqQ | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=32 | 603.3 | 11,836.8 ms | 18.71 ms | 16,101.3 ms | 0 | run_ElGXRAFgfF3ZuQ8u | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=8 | 430.4 | 702.4 ms | 17.12 ms | 4,759.5 ms | 0 | run_i_PVnlCYJEEHRUUo | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=1 | 67.4 | 93.9 ms | 14.54 ms | 3,799.2 ms | 0 | run_GufrPFUj3gf9V8QH |
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 196.1
- p95 TTFT / TPOT
- 877.5 ms / 40.55 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 196.9
- p95 TTFT / TPOT
- 877.3 ms / 40.28 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 194.6
- p95 TTFT / TPOT
- 876.8 ms / 40.91 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 452.8
- p95 TTFT / TPOT
- 26,291.5 ms / 45.36 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 103.4
- p95 TTFT / TPOT
- 404.1 ms / 38.6 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 27.5
- p95 TTFT / TPOT
- 101.8 ms / 36.72 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 357.8
- p95 TTFT / TPOT
- 1,802.1 ms / 44.08 ms
- Runtime
- vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 200.7
- p95 TTFT / TPOT
- 869.2 ms / 39.54 ms
- Runtime
- vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 199.7
- p95 TTFT / TPOT
- 869.6 ms / 39.86 ms
- Runtime
- vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 198.1
- p95 TTFT / TPOT
- 869.2 ms / 40.14 ms
- Runtime
- vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 105
- p95 TTFT / TPOT
- 400.4 ms / 37.96 ms
- Runtime
- vllm 0.11.2.dev280+gilded.gnosis.v20.vllm4d006a4.b12xcd3ce19.fi1ac6942.cu132.20260810.r34
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 27.8
- p95 TTFT / TPOT
- 98.1 ms / 36.07 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 407.5
- p95 TTFT / TPOT
- 704.1 ms / 19.3 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192- Test load
- c=8
- Req/s
- Output tok/s
- 420.9
- p95 TTFT / TPOT
- 714.5 ms / 18.63 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=32768- Test load
- c=8
- Req/s
- Output tok/s
- 423.2
- p95 TTFT / TPOT
- 713.5 ms / 18.53 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048- Test load
- c=8
- Req/s
- Output tok/s
- 420.6
- p95 TTFT / TPOT
- 446.5 ms / 18.59 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 376.5
- p95 TTFT / TPOT
- 720.9 ms / 20.86 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 200.9
- p95 TTFT / TPOT
- 897.8 ms / 39.37 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 384
- p95 TTFT / TPOT
- 720 ms / 20.44 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 376.4
- p95 TTFT / TPOT
- 720 ms / 20.86 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 376.4
- p95 TTFT / TPOT
- 719.8 ms / 20.86 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 751.3
- p95 TTFT / TPOT
- 21,576.5 ms / 21.89 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 197.1
- p95 TTFT / TPOT
- 364.6 ms / 19.9 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 752.4
- p95 TTFT / TPOT
- 7,814.2 ms / 22.65 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 56.3
- p95 TTFT / TPOT
- 90.8 ms / 17.49 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 652.5
- p95 TTFT / TPOT
- 1,450 ms / 24.13 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 612.4
- p95 TTFT / TPOT
- 22,564.4 ms / 18.85 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 605.7
- p95 TTFT / TPOT
- 5,337.6 ms / 19.98 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 227.1
- p95 TTFT / TPOT
- 349.3 ms / 16.8 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 120.9
- p95 TTFT / TPOT
- 186.7 ms / 16.04 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=128
- Req/s
- Output tok/s
- 612.2
- p95 TTFT / TPOT
- 49,461.2 ms / 20.62 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 603.3
- p95 TTFT / TPOT
- 11,836.8 ms / 18.71 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 430.4
- p95 TTFT / TPOT
- 702.4 ms / 17.12 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=26 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 67.4
- p95 TTFT / TPOT
- 93.9 ms / 14.54 ms