- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 35 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 603.2 | 2,061.6 ms | 12.19 ms | 3,704.4 ms | 0 | run_2FLIC-6vnIULZkw0 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 491.2 | 1,032.1 ms | 7.19 ms | 2,116.4 ms | 0 | run_AHKS717Z228rrvoH | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 497.5 | 1,037 ms | 7.09 ms | 2,090 ms | 0 | run_Cj7-zuFhan8KOfQx | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 281.2 | 277.6 ms | 2.52 ms | 916.1 ms | 0 | run_Q6779AvfAerIfSsi | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 281.1 | 277.2 ms | 2.52 ms | 916.5 ms | 0 | run_-BOXt8JQCKaj7JfO | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 280.8 | 276.5 ms | 2.53 ms | 916.8 ms | 0 | run__Da6g0Rlzf9GN_Di | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 694.9 | 2,841.5 ms | 21.73 ms | 6,955.5 ms | 0 | run_617vimGjp9zy5Ls5 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 669.4 | 1,667.5 ms | 10.94 ms | 3,513.9 ms | 0 | run_8V44xmDUoVj2GzMc | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 569.1 | 851.1 ms | 6.16 ms | 1,890.2 ms | 0 | run_Z2KhZQG_T_xOhuRS | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 579.5 | 1,091.6 ms | 5.92 ms | 2,059.6 ms | 0 | run_65BuldXkrrSfNeNh | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 340.9 | 289.8 ms | 2 ms | 797 ms | 0 | run_AzgSbfULR4EvA3RC | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 341.3 | 288.8 ms | 1.99 ms | 793.4 ms | 0 | run_qjfl6PnmhQWEf5Ne | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 341.3 | 289.7 ms | 1.99 ms | 793 ms | 0 | run_N8EXKzHJik_BDMqW | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 742.8 | 2,982.1 ms | 20.22 ms | 6,974.9 ms | 0 | run_ctbMXvAL-EKHsALa | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 569.8 | 1,548.2 ms | 13.04 ms | 3,691.7 ms | 0 | run_V6q2dINUh3fxlK7l | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 568.3 | 1,905.9 ms | 12.96 ms | 3,869.7 ms | 0 | run_vUpZCChcg0NrMHgW | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=128 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 568.3 | 1,905.6 ms | 13 ms | 3,873.8 ms | 0 | run_yNgBMwyLnRwhOg7F | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 586.2 | 2,141.8 ms | 12.56 ms | 3,795.1 ms | 0 | run_vXbPxdKmNNOFGWBe | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 599.9 | 1,972.5 ms | 12.3 ms | 3,712.6 ms | 0 | run_10nhaykiuVOpplTQ | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=128 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 599.4 | 2,053.4 ms | 12.32 ms | 3,712.2 ms | 0 | run_8xi9IBwje5x8byJ0 | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 606.5 | 2,035.2 ms | 12.17 ms | 3,675.9 ms | 0 | run_JJbypLCsWOVVTA0B | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 561.7 | 1,921.3 ms | 13.11 ms | 3,912.7 ms | 0 | run_TN2-FbwQo3RhJKSe | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192 | c=8 | 594.5 | 1,546 ms | 11.65 ms | 3,712.3 ms | 0 | run_xMislh5naHT0nFIJ | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048 | c=8 | 596.5 | 606.5 ms | 12.09 ms | 3,530.4 ms | 0 | run_egM6U1suHKreDORg | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 599.7 | 2,058 ms | 12.32 ms | 3,718.5 ms | 0 | run_xqyTjs_S1SV2HZHo | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 581.3 | 1,353.3 ms | 12.71 ms | 3,800.4 ms | 0 | run_3WFfEa7h7hNC6W5s | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 582.4 | 2,057.2 ms | 12.7 ms | 3,792.5 ms | 0 | run_lfDFigiwWYu9eINq | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 483.4 | 1,081.1 ms | 7.28 ms | 2,149.7 ms | 0 | run_sGIiozpF6tfs_yPv | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 483.1 | 1,080 ms | 7.29 ms | 2,151.4 ms | 0 | run_JAo_wRAqESj4rFPL | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 751.8 | 7,266.5 ms | 39.29 ms | 15,728.7 ms | 0 | run_4HC28_Uot5fg3SCe | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 366.3 | 549 ms | 4.43 ms | 1,413.2 ms | 0 | run_2R6uZc_mlaEd3zP- | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 366.2 | 549.6 ms | 4.43 ms | 1,413.5 ms | 0 | run_Vkk2P7k1R4eUCfLY | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=2 | 365.5 | 548.4 ms | 4.45 ms | 1,415.9 ms | 0 | run_D01tOQ-BWyC2ePCg | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 274.6 | 284 ms | 2.57 ms | 935.7 ms | 0 | run_UbrhTV7jyZ3EQGwJ | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 676.7 | 2,957.8 ms | 22.46 ms | 6,888.2 ms | 0 | run_fHZ0BOgbaugzpuRF |
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 603.2
- p95 TTFT / TPOT
- 2,061.6 ms / 12.19 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 491.2
- p95 TTFT / TPOT
- 1,032.1 ms / 7.19 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 497.5
- p95 TTFT / TPOT
- 1,037 ms / 7.09 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 281.2
- p95 TTFT / TPOT
- 277.6 ms / 2.52 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 281.1
- p95 TTFT / TPOT
- 277.2 ms / 2.52 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 280.8
- p95 TTFT / TPOT
- 276.5 ms / 2.53 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 694.9
- p95 TTFT / TPOT
- 2,841.5 ms / 21.73 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 669.4
- p95 TTFT / TPOT
- 1,667.5 ms / 10.94 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 569.1
- p95 TTFT / TPOT
- 851.1 ms / 6.16 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 579.5
- p95 TTFT / TPOT
- 1,091.6 ms / 5.92 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 340.9
- p95 TTFT / TPOT
- 289.8 ms / 2 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 341.3
- p95 TTFT / TPOT
- 288.8 ms / 1.99 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 341.3
- p95 TTFT / TPOT
- 289.7 ms / 1.99 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 742.8
- p95 TTFT / TPOT
- 2,982.1 ms / 20.22 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 569.8
- p95 TTFT / TPOT
- 1,548.2 ms / 13.04 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 568.3
- p95 TTFT / TPOT
- 1,905.9 ms / 12.96 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=128 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 568.3
- p95 TTFT / TPOT
- 1,905.6 ms / 13 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 586.2
- p95 TTFT / TPOT
- 2,141.8 ms / 12.56 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 599.9
- p95 TTFT / TPOT
- 1,972.5 ms / 12.3 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=128 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 599.4
- p95 TTFT / TPOT
- 2,053.4 ms / 12.32 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 606.5
- p95 TTFT / TPOT
- 2,035.2 ms / 12.17 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 561.7
- p95 TTFT / TPOT
- 1,921.3 ms / 13.11 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=8192- Test load
- c=8
- Req/s
- Output tok/s
- 594.5
- p95 TTFT / TPOT
- 1,546 ms / 11.65 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=2048- Test load
- c=8
- Req/s
- Output tok/s
- 596.5
- p95 TTFT / TPOT
- 606.5 ms / 12.09 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 599.7
- p95 TTFT / TPOT
- 2,058 ms / 12.32 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=false expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 581.3
- p95 TTFT / TPOT
- 1,353.3 ms / 12.71 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 582.4
- p95 TTFT / TPOT
- 2,057.2 ms / 12.7 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 483.4
- p95 TTFT / TPOT
- 1,081.1 ms / 7.28 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 483.1
- p95 TTFT / TPOT
- 1,080 ms / 7.29 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 751.8
- p95 TTFT / TPOT
- 7,266.5 ms / 39.29 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 366.3
- p95 TTFT / TPOT
- 549 ms / 4.43 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 366.2
- p95 TTFT / TPOT
- 549.6 ms / 4.43 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 365.5
- p95 TTFT / TPOT
- 548.4 ms / 4.45 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 274.6
- p95 TTFT / TPOT
- 284 ms / 2.57 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 676.7
- p95 TTFT / TPOT
- 2,957.8 ms / 22.46 ms