gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090

Hardware
1× NVIDIA GeForce RTX 5090
Draft model
incoai/Qwen3.8-27B-DFlash2
Workload
8192 → 256
Runs
9 eligible
Efficient frontierOther eligible run
p95 TTFT (ms)Request throughput (req/s)02140.201run_G0VEc4dkOcJdfmOf: 1.16 req/s, p95 TTFT 2,140.2 msrun_hL-HgU1CB7sW17kN: 1.17 req/s, p95 TTFT 1,278.1 msrun_IvyXtniXDLmTUbSp: 1.04 req/s, p95 TTFT 675.3 msrun_U6iGiktsmhwdljNA: 1.04 req/s, p95 TTFT 674.6 msrun_PMnqSjjH5rN-YNSn: 1.04 req/s, p95 TTFT 686.7 msrun_QaFexjkwufHT-MQt: 0.79 req/s, p95 TTFT 651.2 msrun_Tx838CoIbYscQaJv: 0.79 req/s, p95 TTFT 649.9 msrun_5kGX-v6JSVmHFjfW: 0.79 req/s, p95 TTFT 651.2 msrun_XS6QTT-rtZmhQye3: 0.8 req/s, p95 TTFT 650.6 ms

Runs

All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.

RuntimeMaterial parametersTest loadReq/sOutput tok/sp95 TTFTp95 TPOTp95 E2EFailuresRun
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=4296.92,140.2 ms11.14 ms0run_G0VEc4dkOcJdfmOf
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=3299.61,278.1 ms11.28 ms0run_hL-HgU1CB7sW17kN
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=2267675.3 ms8.14 ms0run_IvyXtniXDLmTUbSp
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=2267.1674.6 ms8.13 ms0run_U6iGiktsmhwdljNA
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=2266.7686.7 ms8.16 ms0run_PMnqSjjH5rN-YNSn
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=1202.4651.2 ms3.46 ms0run_QaFexjkwufHT-MQt
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1c=1203.5649.9 ms3.42 ms0run_Tx838CoIbYscQaJv
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1c=1203.5651.2 ms3.42 ms0run_5kGX-v6JSVmHFjfW
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1c=1203.5650.6 ms3.42 ms0run_XS6QTT-rtZmhQye3
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=4
Req/s
Output tok/s
296.9
p95 TTFT / TPOT
2,140.2 ms / 11.14 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=3
Req/s
Output tok/s
299.6
p95 TTFT / TPOT
1,278.1 ms / 11.28 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
267
p95 TTFT / TPOT
675.3 ms / 8.14 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
267.1
p95 TTFT / TPOT
674.6 ms / 8.13 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
266.7
p95 TTFT / TPOT
686.7 ms / 8.16 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=1
Req/s
Output tok/s
202.4
p95 TTFT / TPOT
651.2 ms / 3.46 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1
Test load
c=1
Req/s
Output tok/s
203.5
p95 TTFT / TPOT
649.9 ms / 3.42 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1
Test load
c=1
Req/s
Output tok/s
203.5
p95 TTFT / TPOT
651.2 ms / 3.42 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1
Test load
c=1
Req/s
Output tok/s
203.5
p95 TTFT / TPOT
650.6 ms / 3.42 ms