gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090

Hardware
1× NVIDIA GeForce RTX 5090
Draft model
incoai/Qwen3.8-27B-DFlash2
Workload
4096 → 1
Runs
7 eligible
Efficient frontierOther eligible run
p95 TTFT (ms)Request throughput (req/s)02356.604run_Qap9Q74gQK9MNqDa: 3.49 req/s, p95 TTFT 2,356.6 msrun_rmav0sFoNhpjzv8l: 3.49 req/s, p95 TTFT 1,726.1 msrun_e2Y0q3TGsJQYEFGD: 3.49 req/s, p95 TTFT 1,208.7 msrun_u3pyRlo_XXZa_BeW: 3.5 req/s, p95 TTFT 629.7 msrun_u6fAm0QtXs6oqOy-: 3.5 req/s, p95 TTFT 629.5 msrun_APqikSrVvuhXXHp1: 3.49 req/s, p95 TTFT 631 msrun_vtQdD8fySOgDVZS5: 3.4 req/s, p95 TTFT 295.3 ms

Runs

All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.

RuntimeMaterial parametersTest loadReq/sOutput tok/sp95 TTFTp95 TPOTp95 E2EFailuresRun
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=83.52,356.6 ms0 ms0run_Qap9Q74gQK9MNqDa
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=63.51,726.1 ms0 ms0run_rmav0sFoNhpjzv8l
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=43.51,208.7 ms0 ms0run_e2Y0q3TGsJQYEFGD
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=23.5629.7 ms0 ms0run_u3pyRlo_XXZa_BeW
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=23.5629.5 ms0 ms0run_u6fAm0QtXs6oqOy-
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=23.5631 ms0 ms0run_APqikSrVvuhXXHp1
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4c=13.4295.3 ms0 ms0run_vtQdD8fySOgDVZS5
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=8
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
2,356.6 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=6
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
1,726.1 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=4
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
1,208.7 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
629.7 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
629.5 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=2
Req/s
Output tok/s
3.5
p95 TTFT / TPOT
631 ms / 0 ms
Runtime
sglang 0.0.0.dev1+g5f55db35eDFlash2 · BF16 draft
Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=4 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=4
Test load
c=1
Req/s
Output tok/s
3.4
p95 TTFT / TPOT
295.3 ms / 0 ms