- Hardware
- 1× NVIDIA GeForce RTX 5090
- Draft model
- meta-models/Muse-Glimmer-30B-GGUF
- Workload
- 256 → 1024
- Runs
- 10 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,397.1 | 665.8 ms | 5.83 ms | 6,430.9 ms | 0 | run_hnVplgclHiGtCpSg | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,054.5 | 671.4 ms | 8.15 ms | 8,530.4 ms | 0 | run_7J2w_Aw4ho6I1yWw | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,417.9 | 642 ms | 5.82 ms | 6,320.8 ms | 0 | run_ZR_RAzllpLkB8sYn | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,156.9 | 620.9 ms | 6.74 ms | 7,309 ms | 0 | run_vPfuBmCI0zxI4Crr | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 637.3 | 88 ms | 1.5 ms | 1,621.2 ms | 0 | run_CiulJ-cHIZuzzW_R | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,396.8 | 865.7 ms | 5.91 ms | 6,535.4 ms | 0 | run_xb2pOY5Lgv5-fgCG | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,117.5 | 656.3 ms | 7.03 ms | 7,554.3 ms | 0 | run_aXhViDsvAnJIxxJj | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,403.9 | 659.5 ms | 5.9 ms | 6,434 ms | 0 | run_Y576sLBflzGiCVyS | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,144.5 | 673.8 ms | 6.87 ms | 7,449.2 ms | 0 | run_Ox5bxidX1u7dS0UN | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 635.1 | 88.5 ms | 1.51 ms | 1,628.4 ms | 0 | run_p8OFEpVTMDQna7Ad |
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,397.1
- p95 TTFT / TPOT
- 665.8 ms / 5.83 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,054.5
- p95 TTFT / TPOT
- 671.4 ms / 8.15 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,417.9
- p95 TTFT / TPOT
- 642 ms / 5.82 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,156.9
- p95 TTFT / TPOT
- 620.9 ms / 6.74 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 637.3
- p95 TTFT / TPOT
- 88 ms / 1.5 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,396.8
- p95 TTFT / TPOT
- 865.7 ms / 5.91 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,117.5
- p95 TTFT / TPOT
- 656.3 ms / 7.03 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,403.9
- p95 TTFT / TPOT
- 659.5 ms / 5.9 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,144.5
- p95 TTFT / TPOT
- 673.8 ms / 6.87 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 635.1
- p95 TTFT / TPOT
- 88.5 ms / 1.51 ms