- Hardware
- 1× NVIDIA GeForce RTX 5090
- Draft model
- meta-models/Muse-Glimmer-30B-GGUF
- Workload
- 8192 → 256
- Runs
- 8 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 100.3 | 16,447.6 ms | 70.48 ms | 27,674.2 ms | 0 | run_Wqvl463gYk_MoIpZ | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 97.7 | 15,944.2 ms | 61.58 ms | 25,255 ms | 0 | run_a8KLT66w4snPV-C_ | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 100.2 | 16,178.2 ms | 70.49 ms | 25,312 ms | 0 | run_HH9wK2E0V7rDkCjp | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 95.7 | 2,336.1 ms | 1.43 ms | 2,699.7 ms | 0 | run_-RkBS5z3ph21g5OS | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 99.1 | 15,765.1 ms | 68.68 ms | 24,971.1 ms | 0 | run_n_Ode1eTiz7xJwbz | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 102.3 | 15,754.9 ms | 68.93 ms | 24,454.7 ms | 0 | run_2E87nIksxGF5ikLl | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 102 | 16,075.8 ms | 69.01 ms | 24,713.9 ms | 0 | run_A-sxzb7Q4y28D0b8 | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 96.3 | 2,333.7 ms | 1.44 ms | 2,702.2 ms | 0 | run_Snm9nSPV8usPhFML |
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 100.3
- p95 TTFT / TPOT
- 16,447.6 ms / 70.48 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 97.7
- p95 TTFT / TPOT
- 15,944.2 ms / 61.58 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 100.2
- p95 TTFT / TPOT
- 16,178.2 ms / 70.49 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 95.7
- p95 TTFT / TPOT
- 2,336.1 ms / 1.43 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 99.1
- p95 TTFT / TPOT
- 15,765.1 ms / 68.68 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 102.3
- p95 TTFT / TPOT
- 15,754.9 ms / 68.93 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 102
- p95 TTFT / TPOT
- 16,075.8 ms / 69.01 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 96.3
- p95 TTFT / TPOT
- 2,333.7 ms / 1.44 ms