- Hardware
- 1× NVIDIA GeForce RTX 5090
- Draft model
- meta-models/Muse-Glimmer-30B-GGUF
- Workload
- 1024 → 256
- Runs
- 8 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 563.3 | 2,295.5 ms | 13.26 ms | 3,982.8 ms | 0 | run_jpAO6AqnPV8fIE6G | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 403.2 | 291.4 ms | 1.39 ms | 642.3 ms | 0 | run_8p6kxiiQ0v4I6779 | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 403.8 | 284.8 ms | 1.39 ms | 639.1 ms | 0 | run_n1slR5fu_FGDsXy1 | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 405.8 | 284 ms | 1.38 ms | 634.5 ms | 0 | run_Cv7M7AziqHXBXxd_ | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 567.8 | 2,266.6 ms | 13.31 ms | 4,039 ms | 0 | run_KnGBYhrH8L-i8lm6 | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 404.8 | 288.1 ms | 1.39 ms | 640.6 ms | 0 | run_Y5Axw5x4__ZQ5beL | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 405.5 | 281.4 ms | 1.39 ms | 635.4 ms | 0 | run_ZezDHb_l9UhnlgfB | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 405.1 | 289.2 ms | 1.4 ms | 644.4 ms | 0 | run_LbJk_5I94aFDjfWG |
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 563.3
- p95 TTFT / TPOT
- 2,295.5 ms / 13.26 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 403.2
- p95 TTFT / TPOT
- 291.4 ms / 1.39 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 403.8
- p95 TTFT / TPOT
- 284.8 ms / 1.39 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 405.8
- p95 TTFT / TPOT
- 284 ms / 1.38 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 567.8
- p95 TTFT / TPOT
- 2,266.6 ms / 13.31 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 404.8
- p95 TTFT / TPOT
- 288.1 ms / 1.39 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 405.5
- p95 TTFT / TPOT
- 281.4 ms / 1.39 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 405.1
- p95 TTFT / TPOT
- 289.2 ms / 1.4 ms