- Hardware
- 1× NVIDIA GeForce RTX 5090
- Draft model
- meta-models/Muse-Glimmer-30B-GGUF
- Workload
- 256 → 1024
- Runs
- 10 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,481.2 | 803.5 ms | 5.57 ms | 6,127.4 ms | 0 | run_Detp7qWzpW8eTAVS | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,184.4 | 609.7 ms | 6.75 ms | 7,182.4 ms | 0 | run_4yIvCI26xEIl1q3_ | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,490.4 | 621 ms | 5.54 ms | 6,001.3 ms | 0 | run_iqr-3lMPfKk1Cnsk | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,224.1 | 623.2 ms | 6.56 ms | 6,977.5 ms | 0 | run_ItnsZ7eQkCsSGj9i | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 698.5 | 83 ms | 1.37 ms | 1,477.9 ms | 0 | run_-xw7EW6aooOjOWuP | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,512.8 | 772.2 ms | 5.44 ms | 5,940.3 ms | 0 | run_yN1_MOPbeicaIh_R | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,181.5 | 613.1 ms | 6.82 ms | 7,175.7 ms | 0 | run_N2VYNWN25kzDcrVk | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,500 | 608 ms | 5.49 ms | 5,942.4 ms | 0 | run_RPfdGEok-Szn4e-C | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 1,181.4 | 621.6 ms | 7 ms | 7,435.9 ms | 0 | run_kF4pG6SlGbL9BMnd | |
llama.cpp b10689Speculative · Q4_K_M | speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 695.1 | 82.9 ms | 1.38 ms | 1,488.2 ms | 0 | run_BNuNM-mIdZ6fq4ht |
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,481.2
- p95 TTFT / TPOT
- 803.5 ms / 5.57 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,184.4
- p95 TTFT / TPOT
- 609.7 ms / 6.75 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,490.4
- p95 TTFT / TPOT
- 621 ms / 5.54 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,224.1
- p95 TTFT / TPOT
- 623.2 ms / 6.56 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 698.5
- p95 TTFT / TPOT
- 83 ms / 1.37 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,512.8
- p95 TTFT / TPOT
- 772.2 ms / 5.44 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,181.5
- p95 TTFT / TPOT
- 613.1 ms / 6.82 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,500
- p95 TTFT / TPOT
- 608 ms / 5.49 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,181.4
- p95 TTFT / TPOT
- 621.6 ms / 7 ms
- Runtime
- llama.cpp b10689Speculative · Q4_K_M draft
- Material parameters
speculative.type=draft-dflash speculative.n_max=15 ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 695.1
- p95 TTFT / TPOT
- 82.9 ms / 1.38 ms