- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 256 → 1024
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 72 | 72.6 ms | 13.87 ms | 14,256.5 ms | 0 | run_hr4H16loHXgxGwLI | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 72 | 72 ms | 13.85 ms | 14,233.9 ms | 0 | run_aXKgACdJMkTRt5E_ | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 71.9 | 72.8 ms | 13.9 ms | 14,286.3 ms | 0 | run_amWkOyipTZnBZoRo | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 71.9 | 72.7 ms | 13.88 ms | 14,264.4 ms | 0 | run_rcqbIXuIcCjDkdsm | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 71.9 | 72.8 ms | 13.86 ms | 14,251.6 ms | 0 | run_KbpGDCzaT_pbiULj | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 71.8 | 72.7 ms | 13.91 ms | 14,296.9 ms | 0 | run_MzwfVBHrKH4WI4YH |
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 72
- p95 TTFT / TPOT
- 72.6 ms / 13.87 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 72
- p95 TTFT / TPOT
- 72 ms / 13.85 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 71.9
- p95 TTFT / TPOT
- 72.8 ms / 13.9 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 71.9
- p95 TTFT / TPOT
- 72.7 ms / 13.88 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 71.9
- p95 TTFT / TPOT
- 72.8 ms / 13.86 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 71.8
- p95 TTFT / TPOT
- 72.7 ms / 13.91 ms