- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 8 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 62.2 | 13,360.5 ms | 126.8 ms | 36,696 ms | 0 | run_-AoXomjXA_6Kr_y- | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 90.3 | 13,328.5 ms | 87.77 ms | 26,694.7 ms | 0 | run_xhcGxbxHYf8WtTP7 | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 62.1 | 13,584.4 ms | 126.57 ms | 38,272.3 ms | 0 | run_ahWgiU9gPnz73uld | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 46.1 | 1,949.5 ms | 14.2 ms | 5,564 ms | 0 | run_4f7EU1vdpbn8ordT | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 61.8 | 13,465.6 ms | 127.5 ms | 36,877.7 ms | 0 | run_JSRIEh1jrPcKuFkn | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 89.7 | 13,423.1 ms | 88.34 ms | 26,903.4 ms | 0 | run_7_d8G2wKpJgSGnpv | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 65.2 | 13,382.1 ms | 115.08 ms | 35,036.1 ms | 0 | run_R1OPtU9JPkrCQc9P | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 45.9 | 1,969.4 ms | 14.21 ms | 5,585.4 ms | 0 | run_WcI4LvRTOfkvJVbX |
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 62.2
- p95 TTFT / TPOT
- 13,360.5 ms / 126.8 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 90.3
- p95 TTFT / TPOT
- 13,328.5 ms / 87.77 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 62.1
- p95 TTFT / TPOT
- 13,584.4 ms / 126.57 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 46.1
- p95 TTFT / TPOT
- 1,949.5 ms / 14.2 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 61.8
- p95 TTFT / TPOT
- 13,465.6 ms / 127.5 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 89.7
- p95 TTFT / TPOT
- 13,423.1 ms / 88.34 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 65.2
- p95 TTFT / TPOT
- 13,382.1 ms / 115.08 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-Dynamic-Q4_K_XL.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 45.9
- p95 TTFT / TPOT
- 1,969.4 ms / 14.21 ms