- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 8192 → 256
- Runs
- 8 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 67.7 | 12,742.4 ms | 115.77 ms | 33,635.3 ms | 0 | run_Ij7nQCOk2Z3vDVWG | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 95.7 | 12,744.1 ms | 83.11 ms | 25,288.4 ms | 0 | run_bJGD2V5xSxQCmoLj | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 70.5 | 11,128.6 ms | 104.94 ms | 33,045.1 ms | 0 | run_GNd0cF39V4-y3Baj | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 50.9 | 1,865.6 ms | 12.44 ms | 5,036.1 ms | 0 | run_je1y1g4VElJToECh | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 68.3 | 12,566.6 ms | 114.92 ms | 33,366.5 ms | 0 | run_3G618eg5AK4UDZj- | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 97 | 12,537.2 ms | 81.96 ms | 24,944.9 ms | 0 | run_drSvdLWHoqpp-Xmr | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 71.6 | 11,050 ms | 104.03 ms | 32,309.5 ms | 0 | run_UcVYcgzXzDTetnWH | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 51.1 | 1,842.2 ms | 12.47 ms | 5,016.4 ms | 0 | run_0TcGlopktIQXp3ui |
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 67.7
- p95 TTFT / TPOT
- 12,742.4 ms / 115.77 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 95.7
- p95 TTFT / TPOT
- 12,744.1 ms / 83.11 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 70.5
- p95 TTFT / TPOT
- 11,128.6 ms / 104.94 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 50.9
- p95 TTFT / TPOT
- 1,865.6 ms / 12.44 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 68.3
- p95 TTFT / TPOT
- 12,566.6 ms / 114.92 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 97
- p95 TTFT / TPOT
- 12,537.2 ms / 81.96 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 71.6
- p95 TTFT / TPOT
- 11,050 ms / 104.03 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 51.1
- p95 TTFT / TPOT
- 1,842.2 ms / 12.47 ms