- Hardware
- 4× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 8 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=64 | 666.3 | 4,510.7 ms | 143.7 ms | 39,020 ms | 0 | run_EV4-PuRWmIsHaHcj | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=16 | 609.6 | 1,095.7 ms | 48.1 ms | 13,346.7 ms | 0 | run_8UpzMA2oIwtEKZYV | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=4 | 263.7 | 287.6 ms | 14.14 ms | 3,884.6 ms | 0 | run_KE4Ca-iTDdmTQkyf | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=2 | 132.3 | 279.2 ms | 14.12 ms | 3,875.1 ms | 0 | run_NA5YxygJeYnPY5jx | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=128 | 1,216.4 | 9,298.9 ms | 129.37 ms | 36,491.1 ms | 0 | run_fyUaMp-rKzwely1c | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=32 | 704.1 | 2,319 ms | 86.49 ms | 23,468 ms | 0 | run_9ToGPxDd_y_xlhhy | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=8 | 438.8 | 352.2 ms | 16.7 ms | 4,586.4 ms | 0 | run_z1yxO0Hao6s3A81j | |
| llama.cpp b10353 | dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4 | c=1 | 66.1 | 288.7 ms | 14.12 ms | 3,885 ms | 0 | run_OVle3RPsxaN1HeV- |
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=64
- Req/s
- Output tok/s
- 666.3
- p95 TTFT / TPOT
- 4,510.7 ms / 143.7 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=16
- Req/s
- Output tok/s
- 609.6
- p95 TTFT / TPOT
- 1,095.7 ms / 48.1 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=4
- Req/s
- Output tok/s
- 263.7
- p95 TTFT / TPOT
- 287.6 ms / 14.14 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=2
- Req/s
- Output tok/s
- 132.3
- p95 TTFT / TPOT
- 279.2 ms / 14.12 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=128
- Req/s
- Output tok/s
- 1,216.4
- p95 TTFT / TPOT
- 9,298.9 ms / 129.37 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=32
- Req/s
- Output tok/s
- 704.1
- p95 TTFT / TPOT
- 2,319 ms / 86.49 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=8
- Req/s
- Output tok/s
- 438.8
- p95 TTFT / TPOT
- 352.2 ms / 16.7 ms
- Runtime
- llama.cpp b10353
- Material parameters
dflash=false kv_cache=Q8_0 slots_per_replica=64 context_tokens_per_slot=2048 context_tokens_per_replica=131072 replicas=4- Test load
- c=1
- Req/s
- Output tok/s
- 66.1
- p95 TTFT / TPOT
- 288.7 ms / 14.12 ms