Qwen
Community-submitted & scraped throughput measurements. Sortable by generation speed.
← Back to model| Rig / GPU | Quant | Runtime | Context | Prompt tok/s | Gen tok/s | VRAM (GB) | Source | Reporter |
|---|---|---|---|---|---|---|---|---|
| RTX 3090 | GGUF · Q4_K_M | llama.cpp | 4,096 | 2,988.60 | 153.60 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 4,669.17 | 141.63 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · Q4_K_M | llama.cpp | 16,384 | 5,084.45 | 139.76 | — | scraped | anonymous |
| RTX 4090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 4,548.53 | 139.71 | — | scraped | anonymous |
| RTX 3090 Ti | GGUF · Q4_K_M | llama.cpp | 16,384 | 2,205.58 | 121.88 | — | scraped | anonymous |
| RTX 3090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 1,958.99 | 113.84 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 32,768 | 2,877.53 | 110.65 | — | scraped | anonymous |
| RTX 4090 | GGUF · Q4_K_M | llama.cpp | 32,768 | 2,726.03 | 105.57 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · Q4_K_M | llama.cpp | 32,768 | 3,863.04 | 103.33 | — | scraped | anonymous |
| AMD Ryzen AI Max+ 395 (128 GB) | GGUF · IQ4_XS | llama.cpp | 2,048 | — | 103.18 | — | scraped | anonymous |
| AMD Ryzen AI Max+ 395 (128 GB) | GGUF · IQ4_XS | llama.cpp | 2,048 | — | 100.04 | — | scraped | anonymous |
| RTX 3090 Ti | GGUF · Q4_K_M | llama.cpp | 32,768 | 1,483.93 | 91.97 | — | scraped | anonymous |
| RTX 3090 | GGUF · Q4_K_M | llama.cpp | 32,768 | 1,336.79 | 87.21 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · Q4_K_M | llama.cpp | 65,536 | 2,864.83 | 80.15 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 65,536 | 1,512.46 | 76.56 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 16,384 | 1,901.13 | 75.35 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · Q4_K_M | llama.cpp | 131,072 | 1,270.31 | 56.14 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 131,072 | 716.76 | 52.84 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 32,768 | 1,275.59 | 48.13 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 65,536 | 764.16 | 27.57 | — | scraped | anonymous |
selected to compare · pick at least 2