Qwen
Community-submitted & scraped throughput measurements. Sortable by generation speed.
← Back to model| Rig / GPU | Quant | Runtime | Context | Prompt tok/s | Gen tok/s | VRAM (GB) | Source | Reporter |
|---|---|---|---|---|---|---|---|---|
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 4,096 | 2,931.30 | 61.40 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 2,077.16 | 50.92 | — | scraped | anonymous |
| RTX 5090 | GGUF · Q4_K_M | llama.cpp | 32,768 | 1,451.08 | 43.82 | — | scraped | anonymous |
| RTX 4090 | GGUF · Q4_K_M | llama.cpp | 4,096 | 2,448.00 | 39.60 | — | scraped | anonymous |
| RTX 4090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 1,684.85 | 37.68 | — | scraped | anonymous |
| RTX 3090 | GGUF · Q4_K_M | llama.cpp | 4,096 | 1,087.90 | 35.10 | — | scraped | anonymous |
| RTX 4090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 1,707.40 | 34.40 | — | scraped | anonymous |
| RTX 3090 Ti | GGUF · Q4_K_M | llama.cpp | 16,384 | 862.69 | 32.61 | — | scraped | anonymous |
| RTX 3090 | GGUF · Q4_K_M | llama.cpp | 16,384 | 767.82 | 30.28 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 16,384 | 704.82 | 18.32 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 32,768 | 502.73 | 13.52 | — | scraped | anonymous |
| RTX A6000 | GGUF · Q4_K_M | llama.cpp | 65,536 | 318.95 | 8.68 | — | scraped | anonymous |
selected to compare · pick at least 2