Qwen

Qwen3-8B — performance reports

Community-submitted & scraped throughput measurements. Sortable by generation speed.

← Back to model
Ran this model? Log in to submit your own performance result.
Rig / GPU Quant Runtime Context Prompt tok/s Gen tok/s VRAM (GB) Source Reporter
RTX 5090 GGUF · Q4_K_M llama.cpp 16,384 6,956.11 145.34 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 4,096 4,049.60 115.30 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 32,768 3,687.76 111.91 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 16,384 6,720.91 104.31 scraped anonymous
RTX 5080 GGUF · Q4_K_M llama.cpp 16,384 4,024.38 94.14 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 16,384 2,834.15 93.60 scraped anonymous
RTX 5070 Ti GGUF · Q4_K_M llama.cpp 16,384 3,653.77 87.54 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 16,384 2,572.49 87.45 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 65,536 2,211.55 80.14 scraped anonymous
RTX 4080 Super GGUF · Q4_K_M llama.cpp 16,384 3,858.11 79.36 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 32,768 4,223.63 78.42 scraped anonymous
RTX 4080 GGUF · Q4_K_M llama.cpp 16,384 3,809.77 77.86 scraped anonymous
RTX 5080 GGUF · Q4_K_M llama.cpp 32,768 1,943.27 72.49 scraped anonymous
RTX 4070 Ti Super GGUF · Q4_K_M llama.cpp 16,384 3,050.73 72.20 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 32,768 1,867.96 71.75 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 32,768 1,714.63 67.88 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 16,384 2,427.98 64.26 scraped anonymous
RTX 5070 Ti GGUF · Q4_K_M llama.cpp 32,768 2,268.97 63.30 scraped anonymous
RTX 4080 Super GGUF · Q4_K_M llama.cpp 32,768 2,537.08 59.47 scraped anonymous
RTX 5070 GGUF · Q4_K_M llama.cpp 16,384 1,600.78 59.13 scraped anonymous

selected to compare · pick at least 2