Qwen

Qwen3-14B — performance reports

Community-submitted & scraped throughput measurements. Sortable by generation speed.

← Back to model
Ran this model? Log in to submit your own performance result.
Rig / GPU Quant Runtime Context Prompt tok/s Gen tok/s VRAM (GB) Source Reporter
RTX 5090 GGUF · Q4_K_M llama.cpp 16,384 4,473.08 102.68 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 32,768 2,908.42 82.35 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 4,096 2,459.00 70.00 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 16,384 3,927.70 69.14 scraped anonymous
RTX 5080 GGUF · Q4_K_M llama.cpp 16,384 2,542.01 64.04 scraped anonymous
RTX 5070 Ti GGUF · Q4_K_M llama.cpp 16,384 2,303.90 57.98 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 65,536 1,707.24 57.58 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 16,384 1,914.75 56.90 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 32,768 2,511.27 55.49 scraped anonymous
RTX 4080 Super GGUF · Q4_K_M llama.cpp 16,384 2,526.69 52.76 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 16,384 1,678.68 52.14 scraped anonymous
RTX 5080 GGUF · Q4_K_M llama.cpp 32,768 1,326.05 51.87 scraped anonymous
RTX 4080 GGUF · Q4_K_M llama.cpp 16,384 2,295.10 51.22 scraped anonymous
RTX 4070 Ti Super GGUF · Q4_K_M llama.cpp 16,384 2,003.44 47.18 scraped anonymous
RTX 5070 Ti GGUF · Q4_K_M llama.cpp 32,768 1,658.23 45.54 scraped anonymous
RTX 4080 Super GGUF · Q4_K_M llama.cpp 32,768 1,769.29 42.64 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 16,384 1,529.00 40.69 scraped anonymous
RTX 5070 GGUF · Q4_K_M llama.cpp 16,384 1,315.22 40.59 scraped anonymous
RTX 4080 GGUF · Q4_K_M llama.cpp 32,768 1,395.65 40.56 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 65,536 1,545.47 38.73 scraped anonymous

selected to compare · pick at least 2