Qwen

Qwen3-32B — performance reports

Community-submitted & scraped throughput measurements. Sortable by generation speed.

← Back to model
Ran this model? Log in to submit your own performance result.
Rig / GPU Quant Runtime Context Prompt tok/s Gen tok/s VRAM (GB) Source Reporter
RTX 5090 GGUF · Q4_K_M llama.cpp 4,096 2,931.30 61.40 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 16,384 2,077.16 50.92 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 32,768 1,451.08 43.82 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 4,096 2,448.00 39.60 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 16,384 1,684.85 37.68 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 4,096 1,087.90 35.10 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 16,384 1,707.40 34.40 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 16,384 862.69 32.61 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 16,384 767.82 30.28 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 16,384 704.82 18.32 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 32,768 502.73 13.52 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 65,536 318.95 8.68 scraped anonymous

selected to compare · pick at least 2