openai
Community-submitted & scraped throughput measurements. Sortable by generation speed.
← Back to model| Rig / GPU | Quant | Runtime | Context | Prompt tok/s | Gen tok/s | VRAM (GB) | Source | Reporter |
|---|---|---|---|---|---|---|---|---|
| RTX Pro 6000 Blackwell 96GB | GGUF · F16 | llama.cpp | 2,048 | 11,521.95 | 286.91 | — | scraped | anonymous |
| RTX 5090 | GGUF · F16 | llama.cpp | 2,048 | 9,848.38 | 282.51 | — | scraped | anonymous |
| RTX 5090 | GGUF · F16 | llama.cpp | 16,384 | 7,168.10 | 249.19 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · F16 | llama.cpp | 16,384 | 7,478.71 | 237.92 | — | scraped | anonymous |
| RTX 4090 | GGUF · F16 | llama.cpp | 2,048 | 8,022.33 | 221.95 | — | scraped | anonymous |
| RTX 5090 | GGUF · F16 | llama.cpp | 32,768 | 5,183.08 | 215.08 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · F16 | llama.cpp | 32,768 | 5,039.46 | 207.45 | — | scraped | anonymous |
| RTX 5080 | GGUF · F16 | llama.cpp | 2,048 | 7,476.55 | 204.85 | — | scraped | anonymous |
| RTX 5070 Ti | GGUF · F16 | llama.cpp | 2,048 | 6,339.76 | 189.45 | — | scraped | anonymous |
| RTX 4080 Super | GGUF · F16 | llama.cpp | 2,048 | 8,170.95 | 186.51 | — | scraped | anonymous |
| RTX Pro 6000 Blackwell 96GB | GGUF · F16 | llama.cpp | 65,536 | — | 171.33 | — | scraped | anonymous |
| RTX 5090 | GGUF · F16 | llama.cpp | 65,536 | 3,019.74 | 168.95 | — | scraped | anonymous |
| RTX 4090 | GGUF · F16 | llama.cpp | 16,384 | 6,302.76 | 163.92 | — | scraped | anonymous |
| RTX 3090 | GGUF · F16 | llama.cpp | 2,048 | 5,170.56 | 161.77 | — | scraped | anonymous |
| RTX 3090 | GGUF · F16 | llama.cpp | 4,096 | 4,400.30 | 147.50 | — | scraped | anonymous |
| RTX 5080 | GGUF · F16 | llama.cpp | 16,384 | 4,932.33 | 140.48 | — | scraped | anonymous |
| RTX 4090 | GGUF · F16 | llama.cpp | 32,768 | 4,641.50 | 140.34 | — | scraped | anonymous |
| RTX 3090 Ti | GGUF · F16 | llama.cpp | 16,384 | 3,440.06 | 137.55 | — | scraped | anonymous |
| RTX 5070 Ti | GGUF · F16 | llama.cpp | 16,384 | 4,940.71 | 133.05 | — | scraped | anonymous |
| RTX 3090 | GGUF · F16 | llama.cpp | 16,384 | 3,243.60 | 128.51 | — | scraped | anonymous |
selected to compare · pick at least 2