llm-benchmarks
githubdrose.io

Cloud LLM benchmarks

Models
283
Providers
9
Samples
79,358
Median tok/s
31
p90 tok/s
73
Max tok/s
297
Median spread
183%
Median TTFT
1.24s

Throughput distribution · tok/s

050100150200250300350

Visible-token throughput, same basis as the table · curves normalised per model · 2 models' tails run past the axis · 261 slower models not drawn, all 283 are in the table below

By provider

ProviderModelsMedianp90BestSpreadTTFT
groq6175297297152%
cerebras1132132132421%1.01
bedrock225696118110%0.38
together215279107212%
openai38386184189%1.92
openai via OpenRouter638474772%0.90
fireworks22367499193%
together via OpenRouter1343434105%0.84
deepinfra1262550191210%
deepinfra via OpenRouter19254352141%1.01
anthropic10242843152%1.48
anthropic via OpenRouter621373751%1.60
google via OpenRouter133340%1.09
google42160160145%0.93

Throughput × spread · 283 models

100200300250500GPT-5.5 · openai · 22 tok/s · 134% spreadMiniMax-M2.7 · fireworks · 62 tok/s · 207% spreadQwen3.6-27B · groq · 219 tok/s · 173% spreadclaude-haiku-4.5 · anthropic · 43 tok/s · 151% spreadgpt-4 · openai · 23 tok/s · 230% spreado4 Mini · openai · 47 tok/s · 345% spreadGPT-5.1-codex-max · openai · 61 tok/s · 181% spreadllama-4-scout · groq · 117 tok/s · 152% spreadGLM-5.2 · fireworks · 32 tok/s · 280% spreadKimi-K2.6 · fireworks · 36 tok/s · 182% spreadGPT-5-chat-latest · openai · 61 tok/s · 101% spreadGPT-5.4-mini · openai · 43 tok/s · 200% spreadGPT-5.1-codex-mini · openai · 84 tok/s · 104% spreadGPT-oss-120b · fireworks · 99 tok/s · 210% spreadGPT-5.1-codex · openai · 68 tok/s · 92% spreadgpt-4.1 · openai · 48 tok/s · 186% spreadGPT-5 · openai · 38 tok/s · 196% spreadgpt-3.5-turbo · openai · 41 tok/s · 276% spreadgpt-4.1-nano · openai · 50 tok/s · 265% spreadglm-5p1 · fireworks · 29 tok/s · 208% spreadGoogle: Nano Banana (Gemini 2.5 Flash Image) · google · 160 tok/s · 145% spreadgpt-4.1-mini · openai · 36 tok/s · 169% spreadgpt-4o-mini · openai · 38 tok/s · 243% spreadgpt-4o · openai · 37 tok/s · 200% spreadGPT-oss-safeguard-20b · groq · 297 tok/s · 221% spreadGPT-5.5-pro · openai · 11 tok/s · 265% spreadGPT-5 Nano · openai · 83 tok/s · 181% spreadclaude-haiku-4.5 · bedrock · 44 tok/s · 133% spreadClaude Opus 4.1 · bedrock · 8 tok/s · 173% spreadclaude-opus-4.5 · bedrock · 20 tok/s · 111% spreadclaude-opus-4.6 · bedrock · 21 tok/s · 101% spreadclaude-opus-4-7 · bedrock · 28 tok/s · 130% spreadclaude-sonnet-4.5 · bedrock · 22 tok/s · 130% spreadclaude-sonnet-4.6 · bedrock · 27 tok/s · 99% spreadgpt-5.2-codex · openai · 50 tok/s · 87% spreadllama-3-70b · bedrock · 36 tok/s · 111% spreadllama-3-8b · bedrock · 78 tok/s · 110% spreadllama-3.1-70b · bedrock · 57 tok/s · 110% spreadllama-3.1-8b · bedrock · 96 tok/s · 109% spreadllama-3.2-90b · bedrock · 46 tok/s · 22% spreadllama-3.3-70b · bedrock · 85 tok/s · 138% spreadllama-4-maverick · bedrock · 107 tok/s · 105% spreadllama-4-scout · bedrock · 96 tok/s · 90% spreadmistral-7b · bedrock · 82 tok/s · 75% spreadmistral-large · bedrock · 42 tok/s · 97% spreadmistral-small · bedrock · 56 tok/s · 67% spreadmixtral-8x7b · bedrock · 73 tok/s · 84% spreadnova-lite · bedrock · 91 tok/s · 144% spreadnova-micro · bedrock · 118 tok/s · 136% spreadnova-pro · bedrock · 89 tok/s · 132% spreadGPT-5.4 · openai · 24 tok/s · 178% spreadGPT-5.1 · openai · 31 tok/s · 239% spreadGPT-5.2-chat-latest · openai · 39 tok/s · 133% spreadGPT-5.2 · openai · 23 tok/s · 137% spreadGPT-5.3-codex · openai · 18 tok/s · 297% spreado3-pro · openai · 16 tok/s · 200% spreadgemini-2.5-flash-lite · google · 72 tok/s · 239% spreadGPT-5.2-pro · openai · 14 tok/s · 118% spreadGPT-5-codex · openai · 56 tok/s · 123% spreadclaude-sonnet-4.6 · anthropic · 24 tok/s · 152% spreadGPT-5.1-chat-latest · openai · 49 tok/s · 130% spreadqwen-3-32b · groq · 175 tok/s · 89% spreadKimi-K2.7-Code · together · 79 tok/s · 249% spreadllama-3.1-8b · groq · 215 tok/s · 188% spreadllama-3.3-70b · groq · 147 tok/s · 132% spreadGLM-5.2 · together · 78 tok/s · 243% spreadGPT-5.6-sol · openai · 17 tok/s · 175% spreadclaude-sonnet-5 · anthropic · 28 tok/s · 203% spreadLFM2.5-8B-A1B · together · 107 tok/s · 260% spreadGPT-5.6-luna · openai · 27 tok/s · 269% spreadGPT-5.6-terra · openai · 24 tok/s · 189% spreadInkling · together · 24 tok/s · 153% spreadclaude-opus-4-8 · anthropic · 28 tok/s · 163% spreadDeepSeek-V4-Pro · fireworks · 31 tok/s · 159% spreadgemma-4-31b · cerebras · 132 tok/s · 421% spreadNVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 · deepinfra · 36 tok/s · 225% spreadclaude-opus-4.5 · anthropic · 24 tok/s · 136% spreadclaude-opus-4.6 · anthropic · 19 tok/s · 142% spreadclaude-opus-4-7 · anthropic · 25 tok/s · 155% spreadQwen3-VL-235B-A22B-Instruct · deepinfra · 13 tok/s · 292% spreadQwen3-VL-30B-A3B-Instruct · deepinfra · 25 tok/s · 156% spreadKimi-K2.7-Code · deepinfra · 37 tok/s · 312% spreadGLM-5.2 · deepinfra · 31 tok/s · 248% spreadInkling · deepinfra · 52 tok/s · 193% spreadgemma-4-E4B-it · deepinfra · 42 tok/s · 193% spreadHy3 · deepinfra · 30 tok/s · 206% spreadclaude-sonnet-5 · deepinfra · 31 tok/s · 63% spreadclaude-fable-5 · deepinfra · 18 tok/s · 125% spreadMiniMax-M3 · deepinfra · 16 tok/s · 502% spreadgemini-2.5-pro · google · 2 tok/s · 102% spreadclaude-fable-5 · anthropic · 21 tok/s · 185% spreadClaude Opus 4.1 · anthropic · 15 tok/s · 77% spreado3 Mini · openai · 57 tok/s · 329% spreado1 · openai · 54 tok/s · 255% spreadGPT-5 Mini · openai · 50 tok/s · 216% spreado3 · openai · 43 tok/s · 245% spreadgemini-3.5-flash · deepinfra · 29 tok/s · 275% spreadGPT-5.4-nano · openai · 47 tok/s · 265% spreadgemini-3.1-flash-lite · deepinfra · 35 tok/s · 414% spreadgpt-5.3-chat-latest · openai · 36 tok/s · 125% spreadqwen-2.5-7b · together · 71 tok/s · 144% spreadgemma-3n-e4b-it · together · 33 tok/s · 155% spreadllama-3.3-70b · together · 43 tok/s · 219% spreadQwen2.5-7B-Instruct-Turbo · together · 68 tok/s · 54% spreadgemini-2.5-flash · google · 2 tok/s · 147% spreadSeed-2.0-code · deepinfra · 1 tok/s · 582% spreadSeed-2.0-pro · deepinfra · 3 tok/s · 545% spreadqwen-3.5-9b · together · 65 tok/s · 155% spreadMiniMax-M2.1 · deepinfra · 33 tok/s · 52% spreadMiniMax-M2.5 · deepinfra · 23 tok/s · 33% spreadqwen-2.5-72b · deepinfra · 15 tok/s · 290% spreadQwen 2.5 Coder 32B · deepinfra · 43 tok/s · 129% spreadqwen-3-14b · deepinfra · 26 tok/s · 202% spreadqwen-2-1.5b-instruct · together · 99 tok/s · 253% spreadqwen-3-235b · deepinfra · 18 tok/s · 202% spreadQwen3-235B-A22B-Thinking-2507 · deepinfra · 8 tok/s · 336% spreadQwen3-30B-A3B · deepinfra · 57 tok/s · 129% spreadQwen3-32B · deepinfra · 41 tok/s · 148% spreadQwen3-Coder-480B-A35B-Instruct · deepinfra · 29 tok/s · 213% spreadQwen3-Coder-480B-A35B-Instruct-Turbo · deepinfra · 27 tok/s · 231% spreadQwen3-Max · deepinfra · 22 tok/s · 219% spreadQwen3-Max-Thinking · deepinfra · 19 tok/s · 222% spreadQwen3-Next-80B-A3B-Instruct · deepinfra · 47 tok/s · 223% spreadqwen-3.5-0.8b · deepinfra · 25 tok/s · 370% spreadDeepSeek-V4-Pro · together · 26 tok/s · 306% spreadqwen-3.5-122b-a10b · deepinfra · 58 tok/s · 212% spreadqwen-3.5-27b · deepinfra · 53 tok/s · 142% spreadqwen-3.5-2b · deepinfra · 28 tok/s · 301% spreadqwen-3.5-35b-a3b · deepinfra · 94 tok/s · 165% spreadqwen-3.5-397b-a17b · deepinfra · 44 tok/s · 168% spreadGPT-5.4-pro · openai · 4 tok/s · 205% spreadqwen-3.5-4b · deepinfra · 28 tok/s · 290% spreadQwen3.6-27B · deepinfra · 45 tok/s · 166% spreadLlama-Guard-4-12B · together · 3 tok/s · 110% spreadQwen3.7-Max · deepinfra · 2 tok/s · 26% spreadMiniMax-M3 · together · 26 tok/s · 300% spreadL3.3-70B-Euryale-v2.3 · deepinfra · 30 tok/s · 109% spreadMiMo-V2.5 · deepinfra · 24 tok/s · 227% spreadMiMo-V2.5-Pro · deepinfra · 62 tok/s · 210% spreadOlmo-3.1-32B-Instruct · deepinfra · 21 tok/s · 330% spreadclaude-3-7-sonnet-latest · deepinfra · 17 tok/s · 138% spreadclaude-4-opus · deepinfra · 31 tok/s · 76% spreadclaude-4-sonnet · deepinfra · 17 tok/s · 168% spreadclaude-haiku-4.5 · deepinfra · 30 tok/s · 168% spreadclaude-opus-4-7 · deepinfra · 31 tok/s · 58% spreadKimi-K2.6 · together · 67 tok/s · 212% spreadclaude-opus-4-8 · deepinfra · 28 tok/s · 64% spreadclaude-sonnet-4.6 · deepinfra · 17 tok/s · 160% spreadnemotron-3-ultra-550b-a55b · together · 56 tok/s · 206% spreadGPT-oss-120b · together · 58 tok/s · 226% spreadDeepSeek-R1-0528 · deepinfra · 20 tok/s · 210% spreadGPT-oss-20b · together · 52 tok/s · 311% spreadDeepSeek-V3 · deepinfra · 17 tok/s · 268% spreadDeepSeek-V3.1 · deepinfra · 10 tok/s · 290% spreadDeepSeek-V3.1-Terminus · deepinfra · 35 tok/s · 197% spreadDeepSeek-V4-Flash · deepinfra · 23 tok/s · 293% spreadDeepSeek-V4-Pro · deepinfra · 17 tok/s · 240% spreadgemini-2.5-flash · deepinfra · 36 tok/s · 302% spreadgemini-3.1-pro · deepinfra · 23 tok/s · 272% spreadgemma-3-12b-it · deepinfra · 31 tok/s · 117% spreadgemma-3-27b-it · deepinfra · 19 tok/s · 181% spreadgemma-3-4b-it · deepinfra · 27 tok/s · 179% spreadgemma-4-26B-A4B-it · deepinfra · 20 tok/s · 184% spreadgemma-4-31B-it · deepinfra · 17 tok/s · 481% spreadgemma-4-31B-it-turbo · deepinfra · 37 tok/s · 149% spreadllama-2-70b · deepinfra · 25 tok/s · 168% spreadllama-3.2-11b · deepinfra · 22 tok/s · 370% spreadllama-3.2-1b · deepinfra · 20 tok/s · 409% spreadllama-3.2-3b · deepinfra · 17 tok/s · 400% spreadllama-3.2-90b · deepinfra · 48 tok/s · 230% spreadLlama-3.3-70B-Instruct-Turbo · deepinfra · 13 tok/s · 234% spreadllama-3.3-70b · deepinfra · 14 tok/s · 193% spreadllama-4-maverick · deepinfra · 47 tok/s · 223% spreadLlama-Guard-4-12B · deepinfra · 3 tok/s · 142% spreadllama-3-70b · deepinfra · 24 tok/s · 179% spreadllama-3-8b · deepinfra · 34 tok/s · 262% spreadllama-3.1-405b · deepinfra · 18 tok/s · 135% spreadllama-3.1-70b · deepinfra · 25 tok/s · 172% spreadllama-3.1-8b · deepinfra · 17 tok/s · 176% spreadphi-4 · deepinfra · 45 tok/s · 117% spreadMiniMax-M2.7-Turbo · deepinfra · 50 tok/s · 173% spreaddevstral-small · deepinfra · 24 tok/s · 265% spreadmistral-7b · deepinfra · 25 tok/s · 233% spreadMistral-Nemo-Instruct-2407 · deepinfra · 27 tok/s · 307% spreadMistral-Small-24B-Instruct-2501 · deepinfra · 37 tok/s · 164% spreadMistral-Small-3.2-24B-Instruct-2506 · deepinfra · 25 tok/s · 304% spreadmixtral-8x7b · deepinfra · 38 tok/s · 173% spreadKimi-K2-Instruct-0905 · deepinfra · 18 tok/s · 455% spreadKimi-K2-Thinking · deepinfra · 17 tok/s · 508% spreadKimi-K2.5 · deepinfra · 21 tok/s · 410% spreadKimi-K2.5-Turbo · deepinfra · 17 tok/s · 365% spreadKimi-K2.6 · deepinfra · 12 tok/s · 286% spreadLlama-3.3-Nemotron-Super-49B-v1.5 · deepinfra · 38 tok/s · 186% spreadNVIDIA-Nemotron-3-Super-120B-A12B · deepinfra · 37 tok/s · 194% spreadnemotron-3-ultra-550b-a55b · deepinfra · 37 tok/s · 183% spreadNVIDIA-Nemotron-Nano-12B-v2-VL · deepinfra · 37 tok/s · 208% spreadNVIDIA-Nemotron-Nano-9B-v2 · deepinfra · 58 tok/s · 261% spreadNemotron-3-Nano-30B-A3B · deepinfra · 58 tok/s · 300% spreadNemotron-3-Nano-Omni-30B-A3B-Reasoning · deepinfra · 39 tok/s · 189% spreadGPT-oss-120b · deepinfra · 17 tok/s · 315% spreadGPT-oss-120b-Turbo · deepinfra · 65 tok/s · 273% spreadGPT-oss-20b · deepinfra · 59 tok/s · 198% spreadGLM-4.6 · deepinfra · 30 tok/s · 213% spreadGLM-4.6V · deepinfra · 20 tok/s · 207% spreadGLM-4.7 · deepinfra · 28 tok/s · 183% spreadGLM-4.7-Flash · deepinfra · 50 tok/s · 256% spreadGLM-5 · deepinfra · 21 tok/s · 237% spreadGLM-5.1 · deepinfra · 22 tok/s · 214% spreadMiniMax-M2 · deepinfra · 25 tok/s · 25% spreadGPT-5-pro · openai · 8 tok/s · 85% spreadMiniMax-M2.7 · deepinfra · 15 tok/s · 173% spreaddeepseek-v3.2 · deepinfra · 15 tok/s · 404% spreadOrnith-1.0-35B · deepinfra · 35 tok/s · 249% spreadQwen3.6-35B-A3B · deepinfra · 35 tok/s · 281% spreadgemma-4-31B-it · together · 51 tok/s · 201% spreaddeepseek-ai/DeepSeek-R1-0528-Turbo · deepinfra · 20 tok/s · 191% spreadDeepSeek-V4-Flash-0731 · deepinfra · 27 tok/s · 164% spreadKimi-K3 · fireworks · 30 tok/s · 188% spreadDeepSeek-V4-Flash · fireworks · 32 tok/s · 186% spreadKimi-K3 · together · 38 tok/s · 182% spreadKimi-K2.7-Code · fireworks · 35 tok/s · 201% spreadclaude-opus-5 · anthropic · 25 tok/s · 217% spreadGPT-oss-20b · fireworks · 74 tok/s · 193% spreadMiniMax-M3 · fireworks · 54 tok/s · 197% spreadInkling-Small · deepinfra · 51 tok/s · 273% spreadQwen3.8-Max · deepinfra · 6 tok/s · 391% spreadclaude-opus-5 · deepinfra · 25 tok/s · 116% spreadDeepSeek-V4-Flash-0731 · fireworks · 29 tok/s · 248% spreadqwen3-reranker-8b · fireworks · 63 tok/s · 184% spreadnemotron-3-ultra-550b-a55b · fireworks · 60 tok/s · 232% spreadqwen3p7-plus · fireworks · 52 tok/s · 465% spreadglm-5p2-fast · fireworks · 53 tok/s · 299% spreadkimi-k2p6-turbo · fireworks · 49 tok/s · 184% spreadkimi-k3-fast · fireworks · 30 tok/s · 192% spreadkimi-k2p7-code-fast · fireworks · 56 tok/s · 90% spreadQwen/Qwen2.5-VL-32B-Instruct · deepinfra · 24 tok/s · 162% spreadmicrosoft/WizardLM-2-8x22B · deepinfra · 16 tok/s · 301% spreaddeepseek-ai/DeepSeek-OCR · deepinfra · 23 tok/s · 363% spreadPaddlePaddle/PaddleOCR-VL-0.9B · deepinfra · 20 tok/s · 240% spreadnvidia/Llama-3.1-Nemotron-70B-Instruct · deepinfra · 37 tok/s · 175% spreadallenai/olmOCR-2-7B-1025 · deepinfra · 19 tok/s · 256% spreaddeepseek-ai/DeepSeek-R1-Distill-Llama-70B · deepinfra · 22 tok/s · 167% spreadDeepSeek-V4-Flash-0731 · together · 47 tok/s · 229% spreadInkling · fireworks · 4 tok/s · 0% spreadKimi-K3 · deepinfra · 22 tok/s · 297% spreadNemotron-Lightning-3.5-30B-A3B · fireworks · 83 tok/s · 284% spreadgemini-2.5-flash-lite · google via OpenRouter · 3 tok/s · 40% spreadgemma-4-26B-A4B-it · deepinfra via OpenRouter · 19 tok/s · 194% spreadgpt-4.1-nano · openai via OpenRouter · 44 tok/s · 66% spreadphi-4 · deepinfra via OpenRouter · 20 tok/s · 229% spreadgpt-4o-mini · openai via OpenRouter · 38 tok/s · 72% spreadNemotron-3-Nano-30B-A3B · deepinfra via OpenRouter · 52 tok/s · 157% spreadMistral-Small-24B-Instruct-2501 · deepinfra via OpenRouter · 43 tok/s · 67% spreadqwen-2.5-72b · deepinfra via OpenRouter · 16 tok/s · 205% spreadgpt-3.5-turbo · openai via OpenRouter · 47 tok/s · 75% spreadclaude-opus-4-8 · anthropic via OpenRouter · 22 tok/s · 73% spreadgemma-3-4b-it · deepinfra via OpenRouter · 20 tok/s · 64% spreadgpt-4o · openai via OpenRouter · 38 tok/s · 82% spreadgpt-4.1-mini · openai via OpenRouter · 28 tok/s · 127% spreadgemma-3n-e4b-it · together via OpenRouter · 34 tok/s · 105% spreaddeepseek-v3.2 · deepinfra via OpenRouter · 11 tok/s · 174% spreadgpt-4 · openai via OpenRouter · 24 tok/s · 52% spreadNVIDIA-Nemotron-3-Super-120B-A12B · deepinfra via OpenRouter · 38 tok/s · 0% spreadgemma-3-12b-it · deepinfra via OpenRouter · 25 tok/s · 95% spreadMistral-Nemo-Instruct-2407 · deepinfra via OpenRouter · 29 tok/s · 172% spreadDeepSeek-V3.1-Terminus · deepinfra via OpenRouter · 40 tok/s · 103% spreadMistral-Small-3.2-24B-Instruct-2506 · deepinfra via OpenRouter · 32 tok/s · 62% spreadllama-3.1-8b · deepinfra via OpenRouter · 18 tok/s · 163% spreadDeepSeek-V3 · deepinfra via OpenRouter · 13 tok/s · 91% spreadclaude-haiku-4.5 · anthropic via OpenRouter · 37 tok/s · 81% spreadQwen3-VL-30B-A3B-Instruct · deepinfra via OpenRouter · 21 tok/s · 141% spreadQwen3-Next-80B-A3B-Instruct · deepinfra via OpenRouter · 41 tok/s · 141% spreadDeepSeek-V3.1 · deepinfra via OpenRouter · 11 tok/s · 149% spreadclaude-opus-4-7 · anthropic via OpenRouter · 21 tok/s · 43% spreadclaude-sonnet-4.6 · anthropic via OpenRouter · 21 tok/s · 102% spreadclaude-sonnet-5 · anthropic via OpenRouter · 21 tok/s · 51% spreadclaude-opus-4.6 · anthropic via OpenRouter · 20 tok/s · 31% spreadllama-3.1-70b · deepinfra via OpenRouter · 25 tok/s · 134% spreadDeepSeek-V4-Flash · deepinfra via OpenRouter · 33 tok/s · 125% spreadmeta-models/Muse-Glimmer-30B · together · 9 tok/s · 68% spreadaccounts/fireworks/models/muse-glimmer-30b · fireworks · 15 tok/s · 137% spreadmeta-models/Muse-Glimmer-30B · deepinfra · 25 tok/s · 121% spreadnvidia/NVIDIA-Nemotron-3.5-Lightning · deepinfra · 191 tok/s · 54% spread
mean tok/s →↑ spread %

Full results

283 of 283 models
State
min·mean·max
Trend

Throughput over time · shared scale

Method. A cron job calls each model's live API endpoint on a schedule and records what came back. Mean, min and max are over completed samples in the selected window, and n is how many there were. A missing value means the endpoint returned an error or the model was not yet in the catalogue.

Spread is (max − min) ÷ mean, so it measures run-to-run variation rather than absolute speed. TTFT is seconds to the first visible token; runs that emit only reasoning tokens are left out of that average. Mean counts visible output tokens where a provider reports them and falls back to generated throughput where it does not, which is why Gen is higher for models that think before answering.