llm-benchmarks
githubdrose.io

phala Provider Benchmarks


Measured over the last 30 days

Models Tracked
21
Avg Tokens / Second
14.28
Avg Time to First Token (ms)
13453.93
Last Updated
Sep 1, 2026

All phala models

21 tracked · fastest first
ModelAvg Toks/SecMinMaxAvg TTF (ms)
Qwen2.5 7B Instruct52.4039.7059.70610.00
Qwen2.5 7B Instruct46.3028.2062.00730.00
Gemma 4 31B28.003.4451.401210.00
gpt-oss-120b21.9014.8030.802590.00
GLM 5.215.408.6820.103310.00
Gemma 3 27B12.906.8018.901090.00
DeepSeek V4 Flash 073111.807.8714.104810.00
gpt-oss-20b10.7010.7010.704910.00
Muse Glimmer 30B6.315.956.739120.00
Muse Glimmer 30B6.285.338.139350.00
Qwen3.6 35B A3B5.574.056.9111600.00
DeepSeek V3.25.252.967.272660.00
Hy34.674.674.6713300.00
Kimi K2.54.561.507.3420300.00
Kimi K2.63.622.225.5818200.00
Kimi K33.031.684.0123200.00
DeepSeek V4 Flash 04232.662.412.914670.00
Qwen3.5 397B A17B1.900.952.9634200.00
GLM 5.11.451.151.9645300.00
Qwen3.5-27B0.960.671.5068000.00
DeepSeek V4 Pro 08130.200.200.2045500.00

Frequently Asked Questions

Which phala model is fastest?
Based on recent tests, Qwen2.5 7B Instruct shows the highest average throughput among tracked phala models.
How many recent measurements feed this dashboard?
This provider summary aggregates 5495 individual prompts measured across 4547 monitoring runs over the past month.