inferenstack — the market read on AI inference · last observation 2026-09-20. See the boards
Blended cost

What each provider really costs your workload

Agentic workloads are ~10:1 input:output with heavy cache reads — naive input+output ranking is wrong for exactly that use. This ranks providers on the mix you choose.

MiniMax-M2.5

48 providers priced · blended $/M
●Deep Infra
$0.165$8/mo
Venice AI
$0.179$9/mo
OpenRouter
$0.189$9/mo
GreenPT
$0.195$10/mo
NovitaAI
$0.210$11/mo
Eden AI
$0.210$11/mo
FrogBot
$0.210$11/mo
HPC-AI
$0.210$11/mo
Hugging Face
$0.210$11/mo
Kilo Gateway
$0.210$11/mo
LLM Gateway
$0.210$11/mo
LLM Gateway
$0.210$11/mo
OpenCode Go
$0.210$11/mo
SiliconFlow
$0.210$11/mo
TokenGo
$0.210$11/mo
DigitalOcean
$0.229$11/mo
Friendli
$0.229$11/mo
OpenCode Zen
$0.229$11/mo
Together AI
$0.229$11/mo
Cortecs
$0.236$12/mo
MiniMax (minimax.cn)
$0.241$12/mo
DevPass (LLM Gateway)
$0.241$12/mo
Merge Gateway
$0.241$12/mo
MiniMax (minimax.io)
$0.241$12/mo
Ofox
$0.241$12/mo
OrcaRouter
$0.241$12/mo
Vercel AI Gateway
$0.241$12/mo
ZenMux
$0.241$12/mo
TensorX
$0.269$13/mo
DInference
$0.280*$14/mo
NanoGPT
$0.286$14/mo
D.Run (China)
$0.369*$18/mo
Alibaba (China)
$0.382*$19/mo
Amazon Bedrock
$0.382*$19/mo
Baseten
$0.382*$19/mo
CloudFerro Sherlock
$0.382*$19/mo
Meganova
$0.382*$19/mo
302.AI
$0.382*$19/mo
SiliconFlow (China)
$0.384*$19/mo
LLM Gateway
$0.401$20/mo
NovitaAI
$0.401$20/mo
DevPass (LLM Gateway)
$0.432$22/mo
Vercel AI Gateway
$0.432$22/mo
OrcaRouter
$0.432$22/mo
MiniMax (minimax.cn)
$0.451$23/mo
MiniMax (minimax.io)
$0.451$23/mo
Merge Gateway
$0.451$23/mo
ZenMux
$0.700$35/mo
Unavailable: OpenCode Zen (placeholder)Alibaba Token Plan (China) (placeholder)MiniMax Token Plan (minimax.io) (placeholder)Tencent Coding Plan (China) (placeholder)Alibaba Coding Plan (placeholder)Alibaba Coding Plan (China) (placeholder)Alibaba Token Plan (placeholder)SCNet Token Plan (placeholder)MiniMax Token Plan (minimax.io) (placeholder)MiniMax Token Plan (minimax.cn) (placeholder)MiniMax Token Plan (minimax.cn) (placeholder)

Blended over 1M workload tokens at input:output 10:1, 70% cache hit. Hatched bars (*) have no published cache price and are charged at full input. Tiered rows use the base tier. Monthly $ = blended × 50M.

Data: models.dev (MIT), snapshot 2026-09-20. Prices are vendor-published; verify before purchase. Methodology.