inferenstack — the market read on AI inference · last observation 2026-09-20. See the boards
Price spread

meta-llama/llama-4-maverick-17b-128e-instruct-fp8

meta-llama· 131K ctx
open weightstool call quant: unknown

spread (output)

2.5×

$0.600 – $1.48 · 6 providers

6 providers priced
ProviderInputOutputCache rdBlended
Nvidia
relay router
free/—free/——free/—
Llamafp8
relay router
free/—free/——free/—
IO.NETfp8
relay router
$0.150$0.600$0.075$0.168
Deep Infrafp8
open weights host
$0.200$0.800—$0.255*
NovitaAIfp8
relay router
$0.270$0.850—$0.323*
Azurefp8
hyperscaler
$0.250$1.00—$0.318*
Azure Cognitive Servicesfp8
unknown
$0.250$1.00—$0.318*
watsonx.aifp8outlier
open weights host
$0.371$1.48—$0.472*

Data: models.dev (MIT), snapshot 2026-09-20. Prices are vendor-published; verify before purchase. Methodology.