定价是怎么算的:倍率如何变成你的账单
你的价格 = 官方每 token 单价 × 该模型的倍率。倍率从 0.05 倍到 1 倍都有,所以光看倍率永远判断不出谁更便宜。
一个公式,逐个模型套用
到手价 = 官方每 token 单价 × 该模型的 rateMultiplier。官方价是上游厂商为这个模型公布的价格,倍率是我们在它上面乘的系数。两者都逐个模型记录在目录里,每个模型页上都能看到。
举个算得出来的例子。claude-sonnet-5 的官方价是输入每百万 token 3 美元、输出 15 美元,倍率 0.1。一次读进 50,000 token、写出 8,000 token 的请求,官方口径是 (50,000 ÷ 1,000,000 × 3) + (8,000 ÷ 1,000,000 × 15) = 0.27 美元,乘完倍率是 0.027 美元。
同一个请求换 gpt-5.6-sol(官方 5 和 30 美元,同样 0.1 倍),官方 0.49 美元、到手 0.049 美元;换 gemini-3-flash(官方 0.50 和 3 美元,0.1 倍),官方 0.049 美元、到手 0.0049 美元。同一套算法,三个结果,差别全在底价。
倍率不是排名
这是那个会让人多花钱的误解。因为每个倍率乘的底价不一样,倍率更低完全可能账单更高。gpt-5.6-luna 是 0.3 倍乘官方 0.20 美元的输入价,折成每百万 0.06 美元;gpt-5.4-mini 是 0.1 倍——数字上好看三倍——乘官方 0.75 美元,折成 0.075 美元。0.3 倍的那个才是便宜的。
反方向也一样。stable-claude-haiku-4-5 是 0.4 倍乘官方 1 美元,等于每百万 0.40 美元;claude-sonnet-5 是 0.1 倍乘 3 美元,等于 0.30 美元。倍率看着差四倍,实际便宜的是倍率高的那个。
最容易读错的是这个:grok-composer-2.5-fast 的倍率是全目录最低的 0.05,但它的官方输入价是每百万 3 美元,折下来 0.15 美元——是 gemini-3-flash 那 0.050 美元的三倍。先乘,再比。永远不要拿倍率给目录排序。
倍率到底都是多少
31 个条目里一共出现六种取值。18 个是 0.1 倍——所以"主流模型 0.1 倍"这个说法是站得住的。1 个是 0.05 倍:grok-composer-2.5-fast,全目录最低。2 个是 0.2 倍:gemini-3.8-flash 和 stable-gpt-6-astra。1 个是 0.3 倍:gpt-5.6-luna。7 个是 0.4 倍:所有 stable-* 的 Claude 通道。还有 2 个是 1 倍:grok-imagine-image 和 grok-imagine-image-quality。
1 倍就是没有折扣。这两个图像模型按张计费,分别是 0.01 和 0.04 美元,按官方全价收。生成 40 张标准图是 0.40 美元,40 张 quality 是 1.60 美元,倍率在这里不起任何作用。"这儿的东西都是 0.1 倍"这种说法是错的,而且错得最明显的就是这两个 id。
倍率抬升的另一处是 stable-* 通道。stable-* 表示这条通道由我们自己的 key 承载,不走共享账号池,也不参与池内 failover。Claude 的 stable 通道清一色 0.4 倍,stable-gpt-6-astra 是 0.2 倍。所以 claude-sonnet-5 的 0.30 / 1.50 和 stable-claude-sonnet-5 的 0.80 / 4.00,是同一份权重走不同路由,价格随之不同。
哪些东西被计入,以及怎么核账
输入和输出是两个价,而且差得不小:整个目录里输出价是输入价的 3 到 6 倍。比例最窄的是 grok-4.6 和 grok-4.5 的 3 倍(乘完倍率是 0.20 对 0.60);六个 gpt-5.x、gemini-3-flash 和 gemini-3.1-pro-low 是 6 倍;剩下 17 个文本 id 是 5 倍,包括所有 Claude id 和 stable-gpt-6-astra。任何让回答变长的东西,算的都是贵的那一侧。
缓存命中的输入单独计价,有自己的每 token 费率,低于标准输入价,倍率同样照乘。前缀如果真的一轮轮原样重复,这就是那个可用的杠杆。媒体模型则完全不按 token 走:两个 grok-imagine-image 按张计费,grok-imagine-video-1.5 按视频秒数计费、0.1 倍率——推动账单的是片长,不是 prompt 长度。
想自己核一遍,就把响应里的 token 数读回来乘一遍。三个路由都会报 usage:Anthropic 形状给的是 input_tokens 和 output_tokens,另外把 cache_read_input_tokens 和 cache_creation_input_tokens 单列;OpenAI 形状给的是 prompt_tokens 和 completion_tokens,缓存读取放在 prompt_tokens_details.cached_tokens 里。每一桶乘各自的有效单价,加起来应该跟扣费对得上。
# claude-sonnet-5: official $3 / $15 per M, multiplier 0.1x
curl -sS https://token-share.app/v1/messages \
-H "x-api-key: $TOKEN_SHARE_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Summarise this changelog in three bullets."}]
}' \
| jq '.usage as $u
| {usage: $u,
billed_usd: (($u.input_tokens / 1000000 * 3 * 0.1)
+ ($u.output_tokens / 1000000 * 15 * 0.1))}'
# Every model publishes its own rate and multiplier — read them from the catalog:
curl -sS https://token-share.app/v1/models \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
| jq '[.data[] | {id, endpoint, context_window, max_output_tokens}]'