按任务类型看最低成本:每种活儿到底花多少钱
倍率最低不等于价格最低。按每种负载真正的约束条件排序,有效单价从每百万输入 token 0.050 美元起。
倍率最低的那个,不是最便宜的那个
倍率乘的是每个模型自己的官方单价,所以只有底价相同的时候,两个倍率才有可比性。而目录里底价几乎从不相同——照着倍率挑便宜货,方向就反了。
最典型的例子:grok-composer-2.5-fast 是全目录最低的 0.05 倍,但它的官方价是输入每百万 3 美元,折下来 0.15 美元。gemini-3-flash 的倍率是它的两倍(0.1 倍),官方价却只有 0.50 美元,折下来 0.050 美元——比"倍率最低"的那个还便宜三倍。
下面所有数字都是有效单价,也就是官方价乘倍率、你实际付的钱。先乘,再比。
高频调用、答案很短
分类、抽取、路由、打标签——请求量大、每条回答只有几十个 token 的活儿。账单几乎全压在输入侧,所以排序看输入单价就够了。
gemini-3-flash 是目录里输入最便宜的,每百万 0.050 美元(0.1 倍乘 0.50 美元),输出也是最低的 0.30 美元;上下文 100 万 token,能力覆盖 text、tools、thinking。往下依次是 gpt-5.6-luna 的 0.06 美元(0.3 倍乘 0.20 美元——倍率不算低,胜在底价更低)、gemini-3.7-flash-high 和 gemini-3.6-flash-high 的 0.075 美元、gpt-5.4-mini 的 0.075 美元。
这四个在输入侧彼此不超过 1.5 倍。量大的时候这是真金白银,但还谈不上量级差别。真正区分它们的东西不在价格栏里:路由不同(Gemini 系走 /v1/chat/completions,GPT 系走 /v1/responses),以及模型答对的比例够不够高——一个需要重试的便宜模型,总账比不用重试的贵模型还贵。
# gemini-3-flash: $0.050 / M input, $0.30 / M output (0.1x on $0.50 / $3)
curl -sS https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "gemini-3-flash",
"messages": [
{"role": "user", "content": "Classify this ticket as bug, feature, or question. Reply with one word.\n\nTicket: the export button downloads an empty CSV"}
]
}' | jq '{output: .choices[0].message.content, usage}'长输入、重输出,以及所有要用工具的活儿
输入很长的时候,上下文上限和输入单价是一起起作用的。能装下 100 万 token 又停在 Flash 价位的有五个:gemini-3-flash 0.050 美元、gemini-3.7-flash-high 和 gemini-3.6-flash-high 0.075 美元、gemini-3.8-flash 0.15 美元(0.2 倍乘 0.75 美元)、gemini-3.1-pro-low 0.20 美元。再往上,claude-sonnet-5 同样是 100 万 token、0.30 美元,但把单次输出上限从 65,536 抬到了 12.8 万 token。
输出很长的时候,改看输出单价,顺便确认输出上限够不够。上面那五个 Gemini id 的输出上限都是 65,536 token(gemini-3.1-pro-low 是 65,535)。真要在一次响应里吐超过这个数,能到 12.8 万 token 里最便宜的是 gpt-5.6-luna 的每百万 0.36 美元,其次 gpt-5.6-terra 的 1.20 美元、claude-sonnet-5 的 1.50 美元。
工具能力不构成区分度:31 个条目里 27 个都列了 tools,剩下四个是图像和视频模型。thinking 稍微窄一点,25 个条目有;文本模型里没有的只有 stable-claude-haiku-4-5(0.40 / 2.00 美元)和 grok-composer-2.5-fast(0.15 / 0.75 美元)。如果你想要工具调用但不想为推理 token 付钱,这两个就是花不出去那笔钱的 id。
图像和视频的计费方式不一样
图像模型不按 token 走,而且这正是倍率不再帮忙的地方。grok-imagine-image 每张 0.01 美元、grok-imagine-image-quality 每张 0.04 美元,两个都是 1 倍率——一分折扣没有,也是整个目录里仅有的两个这样的条目。gpt-image-2 则是 0.1 倍率、按 token 计价,官方 5/30 美元,折下来 0.50 / 3.00 美元每百万。
grok-imagine-video-1.5 按视频秒数计费、0.1 倍率,所以推动账单的是片子多长,不是 prompt 多长。
于是三个图像 id 之间的比较,本质上是两种计费单位之间的比较。按张计价的好处是可预测,按 token 计价则随你发过去的东西一起涨。哪个对你更便宜,取决于你的 prompt 有多大、每个 prompt 出几张图——先数清楚这两件事,别先下结论。