批量处理用什么模型:当成本本身就是需求
同样是给 10 万份文档分类,Gemini 3 Flash 7.60 美元,Grok Composer 2.5 Fast 21 美元,Claude Haiku 4.5 Stable 56 美元。倍率不等于价格。
同一个任务,七个价格
拿一个具体的批处理来算:10 万份文档,每份输入 800 token、输出 120 token。合计 8000 万输入 token、1200 万输出 token——整个成本完全由两个每 token 单价决定。
按消费者单价(官方价 × 倍率):Gemini 3 Flash 是 $0.50/$3 的 0.1 倍,4.00 + 3.60 = 7.60 美元。GPT 5.6 Luna 是 $0.2/$1.2 的 0.3 倍,4.80 + 4.32 = 9.12 美元。Gemini 3.7 Flash 是 $0.75/$3.75 的 0.1 倍,6.00 + 4.50 = 10.50 美元。GPT 5.4 Mini 是 $0.75/$4.5 的 0.1 倍,6.00 + 5.40 = 11.40 美元。
再往上:Grok Composer 2.5 Fast 是 $3/$15 的 0.05 倍,12.00 + 9.00 = 21.00 美元。Claude Sonnet 5 是 $3/$15 的 0.1 倍,24.00 + 18.00 = 42.00 美元。Claude Haiku 4.5 Stable 是 $1/$5 的 0.4 倍,32.00 + 24.00 = 56.00 美元。同样的活,最便宜到最贵差 7.4 倍。
export TOKEN_SHARE_KEY="<your-pool-api-key>"
# Estimate: docs x tokens x (consumer rate per million).
# gemini-3-flash consumer rates: 0.1x of $0.50/M in and $3/M out.
awk 'BEGIN {
docs = 100000; in_tok = 800; out_tok = 120
printf "input $%.2f\n", docs * in_tok / 1000000 * 0.050
printf "output $%.2f\n", docs * out_tok / 1000000 * 0.300
printf "total $%.2f\n", docs * in_tok / 1000000 * 0.050 + docs * out_tok / 1000000 * 0.300
}'
# Verify the shape on one real document before multiplying by 100,000.
curl -sS https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-flash",
"messages": [
{"role": "system", "content": "Classify the document. Reply with one label and one sentence."},
{"role": "user", "content": "<one real document here>"}
]
}' | jq '.usage'倍率最低的不是价格最低的
倍率最低的那个未必最便宜。Grok Composer 2.5 Fast 是目录里唯一的 0.05 倍,可上面那个批处理它要 21 美元,接近 0.1 倍的 Gemini 3 Flash 的三倍——因为倍率只是对官方价的折扣,而 Composer 的官方价是 $3/$15,Gemini 3 Flash 是 $0.50/$3。
反方向同样会踩坑:Claude Haiku 4.5 Stable 是目录里最小的 Claude,但 $1/$5 官方价乘 0.4 倍,输入价 $0.40/M,比 0.1 倍下 Claude Sonnet 5 的 $0.30/M 还高。这个批处理上,「小模型」56 美元,更大的那个 42 美元。
所以该比的既不是倍率,也不是单看官方价,而是两者的乘积:官方价 × 倍率,输入输出分开算,再按你这个任务真实的输入输出比加权。
输入输出比会改变排名
上面那个批处理按 token 算约 87% 是输入,所以输入单价主导。反过来看——读 100 token、写 1500 token 的生成型任务——就轮到输出单价说了算。10 万条就是 1000 万输入、1.5 亿输出 token。
在这个反过来的形状上:Gemini 3 Flash 是 0.50 + 45.00 = 45.50 美元;GPT 5.6 Luna 是 0.60 + 54.00 = 54.60 美元;Gemini 3.7 Flash 是 0.75 + 56.25 = 57.00 美元。输出主导时排名只看输出那一侧,Luna 与 Flash 的差距因此比分类批处理时更窄——它的官方输出价是输入价的 6 倍。
看任何排名之前先算自己的比例,包括这一页的排名。两个数字——每条的平均输入 token 和平均输出 token——就能把目录里每个模型折算成一个可比的数,而这恰好是价格表替你猜不出来的两个数。
会随规模放大的不止成本
批处理每条都带同一段固定 prompt,那段前缀会被发 10 万次。只要它确实重复,提示词缓存就能让后续请求按缓存读取计费而不是按新输入——在上面那个分类例子里,动的正是最大的那一项。
质量问题同样会随规模放大,而且比钱放大得更狠。错标 3% 意味着 3000 行错数据,把它们找出来的代价远超 7.60 美元和 42 美元之间那点差价。先拿 200 条带标注的样本跑两个候选,数错误率,再去比总价。
接口形态在大批量下的意义只在于你的 worker 代码长什么样:Gemini 和 Grok 走 /v1/chat/completions,OpenAI 走 /v1/responses,Claude 走 /v1/messages。同一形态内换 id 只改 model 字段,所以上面这套对比,在你自己的数据上重跑一遍也就几美元。