Gemini 3.1 Pro 与 Gemini Flash:价差取决于你说的是哪个 Flash
Pro 的输入是 gemini-3-flash 的 4 倍,却只是 gemini-3.8-flash 的 1.33 倍。窗口同为 1,000,000 token、能力相同、路由相同——所以这道题只关乎单价,以及你的任务能不能察觉出差别。
规格几乎一致,价格不是
gemini-3.1-pro-low 和四个 Flash id 的 context 都是 1,000,000 token,能力都是文本 / 工具调用 / thinking,都走 POST /v1/chat/completions。输出上限也基本一致:Pro 是 65,535,Flash 都是 65,536。能力这一栏区分不出它们。
Pro 的官方定价是输入每百万 2 美元、输出 12 美元,0.1 倍率之后是 0.20 和 1.20 美元。目录里能说清的"Pro 和 Flash 有什么不同",到这儿就说完了。
而 Flash 并不是一个价格,所以"Pro 还是 Flash"根本不能当成一个问题来答。gemini-3-flash 是 0.050/0.30;gemini-3.7-flash-high 和 gemini-3.6-flash-high 是 0.075/0.375;gemini-3.8-flash 是 0.15/0.75。Pro 相对它们分别是 4 倍、2.67 倍 / 3.2 倍、1.33 倍 / 1.6 倍。
拿一个你手上真有的任务来算
假设一个读 200,000 token、写 20,000 token 的任务——大段 diff 的评审,或者过一遍文档。gemini-3-flash 是 0.016 美元,gemini-3.7-flash-high 是 0.0225 美元,gemini-3.8-flash 是 0.045 美元,gemini-3.1-pro-low 是 0.064 美元。
这四个数字要当成一个区间来读,而不是一份排名。gemini-3.8-flash 和 Pro 之间差不到两分钱,对多数团队来说还不如一次重试的波动大;但 gemini-3-flash 和 Pro 之间差 4 倍,一天跑一千个任务就是 16 美元和 64 美元的区别。
所以真正决定这道题该花多少心思的是量级。量小的时候整条 Gemini 线价格差不多,那就按产出质量挑;量大的时候它是一笔明确的开支,你实际在决定的是区间两端那 4 倍的差距。
for MODEL in gemini-3.1-pro-low gemini-3.8-flash gemini-3-flash; do
echo "== $MODEL"
curl -s https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d "{
\"model\": \"$MODEL\",
\"max_tokens\": 1024,
\"messages\": [
{\"role\": \"user\", \"content\": \"Find the race condition in this handler and explain it.\"}
]
}" | jq '{answer: .choices[0].message.content, usage}'
done目录说不了的部分,怎么自己找出来
目录把 Pro 标为 frontier 档、Flash 标为 fast 档,但它没给任何 benchmark、任何正确率数字,也没有"这个有那个没有"的能力项。你能从中核实的差别只有价格。所以"Pro 在真实任务上是不是更强"这类问题,这份数据答不了;"Flash 够不够用"同样答不了。
但这两个问题在你自己的工作负载上都能答,而且很便宜:挑二十个你已经知道正确答案长什么样的任务,两个 id 各跑一遍,给结果打分。这样你就拿到了一个正确率差值,可以和表上那个价格倍数放在一起权衡。
实测时有一点要注意:Pro 这个 id 标的是 low 推理档,Flash 各自也有自己的 thinking 档位。如果你的 prompt 依赖推理步骤,对比时要把这个设置固定住,否则你测的是配置,不是模型。