五个 Gemini 模型怎么选
这里的每个 Gemini id 都是 1,000,000 token context、同样的能力、同样的路由。输入价从每百万 0.050 到 0.20 美元——4 倍差距,其余全都一样。
五个 id 的规格是一样的
gemini-3.8-flash、gemini-3.7-flash-high、gemini-3.6-flash-high、gemini-3-flash、gemini-3.1-pro-low,五个 id 的 context 都是 1,000,000 token,能力都是文本 / 工具调用 / thinking,都走 POST /v1/chat/completions。输出上限四个 Flash 是 65,536,Pro 是 65,535。
一个模型家族内部这么整齐是少见的,也让选型省事不少:不存在"只有它塞得下"的 id,不存在"只有它能调工具"的 id,也不需要为路由差异写额外代码。
剩下的就只有价格,而且拉得很开。各自倍率算完之后,输入每百万分别是:gemini-3-flash 0.050 美元、gemini-3.6-flash-high 和 gemini-3.7-flash-high 0.075、gemini-3.8-flash 0.15、gemini-3.1-pro-low 0.20;输出按同样顺序是 0.30、0.375、0.75、1.20。
看价格梯,别看版本号
价格顺序和版本号顺序不一致,这也是这个家族最容易让人搞混的地方:gemini-3.8-flash 是最新的(2026-09-02),价格却排第二贵,比更老的 gemini-3.7-flash-high 和 gemini-3.6-flash-high 都高一倍。
原因在倍率,不在官方价目表。gemini-3.8-flash、gemini-3.7-flash-high、gemini-3.6-flash-high 的官方价都是 0.75/3.75 美元,但第一个按 0.2 倍计费、后两个按 0.1 倍。上游价格完全相同,其中一个的账单翻了倍。
gemini-3-flash 排在最下面靠的是真的更低的官方价——0.50/3 美元,0.1 倍率——输入是 3.6 / 3.7 那一对的三分之二,输出是它们的五分之四。gemini-3.1-pro-low 在最上面,官方价 2/12 美元,同样 0.1 倍率。
for MODEL in gemini-3-flash gemini-3.7-flash-high gemini-3.8-flash gemini-3.1-pro-low; do
echo "== $MODEL"
curl -s https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d "{
\"model\": \"$MODEL\",
\"max_tokens\": 512,
\"messages\": [
{\"role\": \"user\", \"content\": \"Explain what this SQL query does and name one risk.\"}
]
}" | jq '{answer: .choices[0].message.content, usage}'
done没有 benchmark 可依,怎么选
目录能给你价格、日期和规格,给不了正确率,我们也不会拿一个猜测去顶替它。所以这道题只能用你自己的产出来判,好在五个 id 的请求结构完全一样,这就是一次小实验,不是一个项目。
可以这么做:从真实负载里挑二十个你清楚"什么算答得好"的任务,先全部过一遍 gemini-3-flash——它在梯子最底下——数一下失败了几个。如果一个明显的问题都没有,那梯子上面的每一档,在你的负载上都是没有证据支撑的开销;如果有,往上挪一档再来一遍。
过程中把推理配置固定住:Flash 各自有自己的 thinking 档位,gemini-3.1-pro-low 本身是 low 档的 Pro,不固定就变成在比配置了。跑完再把 token 总量对着价格梯算一遍——量小的时候整个家族花的钱差不多,量大的时候,两端那 4 倍就是这道题的全部。