Gemini 3 Flash:目录里单价最低的模型
0.1 倍率之后是输入每百万 0.050 美元、输出 0.30 美元,context 还有 1,000,000 token。这个价格买到什么、第二名贵多少,以及什么时候最便宜的那个反而不该选。
这个数字,以及紧随其后的是谁
gemini-3-flash 的官方定价是输入每百万 0.50 美元、输出 3 美元,按 0.1 倍计费,折算下来是 0.050 和 0.30 美元。在这个目录的所有文本 id 里,输入和输出这两个数字都没有比它更低的。
看看第二名就有概念了:gpt-5.6-luna 是 0.06 和 0.36 美元,两头都是 1.2 倍(它的官方价 0.20/1.20,倍率 0.3)。再往下是 gpt-5.4-mini 的 0.075 和 0.45(都是 1.5 倍),以及 gemini-3.7-flash-high 和 gemini-3.6-flash-high 的 0.075 和 0.375(输入 1.5 倍、输出 1.25 倍)。
和主流 id 对照:claude-sonnet-5 是 0.30 和 1.50 美元,分别是 6 倍和 5 倍;grok-4.6 是 0.20 和 0.60,分别是 4 倍和 2 倍。输出侧的差距已经不算悬殊,写得多的任务别凭印象判断,按自己的 token 量算一遍。
便宜的这个不是缩水版
便宜的模型通常要在规格上让步,这个基本没让。gemini-3-flash 的 context 是 1,000,000 token——和 claude-opus-5 以及这里所有 Gemini id 一样大——输出上限 65,536。能力列表是文本、工具调用、thinking,所以工具型 agent 和需要推理的 prompt 它都接得住。
它是目录里发布最早的 Gemini id:2025-12-17,而 gemini-3.1-pro-low 是 2026-03-01、gemini-3.8-flash 是 2026-09-02。目录记录的只有日期,没有质量分数,所以把这个日期当成"什么时候发布的"这个事实就好,别把它当成效果的替代指标。
缓存读取的官方价是每百万 0.05 美元,0.1 倍后是 0.005 美元,只有新输入价的十分之一。前缀重复的场景里,这就是"每轮都为同一段系统提示词全价付费"和"只付十分之一"的区别。
curl https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "gemini-3-flash",
"max_tokens": 256,
"messages": [
{"role": "system", "content": "Classify each ticket as bug, feature, or question. Reply with one word."},
{"role": "user", "content": "The export button does nothing on Safari."}
]
}' | jq '{content: .choices[0].message.content, usage}'什么时候最低价反而不该选
价格优势只有在便宜的 id 真的把活干完时才兑现。假如一个任务在 gemini-3-flash 上要试两次、在贵 4 倍的模型上一次过,那便宜的这个实际只省了一半——还是更省,但已经不是价目表上那个比例了,而且这还没算重试的延迟和为此要写的判断逻辑。
真正会翻盘的是"答错比 token 更贵"的场景:迁移脚本、账务计算,以及任何后面得由人来复核的东西。输出每百万 0.30 美元,一整天请求的 token 成本可能还不如工程师花一小时去收拾一个错误答案。这不是在替贵的那个说话,而是在说:这件事要测,不能拍脑袋。
测法很简单:拿一批有标准答案的真实任务,全部过一遍 gemini-3-flash,数一下有多少条结果可以接受。把这个正确率和 4 倍、6 倍的价差摆在一起,才是真正的决策依据;一份通用排名不是。