八个 OpenAI id 怎么挑
八个里有两个在比价之前就被路由和模态排除了。剩下六个的差异在上下文、输出上限,以及跨度 8.33 倍的单价。按什么顺序决定。
先按路由和模态排除
有两个 id 在比质量、比价格之前就该划掉。gpt-image-2 是走 /v1/images/generations 的图像模型,它不是文本模型的替代品,是另一件事。stable-gpt-6-astra 记录的路由是 /v1/messages,要用 x-api-key 加 anthropic-version 的 Anthropic 形状请求,而不是其余几个那种 Bearer + responses 的调用。
剩下六个在 /v1/responses 上:gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna、gpt-5.5、gpt-5.4、gpt-5.4-mini。这六个之间替换只改一个字段,这才让它们真正可比。
如果你的客户端本来就说 Anthropic 消息格式,这一步就反过来:stable-gpt-6-astra 变成最容易接的那个,而这六个才是需要移植的一边。不管哪种情况,路由都该是第一道筛子——因为它是唯一一个花的是工时而不是钱的差异。
再看两道硬限制
上下文和输出上限是限制,不是偏好:超了就是请求失败或回复被截断,跟预算无关。这六个正好分成两组。gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna 是 372,000 token 上下文、最多输出 128,000;gpt-5.5、gpt-5.4、gpt-5.4-mini 是 272,000 和 64,000。
先查输出上限,因为它炸得最直接——必须单次返回超过 64,000 token 的任务,候选就只剩三个而不是六个。如果输入侧需要超过 372,000 token 的空间,这六个都不够,决策就转向 1,050,000 token 的 stable-gpt-6-astra,同时接受随之而来的路由变更。
六个记录的能力集完全相同——text、tools、thinking——所以能力这一栏在这里筛不掉任何人。发布日期从 GPT 5.4 那对的 2026-03-15,到 gpt-5.5 的 2026-05-01,再到三个 GPT 5.6 的 2026-07-09。
最后比价,但要看对数字
折算后每百万 token 的输入 / 输出单价:gpt-5.6-sol 和 gpt-5.5 是 0.50 / 3.00 美元,gpt-5.4 是 0.25 / 1.50,gpt-5.6-terra 是 0.20 / 1.20,gpt-5.4-mini 是 0.075 / 0.45,gpt-5.6-luna 是 0.06 / 0.36。从头到尾跨度 8.33 倍。
要看这组数字,不是看倍率那一栏。六个里五个是 0.1 倍,gpt-5.6-luna 是 0.3 倍,但每 token 最便宜的恰恰是 Luna——倍率是打在各自官方定价上的折扣,而 Luna 的起点低得多。按倍率排序,名次是反的。
其中两组对照特别干净。gpt-5.6-sol 和 gpt-5.5 折算后单价完全相同,所以这两个之间价格不构成决胜项,上下文才是:372,000/128,000 对 272,000/64,000。另一组是 gpt-5.6-terra 单价低于 gpt-5.4(0.20 / 1.20 对 0.25 / 1.50),同时窗口还更大。
export TOKEN_SHARE_KEY="<your-pool-api-key>"
for MODEL in gpt-5.6-luna gpt-5.6-terra gpt-5.6-sol gpt-5.4-mini gpt-5.4 gpt-5.5; do
echo "=== $MODEL ==="
curl -sS https://token-share.app/v1/responses \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"$MODEL\",
\"input\": \"Given this diff, name the one behavior change a reviewer must verify.\"
}"
done表格替你决定不了的部分
目录里没有任何字段按答案质量给这些 id 排序,这一页也不会凭空造一个。路由、上下文、输出上限筛完之后,剩下的问题是:更便宜的那个 id 在你的 prompt 上给出的答案能不能用。这取决于你的负载,不取决于这张模型清单。
验证成本很低,因为请求结构是共用的。从真实流量里抽几十条 prompt,在两三个候选上各跑一遍,把产出和各自返回的 token 数放在一起看。然后数重试次数:单价便宜 3.33 倍的模型,一旦要跑到第四次才对,就不再便宜了。
还有一项会改变算式:缓存命中的输入与新输入分开计价,官方缓存读取价按各自档位走——gpt-5.5 和 gpt-5.6-sol 是每百万 0.50 美元,gpt-5.6-luna 低到 0.02 美元。如果你的 prompt 有一段很长的固定前缀,做对比时就把这段前缀带上,否则测出来的差距和生产账单对不上。