各家的思考模型横向对比:谁有这个能力,代价是什么
目录里 31 个条目有 25 个带 thinking,四条产品线都有。它没有单独的计价,输出单价是输入的 3 到 6 倍——账单就落在这一侧。
thinking 在这里几乎是标配
目录 31 个条目里有 25 个把 thinking 列为能力。Claude 那 12 个 id 除了 stable-claude-haiku-4-5 全都有;OpenAI 的 8 个除了 gpt-image-2 全都有;xAI 这边是 grok-4.6 和 grok-4.5;Gemini 五个全有。
文本模型里的例外只有两个:stable-claude-haiku-4-5,能力是 text 和 tools,价格 0.40 / 2.00 美元每百万;grok-composer-2.5-fast,同样是 text 和 tools,价格 0.15 / 0.75 美元。剩下四个没有 thinking 的是图像和视频模型,这项能力对它们本来也没有意义。
所以"支不支持思考"筛不掉什么东西——几乎都支持。真正值得问的是:模型用起这个能力时要花多少钱,以及那两个花不出推理 token 的 id,你有没有可能反而想要。
思考没有单独的计价
目录里每个条目只公布两个按 token 的单价:输入和输出。没有第三个专门给推理用的价格。模型在想问题的过程中产出的东西,按的就是你已经知道的那两个价——也就是说,决定扩展思考成本的是输出单价。
而输出单价跟输入不是一个量级。整个目录里,官方输出价是官方输入价的 3 到 6 倍;倍率对两侧一视同仁,所以比例不会变。差距最小的是 grok-4.6 和 grok-4.5,正好 3 倍(0.1 倍率之后是 0.20 对 0.60 美元)。六个 gpt-5.x、gemini-3-flash 和 gemini-3.1-pro-low 是 6 倍。剩下 17 个文本 id——所有 Claude id、stable-gpt-6-astra、grok-composer-2.5-fast,以及另外三个 Gemini id——都是 5 倍。
换成人话:在 6 倍比例的模型上,一段偏长的回答,每个 token 的成本是触发它那段 prompt 的六倍。任何会把回答拉长的东西——思考也在内——都落在账单贵的那一侧,而且不管你选的是哪条产品线,都是这样。
思考档位去目录里读,别从名字猜
支持 thinking 的模型,可选的思考档位并不一样,而这件事记录在目录里。GET /v1/models 会为每个模型返回一个 thinking_levels 数组,跟 context_window、max_output_tokens、capabilities、endpoint 一起给出来,客户端直接读就行,不必把某张表硬编码进代码。
这一点值得强调,是因为名字看起来相近的 id 未必配置相同;名字里像是写死了某个档位的 id,实际也可能给出一整个范围。接入的时候查一次目录,加新模型的时候再查一次,比抄表靠谱。
这个列表同时也是确认"能不能换"三件事的最省事办法:模型在哪个端点应答、输出上限是多少、到底列没列 thinking。
curl -sS https://token-share.app/v1/models \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
| jq '[.data[]
| select(.capabilities and (.capabilities | index("thinking")))
| {id, endpoint, context_window, max_output_tokens, thinking_levels}]'这笔 token 该不该花
目录答不了"思考会不会让你的任务答得更好"——它记的是能力,不是结果。它能告诉你的是试错的价格;而在 Flash 价位的那些 id 上,这个价格低到"靠猜"反而更贵。
一个可操作的做法:挑一批能客观判定对错的任务,同一个 id 上每个任务跑两遍——一遍是你平时的请求,一遍配上扩展思考——然后把正确率和 usage 里报的输出 token 数放在一起看。用多出来的输出 token 乘该模型的输出单价,得到真实的溢价,而不是拍脑袋估。
有两种结果常见到值得提前准备。一是正确率没动:那你就找到了一个可以关掉思考的场景,此时那两个没有 thinking 的文本 id(stable-claude-haiku-4-5 和 grok-composer-2.5-fast)值得看一眼,它们压根跑不出推理账单。二是正确率确实提高了:那就再拿它跟"换一个更强的模型但不开思考"比一比,那是同一个问题上的另一种花钱方式。两种比较都得用你自己的任务,规格表回答不了任何一个。