Grok 4.6 与 Grok 4.5:这个小版本改了什么
同样的 0.1 倍率、同样的 500,000 token context、同样的每百万 2/6 美元、同样的 65,536 token 输出上限。整张表上会动的只有两处:发布日期,和缓存读取价。
除了发布日期,规格表上每一栏都一样
grok-4.6 和 grok-4.5 的 context 都是 500,000 token,输出上限都是 65,536 token,都支持文本、工具调用和 thinking,都走 POST /v1/chat/completions。两者不存在谁是谁的阉割版这回事。
价格也完全一致:官方定价都是输入每百万 token 2 美元、输出 6 美元,倍率都是 0.1 倍,折算下来输入 0.20 美元、输出 0.60 美元。换句话说,这次选型里没有任何"省钱"的理由可讲——无论选哪个,账单一模一样。
目录里能查到的区别只有两处。一是发布时间:grok-4.5 是 2026-06-03,grok-4.6 是 2026-08-12,隔了 70 天。二是缓存读取价——4.5 官方每百万 0.30 美元,4.6 是 0.50,按 0.1 倍算是 0.03 对 0.05。至于谁的推理更强,目录支撑不了这种说法,我们也不会替它编一个。
价格相同,所以试错成本是零
如果两个 id 价格不同,换不换是一道能在表格里算清楚的账。这里新 token 的单价完全一致,表格几乎算不出东西,唯一能作数的证据就是你自己跑出来的结果。
两者请求结构相同,切换只是换一个字符串。把你真实用到的那批 prompt 分别发给两个 id,对比产出,喜欢哪个留哪个——反正账单不变。这种"随便试"的情况在模型选型里其实不多见。
如果你跑的是 agent 循环,那就整段循环一起对比,别只发一条 prompt。单轮问答藏得住 agent 里最要命的问题:第四步一个工具调用出岔子,后面每一步都跟着歪。
curl https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "grok-4.6",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Refactor this function and explain the change."}
]
}'500,000 token 这道墙对两者一样
两个 id 的 context 都到 500,000 token 为止,输出都到 65,536 token 为止。prompt 塞不下的时候,在 4.5 和 4.6 之间来回换是没用的——那是另一道题,要去目录里找 1,000,000 token 窗口的那些 id。
输出长度同理。单次要吐出超过 65,536 token 的任务,选哪个 Grok 都得拆,或者换一个输出上限更高的模型。
窗口之内,两者的计费行为也一致,连价目表上那级台阶都一样:列出的输入每百万 0.20 美元、输出 0.60 美元是 sub-200K 档,单次 prompt 达到或超过 200,000 token,xAI 会把两头都翻倍——4.6 和 4.5 一视同仁。多塞 context 是一个花钱的决定,不是一个变聪明的决定;越过 20 万 token 之后,这个决定比标价看起来更贵。