Grok 的 500K context,和 1M token 的模型怎么比
grok-4.6 和 grok-4.5 是 500,000 token,Claude Sonnet 5 和 Gemini Flash 系列是 1,000,000。多出来的那一半什么时候有用、要花多少钱,以及为什么窗口更大不等于答案更好。
500,000 在目录里是什么位置
grok-4.6 和 grok-4.5 的 context 都是 500,000 token,输出上限都是 65,536。grok-composer-2.5-fast 更小,200,000 进、32,768 出。这就是三个 Grok 文本 id 的全部,500,000 已经是这个系列在这里能给到的上限。
目录里有不少 id 是它的两倍。claude-sonnet-5、claude-opus-5、claude-opus-4-8 都是 1,000,000 token 窗口、128,000 token 输出上限。Gemini 整条线也是:gemini-3.8-flash、gemini-3.7-flash-high、gemini-3.6-flash-high、gemini-3-flash、gemini-3.1-pro-low 全是 1,000,000 token,输出上限 65,536(Pro 那个是 65,535)。
这样比就具体了:输入空间上 Grok 是那批 id 的一半;输出上限方面它和 Gemini 打平(都是 65,536),比 1M 那几个 Claude 的 128,000 少。反过来说,如果你的 prompt 离 500,000 还远,上面这些差别你一次都碰不到。
一个大 prompt 在各家分别要多少钱
窗口大小是限制,账单来自单价。先看一个 150,000 token 的 prompt——上面提到的 id 都塞得下。grok-4.6 经 0.1 倍率后输入每百万 0.20 美元,这一次是 0.03 美元,和 gemini-3.1-pro-low(每百万 0.20 美元)持平;claude-sonnet-5 是 0.045 美元(每百万 0.30),claude-opus-5 是 0.075 美元(每百万 0.50),gemini-3-flash 是 0.0075 美元(每百万 0.050)。
但 Grok 还有第二档价格,而且这一档远在窗口上限之前就开始了:目录里列的是 sub-200K 的价格,单次 prompt 达到或超过 200,000 token 时,xAI 的输入和输出都翻倍。所以 grok-4.6 和 grok-4.5 真正要盯的分界线是 200,000 而不是 500,000,越过之后输入变成每百万 0.40 美元、输出 1.20 美元。
这会把上一段的结论掉个个儿。400,000 token 的 prompt 走上层价档,grok-4.6 要 0.16 美元,而 claude-sonnet-5 是 0.12 美元、gemini-3-flash 是 0.02 美元——后两者的价目表上都没有这一级台阶。也就是说:20 万 token 以下 Grok 更省,以上更贵。这条线比窗口大小本身重要得多。
curl https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "grok-4.6",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Summarise the attached module in five bullet points."}
]
}' | jq '.usage'装得下,不等于记得住
500,000 token 的窗口,意思是这么大的请求不会被拒,不代表模型对每个 token 一视同仁,更不代表把窗口填满答案就会变好。往 prompt 里灌料是确定的涨价、不确定的收益——在 Grok 上甚至不止是线性涨价:一旦越过 200,000 token,整个请求的单价都会翻倍。
落到操作上就一句话:任务需要什么就发什么。问的是三个文件,那就发三个文件。"保险起见"把整个仓库贴进去,在循环里就是每一次请求都多付一遍——agent 跑一轮是上百次请求,不是一次。
如果长前缀确实会在多轮之间重复(系统提示词、反复引用的规格文档),grok-4.6 的缓存读取官方价是每百万 0.50 美元,按 0.1 倍算是 0.05 美元,只有新输入 0.20 美元的四分之一。重复 context 该用的杠杆是这个,不是换一个更大的窗口。