六个 Grok 模型怎么选
三个文本 id、两个图像 id、一个视频 id,分属三个路由,倍率从 0.05 倍到 1 倍。它们的区别在哪,各自该出现在什么决策里。
第一刀:文本、图像、视频
挂 Grok 名字的有六个 id,它们之间其实不构成竞争关系。三个是文本模型,走 POST /v1/chat/completions:grok-4.6、grok-4.5、grok-composer-2.5-fast;两个是图像模型,走 POST /v1/images/generations:grok-imagine-image、grok-imagine-image-quality;一个是视频,grok-imagine-video-1.5,走 POST /openai/v1/videos。
路由不同,所以这不是换个 model 字段的事。图像请求不能打到 chat-completions 上;视频那个是异步的,要先创建任务再拿返回的 id 轮询。所谓"选一个 Grok 模型",第一步选的其实是路由。
计费单位也不一样。文本按每百万 token;图像按张算,grok-imagine-image 每张 0.01 美元、grok-imagine-image-quality 每张 0.04 美元,倍率都是 1 倍——和这个系列的其他成员不同,这两个没有任何折扣;视频按 video_second 计费,倍率 0.1。
三个文本 id,两个问题就能定
第一个问题:需不需要 thinking,或者 context 会不会超过 200,000 token?grok-composer-2.5-fast 的能力只有文本和工具调用,context 200,000、输出上限 32,768;grok-4.6 和 grok-4.5 多一个 thinking,context 500,000、输出上限 65,536。这两条只要有一条为"是",Composer 就是能力上出局,不是偏好问题。
第二个问题(Composer 还在的话):你的输入输出比是多少?Composer 是输入 0.15、输出 0.75 美元(3/15 美元的 0.05 倍);grok-4.6 和 grok-4.5 是 0.20 和 0.60(2/6 美元的 0.1 倍)。输出占输入不到三分之一时 Composer 更省,超过就更贵。另外 4.6 / 4.5 这组数字是 sub-200K 档:单次 prompt 达到或超过 200,000 token,xAI 会把两头都翻倍——而 Composer 的窗口正好也到这里为止。
至于 grok-4.6 和 grok-4.5 之间,纸面上没什么可决定的:窗口都是 500,000、输出上限都是 65,536、能力一样、价格都是 0.20/0.60、路由相同。区别只有发布日期(2026-06-03 和 2026-08-12),以及缓存读取价:4.5 官方每百万 0.30 美元、4.6 是 0.50,按 0.1 倍算是 0.03 对 0.05。前缀复用很重的负载,这是整张表里唯一会动的一行。
# Text: grok-4.6, grok-4.5, grok-composer-2.5-fast
curl https://token-share.app/v1/chat/completions \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "grok-4.6",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Write a migration for this schema change."}]
}'
# Image: different route, billed per image
curl https://token-share.app/v1/images/generations \
-H "Authorization: Bearer $TOKEN_SHARE_KEY" \
-H "content-type: application/json" \
-d '{
"model": "grok-imagine-image",
"prompt": "A wireframe diagram of a three-tier web application."
}'两个图像 id 差在价格,视频 id 差在分辨率
grok-imagine-image 和 grok-imagine-image-quality 都是 1 倍率——目录里仅有的两个不打折的 id——都按生成张数计费,区别是每张 0.01 对 0.04 美元,四倍。目录把后者描述为更高保真的版本,但没有给任何质量指标,所以正式跑批量之前,先拿同一个 prompt 在两边各生成一次,自己看结果。
grok-imagine-video-1.5 按 video_second 计费,倍率 0.1,官方单价随分辨率变:480p 每秒 0.08 美元、720p 0.14、1080p 0.25。片长 1 到 15 秒,所以单次生成的成本由分辨率和时长共同决定,从 1080p 降到 480p 大约能砍掉三分之二。
视频这边还有个工程上的注意点:它是异步的。POST 到 /openai/v1/videos 拿到一个 video id,再轮询 /openai/v1/videos/{video_id} 直到完成,最后从 /openai/v1/videos/{video_id}/content 取结果。照着同步 chat 接口写的代码,不补这个轮询是跑不通的。