MiniMax 模型对比:M2.7、M2.7-highspeed 与 M3
YiduoChan 通过一个 OpenAI 兼容接口和一个 Anthropic 兼容接口提供三个 MiniMax 文本模型。在它们之间做选择,主要是价格与延迟的权衡;价目表上有三处关键边界,在把工作负载定下来之前值得先弄清楚。
YiduoChan 上的三个 MiniMax 文本模型,即 MiniMax-M2.7、MiniMax-M2.7-highspeed 和 MiniMax-M3,都通过同一个 Base URL 访问,鉴权方式相同,请求格式也都是 OpenAI 兼容格式。区分它们的是价目表,而价目表上有三处边界需要你在设计时考虑:M3 以 512K 提示 tokens 为界的价格分档、highspeed 的输入和输出价格恰好翻倍,以及 M3 1,048,576 tokens 的硬上限。下文价格为 MiniMax 官方公布的按量付费价格,YiduoChan 与之一致;目前所有账号都在倍率为 0.95 的分组中,所以实际扣费比刊例价低 5%。
三个文本模型一览
| 价格(美元 / 每百万 tokens) | MiniMax-M2.7 |
MiniMax-M2.7-highspeed |
MiniMax-M3提示 ≤ 512K |
MiniMax-M3提示 > 512K |
|---|---|---|---|---|
| 上下文窗口 | 本页未列出 | 本页未列出 | 1,048,576 tokens,硬上限 | |
| 输入 | $0.30 | $0.60 | $0.30 | $0.60 |
| 输出 | $1.20 | $2.40 | $1.20 | $2.40 |
| 缓存读取 | $0.06 | $0.06 | $0.06 | $0.12 |
| 缓存写入 | $0.375 | $0.375 | 未公布 | |
| 按当前 5% 分组折扣后的输入 / 输出 | $0.285 / $1.14 | $0.57 / $2.28 | $0.285 / $1.14 | $0.57 / $2.28 |
| 折扣后的缓存读取 | $0.057 | $0.057 | $0.057 | $0.114 |
有两个单元格需要说明。本页没有列出 M2.7 的上下文窗口,请见 M2.7 模型页;M3 的缓存写入价格没有公布,所以如果你在 M3 上大量使用缓存,请对照自己的用量记录确认实际扣费,不要默认它与 M2.7 相同。模型 ID 区分大小写,必须严格按上面的写法发送。
512K 以内,M2.7 与 M3 价格相同
这是本页最有用的一条事实。只要提示不超过 512K tokens,M3 的输入 $0.30、输出 $1.20、缓存读取 $0.06,三项都与 M2.7 完全相同。因此,在提示真正越过边界之前,选择 M3 不会多花一分钱。超过 512K、直到 1M 上限,输入和输出分别翻倍到 $0.60 和 $2.40,缓存读取也翻倍到 $0.12。
实用规则:如果你的提示可能变长,比如语料库在不断扩充的检索流水线、不断累积工具输出的 Agent、输入不受你控制的文档工作流,就把 M3 设为默认。常见情况下你付的是 M2.7 的价格,同时保留了余量,而不是撞上天花板。M2.7 留给提示长度由你自己限定、永远不会接近 512K 的工作负载,在这种场景下多出来的余量买不到任何东西。
-highspeed 到底买到了什么
MiniMax-M2.7-highspeed 模型质量相同、延迟更低。价格上,它的输入恰好是 M2.7 的两倍($0.60 对 $0.30),输出也恰好是两倍($2.40 对 $1.20),而缓存读取不变,仍为 $0.06。这种不对称很关键:延迟溢价全部落在未命中缓存的输入和生成的输出上,所以带有大段稳定缓存前缀的工作负载,相对溢价比不走缓存的工作负载小得多。下文的缓存计算示例中,切换到 highspeed 只多花 21.8%,而不是 100%。
把 highspeed 当作为延迟付费,而不是为能力付费。如果响应慢一点只是稍微有点烦人,就不值得付这份溢价;如果响应处在用户可见的交互循环里,比如行内补全、大调用之前的路由或分类环节、与语音相关的对话轮次,往往就值得。
1M 是硬上限
M3 的 1,048,576 tokens 上下文是硬上限,不是可以弹性突破的目标。它之上没有溢出档位,也不能指望平滑截断:超过上限的提示必须先切块、摘要或改用检索,再发送。另外请注意,Anthropic 兼容接口不提供 count_tokens,所以请求前的长度预估只能来自你自己的 tokenizer,或你这边保守的按字符估算规则。
三个按月计算的示例
下面所有计算都先按刊例价算,再乘以 0.95 得到当前分组折扣后的金额。价格单位为每 1,000,000 tokens。
1. 基于 M2.7 的聊天产品
每月 120,000 次请求,平均每次 2,000 输入 tokens、400 输出 tokens,不使用缓存。
- 输入:120,000 × 2,000 = 240,000,000 tokens = 240M × $0.30 = $72.00
- 输出:120,000 × 400 = 48,000,000 tokens = 48M × $1.20 = $57.60
- 刊例价合计:$72.00 + $57.60 = $129.60。按 5% 折扣后:$129.60 × 0.95 = $123.12
同样的工作负载放到 M3 上,总价完全相同(刊例价 $129.60,折后 $123.12),因为 2,000 tokens 的提示远低于 512K。放到 highspeed 上则翻倍:240M × $0.60 = $144.00,加上 48M × $2.40 = $115.20,刊例价 $259.20,折后 $246.24。
2. 跨越 512K 的长上下文流水线
一个运行在 M3 上的文档分析任务,每月 2,000 次,每次输出 8,000 tokens。其中 1,200 次的提示为 400,000 tokens(低于边界),800 次的提示为 700,000 tokens(高于边界)。
- 512K 以下,输入:1,200 × 400,000 = 480,000,000 = 480M × $0.30 = $144.00
- 512K 以下,输出:1,200 × 8,000 = 9,600,000 = 9.6M × $1.20 = $11.52(小计 $155.52)
- 512K 以上,输入:800 × 700,000 = 560,000,000 = 560M × $0.60 = $336.00
- 512K 以上,输出:800 × 8,000 = 6,400,000 = 6.4M × $2.40 = $15.36(小计 $351.36)
- 刊例价合计:$155.52 + $351.36 = $506.88。折后:$506.88 × 0.95 = $481.54
40% 的运行次数占了账单的 69.3%($506.88 中的 $351.36)。如果重新切块,让这 800 次的提示都落在 500,000 tokens 而不是 700,000,它们就回到了较便宜的档位:800 × 500,000 = 400M × $0.30 = $120.00 输入,加上 6.4M × $1.20 = $7.68 输出,小计 $127.68,而不是 $351.36。新的刊例价合计为 $155.52 + $127.68 = $283.20,折后 $269.04:仅靠调整切块,就按刊例价省下 $223.68。用费用计算器测试这类变体最快。
3. 基于 highspeed 的延迟敏感接口
一个运行在 MiniMax-M2.7-highspeed 上的交互式接口:每月 900,000 次请求,每次 800 输入 tokens、120 输出 tokens,不使用缓存。
- 输入:900,000 × 800 = 720,000,000 = 720M × $0.60 = $432.00
- 输出:900,000 × 120 = 108,000,000 = 108M × $2.40 = $259.20
- 刊例价合计:$691.20。折后:$691.20 × 0.95 = $656.64
同样的流量放在普通 M2.7 上是 720M × $0.30 = $216.00,加上 108M × $1.20 = $129.60,刊例价合计 $345.60,折后 $328.32。按刊例价计,延迟溢价为每月 $345.60。上线之前,请拿它和低延迟的价值比一比。
| 场景 | 模型 | 每月刊例价合计 | 5% 折扣后 |
|---|---|---|---|
| 聊天产品 | MiniMax-M2.7 | $129.60 | $123.12 |
| 长上下文流水线 | MiniMax-M3 | $506.88 | $481.54 |
| 延迟敏感接口 | MiniMax-M2.7-highspeed | $691.20 | $656.64 |
Prompt 缓存如何改变计算结果
缓存读取 $0.06 是 $0.30 输入价的五分之一,缓存写入 $0.375 是输入价的 1.25×。这个比例只奖励一种特定设计:每个请求开头放一段很长、逐字节稳定的前缀,变化的部分追加在末尾。对前缀重新排序、重新序列化或加上时间戳,都会导致无法命中缓存,又得按完整输入价付费。
假设一个运行在 M2.7 上的编码助手:稳定前缀 40,000 tokens,每轮新增文本 1,000 tokens,输出 600 tokens,每月 50,000 次请求。完全不使用缓存时:
- 输入:50,000 × 41,000 = 2,050,000,000 = 2,050M × $0.30 = $615.00
- 输出:50,000 × 600 = 30,000,000 = 30M × $1.20 = $36.00
- 刊例价合计 $651.00,折后 $618.45
现在假设缓存命中率为 90%,另外 10% 必须写入缓存的前缀按缓存写入价计费:
- 缓存读取:45,000 × 40,000 = 1,800,000,000 = 1,800M × $0.06 = $108.00
- 缓存写入:5,000 × 40,000 = 200,000,000 = 200M × $0.375 = $75.00
- 每轮新增文本:50,000 × 1,000 = 50,000,000 = 50M × $0.30 = $15.00
- 输出:30M × $1.20 = $36.00
- 刊例价合计 $108.00 + $75.00 + $15.00 + $36.00 = $234.00,折后 $222.30
这相当于按刊例价节省 $417.00,比不用缓存的账单低 64.1%。再把这个带缓存的版本放到 highspeed 上:缓存读取仍是 $108.00,缓存写入仍是 $75.00,变化的只有新增输入(50M × $0.60 = $30.00)和输出(30M × $2.40 = $72.00)。刊例价合计变为 $285.00,折后 $270.75,只比 M2.7 的数字高 21.8%,而不是翻倍。在据此做预算之前,请用自己的用量记录核实缓存写入与普通输入的计费方式。
在 Claude Code 和 Cursor 中该设置哪个模型
对于 Claude Code,把 Anthropic 兼容的环境变量指向 YiduoChan。Agent 会话会不断累积上下文,所以主模型选 M3 比较合理;highspeed 则很适合放在快速辅助模型的位置:
export ANTHROPIC_BASE_URL=https://yiduochan.com
export ANTHROPIC_AUTH_TOKEN="<your key>"
export ANTHROPIC_MODEL=MiniMax-M3
export ANTHROPIC_DEFAULT_HAIKU_MODEL=MiniMax-M2.7-highspeed
# Use M2.7 instead when you bound prompt size yourself:
# export ANTHROPIC_MODEL=MiniMax-M2.7
对于 Cursor 以及其他任何 OpenAI 兼容工具,使用 /v1 的 Base URL 和 Bearer Key。流式输出、工具调用和 JSON 模式都按标准格式工作:
curl https://yiduochan.com/v1/chat/completions \
-H "Authorization: Bearer $YIDUOCHAN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-M2.7-highspeed",
"messages": [{"role": "user", "content": "Reply with OK."}]
}'
curl -s https://yiduochan.com/v1/models -H "Authorization: Bearer $YIDUOCHAN_API_KEY"
如果按请求做路由,请把这两条边界显式写进代码,不要让它们停留在隐含状态:
from openai import OpenAI
client = OpenAI(api_key="<your key>", base_url="https://yiduochan.com/v1")
M3_PRICE_BOUNDARY = 512 * 1024 # 524,288 tokens; above this M3 input/output/cache read double
M3_HARD_CEILING = 1_048_576 # M3 will not accept more than this
HIGHSPEED_MAX_PROMPT = 100_000 # conservative cut-off; check the M2.7 context window in the MiniMax docs
def pick_model(prompt_tokens: int, latency_critical: bool = False) -> str:
if prompt_tokens > M3_HARD_CEILING:
raise ValueError("prompt exceeds the M3 1M ceiling & must be chunked")
if latency_critical and prompt_tokens < HIGHSPEED_MAX_PROMPT:
return "MiniMax-M2.7-highspeed"
return "MiniMax-M3"
stream = client.chat.completions.create(
model=pick_model(prompt_tokens=180_000),
messages=[{"role": "user", "content": "Summarise the attached spec."}],
stream=True,
)
选型清单
- 提示可能变长,或者长度不由你控制 →
MiniMax-M3。512K 以内它的价格与 M2.7 完全相同。 - 提示长度有上限且较短,成本是首要考虑 →
MiniMax-M2.7。 - 响应延迟用户可见,并且值得在输入和输出上付大约两倍的价格 →
MiniMax-M2.7-highspeed。 - 提示经常超过 512K → 按 $0.60 / $2.40 / $0.12 做预算,并评估切块到边界以下是否比支付高档价格更便宜。
- 提示可能超过 1,048,576 tokens → 这里没有模型能覆盖,请先切块或改用检索。
- 一段很长的前缀在多个请求中重复出现 → 先把它逐字节固定下来,让 $0.06 的缓存读取发挥作用,再考虑要不要换模型。
计费说明
计费方式为预付美元额度、按量付费、无订阅。最低充值 $5,预设档位有 $5/$10/$20/$50/$100/$200/$500,也可以自定义金额;额度有效期 12 个月,失败的请求从不计费。新账号注册即送 $0.10 试用额度,够发几次测试请求;要用真实用量验证上面这些数字,建议先小额充值一次。5% 的分组折扣是当前应用在你账号上的倍率,不是永久承诺,实时价格请查看定价页。语音模型按输入字符单独计价,见 speech-2.8 定价。MiniMax-H3 视频在本平台暂时不可用。可以从 MiniMax 模型总览、M3 模型页开始,或者直接创建账号;如有问题请发邮件至 support@yiduochan.com。
常见问题
MiniMax-M3 比 MiniMax-M2.7 贵吗?
提示不超过 512K tokens 时不贵:两者每百万 tokens 都是输入 $0.30、输出 $1.20、缓存读取 $0.06。超过 512K 后,M3 变为输入 $0.60、输出 $2.40、缓存读取 $0.12。
MiniMax-M2.7-highspeed 与 MiniMax-M2.7 相比有什么变化?
只改变延迟:模型质量不变,代价是输入和输出价格恰好翻倍,为每百万 tokens $0.60 和 $2.40。缓存读取不变,仍为 $0.06,所以大量使用缓存的工作负载,相对溢价要小得多。
MiniMax-M3 的最大上下文是多少?
1,048,576 tokens,这是硬上限,上面没有更高的档位。超过这个长度的提示,必须先切块、摘要或改用检索,再发送。
5% 折扣是怎样体现在账单上的?
目前所有账号都在倍率为 0.95 的分组中,所以实际扣费比本页列出的刊例价低 5%。这是当前生效的设置,不是永久承诺。
在 Claude Code 里应该设置哪个模型?
把 ANTHROPIC_MODEL 设为 MiniMax-M3 作为默认模型,因为 Agent 会话会不断累积上下文,而 M3 在 512K 以内与 M2.7 同价。可选:把 ANTHROPIC_DEFAULT_HAIKU_MODEL 设为 MiniMax-M2.7-highspeed,用作快速辅助模型。
充值之前可以先用免费额度测试模型吗?
新账号注册即送 $0.10 试用额度,够发几次测试请求;正式使用需预付充值,最低 $5。YiduoChan 为预付、按量付费,失败的请求从不计费,额度有效期 12 个月。