MiniMax 模型对比:M2.7、M2.7-highspeed 与 M3

YiduoChan 通过一个 OpenAI 兼容接口和一个 Anthropic 兼容接口提供三个 MiniMax 文本模型。在它们之间做选择,主要是价格与延迟的权衡;价目表上有三处关键边界,在把工作负载定下来之前值得先弄清楚。

YiduoChan 上的三个 MiniMax 文本模型,即 MiniMax-M2.7、MiniMax-M2.7-highspeed 和 MiniMax-M3,都通过同一个 Base URL 访问,鉴权方式相同,请求格式也都是 OpenAI 兼容格式。区分它们的是价目表,而价目表上有三处边界需要你在设计时考虑:M3 以 512K 提示 tokens 为界的价格分档、highspeed 的输入和输出价格恰好翻倍,以及 M3 1,048,576 tokens 的硬上限。下文价格为 MiniMax 官方公布的按量付费价格,YiduoChan 与之一致;目前所有账号都在倍率为 0.95 的分组中,所以实际扣费比刊例价低 5%。

三个文本模型一览

价格(美元 / 每百万 tokens) MiniMax-M2.7 MiniMax-M2.7-highspeed MiniMax-M3
提示 ≤ 512K
MiniMax-M3
提示 > 512K
上下文窗口 本页未列出 本页未列出 1,048,576 tokens,硬上限
输入 $0.30 $0.60 $0.30 $0.60
输出 $1.20 $2.40 $1.20 $2.40
缓存读取 $0.06 $0.06 $0.06 $0.12
缓存写入 $0.375 $0.375 未公布
按当前 5% 分组折扣后的输入 / 输出 $0.285 / $1.14 $0.57 / $2.28 $0.285 / $1.14 $0.57 / $2.28
折扣后的缓存读取 $0.057 $0.057 $0.057 $0.114

有两个单元格需要说明。本页没有列出 M2.7 的上下文窗口,请见 M2.7 模型页;M3 的缓存写入价格没有公布,所以如果你在 M3 上大量使用缓存,请对照自己的用量记录确认实际扣费,不要默认它与 M2.7 相同。模型 ID 区分大小写,必须严格按上面的写法发送。

512K 以内,M2.7 与 M3 价格相同

这是本页最有用的一条事实。只要提示不超过 512K tokens,M3 的输入 $0.30、输出 $1.20、缓存读取 $0.06,三项都与 M2.7 完全相同。因此,在提示真正越过边界之前,选择 M3 不会多花一分钱。超过 512K、直到 1M 上限,输入和输出分别翻倍到 $0.60 和 $2.40,缓存读取也翻倍到 $0.12。

实用规则:如果你的提示可能变长,比如语料库在不断扩充的检索流水线、不断累积工具输出的 Agent、输入不受你控制的文档工作流,就把 M3 设为默认。常见情况下你付的是 M2.7 的价格,同时保留了余量,而不是撞上天花板。M2.7 留给提示长度由你自己限定、永远不会接近 512K 的工作负载,在这种场景下多出来的余量买不到任何东西。

-highspeed 到底买到了什么

MiniMax-M2.7-highspeed 模型质量相同、延迟更低。价格上,它的输入恰好是 M2.7 的两倍($0.60 对 $0.30),输出也恰好是两倍($2.40 对 $1.20),而缓存读取不变,仍为 $0.06。这种不对称很关键:延迟溢价全部落在未命中缓存的输入和生成的输出上,所以带有大段稳定缓存前缀的工作负载,相对溢价比不走缓存的工作负载小得多。下文的缓存计算示例中,切换到 highspeed 只多花 21.8%,而不是 100%。

把 highspeed 当作为延迟付费,而不是为能力付费。如果响应慢一点只是稍微有点烦人,就不值得付这份溢价;如果响应处在用户可见的交互循环里,比如行内补全、大调用之前的路由或分类环节、与语音相关的对话轮次,往往就值得。

1M 是硬上限

M3 的 1,048,576 tokens 上下文是硬上限,不是可以弹性突破的目标。它之上没有溢出档位,也不能指望平滑截断:超过上限的提示必须先切块、摘要或改用检索,再发送。另外请注意,Anthropic 兼容接口不提供 count_tokens,所以请求前的长度预估只能来自你自己的 tokenizer,或你这边保守的按字符估算规则。

三个按月计算的示例

下面所有计算都先按刊例价算,再乘以 0.95 得到当前分组折扣后的金额。价格单位为每 1,000,000 tokens。

1. 基于 M2.7 的聊天产品

每月 120,000 次请求,平均每次 2,000 输入 tokens、400 输出 tokens,不使用缓存。

同样的工作负载放到 M3 上,总价完全相同(刊例价 $129.60,折后 $123.12),因为 2,000 tokens 的提示远低于 512K。放到 highspeed 上则翻倍:240M × $0.60 = $144.00,加上 48M × $2.40 = $115.20,刊例价 $259.20,折后 $246.24。

2. 跨越 512K 的长上下文流水线

一个运行在 M3 上的文档分析任务,每月 2,000 次,每次输出 8,000 tokens。其中 1,200 次的提示为 400,000 tokens(低于边界),800 次的提示为 700,000 tokens(高于边界)。

40% 的运行次数占了账单的 69.3%($506.88 中的 $351.36)。如果重新切块,让这 800 次的提示都落在 500,000 tokens 而不是 700,000,它们就回到了较便宜的档位:800 × 500,000 = 400M × $0.30 = $120.00 输入,加上 6.4M × $1.20 = $7.68 输出,小计 $127.68,而不是 $351.36。新的刊例价合计为 $155.52 + $127.68 = $283.20,折后 $269.04:仅靠调整切块,就按刊例价省下 $223.68。用费用计算器测试这类变体最快。

3. 基于 highspeed 的延迟敏感接口

一个运行在 MiniMax-M2.7-highspeed 上的交互式接口:每月 900,000 次请求,每次 800 输入 tokens、120 输出 tokens,不使用缓存。

同样的流量放在普通 M2.7 上是 720M × $0.30 = $216.00,加上 108M × $1.20 = $129.60,刊例价合计 $345.60,折后 $328.32。按刊例价计,延迟溢价为每月 $345.60。上线之前,请拿它和低延迟的价值比一比。

场景模型每月刊例价合计5% 折扣后
聊天产品MiniMax-M2.7$129.60$123.12
长上下文流水线MiniMax-M3$506.88$481.54
延迟敏感接口MiniMax-M2.7-highspeed$691.20$656.64

Prompt 缓存如何改变计算结果

缓存读取 $0.06 是 $0.30 输入价的五分之一,缓存写入 $0.375 是输入价的 1.25×。这个比例只奖励一种特定设计:每个请求开头放一段很长、逐字节稳定的前缀,变化的部分追加在末尾。对前缀重新排序、重新序列化或加上时间戳,都会导致无法命中缓存,又得按完整输入价付费。

假设一个运行在 M2.7 上的编码助手:稳定前缀 40,000 tokens,每轮新增文本 1,000 tokens,输出 600 tokens,每月 50,000 次请求。完全不使用缓存时:

现在假设缓存命中率为 90%,另外 10% 必须写入缓存的前缀按缓存写入价计费:

这相当于按刊例价节省 $417.00,比不用缓存的账单低 64.1%。再把这个带缓存的版本放到 highspeed 上:缓存读取仍是 $108.00,缓存写入仍是 $75.00,变化的只有新增输入(50M × $0.60 = $30.00)和输出(30M × $2.40 = $72.00)。刊例价合计变为 $285.00,折后 $270.75,只比 M2.7 的数字高 21.8%,而不是翻倍。在据此做预算之前,请用自己的用量记录核实缓存写入与普通输入的计费方式。

在 Claude Code 和 Cursor 中该设置哪个模型

对于 Claude Code,把 Anthropic 兼容的环境变量指向 YiduoChan。Agent 会话会不断累积上下文,所以主模型选 M3 比较合理;highspeed 则很适合放在快速辅助模型的位置:

export ANTHROPIC_BASE_URL=https://yiduochan.com
export ANTHROPIC_AUTH_TOKEN="<your key>"
export ANTHROPIC_MODEL=MiniMax-M3
export ANTHROPIC_DEFAULT_HAIKU_MODEL=MiniMax-M2.7-highspeed

# Use M2.7 instead when you bound prompt size yourself:
# export ANTHROPIC_MODEL=MiniMax-M2.7

对于 Cursor 以及其他任何 OpenAI 兼容工具,使用 /v1 的 Base URL 和 Bearer Key。流式输出、工具调用和 JSON 模式都按标准格式工作:

curl https://yiduochan.com/v1/chat/completions \
  -H "Authorization: Bearer $YIDUOCHAN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
        "model": "MiniMax-M2.7-highspeed",
        "messages": [{"role": "user", "content": "Reply with OK."}]
      }'

curl -s https://yiduochan.com/v1/models -H "Authorization: Bearer $YIDUOCHAN_API_KEY"

如果按请求做路由,请把这两条边界显式写进代码,不要让它们停留在隐含状态:

from openai import OpenAI

client = OpenAI(api_key="<your key>", base_url="https://yiduochan.com/v1")

M3_PRICE_BOUNDARY = 512 * 1024  # 524,288 tokens; above this M3 input/output/cache read double
M3_HARD_CEILING   = 1_048_576  # M3 will not accept more than this
HIGHSPEED_MAX_PROMPT = 100_000  # conservative cut-off; check the M2.7 context window in the MiniMax docs

def pick_model(prompt_tokens: int, latency_critical: bool = False) -> str:
    if prompt_tokens > M3_HARD_CEILING:
        raise ValueError("prompt exceeds the M3 1M ceiling & must be chunked")
    if latency_critical and prompt_tokens < HIGHSPEED_MAX_PROMPT:
        return "MiniMax-M2.7-highspeed"
    return "MiniMax-M3"

stream = client.chat.completions.create(
    model=pick_model(prompt_tokens=180_000),
    messages=[{"role": "user", "content": "Summarise the attached spec."}],
    stream=True,
)

选型清单

计费说明

计费方式为预付美元额度、按量付费、无订阅。最低充值 $5,预设档位有 $5/$10/$20/$50/$100/$200/$500,也可以自定义金额;额度有效期 12 个月,失败的请求从不计费。新账号注册即送 $0.10 试用额度,够发几次测试请求;要用真实用量验证上面这些数字,建议先小额充值一次。5% 的分组折扣是当前应用在你账号上的倍率,不是永久承诺,实时价格请查看定价页。语音模型按输入字符单独计价,见 speech-2.8 定价。MiniMax-H3 视频在本平台暂时不可用。可以从 MiniMax 模型总览、M3 模型页开始,或者直接创建账号;如有问题请发邮件至 support@yiduochan.com。

常见问题

MiniMax-M3 比 MiniMax-M2.7 贵吗?

提示不超过 512K tokens 时不贵:两者每百万 tokens 都是输入 $0.30、输出 $1.20、缓存读取 $0.06。超过 512K 后,M3 变为输入 $0.60、输出 $2.40、缓存读取 $0.12。

MiniMax-M2.7-highspeed 与 MiniMax-M2.7 相比有什么变化?

只改变延迟:模型质量不变,代价是输入和输出价格恰好翻倍,为每百万 tokens $0.60 和 $2.40。缓存读取不变,仍为 $0.06,所以大量使用缓存的工作负载,相对溢价要小得多。

MiniMax-M3 的最大上下文是多少?

1,048,576 tokens,这是硬上限,上面没有更高的档位。超过这个长度的提示,必须先切块、摘要或改用检索,再发送。

5% 折扣是怎样体现在账单上的?

目前所有账号都在倍率为 0.95 的分组中,所以实际扣费比本页列出的刊例价低 5%。这是当前生效的设置,不是永久承诺。

在 Claude Code 里应该设置哪个模型?

把 ANTHROPIC_MODEL 设为 MiniMax-M3 作为默认模型,因为 Agent 会话会不断累积上下文,而 M3 在 512K 以内与 M2.7 同价。可选:把 ANTHROPIC_DEFAULT_HAIKU_MODEL 设为 MiniMax-M2.7-highspeed,用作快速辅助模型。

充值之前可以先用免费额度测试模型吗?

新账号注册即送 $0.10 试用额度,够发几次测试请求;正式使用需预付充值,最低 $5。YiduoChan 为预付、按量付费,失败的请求从不计费,额度有效期 12 个月。

免费注册获取 API Key 查看完整模型定价