计费口径
单位与精度、计价公式、预扣与实结、零完成保险,以及在哪里核对。
按量计费,没有月费与最低消费。这一页写的是账单怎么算出来的——目标是让你能自己复算每一笔。
单位与精度#
- USD 是唯一记账货币。非美元支付在下单时锁定汇率换算入账。
- token 价按每百万 token 计(USD / 1M tokens)。
- 所有金额在 JSON 里是定长 8 位小数的字符串,例如
"0.01050000"。请按字符串或高精度小数处理:用浮点数接一次就可能把它变成0.010499999999999999。 - 展示价含模型倍率与供给折扣,不含用户等级折扣与活动折扣。
计价公式#
plain
有效单价 = 价格基线 × 模型倍率分项 = round8(有效单价 × token 数 ÷ 1,000,000)小计 = 各分项之和实扣 = round8(小计 × 供给折扣 × 等级折扣 × 活动折扣)- 部分线路按输入长度分档定价(阶梯价):本次单价取
prompt_tokens落进的那一档,输入、输出与缓存读写四个价都可能随档位变。 prompt_tokens含缓存读与缓存写部分;按标准输入价计费的是prompt_tokens − cache_read − cache_write(下界 0),缓存读写各按自己的单价计。completion_tokens不含思考 token;思考量单独按输出口径计费。- 倍率单列在模型详情里,就是为了让你能验算「单价 × 倍率 × 折扣 = 被扣的钱」。
- 舍入是四舍五入(half away from zero),保留 8 位小数。
预扣与实结#
- 请求开始前会冻结一笔预扣:估算金额 × 1.2,下限 $0.001,租约 15 分钟。
- 预扣不乘等级折扣——宁可多冻结,实结时全额退回;少冻结会导致透支。
- 不传
max_tokens时输出量按0.6 × 模型最大输出估算;给了max_tokens冻结额会更贴近实际。 - 请求结束后按上游返回的真实用量实结,多退少补。
- 视频任务另算:预扣按估算的最终金额来(不乘 1.2),租约 60 分钟并由任务推进器续期。
- 因此流式请求进行中查余额会看到一笔冻结额,这是正常的,不是重复扣费。
零完成保险#
没有任何产出的请求不收费,不论失败原因。判定只看用量:可见输出、思考、图片、视频秒数、音频秒数全为 0 就算零产出。
换句话说:只要产出了一个 token 就按实际产出计费,包括你中途断开连接的情况。参数非法、鉴权失败、限流、余额不足这几类请求根本没走到上游,也就没有账可豁免。
豁免时非流式响应会带 X-AiRouter-Insured,值是豁免原因(empty_completion / upstream_error / content_filtered / client_abort);流式的豁免记录在 调用日志 里。
视频计费#
视频有两种对客模式:按秒(per_second)与按 token(per_token,分含参考视频与不含两档)。用哪种取决于模型接的上游,模型详情页显示的就是实际生效的那种。失败任务不收费。
扣费顺序#
- 赠送额度优先消耗(不可提现、不可开票)。
- 其次是现金余额。
平台不会替你发请求#
线路的可用率、延迟与熔断状态全部来自真实流量的被动统计,网关不会为了探活而额外发起计费请求。所以账单里的每一笔都对应你自己的一次调用——看到不认识的消耗,先在调用日志里按时间和 Key 查。