很多采购人第一次看到模型报价时都会觉得「很便宜」,但上线一个月后账单却远超预期。问题往往出在测算口径上:刊例价是按每百万 Token 算的,而真实成本由四个数字共同决定。
数字一:输入 Token 量
输入 Token 包括用户的提问、附带的上下文、系统提示词等。上下文越长、使用越频繁,输入量增长越快。一些长文本场景的输入成本占比甚至超过输出。
数字二:输出 Token 量
输出 Token 是模型生成的内容量,通常单价高于输入。生成式任务的输出量波动大,建议按「均值 × 峰值系数」预估,给预算留出上浮空间。
数字三:月调用次数
调用次数乘上每次的输入输出量,才是月总量。别只看单次成本,要把用户规模与使用频率乘进来。
数字四:并发与峰值水位
促销、月底结账等业务峰值会拉高瞬时调用,若按峰值备量会抬高成本,按均值备量又可能排队。建议按业务分级:核心链路确定性供给,非核心链路弹性降级。
把这四个数字放进一个统一的计算器,月成本就一目了然。智渡的成本计算器可以免费帮你按模型、按用量实时估算,再对照官方渠道参考价做预算。