大模型 API 计费与成本指南

大模型 API 的账单看不懂,通常不是数学问题,而是计费维度太多:输入、输出、缓存写入、缓存命中,长上下文还有另一档单价;部分平台再用「分组倍率」把同一模型卖出不同价格。把这些维度理清楚,成本能压下来一大截。

四个计价维度

输入 token

你发上去的所有内容:系统提示、上下文文件、历史对话。常见误区是只算「我写的那句话」,实际大头往往是粘进去的文件和长历史。

输出 token

模型生成的内容,单价通常是输入的数倍。控制输出长度的收益比压缩输入更直接:一句「只输出代码,不要解释」就能省掉大量输出 token。

缓存命中 / 缓存写入

把稳定的长前缀(系统提示、文档、代码规范)缓存起来,命中部分单价通常只有输入价的十分之一左右,长对话和固定提示词场景收益最大。

分组倍率

中转平台把同一模型接不同上游渠道,用倍率区分价格与稳定性。倍率低的多是逆向或特惠渠道,适合非关键任务;正式业务用稳定渠道,别为了省钱赌可用性。

三个立刻能用的省钱动作

一是把固定提示词做缓存;二是给任务设输出上限、禁止客套话;三是按任务分级选渠道,而不是一律用最贵的模型。

本系列文章

相关资源:模型价格表 · 接入配置教程 · 调用排行榜