成本优化
账单真正由什么决定,以及哪些手段真的有用。
账单由什么决定?
token 数 × 模型单价。多数场景下 token 数的大头不是你新写的内容,而是你重发的内容: 对话历史、检索到的 RAG 片段、系统提示,每一轮都会重新计费。
哪个手段最有效?
通常是换模型。旗舰与小模型每百万 token 的价差常常是一个数量级,而在常规任务上 (分类、抽取、翻译、短改写)质量差距要小得多。模型页把输入价、输出价与官方价并排显示, 这个对比是具体的。
输出比输入贵吗?
通常是,而且往往贵好几倍。所以生成长响应的场景对输出价格外敏感 —— 要看输出那一列,不能只看输入。
失败的请求要钱吗?
不要。失败、超时、以及上游从未完成的取消生成都不计费。只有真的返回了响应才扣费。
元数据调用计费吗?
不计。GET /v1/models 是元数据查询,免费。客户端的「测试连接」按钮通常打的就是它 ——
所以连接测试通过并不能证明你有余额。
怎么分摊花费?
按项目或环境各建一把 key。按 key 的花费在控制台可见,所以分账取决于你当初有没有把 key 分开 —— 事后从一把共用的 key 里是还原不出来的。