模型与计费
New API 聚合多个上游渠道。不同模型的能力、价格、上下文长度和可用性可能不同,请以控制台实时信息为准。
选择模型
在 控制台 打开 模型广场/定价,重点查看:
- 模型标识:API 请求中
model字段要填写的准确值; - 支持能力:文本、图片理解、工具调用、推理或嵌入等;
- 计费方式:输入、输出、缓存、按次或其他计费规则;
- 可用分组:你的令牌分组是否可以调用该模型。
先用小请求验证
新模型先发送一句简短提示词,确认令牌权限、模型名和返回格式都正确,再用于长文本或批量任务。
常见费用组成
大语言模型通常按 Token 计费:
- 输入 Token:系统提示词、历史消息、用户本次输入;
- 输出 Token:模型生成的内容;
- 缓存 Token:部分模型会对命中或写入缓存单独计费;
- 附加能力:图片、音频、搜索、工具或推理可能有独立规则。
一次对话携带的历史越长,输入 Token 通常越多。客户端持续保留全部聊天记录时,后续每轮请求可能越来越贵。
控制用量
- 为令牌设置额度,不对日常客户端使用无限额度。
- 不需要长回复时,设置合理的
max_tokens或max_completion_tokens。 - 定期新建对话,减少无关历史消息。
- 批量任务先用少量样本测试。
- 在使用日志中按令牌和模型检查消耗。
为什么预估和最终扣费不同
常见原因包括:
- 实际输入包含客户端自动加入的系统提示词或工具定义;
- 对话历史比当前输入框中的文字更长;
- 模型产生了隐藏推理 Token 或缓存费用;
- 价格或倍率已经调整;
- 请求失败前已产生上游用量。
控制台显示的是最终计费依据。对某条记录有疑问时,保留请求时间、模型名和日志中的请求 ID,再联系管理员核对。
模型不可用时
先检查模型名是否完全一致,然后确认:
- 令牌是否启用了该模型;
- 当前分组是否有可用渠道;
- 余额和令牌额度是否充足;
- 模型是否临时维护或限流。
更多处理步骤见故障排查。