Skip to content

模型与计费

New API 聚合多个上游渠道。不同模型的能力、价格、上下文长度和可用性可能不同,请以控制台实时信息为准。

选择模型

控制台 打开 模型广场/定价,重点查看:

  • 模型标识:API 请求中 model 字段要填写的准确值;
  • 支持能力:文本、图片理解、工具调用、推理或嵌入等;
  • 计费方式:输入、输出、缓存、按次或其他计费规则;
  • 可用分组:你的令牌分组是否可以调用该模型。

先用小请求验证

新模型先发送一句简短提示词,确认令牌权限、模型名和返回格式都正确,再用于长文本或批量任务。

常见费用组成

大语言模型通常按 Token 计费:

  • 输入 Token:系统提示词、历史消息、用户本次输入;
  • 输出 Token:模型生成的内容;
  • 缓存 Token:部分模型会对命中或写入缓存单独计费;
  • 附加能力:图片、音频、搜索、工具或推理可能有独立规则。

一次对话携带的历史越长,输入 Token 通常越多。客户端持续保留全部聊天记录时,后续每轮请求可能越来越贵。

控制用量

  1. 为令牌设置额度,不对日常客户端使用无限额度。
  2. 不需要长回复时,设置合理的 max_tokensmax_completion_tokens
  3. 定期新建对话,减少无关历史消息。
  4. 批量任务先用少量样本测试。
  5. 在使用日志中按令牌和模型检查消耗。

为什么预估和最终扣费不同

常见原因包括:

  • 实际输入包含客户端自动加入的系统提示词或工具定义;
  • 对话历史比当前输入框中的文字更长;
  • 模型产生了隐藏推理 Token 或缓存费用;
  • 价格或倍率已经调整;
  • 请求失败前已产生上游用量。

控制台显示的是最终计费依据。对某条记录有疑问时,保留请求时间、模型名和日志中的请求 ID,再联系管理员核对。

模型不可用时

先检查模型名是否完全一致,然后确认:

  • 令牌是否启用了该模型;
  • 当前分组是否有可用渠道;
  • 余额和令牌额度是否充足;
  • 模型是否临时维护或限流。

更多处理步骤见故障排查

本站为猫咖啡 API 使用文档。请合法、合规使用 AI 服务。