Skip to content

额度与限流

账号有额度,为什么仍提示额度不足?

账号额度与 API Key 额度可能分别控制。即使账号仍有额度,Key 达到上限也会阻止调用。请同时检查账号、Key、项目或分组的可用额度。

为什么请求开始前就提示额度不足?

平台可能根据输入长度和 max_tokens 预估本次最大消耗并进行预检查。降低输出上限、缩短上下文或改用成本较低的模型后重试。

Token 数量是怎么计算的?

输入 Token 包括系统提示词、历史消息、工具定义和附件描述,输出 Token 是模型生成内容。不同模型的分词方式和输入、输出计量规则可能不同,应以控制台日志为准。

为什么实际消耗比看到的文本多?

客户端可能自动附加系统提示词、工具说明、记忆或历史消息;推理模型还可能产生不可直接显示的推理用量。多模态输入也会转换为计量单位。

为什么返回 429?

可能触发请求频率、Token 速率、并发数、日限额或模型服务限流。降低并发并使用带随机抖动的指数退避,不要立即高频重复请求。

降低并发后仍持续 429 怎么办?

等待限流窗口重置。如果只有某个模型失败而其他模型正常,可能是该模型服务暂时繁忙。记录响应头、请求标识和发生时间后联系管理员。

如何避免意外消耗?

按应用分别创建 Key,设置合理的额度和到期时间;限制可用模型;定期查看用量;在程序中限制最大输出、并发和自动重试次数。