开启方式
在 Chat Completions 请求里设置:stream_options.include_usage 会尽量在流结束前返回用量信息;如果上游或网络中断没有返回完整 usage,响应里可能拿不到最终 usage,最终计费以平台账单记录为准。
示例模型使用
gpt-5.4。实际接入时,请以控制台可用模型和模型详情为准。基本请求
读取方式
非流式返回里,文本在:什么时候开启
上线注意
- 前端不要直接持有 Tapapi API Key
- 后端要支持客户端取消生成
- 记录
X-Oneapi-Request-Id、模型名、耗时和最终用量 - 网络断开时,最终
usage可能拿不到,需要有容错 - 504、524 或前端超时后,不要盲目立刻补跑,先查业务状态和账单
- 超时和重试策略见 超时处理