Skip to main content
文本模型选择先看任务类型,再看成本、上下文长度、速度和输出质量。不要一开始就把所有任务都放到最贵模型上,建议先用真实样本做小规模评估。
模型可用性、上下文长度和价格以控制台为准。文档里的参数建议是通用起点,生产环境仍需实测。

常用参数

严格 JSON、JSON Schema、工具调用和长上下文能力都和具体模型、渠道有关。模型详情页和控制台优先于静态文档。
max_tokens 不只是“输出上限”。在计费预估和额度预占场景里,它也会影响系统对本次请求最大输出成本的判断。生产环境不要把它随手设得过大。

参数起点

选型思路

  1. 简单分类、摘要、改写:优先看成本和速度
  2. 长上下文、复杂推理:优先看上下文长度和稳定性
  3. 代码生成、工具调用:优先看指令遵循和结构化输出
  4. 生产默认模型:用真实请求测成功率、耗时和成本
  5. 兜底模型:选择一个更稳或更便宜的模型,用于失败重试或降级

验证清单

生产建议

  • 先用默认参数跑通,不要一开始调太多参数
  • 每个业务场景保留 20-50 条真实样本做回归测试
  • 记录模型名、参数、耗时、错误码、成本和 X-Oneapi-Request-Id
  • 不同模型对 toolsresponse_format、长上下文的支持不同,接入前单独验证
  • 文本、图片、视频接口的响应结构不同,不要用同一个 parser 处理所有模型