Skip to main content
模型对比不是找一个“全场最强模型”,而是给每类业务选出默认模型、兜底模型和实验模型。实时价格、可见分组、账号权限和模型上下线以控制台和价格页为准,本页只提供对比方法和生产评估口径。
模型中心只展示主流模型族和选型方法,不做完整库存表。横向看主流方向请先看 主流模型,实时可调用列表以控制台和价格页为准。

多模态总览

核心对比维度

场景推荐

图片模型对比

图片模型更新快,价格和可见权限以控制台为准。文档里的图片模型详情页用于解释典型定位,不代表控制台实时可见的全部模型。

图片能力边界

视频模型对比

视频模型按受控开放维护。即使状态页显示视频能力正常,也必须先确认控制台可见模型、账号权限、价格和具体接口字段。

生产对比方法

  1. 每个候选模型准备同一批 20-50 条真实 prompt。
  2. 记录成功率、平均耗时、P95 耗时、人工可用率、单次成本。
  3. 分开测试默认模型、低成本模型、高质量模型和兜底模型。
  4. 文本任务额外记录首字时间、JSON/schema 通过率和工具调用成功率。
  5. 图片任务额外记录 data.lengthmetadata.tapapi_partial、输出保存和失败返还。
  6. 视频任务额外记录 task_id、轮询状态、完成耗时、输出转存和失败返还。
  7. 每次请求保存 X-Oneapi-Request-Id,用于排查单次请求和对账。
  8. 最后再决定默认模型和兜底模型,不要只看单次样例效果。

上线前清单

  • 控制台能看到该模型,且账号分组有权限
  • 价格页显示的价格单位和业务预算一致
  • 已确认输入和输出模态,不把文本模型当图片或视频模型调用
  • 已记录成功率、P95 耗时、失败率和实际扣费
  • 已记录 X-Oneapi-Request-Id、业务 task_id 和最终结算字段
  • 已设计兜底模型、有限重试和降级策略
  • 图片和视频输出已转存到自己的对象存储
  • 受控开放模型只进入灰度,不作为默认生产链路