Skip to main content

计费怎么理解?

OmniMux 控制台用户侧用 积分 展示消耗;与内部 raw quota 的换算为:
  • raw_quota ÷ 500000 = USD
  • 1 USD = 10 积分
查看余额与明细请用 控制台。公开定价入口见控制台 / 模型广场;接口侧可用 查询定价 等账户 API(access token)。

如何通过模型规格与动态分组控制成本与质量?

OmniMux 提供了原生的无状态单请求动态分组路由,支持开发者在一把 API 密钥下自由平衡成本与质量,无需反复新建或切换密钥。

1. 三种调用形态对比

2. 代码调用示例

方式 A:模型后缀语法(推荐,支持所有开源客户端与 SDK)

方式 B:HTTP Header 透传(适合业务集成)


如何降低调用成本?

  1. 选对模型
    简单任务用更小/更便宜的 model id;同品牌完整参数页里的枚举只是「能调哪些」,不代表价格相同。
  2. 限制生成长度
    文本请求设置合理的 max_tokens / max_completion_tokens,避免无意义长输出。
  3. 控制批量与多媒体倍数
    图像 n、视频 seconds/duration、分辨率等会放大预扣与结算。网关会对越界参数返回 400;不要用超大 n 或超长时长试探。
  4. 异步视频:理解预扣与结算
    视频类任务常 先预扣、完成后按实际上游消耗结算/退差额。任务失败或取消时以线上结算逻辑为准;创建时用贴近真实时长与规格的参数,减少无效预扣占用。
  5. 能缓存就缓存
    对相同 prompt / 相同业务查询(含社交数据读接口)在客户端做结果缓存,减少重复计费请求。
  6. 流式可提早中止
    stream: true 便于先看到输出;若产品逻辑允许,在确认不需要完整结果时中断连接,避免无意义继续生成(具体是否仍按实际上游计费以控制台账单为准)。
  7. 关注 402 / 余额
    余额不足会 402insufficient_quota)。预扣失败不会「静默透支」。

不建议的做法

  • 用生产 Key 在本地循环压测高价视频/图像模型
  • 把 raw_quota 数字当成「积分」展示给终端用户
  • 依赖未在 live 定价中的 model 名「试试看」

模型与定价

在控制台查看余额、日志与可用模型