计费怎么理解?
OmniMux 控制台用户侧用 积分 展示消耗;与内部 raw quota 的换算为:raw_quota ÷ 500000 = USD- 1 USD = 10 积分
如何通过模型规格与动态分组控制成本与质量?
OmniMux 提供了原生的无状态单请求动态分组路由,支持开发者在一把 API 密钥下自由平衡成本与质量,无需反复新建或切换密钥。1. 三种调用形态对比
2. 代码调用示例
方式 A:模型后缀语法(推荐,支持所有开源客户端与 SDK)
方式 B:HTTP Header 透传(适合业务集成)
如何降低调用成本?
-
选对模型
简单任务用更小/更便宜的 model id;同品牌完整参数页里的枚举只是「能调哪些」,不代表价格相同。 -
限制生成长度
文本请求设置合理的max_tokens/max_completion_tokens,避免无意义长输出。 -
控制批量与多媒体倍数
图像n、视频seconds/duration、分辨率等会放大预扣与结算。网关会对越界参数返回 400;不要用超大n或超长时长试探。 -
异步视频:理解预扣与结算
视频类任务常 先预扣、完成后按实际上游消耗结算/退差额。任务失败或取消时以线上结算逻辑为准;创建时用贴近真实时长与规格的参数,减少无效预扣占用。 -
能缓存就缓存
对相同 prompt / 相同业务查询(含社交数据读接口)在客户端做结果缓存,减少重复计费请求。 -
流式可提早中止
stream: true便于先看到输出;若产品逻辑允许,在确认不需要完整结果时中断连接,避免无意义继续生成(具体是否仍按实际上游计费以控制台账单为准)。 -
关注 402 / 余额
余额不足会 402(insufficient_quota)。预扣失败不会「静默透支」。
不建议的做法
- 用生产 Key 在本地循环压测高价视频/图像模型
- 把 raw_quota 数字当成「积分」展示给终端用户
- 依赖未在 live 定价中的 model 名「试试看」
模型与定价
在控制台查看余额、日志与可用模型