这是一份面向 Token 平台的性能指标字典,说明各指标的含义、常用口径和适用场景,帮助你比较模型与服务商,并判断业务链路的真实表现。
模型广场和模型详情中的服务商数据来自持续采集与评测。下面说明常用指标的统计口径、测试条件和展示位置;数据用于辅助选型,不代表对未来可用性或性能的永久承诺。
| 指标 | 评测口径 | 展示方式 |
|---|---|---|
延迟 | 文本生成使用首 Token 延迟;Embedding、Reranker 使用完整响应延迟。 | 服务商数据使用最近 6 小时 P90;趋势图使用近 7 日 P90。 |
吞吐 | 流式响应中,首 Token 后单位时间收到的输出 Token 数。 | 服务商数据使用最近 6 小时平均值;趋势图使用近 7 日平均值。 |
可靠性 | 真实请求采样成功率 × 0.8 + Benchmark 测试成功率 × 0.2;真实样本不足时使用 Benchmark。 | 模型详情的服务商数据使用最近 6 小时可靠性结果。 |
价格与能力 | 价格、上下文长度等优先采用服务商提供的数据;缺失的最大输入/输出长度可通过边界请求评测。 | 展示在模型详情和服务商数据卡片中,具体以当前模型数据为准。 |
测试条件 | 测试不使用缓存,轮次间更换 Prompt 前缀,并从多个区域节点发起请求;同一批次的服务商并发执行。 | 采样结果随模型、服务商、时间窗口、网络和请求条件变化。 |
不同指标回答不同问题:TTFT 和端到端延迟看响应体验,吞吐看持续输出速度,可靠性和错误率看稳定性。比较时应保持模型、请求内容、并发量和统计窗口一致。
| 指标 | 中文名称 | 定义与单位 | 如何解读 |
|---|---|---|---|
Concurrency | 并发请求数 | 同一时刻处于处理中的请求数量 | 用于观察连接、排队和上游处理压力;并发数高不等于每个请求都能获得同样的吞吐。 |
TTFT | 首 Token 延迟 | 请求发送到收到第一个 Token 的时间 | 主要影响流式对话的“开始响应”体验;通常以秒表示,越低越好。 |
Latency / E2E | 端到端延迟 | 请求发送到收到完整响应的时间 | 适合衡量非流式调用或完整任务耗时;需要结合输出长度一起比较。 |
Throughput | 输出吞吐 | 流式响应中单位时间收到的输出 Token 数 | 通常以 tokens/s 表示;适合比较长文本生成过程中的持续输出速度。 |
Success rate | 成功率 | 请求成功数 ÷ 总请求数 | 反映请求链路的稳定程度;应明确统计窗口、状态码范围和是否包含上游失败。 |
Availability | 可用性 | 在统计窗口内可正常接收和完成请求的比例 | 是服务连续性的指标,通常需要和故障时长、错误率及恢复时间一起看。 |
P50 / P90 / P95 / P99 | 延迟分位数 | 按延迟从低到高排序后对应位置的值 | P50 代表典型体验,P90/P95/P99 反映慢请求尾部;分位数越低越好。 |
Context window | 上下文窗口 | 单次请求允许的输入与输出 Token 总上限 | 决定单次请求能承载的上下文规模。 |
Max output tokens | 最大输出长度 | 单次请求允许生成的最大输出 Token 数 | 影响长文本任务的完成能力和耗时,最终以模型及服务商支持范围为准。 |
Error rate | 错误率 | 失败请求数 ÷ 总请求数 | 应按鉴权、限流、余额/配额、参数和上游错误分类,单一总数不便于定位问题。 |
通过统一 API 接入、连接管理和路由层,把不同模型与服务商的调用收敛到同一套接入方式,适合从低流量验证逐步扩展到高并发生产业务。
默认路由会综合当前价格、延迟、吞吐和可靠性,在可用通道中选择;业务可按公开路由参数进一步约束。
模型详情、服务商数据和请求日志提供延迟、吞吐、可靠性、Token 和错误信息,便于比较候选通道、定位慢请求并调整策略。