先明确决策目标
选择与你要保障的用户体验相对应的指标。
单一分数无法证明某个模型适用于所有工作负载。
比较价格
提供商价格表使用不同的计量单位:每个令牌、每百万令牌、每张图像、每秒、每分钟或每次请求。Phaseo 保留原始单位,并为目录视图和价格计算器标准化可比较的价格。 对于文本模型,如果存在输入、缓存输入、缓存写入、推理和输出计费项,应分别比较。对于媒体模型,应显示原生计费单位;不能把每秒视频价格当作令牌价格展示。目录价格可用于估算请求费用,但并不代表所有负载的报价。提供商等级、地区优惠、批量定价、缓存行为和特定请求的计费项都可能改变最终金额。
了解性能指标
Phaseo 会记录经由 Gateway 路由的请求运行时间。
TTFT、输出速度、TPOT 和 ITL 需要流式响应,并且首次输出必须包含内容。 仅包含元数据的流帧不计入。 非流式响应仍可用于统计提供商处理时长、Gateway E2E 和有效吞吐量,而不会虚构 TTFT。
Phaseo 开销用于统计所选提供商调用之外的耗时。 其中可能包含 Gateway 处理、路由工作、重试和网络影响。 它不是固定的平台常数,应视为特定时间窗口内的分布。
正确解读运行数据
性能页面汇总了 Gateway 的实时流量。 这些是观测性测量,并非受控基准测试,也不是模型的固有属性。 结果可能会因以下因素而变化:- 提供商和路由的选择
- Cloudflare 执行位置和网络路径
- 提供商排队或区域负载
- 提示和输出长度
- 流式或非流式行为
- 重试、取消和工具调用
- 所选时间窗口内的模型或提供商更新
开展可复现的工作负载测试
先利用公开遥测缩小候选范围,再用自己的提示组合验证最终候选。- 从默认的
GET /v1/models响应中选择两到三个可路由模型。 - 创建一组经过脱敏的提示,涵盖简短、典型和较长的请求。
- 固定端点、地区、流式模式、提供商约束和并发数。
- 不要只依赖单个样本,应针对每个提示重复发送请求。
- 记录请求 ID、所选提供商、成功或错误状态、输出令牌数、Gateway TTFT、提供商处理时长、Gateway E2E、Phaseo 开销和成本。
- 比较分布和失败模式,并将原始结果与测试配置一并保存。
Phaseo 不作出的承诺
- 模型出现在目录中并不代表它可以路由。请使用默认的有效可用性筛选条件。
- 公开运行遥测不能保证未来的延迟或正常运行时间。
- 基准测试分数无法证明模型在你的提示组合下具备生产级质量。
- 示意性的 UI 配置并非模型的实时测量结果。
- 未经许可且没有佐证材料,不应发布客户引言、徽标或工作负载结果。
后续步骤
查看可靠性和状态
查看事件、模型当前的可路由状态、指标定义和故障排查信息。
比较模型
并排比较价格、元数据和可用的性能指标。
查看模型路由
查看单个模型的提供商路由、功能、可用状态和价格。
查看基准测试方法
了解基准测试来源和分数如何独立于 Gateway 遥测进行标准化。