GPU 单价只是成本的一部分。真正值得优化的是满足质量与延迟目标时,每个成功请求的成本。
建立基准测试
使用代表性的输入长度、输出长度和并发量测试 P50/P95 延迟、吞吐、显存占用和 GPU 利用率。
提高批处理效率
动态批处理能提升吞吐,但也会增加等待时间。批大小应在服务等级目标内调优。
模型大小与业务目标匹配
更大的模型未必在特定任务上带来等比例收益。通过离线评估比较质量,再决定是否值得承担额外成本。
避免空闲资源
对间歇任务使用队列、自动扩缩和自动关机。持续稳定流量则可以评估长期用量承诺。
关注端到端链路
数据预处理、网络传输、CPU 和存储也可能让 GPU 等待。优化应覆盖完整请求路径,而不仅是模型执行时间。
