GPU 单价只是成本的一部分。真正值得优化的是满足质量与延迟目标时,每个成功请求的成本。

建立基准测试

使用代表性的输入长度、输出长度和并发量测试 P50/P95 延迟、吞吐、显存占用和 GPU 利用率。

提高批处理效率

动态批处理能提升吞吐,但也会增加等待时间。批大小应在服务等级目标内调优。

模型大小与业务目标匹配

更大的模型未必在特定任务上带来等比例收益。通过离线评估比较质量,再决定是否值得承担额外成本。

避免空闲资源

对间歇任务使用队列、自动扩缩和自动关机。持续稳定流量则可以评估长期用量承诺。

关注端到端链路

数据预处理、网络传输、CPU 和存储也可能让 GPU 等待。优化应覆盖完整请求路径,而不仅是模型执行时间。