最近在部署一个分割模型(DeepLabV3+,backbone是ResNet50),用TensorRT加速。按教程先转ONNX,再转engine。结果发现转出来的ONNX用onnxruntime跑CPU,比原PyTorch模型直接跑还慢20%左右。我确认了opset版本(12),也试了dynamic_axes,输入输出都命名了,但速度就是上不去。是不是我漏了某些优化pass?或者量化、剪枝这类操作必须在ONNX之前做?另外,转出来的图里有一堆我没见过的op(比如Resize、Pad这种),会不会是这些op在ORT里没有高效实现?有没有有经验的老哥分享下你们从PyTorch到ONNX的常规优化流程,或者踩过的坑?谢谢了。