最近在把一个训练好的YOLOv8-seg模型转到TensorRT(FP16)部署,用torch2trt转换挺顺利的,但推理出来的mask精度差得离谱,边界框倒还行。对比了一下中间层输出,从第5个C2f模块开始数值就有偏差了,误差大概在1e-2量级。我已经关了TRT的层融合,也试过用onnx2trt,问题依旧。GPU是3090,CUDA和TensorRT版本都对齐了。查了一圈感觉可能和动态shape或者某些算子的实现有关,但实在没头绪。有没有折腾过类似问题的老哥?求指点一下排查思路,或者推荐一下靠谱的转换工具链,感谢!