最近在把一个训练好的分割模型部署到服务器上,看教程都说要用ONNX转一下再上TensorRT。但我自己试了试,直接用PyTorch的torch.jit.script或者直接加载权重跑推理,速度也没差太多啊?而且转ONNX的时候还踩了不少坑,像动态尺寸、算子不支持这些,改了半天才跑通。想问问大家,在实际生产环境里,用PyTorch原生做推理到底卡在哪?是显存占用、多线程并发,还是说TensorRT的优化幅度真的很大,只是我模型太小没感觉出来?有没有大佬说说自己踩过的坑,让我少走点弯路。
最近在把一个训练好的分割模型部署到服务器上,看教程都说要用ONNX转一下再上TensorRT。但我自己试了试,直接用PyTorch的torch.jit.script或者直接加载权重跑推理,速度也没差太多啊?而且转ONNX的时候还踩了不少坑,像动态尺寸、算子不支持这些,改了半天才跑通。想问问大家,在实际生产环境里,用PyTorch原生做推理到底卡在哪?是显存占用、多线程并发,还是说TensorRT的优化幅度真的很大,只是我模型太小没感觉出来?有没有大佬说说自己踩过的坑,让我少走点弯路。
暂无回复,快来抢沙发吧