英伟达推出的推理加速库,针对自家显卡做深度优化,可显著提升大模型的推理速度与吞吐,适合日常使用,上手门槛不高。
TensorRT-LLM 是英伟达为自家显卡推出的大模型推理加速工具库,通过算子优化、量化与批处理等技术,在同等硬件上显著提升推理速度与并发吞吐,并降低显存占用。它常被用于把训练好的模型部署为高性能服务,是生产环境中压榨硬件性能的常见选择。使用它需要一定的编译与调优经验,通常与自建推理服务配合。开源免费,效果依赖具体卡型与模型。