NVIDIA Triton Inference Server
NVIDIA Triton Inference Server 是面向 AI 模型服务化的推理服务器,支持多框架模型部署、动态批处理和生产推理服务。
softwareinferencemodel-servingnvidia
赋创 AI 知识平台FUCHUANG AI Infrastructure Platform
AI Infrastructure Knowledge Hub
3 个条目
NVIDIA Triton Inference Server 是面向 AI 模型服务化的推理服务器,支持多框架模型部署、动态批处理和生产推理服务。
TensorRT-LLM 是 NVIDIA 面向大语言模型推理优化的开源推理框架,强调在 NVIDIA GPU 上获得更高吞吐与更低延迟。
vLLM 是面向大语言模型推理与服务化部署的开源引擎,以高吞吐、PagedAttention 和 OpenAI 兼容接口著称。