Skip to content
TopicTracker
来自 X · @AndrewYNg查看原文
译文语言译文语言

高效服务大语言模型新课程——如何以低延迟和合理成本为多并发用户提供服务?

本课程由Andrew Ng联合Red Hat推出,聚焦高效服务大语言模型的核心挑战:一个700亿参数模型仅加载权重就需要约140GB显存,每个活跃请求还需独立的KV缓存。课程将教你通过量化技术减少模型内存占用,并利用vLLM的智能内存管理高效处理大量并发请求。你将学习量化模型并权衡精度、使用vLLM部署并观察并发处理、以及基准测试并在速度、成本与精度之间做出明智抉择。