9月23日,北京商报记者获悉,百度智能云联合SGLang社区围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE(混合专家模型)专家压缩和推理服务治理等话题,梳理出Agent(智能体)走向生产环境所需要的推理底座。 Agent时代,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。要实现这一目标,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和...
网页链接9月23日,北京商报记者获悉,百度智能云联合SGLang社区围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE(混合专家模型)专家压缩和推理服务治理等话题,梳理出Agent(智能体)走向生产环境所需要的推理底座。 Agent时代,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。要实现这一目标,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和...
网页链接
精彩评论