近日,百度智能云携手SGLang社区共同举办了一场以“Agent时代的推理基础设施:百度百舸 × SGLang生产级实践”为主题的Meetup活动。活动聚焦于多芯适配、上下文缓存优化、显存管理以及推理服务治理等关键议题,深入探讨了如何构建支撑Agent规模化落地的推理基础设施。
随着AI技术的快速发展,Agent已不再局限于单次问答,而是逐步演变为能够理解复杂目标、拆解任务、调用工具,并在多轮交互中持续推进的智能系统。这一转变对推理基础设施提出了更高要求:上下文复用能力、超大模型部署效率以及复杂请求的稳定调度,成为影响Agent任务完成效率和规模化应用成本的关键因素。
在真实场景中,Agent任务往往涉及多轮推理和工具调用,输入上下文随任务推进不断增长,且不同轮次间存在大量重复内容。公开数据显示,在393条Agentic Coding任务轨迹中,输入输出比中位数高达213∶1,极端情况下输入序列长度甚至达到67.5万Token。这一特征对推理基础设施的上下文管理能力提出了严峻挑战。
为应对这一挑战,百度百舸与SGLang社区在多芯适配和上下文缓存优化方面展开深度合作。通过sglang-kunlun插件,SGLang与昆仑芯实现无缝对接,显著降低了模型迁移和适配门槛。同时,百度百舸推动社区建立硬件可插拔插件机制,从芯片算子、任务下发和通信等层面进行全面优化,为多芯环境下的高效推理奠定基础。
在上下文缓存方面,SGLang社区展示了从RadixAttention到Unified Radix Cache的技术演进路径。通过构建统一缓存管理体系,不同类型的KV Cache得以高效复用。实践数据显示,FULL与SWA混合模型在多轮HiCache场景下命中率达到96.8%,平均首字时延仅为1.23秒,有效提升了推理效率。
面对超大模型部署的显存挑战,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩等技术手段,释放了更多显存空间。测试表明,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可提升至原来的2.23倍,为长上下文和高并发任务提供了强有力的资源支撑。
当Agent进入生产环境,服务稳定性成为另一大考验。百度百舸从流量、负载和集群缓存三个层面入手,通过动态调度、变长行为感知分桶和KV Cache无感热迁移等技术,确保请求能够进入最合适的推理实例。同时,构建多级缓存体系并通过全链路命中率漏斗定位缓存损失环节,进一步提升了复杂负载下的服务稳定性。
活动还设置了闪电演讲环节,多位行业专家分享了关于推理服务部署、AI Infra工程自动化以及Agent发展趋势的见解。SGLang核心贡献者张晓雨强调了推理服务部署和工程自动化的重要性;元神智算CEO蓝衣剑客从标准与生态角度探讨了Agent的未来发展方向;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论了Agent如何在真实系统中保持状态、完成交付并应对故障恢复。
这些分享共同揭示了一个趋势:Agent的价值不仅在于“更会回答”,更在于能够在连续上下文中理解任务、调用能力并完成交付。百度智能云表示,将继续与SGLang等技术社区及开发者开展技术共建,助力Agent从单点尝试走向规模化落地,推动AI技术在实际应用中的广泛普及。














