百度百舸Meetup在京举办 推理基础设施助力Agent规模化落地
2026-09-23 23:33:08
  • 0
  • 0
  • 0

9月22日,百度智能云联合SGLang社区举办“Agent时代的推理基础设施:百度百舸 × SGLang生产级实践”Meetup,围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题,探讨Agent走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让Agent更快地跑起来

当前,Agent不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响Agent的任务完成效率和规模化应用成本。

一次真实的Agent任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在393条真实Agentic Coding任务轨迹中,输入输出比中位数达到213∶1,极端情况下输入序列长度可达67.5万Token。Agent工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent时代的推理基础设施不能只关注模型一次“答得多快”,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun插件打通SGLang与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动SGLang社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang社区分享了从RadixAttention到Unified Radix Cache的技术演进。通过统一缓存管理体系,不同类型的KV Cache可以实现高效复用。在现场分享的实践数据中,FULL与SWA混合模型在多轮HiCache场景下命中率达到96.8%,平均首字时延为1.23秒。

不止模型跑得快 也要让整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可达到原来的2.23倍。对Agent而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当Agent进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和KV Cache无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

模型能力之外 看见Agent的真实问题

本次活动还设置了闪电演讲环节。SGLang核心贡献者张晓雨围绕推理服务部署和AI Infra工程自动化展开分享;元神智算CEO蓝衣剑客从标准与生态角度分享Agent发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论Agent如何在真实系统中保持状态、完成交付并应对故障恢复。

三位嘉宾的分享共同指向一个变化:Agent的价值不只是“更会回答”,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与SGLang等技术社区及更多开发者开展技术共建,助力Agent从单点尝试走向规模化落地。

模型能力决定Agent能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助Agent跑得更快、更省、更稳。

 
最新文章
相关阅读