
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
强化学习开源框架 RLinf 正式发布 v0.3 版本,首次打通从数据采集、模型训练到真机部署的完整闭环。(如适配 LIBERO 仿真、OpenVLA 模型训练的预置镜像),免去繁琐的环境打包与软件部署,快速跑通从框架适配到场景验证的全流程。在最新的科研成果中,百度百舸团队联合上海交大、地瓜机器人发布 dVLA-RL 框架,首次打通 PPO 算法与离散扩散 VLA 模型的适配通路,为机器人 Fou
针对这一核心矛盾,论文提出了 dVLA-RL。其核心思路并不是修改 PPO,而是重新定义 PPO 的优化对象。dVLA-RL 将整个去噪过程视为一条完整的决策轨迹,使强化学习优化的目标从最终动作扩展到整个动作生成过程,从而让经典 PPO 算法得以直接用于离散扩散 VLA。相比直接优化最终动作,这种方式更符合离散扩散 VLA 的生成机制,为这一技术路线建立起一套贴合模型生成逻辑的强化学习训练体系。
同时,这一架构升级为推理优化带来了新的挑战,同时也创造了性能突破的新机遇。SGLang 社区实测表明,该代码为最新的 DeepSeek-V3.2 模型带来了超过 2 倍解码吞吐量的显著性能提升,让社区能够。这一生产级的代码贡献,使得 SGLang 社区开发者无需重复底层探索与试错,能够直接获得性能倍增且稳定可靠的推理能力。MTP 通过让模型在单个前向传播中一次性预测多个未来 token,然后统一验
部署 DeepSeek-V3.2-Exp 时,百度百舸团队发现其长上下文性能明显低于官方报告。经排查,问题源于官方开源的 Inference Demo 中 RoPE 排布方式的一处细微错配。修正后,DeepSeek-V3.2-Exp 性能完全恢复。本文完整记录了该问题从发现、验证与协同 DeepSeek 官方修复的全过程。
随着大语言模型(LLM)长上下文推理需求飙升至 128K Tokens,首字延迟(TTFT)和显存压力已成为制约工业化落地的核心瓶颈。在处理数万字的法律合同或长篇技术手册时,过高的 TTFT 往往让用户面临漫长的等待。
Agent 将大模型推理全面带入长上下文与多轮交互时代,百度百舸的 AttentionStore 让 KV Cache 从「短暂的显存数据结构」演进为「可持久、可调度、可规模化复用的系统资源」,通过对昆仑芯底层算力的深度调优与推理框架的无缝集成,我们成功实现了更优的 TTFT 响应与更低的成本开销,为大规模国产化算力落地构筑了坚实底座。
同时,在量化层面,百度百舸推出了「模型层 - 框架层 - 硬件层」的端到端的量化体系——通过昆仑芯自研量化工具链实现高精度、高效率的模型量化,对不同来源的 INT8 / INT4 量化模型实现最佳模型部署与量化推理,并基于昆仑芯 XPU 的计算特性,定制化开发高性能量化专用算子库。在适配效率上,基于昆仑芯成熟的高性能算子库,针对无新增算子的新模型(如从 GLM-5.0 版本迭代至 GLM-5.1)
随着大语言模型(LLM)长上下文推理需求飙升至 128K Tokens,首字延迟(TTFT)和显存压力已成为制约工业化落地的核心瓶颈。在处理数万字的法律合同或长篇技术手册时,过高的 TTFT 往往让用户面临漫长的等待。
为解决国产芯片部署开源大模型的效率与性能瓶颈,百度百舸联合昆仑芯正式推出 vLLM-Kunlun Plugin —— 一款面向百度昆仑芯 XPU 的高性能 vLLM 平台插件,该 Plugin 现已全面开源。同时,项目同步开放了配套工具链,包括用于算子精度验证的与支持性能剖析的,助力开发者高效完成模型迁移、调试与优化。欢迎访问以下地址获取资源:torch_xray。
同时,在量化层面,百度百舸推出了「模型层 - 框架层 - 硬件层」的端到端的量化体系——通过昆仑芯自研量化工具链实现高精度、高效率的模型量化,对不同来源的 INT8 / INT4 量化模型实现最佳模型部署与量化推理,并基于昆仑芯 XPU 的计算特性,定制化开发高性能量化专用算子库。百度混合云基于昆仑芯硬件平台 Day0 完成 Kimi K2.6 的模型适配与集群部署,支持 INT4 权重,单机成功








