
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在机器人控制场景下,由于行动空间连续、环境感知部分可观测,且需要兼顾探索安全性和样本利用效率,传统固定系数的熵正则化方案难以满足复杂需求;而 AER 的动态适配特性,能够有效化解这一矛盾。从实际应用场景看,AER 的核心技术思想已通过多种变体框架,在足式机器人运动控制、机械臂灵巧抓取、多机器人协同配合、人形机器人全尺寸运动控制等核心任务中得到验证。本文将从理论基础、核心算法变体、典型应用场景、工程
DeepSeek V4是2026年发布的开源大语言模型,具备三大技术突破:1)混合注意力系统(CSA+HCA)将百万级上下文处理成本降低70%;2)流形约束超连接(mHC)解决万亿参数稳定性问题;3)Muon优化器提升40%训练效率。模型提供1.6万亿参数的Pro版和2840亿参数的Flash版,均支持100万token上下文,在长文本、代码等场景性能媲美顶级闭源模型。采用MIT协议完全开源,支持

文章摘要: 视觉-语言-动作(VLA)模型是具身智能的核心技术,其架构分为链式拆分对齐(V-L-A)与多模态直接融合(V+L-A)两类。V-L-A通过串行流程分阶段处理视觉、语言和动作,保留了语言中间表征,利于调试但存在信息损耗和计算冗余;V+L-A则通过统一隐空间并行融合多模态特征,直接生成动作,显著提升了参数效率(如TurboVLA参数量仅为传统模型的6%)和推理速度(延迟降低至31.2ms)

本文系统分析了大模型推理中注意力机制的技术演进路线,聚焦KVCache显存瓶颈问题。从标准多头注意力(MHA)到多查询注意力(MQA)、分组查询注意力(GQA)和最新的多头潜在注意力(MLA),四种方案在模型质量、显存占用和推理速度三个维度呈现不同权衡:MHA保持无损质量但资源效率最低;MQA实现极致压缩但质量损失明显;GQA在8分组时找到平衡点;MLA通过低秩联合压缩在长序列场景展现出压倒性优势
本文系统介绍了深度学习模型轻量化的两大核心技术:模型量化与知识蒸馏,并提供了PyTorch实战代码。模型量化通过降低参数精度(如FP32转INT8)实现无损压缩,推理速度提升1.5-3倍;知识蒸馏通过"大教小"迁移知识,提升小模型精度。二者组合使用时,先蒸馏优化精度再量化加速推理,形成工业级解决方案。文章包含量化/蒸馏的核心原理对比、独立实现代码(后训练量化和软标签蒸馏)以及组
RECAP是2025年由Physical Intelligence团队提出的新型强化学习框架,专为机器人控制等真实世界复杂任务设计。其核心创新在于将强化学习转化为优势条件化监督学习模式,通过多源数据(专家示范、自主尝试、人工纠错)和离线迭代训练,解决了传统RL在真实场景中的三大痛点:稀疏奖励、仿真偏差和训练不稳定。
本文将从系统设计原理、核心技术创新、代码架构实现三个维度,对 veRL 与 HybridFlow 进行深度技术拆解,帮助读者全面理解这一前沿 RLHF 训练框架的内在机制。
NVIDIA A100基于安培架构,是深度学习领域的标杆级计算节点,通过全链路优化实现从训练到推理的全场景覆盖。其第三代TensorCore支持多种精度计算,80GB HBM2e显存解决大模型访存瓶颈,NVLink3.0和NVSwitch技术支撑高效分布式训练。MIG技术提升资源利用率,CUDA生态确保工业级兼容性。A100在计算、存储、互联等维度均针对深度学习优化,成为行业通用基础计算单元。与V
黎曼流形为具身智能提供了一种统一的理论框架,能够有效建模机器人状态、构型和观测空间中的非线性几何约束(如刚体姿态、关节运动范围等)。该技术通过将物理约束嵌入流形度量张量,将运动规划、控制和姿态估计等问题转化为流形上的测地线或梯度流优化问题,避免了传统欧氏空间方法中约束与优化割裂的弊端。
DeepSeek推出的DSpark是一种高效的大模型投机解码(Speculative Decoding)推理加速框架,旨在解决自回归生成推理效率低下的问题。传统投机解码方案存在生成质量瓶颈(如并行草稿器的多模态冲突)和系统效率瓶颈(固定验证长度导致算力浪费)。DSpark通过半自回归生成架构(并行骨干+轻量串行校正头)提升草稿质量,结合置信度调度验证机制动态调整验证长度,优化GPU资源分配。







