
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
什么是并行优化?并行优化是代码优化的基本方法,从大到小一共可以分成三级:异步框架;任务并行;数据并行。在实际工作中,一般是先设计异步框架,包括异步处理任务以及异步任务的异构化等;第二步一般是做数据并行优化(SIMD),利用CPU的向量指令来对多条数据并行处理;这两步是代码优化的重心,一般做完这两步,系统性能会有明显的提升。今天要讨论的是第三步,for循环的并行优化。与前两者不同的是,for循环..
什么是并行优化?并行优化是代码优化的基本方法,从大到小一共可以分成三级:异步框架;任务并行;数据并行。在实际工作中,一般是先设计异步框架,包括异步处理任务以及异步任务的异构化等;第二步一般是做数据并行优化(SIMD),利用CPU的向量指令来对多条数据并行处理;这两步是代码优化的重心,一般做完这两步,系统性能会有明显的提升。今天要讨论的是第三步,for循环的并行优化。与前两者不同的是,for循环..
低成本行业大模型落地方案:10万元打造边缘AI 本文提出了一套实践验证的低成本行业大模型解决方案,重点解决中小企业应用AI的高门槛问题。方案采用"减法思维",避免昂贵的预训练和复杂RLHF,转而使用Qwen3-8B基座模型+DPO微调技术,仅需1-2万条结构化数据即可完成定制。通过SFT微调、DPO对齐和4bit量化三个关键步骤,最终模型可压缩至4.5GB,在4万元级国产边缘设

本文探讨了大模型生成速度对用户体验的影响,重点分析了首字延迟(TTFT)和生成速度(Token/s)两大关键指标。文章指出: 用户对响应速度极其敏感,TTFT>3秒会导致70%+的流失率; 不同应用场景需要差异化的速度标准,如实时对话要求TTFT<1s且≥40Token/s; 提供可交互的HTML模拟工具,可直观体验不同速度效果,帮助团队理解优化方向。 核心观点:模型性能不等于用户体验

摘要: 论文《LIMI: Less is More for Agency》提出颠覆性观点:仅用78条高质量专家工作轨迹(约330万tokens)训练的大模型,在自主性任务(Agency)上表现远超使用上万条数据的SOTA模型(AgencyBench得分73.5%,提升53.7%)。关键突破在于**"轨迹"设计**——包含推理、工具调用和环境观察的完整闭环记录(平均42.4k t

AI数据并购浪潮席卷科技界,Meta以148亿美元收购Scale AI标志着模型巨头正从"算力竞赛"转向"数据闭环"争夺。这场并购潮经历了三个阶段:早期行业整合期(2017-2021)、工具与社区期(2022-2024)和当前战略下注期(2024-2025)。深层驱动因素包括:技术迭代需求、商业生态构建、人才获取和供应链安全。并购目标集中在规模化标注平台、数

本文介绍了使用 FastAPI 构建大语言模型(LLM)应用的系统方法。FastAPI 因其异步高性能、类型安全和易部署等特性成为 LLM 应用的理想框架。文章详细讲解了五层架构设计(接口层、控制层、业务层、数据层和配置层),重点阐述了 FastAPI 的核心机制,包括模块化路由、控制层设计、业务逻辑封装、数据模型校验和生命周期管理。同时介绍了 Prompt 工程化管理方法,建议将 Prompt

RLHF与PPO:大模型对齐的关键技术解析 强化学习人类反馈(RLHF)结合近端策略优化(PPO)是目前大语言模型对齐的核心技术。该方法通过三个阶段实现:预训练学习语言结构,监督微调模仿人类行为,最后通过RLHF优化模型偏好。关键组件包括奖励模型(将人类偏好转化为可优化信号)、KL正则化(保持生成稳定性)和价值函数(降低训练方差)。PPO通过clip机制控制策略更新幅度,防止模型崩溃。工程实现需注

摘要: 本文系统分析了PPO算法在大模型RLHF训练中的核心问题:奖励稀疏、非MDP假设失效、高维敏感、KL约束不稳定、Critic噪声大等。OpenAI等机构通过工程优化而非算法改进来缓解问题,包括降低PPO权重、升级奖励模型、动态KL控制、局部参数更新、海量SFT数据打底、多行为头隔离风险等。行业趋势正从PPO转向DPO/ORPO等更稳定的方法,并朝结构化世界模型和内在价值体系演进。核心解决思

KL散度(Kullback-Leibler divergence)是现代机器学习的核心工具,贯穿从最大似然估计到深度生成模型、强化学习等多个领域。作为衡量概率分布差异的指标,KL散度具有非负性、不对称性等特点,与熵、交叉熵存在紧密数学关联。其发展历程从信息论奠基到现代大模型训练,尤其在RLHF(基于人类反馈的强化学习)中扮演双重角色:监督学习中作为优化目标,而在RLHF中则成为防止模型偏离的惩罚项








