logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习(RL):原理、算法、RLHF落地全解析

本文系统解析了强化学习(RL)的原理、算法及应用,特别聚焦大模型时代的RLHF技术。文章首先阐述了RL的核心概念与五元组交互逻辑,对比了三大机器学习范式。重点介绍了RL三大算法家族(价值函数法、策略梯度法、Actor-Critic)及其应用场景,详细剖析了Q-Learning和REINFORCE算法的执行流程。针对大模型领域,深入讲解了RLHF的三段式技术链路及其在模型对齐中的作用。最后总结了RL

#算法#人工智能#机器学习
深度学习论文: Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation,

人类视觉可依据格式塔原则将场景拆解为独立语义对象,对应计算机视觉中的目标检测、实例分割与视觉定位任务,广泛支撑机器人感知、自动驾驶、图像编辑等应用。现有人工标注数据集受限于高昂标注成本,存在类别长尾、场景组合覆盖不足的固有缺陷。现有合成数据方案分为两类。仿真渲染类可输出高精度真值,但受三维资产约束,目标多样性不足,适用场景受限。文生图结合伪标签的方法场景丰富,但引入生成与标注噪声,标注可靠性差。

文章图片
#深度学习#人工智能
深度学习论文: Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation,

人类视觉可依据格式塔原则将场景拆解为独立语义对象,对应计算机视觉中的目标检测、实例分割与视觉定位任务,广泛支撑机器人感知、自动驾驶、图像编辑等应用。现有人工标注数据集受限于高昂标注成本,存在类别长尾、场景组合覆盖不足的固有缺陷。现有合成数据方案分为两类。仿真渲染类可输出高精度真值,但受三维资产约束,目标多样性不足,适用场景受限。文生图结合伪标签的方法场景丰富,但引入生成与标注噪声,标注可靠性差。

文章图片
#深度学习#人工智能
DeepAgents : 后端(Backends)

DeepAgents 提供多种后端实现,支持智能体运行逻辑、沙箱环境调度和会话状态持久化。预置后端包括:StateBackend(默认线程内存储)、FilesystemBackend(本地磁盘)、StoreBackend(跨线程持久化)、ContextHubBackend(LangSmith存储)、SandboxBackend(隔离执行)和LocalShellBackend(无隔离开发环境)。Co

#java#开发语言
DeepAgents : 记忆机制(Memory)

摘要: DeepAgents采用“记忆即文件”机制,通过作用域和权限管理实现智能体记忆。核心设计包括: 命名空间隔离:支持用户级、智能体级、组织级隔离,按需配置读写权限; 写入策略:热路径即时更新或后台整合提炼,平衡效率与知识沉淀; 安全防护:敏感路径(如组织策略)设为只读,防止提示注入攻击; 扩展能力:结合对话历史检索和Skills机制动态加载记忆,避免上下文膨胀。 关键实践包括避免并发冲突、控

文章图片
#人工智能#深度学习#开发语言
Multi-Agent多智能体完整详解:架构、协作模式、落地选型与实战步骤

摘要: 多智能体(Multi-Agent)系统通过角色分工与协同配合解决单智能体难以处理的复杂任务,突破能力边界并提升效率。其核心要素包括角色定义、通信机制、协作模式等,并支持中心化管理、对等协作等多种协作方式。实际应用中,多智能体可高效完成如市场调研报告等长链路任务,但面临成本高、调试复杂等挑战。主流开源框架如AutoGen、CrewAI等为开发提供支持。未来,多智能体将成为企业级AI系统的关键

#架构
深度学习论文: ICPR 2026 Competition on Low-Resolution License Plate Recognition

自动车牌识别(ALPR)系统在交通执法、电子收费等场景中应用广泛。在标准成像条件下,车牌检测与识别性能已趋于饱和。然而,在真实监控环境中,由于摄像头距离远、硬件限制以及强压缩,车牌图像常常以低分辨率(Low-Resolution, LR)获取,字符模糊、失真,识别难度显著增加。尽管实际需求迫切,低分辨率车牌识别(LRLPR)仍是一个极具挑战且研究不足的问题,现有最先进方法在真实低质量图像上的识别率

文章图片
#深度学习#人工智能
深度学习论文: Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

本研究采用两阶段训练方案,旨在同步强化模型的跨模态理解能力与面向密集预测任务的细粒度感知能力,确保推理逻辑与空间表征的协同优化。第一阶段:分割导向的领域适配 本阶段核心目标为构建稳健的指代分割能力,其基础是预训练视觉‑语言主干已具备的物体定位能力。具体而言,我们将主干网络从自然语言指令中提取的空间先验,迁移至像素级密集预测任务。在此框架下,通过LoRA对语言模型进行参数高效适配,同时联合训练视觉编

文章图片
#深度学习#人工智能
深度学习论文: Per-Pixel Classification is Not All You Need for Semantic Segmentation

本文提出MaskFormer模型,将语义分割任务转化为预测一系列掩码及其全局类别,统一了语义分割、实例分割和全景分割任务。模型包含像素级模块、Transformer模块和分割模块三部分,通过并行预测N个概率-掩码对实现分割。实验表明,MaskFormer在ADE20K、Cityscapes等数据集上达到SOTA性能,尤其在全景分割任务中表现优异。该方法突破了传统逐像素分类的局限,为分割任务提供了新

文章图片
#深度学习#人工智能
目标检测mAP指标:与生产级精确率/漏检率/误检率的相关性及改造方案

本文探讨目标检测模型评估指标mAP与生产环境关键指标(精确率、漏检率、误检率)的脱节问题。mAP作为综合指标无法直接反映生产场景的实际表现,常导致"实验室高分、现场效果差"的困境。文章提出5个改造方案:1)限定置信度区间的受限mAP;2)引入业务加权的加权mAP;3)按场景拆分的场景mAP;4)重构指标逻辑的业务等价mAP;5)统一评估规则。通过定制化改造,使mAP能准确反映生

#目标检测#均值算法#目标跟踪
    共 114 条
  • 1
  • 2
  • 3
  • 12
  • 请选择