logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ResAD:用于端到端自动驾驶的归一化残差轨迹建模

仅供参考,未经实验验证。端到端自动驾驶(E2EAD)直接从传感器数据预测未来轨迹,但面临一个根本性的数据难题——轨迹数据的时空不平衡(Spatio-temporal Non-uniformity),导致两个关键问题:虚假相关性(Spurious Correlations)模型直接学习从高维传感器到复杂轨迹的映射时,容易走"捷径",学到表面关联而非鲁棒的驾驶逻辑。例如:模型可能学会"前车刹车灯亮 →

#人工智能
DeepSeek-R1:通过强化学习激发大语言模型的推理能力

仅供参考,未经实验验证。DeepSeek-R1 的故事是一个关于**“自我进化”**的故事:从一个未经任何监督的基座模型出发,通过纯强化学习的激励,模型自发学会了思考、反思、验证;再通过人类的少量引导(冷启动数据)和多阶段打磨,最终成为一个既强大又实用的推理专家;最后,它将这份智慧传递给更小、更快的模型,让整个开源社区受益。有时候,我们不需要手把手教模型如何思考,只需要给它正确的激励,它就能自己找

#语言模型#人工智能#自然语言处理
VLM³:视觉语言模型是原生3D学习者

仅供参考,未经实验验证。这篇论文证明:那些能"看图说话"的普通AI(比如GPT-4V、Qwen-VL),本身就有理解三维空间的天赋,不需要改装、不需要特殊训练技巧,只要用对方法教它,就能在3D任务上打败专业选手。图2清晰地传达了 VLM³ 的核心思想:通过巧妙地解决相机模糊性问题(统一焦距)和实现高效的文本化像素/区域引用,配合大规模数据混合与缩放,标准视觉语言模型无需进行任何架构改动或复杂的任务

#人工智能
docker常用命令

docker exec -it <容器名或者容器的id> /bin/bash。# 会列出容器的id(CONTAINER ID)和容器名(NAMES)等。进入运行中的容器执行命令。:记不清参数时,使用。:容器停止后自动删除。

#docker#容器#运维
HMM(隐马尔可夫模型)的理解2——摘要和引言

HMM 的数学理论早在 1960 年代末由 Baum 等人建立,但散落在数学期刊中,工程界难以理解和应用。面向工程师(而非数学家),用直观、实用、可实现的视角系统讲解 HMM 理论,并展示它如何成功应用于语音识别。尽管马尔可夫信源或隐马尔可夫模型在20世纪60年代末和70年代初已被引入和研究,但在过去的几年里,这些统计方法变得越来越受欢迎。这主要有两个强有力的原因。首先,这些模型在数学结构上非常丰

#人工智能
掩码视觉动作的论文3——问题篇

仅供参考,未经实验验证。项目主页:https://masked-visual-actions.github .io/论文地址:https://arxiv.org/pdf/2607.19343它本质上就是"视频版的 Stable Diffusion Inpainting":在潜空间里把掩码视频和噪声拼接,用视频扩散模型逐帧去噪补全。前向推理时掩码贴在机器人身上(模型补全世界),逆向推理时掩码贴在物体

#人工智能
掩码视觉动作的论文2——方法和实验

项目主页:https://masked-visual-actions.github.io/论文地址:https://arxiv.org/pdf/2607.19343把"动作"直接画在视频像素上,用"贴胶带"的方式告诉模型已知条件,同一个模型既能做"给动作猜结果"(正向),也能做"给结果猜动作"(逆向)——而且只练了正向,逆向直接就会。回到原文训练数据来自真实+仿真视频,用"自动抠图"和"3D渲染"

#人工智能
Evolver和Hermess Agent

仅供参考,未经实验验证。两个项目都实现了三层记忆架构 + 闭环自进化的核心设计,这在技术层面确实存在高度相似性。Evolver 更强调协议约束和审计追踪,适合需要合规和可追溯性的企业场景;Hermes Agent 更强调实用性和多平台部署,适合个人用户和多样化集成场景。争议的核心在于:这种架构相似是"趋同进化"(独立发现最优解)还是"代码清洗"(借鉴后重写),目前双方各执一词,社区尚无定论。Evo

#人工智能
掩码视觉动作:面向统一世界建模

数据集构建基于分割:使用 Segment Anything 分割出机器人臂作为掩码。基于渲染:利用 URDF 模型和相机外参渲染机器人网格,生成掩码条件。模型训练:以 Wan-Fun-Control 2.1(14B)为基座模型,采用 LoRA(秩256)微调,将掩码视频与参考帧拼接作为条件输入。视频模型能够吸收关于视觉世界如何运动、交互以及对接触做出反应的丰富先验知识,这使得它们成为机器人世界建模

#人工智能
Two-Pass的论文2——方法和实验

论文标题(监控视频中稀有交通事件的两阶段零样本时空定位)论文地址给定一段时长为DDD秒的交通监控视频VVV,我们预测一个元组t∗x∗y∗c∗t∗x∗y∗c∗,其中t∗∈0Dt∗∈0Dx∗y∗∈012x∗y∗∈012(Qwen3-VL 在010002010002网格上输出原始坐标;我们在合并和评估前将其除以 1000),且c∗∈Cc∗∈C。

#人工智能
    共 98 条
  • 1
  • 2
  • 3
  • 10
  • 请选择