logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

论文精读GAN: Generative Adversarial Nets

如果训练太多次判别器再训练生成器,那么可能导致【模式崩溃】(不管给什么噪声,输出结果一样)因为生成器没有直接接触样本,而是通过判别器告诉它像不像,就像枯叶蝶不知道枯叶长什么样子;源码地址:http://www.github.com/goodfeli/adversarial。论文链接:https://arxiv.org/abs/1406.2661。而是采用的深度学习,深度学习中有完备的训练技巧。条件

文章图片
#生成对抗网络#人工智能#神经网络
[WIP] 机器人领域的一些Key insights

机器人领域的一些Key insights 操作应回归物理本质 操作应回归物理本质 提出人:Matthew T. Mason,卡耐基梅隆大学的机器人学教授blog:https://mtmason.com/the-heart-of-robotic-manipulation/观点: 操作的关键在于理解并利用物理世界的基本规律举例:摩擦锥 friction cone(给定法向压力的情况下,最大能产生的侧

#机器人
自动驾驶感知范式迁移:从BEV/向量化到高斯建模

本质: 这个过程就像一个艺术家在用无数个可塑形的、可变色的“智能粘土球”(高斯体)来雕刻一个与现实一模一样的模型。核心思想: 不再试图填充一个完整的网格,而是使用一组可学习的、稀疏的“查询向量”(Object Queries)作为“探针”,主动去图像中寻找并“提炼”与特定物体相关的信息。本质: 这是一种更有针对性的提炼。最终得到的是一组包含了物体信息的向量,而不是一个完整的场景地图。核心思想: 不

#自动驾驶#人工智能#机器学习
【自动驾驶】Free space与Ray casting

用ray casting算法可以使用lidar信息,提取出类似2d visibility的区域,将这种信息给到自动驾驶规划蹭,可以得出更合理的轨迹。如果和【wall tracking墙面跟踪】结合起来的话,可以再简单一点,其思想是沿着中心点旋转,找到最近的不被遮挡的端点,即可构成三角形。当然,这样的话得发出非常多的光线,其实也可以在知道所有的墙或者障碍物的端点的情况下,按顺序遍历端点,然后就可以找

文章图片
#自动驾驶
【论文阅读】VLA-pilot:Towards Deploying VLA without Fine-Tuning

但是由于预训练数据和特定任务的分布不一致(比如预训练中是抓蓝色杯子,但是任务是抓红色杯子),导致抓取动作的概率很低。VLA提供动作分布和置信度,外部验证器利用多模态大模型(比如GPT-4V)对开放世界的理解能力,通过自然语言推理对任务和动作进行重新评估,使得正确动作的概率更高。策略引导是指的将模型输出的多种轨迹进行评估,从而选择最佳的轨迹。好处是:不需再SFT,通过初始的采样轨迹,剔除差的,保留好

#论文阅读
【论文阅读】RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

设计了指标敏感的过程奖励函数(Metric-sensitive Process Reward),不仅关注最终预测点的准确性(结果奖励),还通过过程奖励(Accuracy Reward)对中间推理步骤的感知精度进行评估和激励。尽管现有的视觉语言模型(VLM)很强大,但在处理复杂的3D场景和根据指令动态推理交互位置方面仍存在不足。结论:实验证明,通过结合专用深度编码器(SFT)和指标敏感的过程奖励(R

#论文阅读#语言模型#人工智能
深度学习基础

但是要注意:噪音背景需要和清晰的音频一样diverse,不能音频有1000条,噪音只有1条,要不然可能过拟合。为了能够使其适用于TaskB,需要对模型进行进一步训练,这个过程取决于taskB的样本数量。make similar的方法包括数据合成。比如含有噪音的音频。迁移学习是原本适用于taskA的模型同样应用在taskB。训练集和验证集的数据分布不同。模型没见过,没学习到;该方法在音频识别种效果很

文章图片
#深度学习#人工智能
强化学习入门

去掉Value model(Critic model),无需额外的价值函数。

文章图片
#人工智能
强化学习入门

去掉Value model(Critic model),无需额外的价值函数。

文章图片
#人工智能
【论文阅读】RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

设计了指标敏感的过程奖励函数(Metric-sensitive Process Reward),不仅关注最终预测点的准确性(结果奖励),还通过过程奖励(Accuracy Reward)对中间推理步骤的感知精度进行评估和激励。尽管现有的视觉语言模型(VLM)很强大,但在处理复杂的3D场景和根据指令动态推理交互位置方面仍存在不足。结论:实验证明,通过结合专用深度编码器(SFT)和指标敏感的过程奖励(R

#论文阅读#语言模型#人工智能
    共 25 条
  • 1
  • 2
  • 3
  • 请选择