logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

超越GPT-4o与Gemini 1.5 Pro!南洋理工联合阿里提出VLM-IE3D,仅凭普通RGB视频,让大模型具备极强3D感知能力

为什么值得关注?VLM-IE3D 证明了无需复杂的3D大骨干网络,仅凭轻量级映射和结构化几何 Token,就能让开源小模型在空间智能上媲美甚至超越顶尖商业模型。这种“轻量级几何注入”的思想非常适合落地到移动机器人或具身智能设备上。谁应该继续阅读原论文?正在做 3D VLM、具身导航、视频空间问答(Spatial VQA)的科研人员,原论文中关于 AnySplat/VGGT 的特征接入细节以及多任务

文章图片
#3d#音视频
谷歌DeepMind联手浙大推出 Archon:多模态大模型的下一个分水岭,是真正的“数字分身”?

谷歌DeepMind与浙江大学团队近日发布的多模态大模型Archon,突破了数字人领域长期存在的"拼凑式"技术瓶颈。该模型通过三大创新实现了任意模态间的高保真转换:1)将视频分解为"语义骨架"和"画质渲染"两阶段处理,使Token数量减少75%;2)引入"模态内省"机制,通过中间模态过渡提升生成稳定性;3)基于统一架构实现72种子任务的协同训练,支持台词修改、性别转换等复杂编辑。实验显示其性能超越

文章图片
#论文阅读#科技#人工智能
ICML 2026 | 如何自动检测多模态大模型的“系统性图文幻觉”?

随着合成数据(Model-Generated Captions)成为多模态大模型预训练的主力,预训练集中的“毒素”与系统性偏见将严重影响下一代模型。Symbal 提供了一套高效、自动化的“数据质检与模型审计”解决方案。阅读建议:谁应该继续阅读原论文:正在从事 MLLM 数据集清洗、模型 Hallucination 评估、以及医疗 AI 可信度研究的科研人员,建议深入论文 Section 4 与 A

文章图片
#算法#人工智能#科技 +1
(COLM 2026) AWS 最新研究:大模型微调靠的是“全局协同”,而非少数“超级参数”

为什么值得关注?本论文纠正了大模型微调领域长期存在的一个直觉误区,明确界定:“重要参数不等于可微调参数”。这一结论直接影响未来的 PEFT 算法设计开发——任何抛弃全层协同、试图“偷懒”只修改少量关键位置的微调方案均被证明不可行。谁应该继续阅读原论文?从事 PEFT 算法研发、模型压缩/量化感知微调(QAT)的科研人员,建议阅读原论文及其附录,参考其精妙的控制变量实验设计(如通过冻结特定 LoRA

#人工智能#论文阅读#科技
华中科技大学 开源Wat3R,零标注也能做水下3D重建

为什么值得关注?Wat3R 展示了“大模型+无监督/半监督迁移”在极度缺乏标注的恶劣环境(如水下、极端天气、航天)中应用的巨大潜力。它证明了利用简单的物理退化合成 + 大规模无标注视频,就能把陆地上学到的强几何先验完美迁移。谁应该继续阅读原论文?从事水下机器人(AUV)、水下 3D 扫描、SLAM 系统的工程研发人员,以及研究 Cross-Domain SSL、3D Feed-forward Re

文章图片
#3d#人工智能#论文阅读
机器人技术攻克双人杂技动作难题,机械臂如何学会与真人实现3球流畅互抛

为什么值得关注?毫秒级在线重规划+合理的物理约束,完全可以让现有的机械臂具备媲美人类的动态抛接协同能力。它代表了物理人机交互(pHRI)从“静态互递”迈向“动态互抛”的重要里程碑。谁应该继续阅读原论文:从事机器人动力学、在线轨迹优化(MPC/SQP)、动态抓取与高精控制的硬核科研人员,原论文的约束公式设计细节极具借鉴意义。谁只看导读即可:仅需了解机器人前沿动态、具身智能应用场景或做技术泛读的同学,

文章图片
#机器人#算法#人工智能 +2
arXiv热点论文:3B/7B小模型在医疗事实核查中反超GPT-4o/GPT-5

这篇论文提出了一种轻量级开源大模型在生物医药断言验证任务上的高效微调方法。研究发现,通过QLoRA技术微调仅1008条样本,7B小模型(Mistral-7B)就能取得88.4%的准确率,超越GPT-4o(85.6%)和GPT-5(77.9%),同时降低44.5倍成本。论文还揭示了经典数据集SciFact存在结构性漏洞(NEI样本证据字段全空),导致模型可通过简单规则"作弊"。在无漏洞数据集Heal

文章图片
没数据也能练具身智能?复旦大学TAP框架:30小时自主探索无标注数据,效果媲美百万级专家轨迹

TAP 论文是一篇思想性与实用性兼备的具身智能佳作。让机器人像婴儿一样自由探索世界,积累“物理直觉”,比一味堆砌人类遥操作数据更加高效且鲁棒。谁应该继续阅读原论文:正在搭建具身智能预训练 Pipeline、探索数据高效型 VLA、或者对机器人无监督/自我探索(Self-exploration)感兴趣的研究者。谁只看导读即可:仅需了解 Embodied AI 最新趋势、或想在宏观层面把握 VLA 数

文章图片
#算法#人工智能#科技 +1
Arxiv论文周选 (2026-W29)

本周该领域的论文涵盖了人机物理交互、无线通信、多模态智能体、人工智能安全以及医学图像分割。在机器人与人机交互方面,学者们探索了高难度的人机多球杂耍实时规划和新型混合智能体博物馆导游系统,展示了精细控制与多模态交互对用户体验的提升。在医疗应用上,结合SAM模型的视觉提示分割框架ViPSAM有效解决了低对比度非增强CT的分割难题。此外,针对电磁感应通信中的天线部署优化,以及从历史社会技术灾难中反思AI

文章图片
#机器人#算法#人工智能 +1
10分钟读懂AVEC 2026:如何用模型预测控制(MPC)让轮腿四足机器人“侧倾”狂飙?

这篇论文是典型的将“传统控制理论(基于模型的MPC)”与“现代智能算法(基于数据驱动的强化学习)”完美结合的典范。它告诉我们,具身智能不只是无脑端到端,利用经典的车辆动力学先验知识对系统进行合理的降维分层,能让机器人在硬件极限边缘表现得更优雅、更稳定。如果你正在寻求如何将多自由度机器人的关节潜力发挥到极限,或者正在做软硬件 Sim-to-Real 的闭环落地,原论文绝对值得你花两个小时精读。如果你

文章图片
#机器人
    共 29 条
  • 1
  • 2
  • 3
  • 请选择