
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在普通的图片抽屉打开/关闭识别任务中,强如GPT-4o也只有50~60%的准确率,所以为了让我们的VLM模型能够准确的识别图中抽屉是打开还是关闭的,基于Qwen2_VL进行自定义数据集的微调。

本文提出了RDT-1B,一个拥有12亿参数的机器人双臂操作扩散基础模型。为解决双臂操作中动作多模态和数据稀缺的挑战,RDT-1B采用了创新的扩散变换器架构,并引入了“物理可解释的统一动作空间”,使其能在大规模、异构的多机器人数据上进行预训练。在真实机器人上的实验表明,该模型在零样本与少样本泛化方面表现卓越,能高效完成复杂的灵巧操作任务,显著优于现有方法。

视觉语言动作模型(VLA)正推动具身智能迈上新台阶,实现AI从感知理解到物理交互的闭环。作为多模态技术的突破性进展,VLA将视觉编码器、语言编码器和动作解码器融合,赋予机器"看-懂-动"的完整能力链。前沿研究涌现出RT-2、GR00T等标志性模型,通过大规模预训练和架构创新,显著提升机器人的语义理解与任务执行能力。应用场景涵盖人形机器人、自动驾驶和医疗工业领域,NVIDIA的GR00T项目更将推动

MetaGPT是一个基于标准化操作流程(SOP)的多智能体协作框架,通过模拟软件公司角色分工实现高效软件开发。其核心公式Code = SOP(Team)将人类团队的流程应用于LLM智能体,解决了传统多智能体系统的逻辑不一致问题。MetaGPT包含角色系统、动作机制、SOP流程和文档生成等组件,支持从需求分析到代码生成的完整软件开发流程。相比单一LLM,MetaGPT通过结构化协作显著提升了输出质量

本文介绍了Open-Qwen2VL,一个完全开源的20亿参数多模态大语言模型。该模型旨在解决当前SOTA模型预训练成本高昂且流程不透明的问题。通过采用高效的数据过滤技术(如MLM-Filter)、创新的多模态序列打包和动态图像分辨率策略,Open-Qwen2VL仅使用220个A100 GPU小时就在2900万图文对上完成了高效预训练,计算成本极低。

CrewAI框架解析:多智能体协作系统的构建方法 摘要: 本文深入探讨了CrewAI框架的设计理念与核心架构,这是一种专为多智能体协作设计的Python框架。CrewAI采用角色扮演(Role-Playing)和事件驱动(Flows)的设计哲学,通过Agent(智能体)、Task(任务)、Crew(团队)和Process(流程)四大核心组件实现复杂任务的分解与协作。文章详细解析了框架的层次化架构,

随着AI Agent从单次对话工具向长期协作搭档进化,记忆成为制约其发展的核心瓶颈。本文系统梳理了Agent记忆系统的分类体系、五大技术路线(上下文窗口、RAG、文件系统、知识图谱、多Agent推理)及七大代表性系统,并从架构、检索机制、信息矛盾处理、隐私部署等维度进行横向对比。其中,ASMR以多Agent并行推理的方式在LongMemEval上达到约99%准确率,OpenClaw则以文件+向量混

文章目录0.数据集介绍1.玻璃数据集读取与分析2.变量关系可视化(平行坐标图)3.属性对相关性可视化0.数据集介绍多类别分类问题与二元分类问题类似,不同之处在于它有多个离散的输出,而不是只有两个。回顾探测未爆炸的水雷的问题,它的输出只有两种可能性:声纳探测的物体是岩石或者水雷。而红酒口感评分问题根据其化学成分会产生几个可能的输出(其口感评分值是从 3 分到 8 分)。但是对于红酒口感评分问题,口感
本文提出NeuPAN,一种实时的端到端机器人导航框架,它直接利用原始点云数据,无需建图。该方法通过一个紧密耦合的感知-控制闭环,避免了传统流程中的误差传播。其核心是一个可解释的深度展开神经编码器(DUNE),将点云高效映射为潜在距离特征,并结合一个神经正则化运动规划器(NRMP)生成无碰撞动作。此框架被建模为一个端到端优化问题,保证了数学上的严谨性和物理可解释性。在多种机器人平台和复杂真实场景中的

大型语言模型(LLM)的崛起,犹如一场科技的奇点,正以惊人的速度重塑着我们与信息、与世界的互动模式。它们不再是冰冷的机器,而是具备理解、生成、甚至创造能力的智能体,展现出前所未有的潜力。然而,在这令人兴奋的机遇背后,也隐藏着复杂的技术挑战和深刻的伦理思考。本文将基于一系列精选参考文献[1-9],从概念、技术、应用、挑战等多个维度,以抽丝剥茧的方式深入剖析LLM,共同揭开LLM的神秘面纱。








