登录社区云,与社区用户共同成长
邀请您加入社区
联合影像作为Rokid单目camera module的提供方,有幸一起推动更多的人使用、体验、反馈单目SLAM技术,助力产品力,正向驱动产品迭代,驶向元宇宙的星辰大海!单目SLAM相较于双目SLAM最大的难度在于没有双目视差,去做深度信息估计。单目只有一个摄像头,只能通过位移运动,获得环境的不同角度的图像,获得视差信息再做深度估计。简而言之,AR有了SLAM才是真的AR,进化到具备三维感知的能力,
当操作界面消弭于无形,当指尖动作直接驱动数字世界,Rokid的手势识别技术正在践行“技术服务于人”的本质追求。这项突破不仅解放了用户的双手,更重构了人机关系的底层逻辑——从“学习操控设备”到“设备理解人类”,一场基于生物本能的交互革命已然到来。在工业现场测试中,工程师仅用三组手势就完成了传统需7步按钮操作的设备检修流程,效率提升40%的同时,首次实现了“操作零接触”的安全标准。这或许正是空间计算时
虚拟现实(VR)和增强现实(AR)技术正引领3D交互革命,苹果VisionPro、MetaQuestPro等设备通过空间感知和手势识别技术实现沉浸式体验。这场革命突破传统2D界面限制,整合眼动追踪、手势识别等多模态交互,在工业设计、医疗、教育等领域带来40%以上的效率提升。尽管面临成本高、续航短等挑战,3D交互技术已展现出显著价值,预计未来5年内设备将更轻量化,AI深度融合将使交互更自然。这场革命
尽管前景广阔,AR三维可视化的大规模普及仍面临挑战。首先是硬件的舒适度与续航,虽然轻量化是趋势,但长时间佩戴仍有负担;其次是内容的制作成本,高精度的3D建模和数据对接需要专业的技术团队,这正是像瑞丰宝丽这样拥有自研虚实共建引擎和AI大模型能力的企业的价值所在——它们通过平台化工具,降低了定制开发的门槛。未来,随着5G/6G网络的高带宽低延迟特性普及,以及AI大模型(如小瑞万解等自然语言处理模型)的
香农将信息定义为“不确定性的减少”。
远程专家协作系统在工业、医疗等领域的需求日益增长,AR 眼镜作为关键交互设备,其界面设计直接影响用户体验。Rokid CXR-M SDK 提供了强大的开发工具,支持开发者自定义 AR 眼镜 UI,实现高效的远程协作功能。
【征文计划】Rokid JSAR 实践指南:打造沉浸式 "声动空间盒" 交互体验
Rokid手势识别驱动的AR课堂,不仅是一场技术革新,更是教育理念的升级。它让学习回归本质:通过自然交互激发好奇心,告别了繁琐的触控设备。随着技术普及,我们预见更多学校将拥抱这一模式,打造更智能、包容的课堂。未来,手势识别或结合语音指令,实现全息教学,让每个学生都能在虚拟与现实交融的世界中,自由探索知识的边界。教育,正因AR而焕发新生。
数学上,手势位置可表示为向量: $$ \vec{p} = (x, y, z) $$ 其中$x, y, z$为空间坐标。例如,识别“捏合”手势时,系统计算手指关节角度变化: $$ \theta = \cos^{-1}\left( \frac{\vec{a} \cdot \vec{b}}{|\vec{a}| |\vec{b}|} \right) $$ 这里$\vec{a}, \vec{b}$为手指向量
打破设备枷锁:用户通过自然手势直接操作虚拟空间重构协作流:实现多用户操作的时空一致性激发创意维度:手势的丰富性远超物理控制器随着算法持续优化,未来将支持更精细的手部微动作识别,为工业设计、生物模拟等领域开启全新协作维度。AR交互正从"单人独奏"迈向"多人交响"的时代。
随着Rokid与多家车企推进前装量产,手势交互将与生物识别深度融合。测试中的"手势+眼动"复合交互系统,通过虹膜追踪预判意图,响应延迟已压缩至80毫秒。传统车载系统依赖物理按键或触控屏,驾驶员需转移视线操作,据统计,视线偏移1秒(时速60km)等于盲驾16米。随着AR-HUD(增强现实抬头显示)技术普及,如何实现"眼不离路、手不离盘"的安全交互成为行业难题。科技终将回归本质:让机器适应人类,而非人
设 $t$ 表示时间点,$g(t)$ 为手势状态向量,捕捉过程涉及实时优化问题: $$ \min_{\theta} \sum_{t=1}^{T} | \hat{y}_t - y_t |^2 $$ 其中,$\hat{y}_t$ 是预测手势类别,$y_t$ 是真实标签,$\theta$ 为模型参数。静态手势识别局限于离散动作,例如单次点击或固定姿势,而动态手势捕捉则聚焦于连续动作序列,如挥手、抓取或旋
例如,使用卷积神经网络(CNN)模型检测手势关键点: $$ \text{CNN}(I) \rightarrow P(\text{手势类别} | \text{输入图像} I) $$ 其中,$I$ 表示输入图像,$P$ 为预测概率分布。模型训练时需优化损失函数,如交叉熵损失: $$ L = -\sum y_i \log(p_i) $$ 这里,$y_i$ 是真实标签,$p_i$ 是预测概率。Rokid公
以下是一篇基于标题“快速响应:Rokid 手势识别的 AR 交互延迟控制技术解析”的原创高质量文章。文章内容结构清晰,从技术背景、核心原理到实际应用逐步展开,确保原创性和专业性。文章严格避免了“php”、“微信”、“高效”等字眼,聚焦于Rokid在增强现实(AR)交互中的创新技术。
Rokid 的系统采用深度学习模型,能高精度识别多类手势,其识别准确率可表示为: $$accuracy = \frac{TP}{TP + FP + FN}$$ 其中,$TP$ 代表真阳性样本数,$FP$ 为假阳性,$FN$ 为假阴性。在众多交互技术中,手势识别以其直观性和自然性脱颖而出,而 Rokid 作为 AR 领域的先行者,其先进的手势识别系统正为行业标准化注入新活力。例如,Rokid 计划在
例如,在疫情背景下,频繁接触设备表面增加了健康风险。数学上,这可以表示为: $$ P(y|x) = \frac{e^{f(x)}}{\sum_{j} e^{f(x)}} $$ 其中 $P(y|x)$ 是给定输入 $x$ 的类别 $y$ 的概率,$f(x)$ 是模型输出函数。类似地,Magic Leap One 采用手柄辅助,虽然精度较好,但手柄本身成为负担,尤其在移动场景中容易丢失或造成疲劳。Ro
Rokid AR与Unity结合打造高效行业虚实交互方案,通过YodaOS-Master空间计算系统和UXR3.0 SDK降低开发门槛。文章聚焦教育培训和工业辅助两大场景,详细拆解技术实现:利用图像识别触发虚拟模型、手势交互操作系统,结合多模态辅助功能,使抽象知识可视化、可操作。开发流程涵盖从SDK导入到代码实现的完整步骤,突出Rokid AR+Unity在提升交互自然度和场景适配性方面的优势,为
摘要:本文聚焦优必选Walker机器人的AI交互技术,涵盖语音交互、视觉交互和意图理解三大核心模块。语音方面,Walker采用麦克风阵列和回声消除技术处理复杂环境下的语音识别,支持多说话人分离;视觉交互则通过表情识别、手势检测和人体姿态估计实现非语言互动;意图理解结合传统NLU和大语言模型处理显性和隐性意图。文章详解了多模态融合的展厅导览场景,并给出面试准备建议,包括语音信号处理、视觉算法和对话系
Unity 集成大语言模型的框架设计与实现研究 摘要:本研究针对 Unity 游戏开发中大语言模型(LLM)集成存在的接入碎片化、角色一致性差等问题,提出了一套双层架构的解决方案。底层通过策略模式和 ScriptableObject 实现零代码模型切换的统一接入层,上层设计了基于人格四元组的可配置人格资产系统。实验表明,该框架将新增平台接入成本降至零行业务代码,角色一致性 F1 值提升 363.5
从0-1搭建门店导购小星,我把能实时交互的具身 Agent 放进了门店终端我学了 3-4 年后端,去年开始转向 Agent 开发。做过基于 RAG 的问答机器人,也给聊天机器人接过各种模型能力,功能都能跑通,但每次给非技术背景的朋友演示,对方的反应都很一致:哦,一个聊天框。这话不好反驳。任凭背后有多复杂的工具调用链,用户看到的就是一个输入框加一串气泡。放在网页里当客服还算合适,可一旦想把它搬进门店
本文探讨了展厅数字人从单向播报升级为具身交互智能体的关键技术与实现路径。传统数字人常因实时响应不足而沦为"会动的背景板",而真正的价值在于能否像真人讲解员一样接住现场提问。魔珐星云通过参数流架构和端侧解算技术,将AI的认知能力(如DeepSeek大模型生成的回答)转化为可实时交互的3D数字人多模态表达,实现500ms级端到端响应。实战演示了如何通过Vue3+TypeScript技术栈,集成Deep
大模型赋予 AI 推理思考能力,但线下门店想要自然沟通,必须搭载完整具身交互智能,让 AI 拥有具象载体、实时语音、同步神态与双向倾听能力。
错因分析全靠学生自己写。但能做错这道题的学生,往往也说不清自己错在哪——这是错题本最尴尬的死循环。├── public/ # 静态资源│ └── index.html # HTML入口├── src/│ ├── components/ # Vue组件│ │ ├── AvatarContainer.vue # 数字人容器组件│ │ ├── ConnectionControl.vue # 连接控制组件
当健康咨询遇上具身智能,数字人如何既答得准,又说得像真人?本文从真实踩坑出发,拆解小星的这条进化之路。
魔珐星云具身智能3D数字人开放平台 - 全球领先的3D具身智能体基础设施用户提问 / 点击数据卡片→ [检索层] Qwen3-Embedding-8B 语义匹配内容库(同源于大屏数据)→ [生成层] Qwen3-VL 流式生成讲解词→ [净化层] optimizeTextForAvatar 去 markdown/emoji→ [表达层] 魔珐星云的端侧渲染 + 流式 speak(isStart/i
企业数字员工"小慧"通过魔珐星云平台实现从形象展示到可交互岗位的落地,具备7×24小时服务能力。其核心在于构建拟人化交互体系: 岗位身份感:主动自我介绍,通过端侧渲染实现低延迟响应; 知识边界管理:严格限定服务范围(如营养建议、健身指导),避免医疗诊断等越界行为; 具身交互智能:结合倾听、思考、动作反馈等状态机逻辑,支持离线待机以节省成本。 技术实现依托魔珐星云的端侧参数流渲染和Qwen向量知识库
《魔珐星云实战:从AI导购数字人落地看具身交互智能的突破》 摘要:本文通过作者在商场AI导购数字人项目中的实践,揭示了从文本Agent到具身交互智能落地的关键挑战。初期方案因延迟高(2-3秒)、表情僵硬和云渲染成本失控而失败。通过采用魔珐星云平台,项目实现了三大突破:1)端到端响应时间优化至220-510ms(部分场景);2)LAM 3D大模型驱动的自然表情动作;3)端侧渲染显著降低成本。实践表明
AI 的进化,正在从会思考走向能表达、会交流。大模型解决了脑子,具身交互智能解决身体。在门店、展馆、政务、教培这些真实场景里,用户从来不缺信息——缺的是一个能接住对话、跟得上节奏、进得了流程的交互主体。浅层 3D 形象无法等同于完整具身交互智能体,只有依托参数流、端侧渲染整套底层能力,才能让 AI 拥有可面对面沟通的具象载体。如果你的 Agent 项目推理能力达标,但终端用户交互体验生硬,核心短板
摘要:本文探讨了城市展厅中数字人Agent的具身交互智能表达设计。传统数字人仅作为静态旁白,与数据大屏割裂。作者提出三层架构:数据同源(ECharts大屏与内容库同步)、语义理解(Qwen3-Embedding向量检索)、动态讲解(Qwen3-VL多模态生成+文本净化)。核心突破在于引入魔珐星云平台,通过端侧AI渲染与参数流技术,将纯文本Agent转化为可实时交互的3D数字人,实现≤500ms响应
真正做过商场导购大屏后,我才发现数字人落地最难的不是“像不像人”,而是用户站到屏幕前时,它能不能及时回应、自然表达、允许插话,并把商品推荐、价格查询这些业务流程接起来。上一套传统数字人方案里,延迟 2-3 秒、表情僵硬、云渲染成本高,项目很快就撞了墙。后来我拿魔珐星云把这件事重做了一遍,才第一次看到一种更接近落地的解法:官网公开口径给的是“1200ms 以内响应”,而在我这次记录的测试环境里,简单
这篇文章分享了开发健康咨询数字人"小星"的实践经验,重点探讨如何解决AI数字人答非所问的问题。作者发现核心症结在于认知层缺失,导致大模型缺乏专业约束。解决方案包括:1)搭建垂直知识库和向量检索系统,设置相似度阈值过滤不相关信息;2)接入多模态模型实现图文识别;3)采用流式交互技术优化响应速度。文章强调认知层(专业内容)与具身层(表达交互)缺一不可,通过魔珐星云平台实现低延迟的拟
我今年招了一位新员工,叫小慧。她不占工位,不打卡,7×24 小时在岗,形象统一,话术规范,永远不会带着情绪回客户话。更关键的是,员工不是对着一个聊天框查健康知识,也不是看一个传统数字人慢半拍播报,而是在企业终端里和一个能看见、能说话、能反馈状态、能随时接住追问的数字人沟通。
回看整个搭建过程,这个 Demo 完成的并不只是“让 DeepSeek 驱动一个数字人说话”。如果只是将大模型输出接入 TTS,让页面播放一段语音,其实很快就能完成。但那种方案依旧停留在文本问答的延伸形态:模型负责生成,语音负责朗读,屏幕上的形象与整个对话过程没有形成真正的协同。这次接入魔珐星云 SDK 后,DeepSeek 生成的讲解内容能够继续转化为数字人的语音、口型、表情和身体动作;当讲解涉
我上学那会儿,错题本是一本纸质本子:抄题、写正解、偶尔翻翻。工作后做教育产品,我想把“错题本”这件事用 AI 重做一遍——不是做一个会聊天的题库,而是让 Qwen 这类国产大模型的识题、拆解和讲解能力,真正落到一个能看着错题、一步步讲明白的具身交互智能数字人老师上。这个项目里,Qwen 负责多模态理解与讲解生成,魔珐星云依托 AI 端渲、端侧解算和参数流,补齐国产 LLM 的具象交互短板,让学生面
本文展示了如何将DeepSeek大模型的问答能力与魔珐星云3D数字人技术结合,打造出一款低成本、可落地的“垃圾分类智能助手”。
员工早上打开企业内网的健康咨询入口。小慧的 3D 形象出现在屏幕左侧,没有冷冰冰的"请输入问题",而是主动开口:“您好,我是健康咨询小慧,很高兴为您服务!我可以为您提供营养分析、健身指导、亚健康调理和健康知识普及服务。请问有什么可以帮您的?这一句"自我介绍",就是小慧"上岗"的仪式感。它不是被动等用户提问,而是以岗位身份主动开口——具身交互智能体和纯文本对话机器人的核心区分点:拥有拟人服务主动性。
现在大家应该彻底看懂了:为什么说大模型负责动脑,魔珐星云负责落地。DeepSeek、千问这些国产大模型,已经把知识问答、逻辑判断做到极致了,垃圾分类这种知识性问题,对大模型来说根本没难度。但空有知识,只能困在对话框里,冷冰冰的没人看、没人用,根本落不了地。而魔珐星云的具身交互智能,就是给 AI 装上身体、表情和动作,通过 AI 端渲、端侧解算与参数流,把枯燥的文字问答,变成可视化、可交互、有温度、
大模型让 AI 学会了思考,但思考只是第一步。AI 要真正进入线下世界——门店、展厅、医院、学校、酒店、交通枢纽——它必须被看见、被感知、能表达、能互动。具身交互智能不是什么玄学概念,它就是 AI 进入终端的最后一公里。魔珐星云解决的正是这"一公里"的问题:把大模型的思考能力,通过一个AI 具身交互智能体看得见的身体、一张会说话的嘴、一套可实时表达的动作系统,送到用户面前。去魔珐星云注册 → 创建
MANUS Metagloves Pro Haptic 的手部数据采样率为 120 Hz。面对关节角或指尖轨迹中的小幅抖动,很多开发者会直接套用移动平均或低通滤波,却忽略截止频率、相位延迟、边界效应和接触峰值损失。本文介绍 Nyquist 频率、频谱检查、Butterworth 滤波、零相位离线处理、因果实时滤波、导数估计和四元数边界,给出一套适用于动作捕捉、机器人遥操作和科研数据分析的参数验证方
交互
——交互
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net