
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
OpenAI 的 GPT-Realtime/GPT-Live、Google 的 Gemini Live,以及 Thinking Machines Lab 的 Interaction Models,均围绕实时语音与多模态交互,构建全双工、端到端体系,提升推理、工具调用与响应速度。语音则是一条单通道、强占用的交互媒介。一方面,Front-desk VUI 需要将用户在多轮对话中逐步形成的目标、约束和
我过去在一加、OPPO 和字节跳动工作,做了十几年的产品和设计,主要都是在做消费电子方向。从手机硬件到手机操作系统,再到 AI 应用,加起来做过差不多近 6 亿级别用户规模的产品了。也是在字节的那一段时间,我开始更深入地参与 AI 产品的构建,尤其是多模态相关的探索。我自己的学科背景其实有一点不一样,PhD 研究方向是认知科学。我一直在思考一个问题:人是如何最直觉地理解这个世界的?

当 AI 看得见、听得清,并开始对真实世界做出反应时,5 月 15 日周五,趁着大家都在硅谷参加 SaaStr 大会,在湾区发起了一场开发者与创业者的聚会。这里汇聚了——涵盖多模态大模型、边缘硬件、全球网络与实时生态。这次是第一个全天的硬件&语音 AI 派对:上午探讨实时多模态 AI 和硬件的结合,下午将动手使用 Agora Skills 和 SenseCAP Watcher 从 0 到 1 部署
模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多
实时语音模型不是自己在干所有活。它是持久 Agent 系统里的协调者:听、理解意图、分配任务、引导对话;Worker Thread 拿对应的工具和权限执行具体任务;只有需要用户知道的事件才会用语音反馈。语音开始成为异步工作的控制平台。不只是发 Prompt 的另一种方式。

实时语音模型不是自己在干所有活。它是持久 Agent 系统里的协调者:听、理解意图、分配任务、引导对话;Worker Thread 拿对应的工具和权限执行具体任务;只有需要用户知道的事件才会用语音反馈。语音开始成为异步工作的控制平台。不只是发 Prompt 的另一种方式。

今年是AR应用开发大赛第三届,恰逢Rokid成立十周年,我们推出全新的大赛品牌“Spatial Joy”,引领开发者享受开发乐趣,为其打造充满挑战和惊喜的开发之旅,逐渐成为空间计算时代全球最大AR应用开发大赛。回顾大赛发展,Rokid于2022年9月第一次发起并主办了AR应用开发大赛,去年的第二届大赛有了Unity和声网的加入,成为国内规模和影响力最大的AR开发大赛。“Spatial Joy”努力

我们欢迎更多的小伙伴参与。

主要监控来源:Hacker News、Product Hunt、Reuters AI 版块、Simon Willison 博客-使用 Firecrawl 进行网站内容获取,可以获取网页和 X 等社交平台内容。

模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多







