logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Agent-VUI 设计:写在语音智能体的「ChatGPT 时刻」前夜|Voice Agent 学习笔记

OpenAI 的 GPT-Realtime/GPT-Live、Google 的 Gemini Live,以及 Thinking Machines Lab 的 Interaction Models,均围绕实时语音与多模态交互,构建全双工、端到端体系,提升推理、工具调用与响应速度。语音则是一条单通道、强占用的交互媒介。一方面,Front-desk VUI 需要将用户在多轮对话中逐步形成的目标、约束和

#学习
想找到 AI 的下个入口?先看看「视觉驱动」的新一代,是怎么用 Visual Agent 看世界的丨Physical AI 学习笔记

我过去在一加、OPPO 和字节跳动工作,做了十几年的产品和设计,主要都是在做消费电子方向。从手机硬件到手机操作系统,再到 AI 应用,加起来做过差不多近 6 亿级别用户规模的产品了。也是在字节的那一段时间,我开始更深入地参与 AI 产品的构建,尤其是多模态相关的探索。我自己的学科背景其实有一点不一样,PhD 研究方向是认知科学。我一直在思考一个问题:人是如何最直觉地理解这个世界的?

文章图片
#人工智能#学习
走,去硅谷造 AI 硬件(并卖出去)丨活动招募:Physical AI Camp 硅谷站

当 AI 看得见、听得清,并开始对真实世界做出反应时,5 月 15 日周五,趁着大家都在硅谷参加 SaaStr 大会,在湾区发起了一场开发者与创业者的聚会。这里汇聚了——涵盖多模态大模型、边缘硬件、全球网络与实时生态。这次是第一个全天的硬件&语音 AI 派对:上午探讨实时多模态 AI 和硬件的结合,下午将动手使用 Agora Skills 和 SenseCAP Watcher 从 0 到 1 部署

#人工智能
Friend 发布第二代 AI 陪伴项链:限制用户修改 AI 名字和音色,随机分配人格;Qwen-Audio-3.0-ASR-Flash 发布:长音频上下文记忆 丨日报

模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多

#人工智能#音视频
全网首拆 ChatGPT Voice for Codex 安装包:当语音成为 Coding Agent 的下一代实时交互入口丨Voice Agent 学习笔记

实时语音模型不是自己在干所有活。它是持久 Agent 系统里的协调者:听、理解意图、分配任务、引导对话;Worker Thread 拿对应的工具和权限执行具体任务;只有需要用户知道的事件才会用语音反馈。语音开始成为异步工作的控制平台。不只是发 Prompt 的另一种方式。

文章图片
#交互#学习
全网首拆 ChatGPT Voice for Codex 安装包:当语音成为 Coding Agent 的下一代实时交互入口丨Voice Agent 学习笔记

实时语音模型不是自己在干所有活。它是持久 Agent 系统里的协调者:听、理解意图、分配任务、引导对话;Worker Thread 拿对应的工具和权限执行具体任务;只有需要用户知道的事件才会用语音反馈。语音开始成为异步工作的控制平台。不只是发 Prompt 的另一种方式。

文章图片
#交互#学习
奖金高达 110 万元,Spatial Joy 2024 全球 AR 应用开发大赛启动

今年是AR应用开发大赛第三届,恰逢Rokid成立十周年,我们推出全新的大赛品牌“Spatial Joy”,引领开发者享受开发乐趣,为其打造充满挑战和惊喜的开发之旅,逐渐成为空间计算时代全球最大AR应用开发大赛。回顾大赛发展,Rokid于2022年9月第一次发起并主办了AR应用开发大赛,去年的第二届大赛有了Unity和声网的加入,成为国内规模和影响力最大的AR开发大赛。“Spatial Joy”努力

文章图片
#ar
Rokid Glasses AR 眼镜发布,搭载通义 AI;3D 社交平台 SEELE 完成千万美元融资丨RTE 开发者日报

主要监控来源:Hacker News、Product Hunt、Reuters AI 版块、Simon Willison 博客-使用 Firecrawl 进行网站内容获取,可以获取网页和 X 等社交平台内容。

文章图片
#人工智能#ar#3d
Friend 发布第二代 AI 陪伴项链:限制用户修改 AI 名字和音色,随机分配人格;Qwen-Audio-3.0-ASR-Flash 发布:长音频上下文记忆 丨日报

模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多

#人工智能#音视频
    共 380 条
  • 1
  • 2
  • 3
  • 38
  • 请选择