logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Noiz AI 发布实时可交互音视频世界模型 HelixWorld,支持 48kHz 立体声;FireRedTeam 开源 FireRedTTS3,支持语义与声学编辑丨日报

已接入 TTS、Voice Cloning、Voice Conversion、ASR、Forced Alignment、VAD、Speaker Diarization、Audio Codec、Source Separation、Music/SFX Generation 等任务。FireRedTTS3-Base 支持英语、中文、日语、韩语、法语、西班牙语等 24 种语言,并覆盖四川、上海、闽南、温州

#人工智能#音视频
清华桌面机器人团队 CyboPal 融资数亿元;Wispr Flow B 轮融资估值 20 亿美元,将发布自研语音识别模型丨日报

英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。自己推荐的信源、项目、话题、活动等;CyboPal 由 90 后清华博士彭天放带队,核心成员来自机器人、自动驾驶、大厂 AI、供应链和

#机器人#语音识别#人工智能
清华桌面机器人团队 CyboPal 融资数亿元;Wispr Flow B 轮融资估值 20 亿美元,将发布自研语音识别模型丨日报

英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。自己推荐的信源、项目、话题、活动等;CyboPal 由 90 后清华博士彭天放带队,核心成员来自机器人、自动驾驶、大厂 AI、供应链和

#机器人#语音识别#人工智能
一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点丨Voice Agent 学习笔记

桌面上的 SKI、Qwen-Audio-Agent、Zoku 还假设人至少在电脑附近,拥有 4G 网络的 Disbrief 则把同样的问题带到了走路、通勤和离开屏幕之后:多个 Agent 继续在后台工作,人通过语音保持联系。前台的对话不断流动,后台的任务也在持续推进,两者同时发生,却互不阻塞。,做法很直接:不自己做 Coding Agent,而是连接 Claude Code、Codex、Curso

#学习#人工智能
活动报名:来 Agentopia,对话 AI,也对话彼此 丨RTE 社区将参加亚马逊云科技中国峰会,6 月 23-24 日

无论是最近刚学到的新技术、正在琢磨的新产品,还是开发过程中遇到的一些好玩的坑,我们都很想听。这次,RTE 开发者社区也会在现场,我们会在一个充满探索感的开发者冒险空间——「Agentopia」等大家!为了这次见面,我们还特意准备了专属的「建造卡片」和「成长卡片」。不管你正在搭建什么,这两套卡片都能帮你记录下当下的状态和想法,陪伴你更好地 build and grow。带上你的好奇心,来找我们聊聊吧

#人工智能#实时互动#科技
Typeless 们的爆火只是开始:为什么 Voice Agent 需要专属的 Skill 与 Harness?丨社区来稿

有时候,明明想说件事,但就是不知道怎么打出来。不是不会打字,是你发现,要把一个模糊的想法变成一段清晰的文字,你得先在脑子里想清楚,再组织语言,再检查一遍,最后才敢按回车。面对输入框发呆的那几秒钟,你做的不是提问,而是编辑和预演。这种费劲的感觉,不是你的问题,是。

#人工智能
OpenAI 揭秘 GPT-Live 全双工流式架构,WARP 显著降低 WebRTC 启动延迟;腾讯混元 Hy ASR 3.0 发布:支持上下文纠错与方言识别丨日报

R1 集成摄像头、语音 AI 和视觉识别能力,针对跑步、骑行和户外活动设计,支持第一视角记录与免手操作交互。Disclosure、Audit Log 成为基础组件,企业部署语音智能体时,需要在实时语音链路中加入 AI 身份提示、交互记录和合成音频标记能力,使透明度要求成为运行时能力,而非上线后的人工流程。:TaoMate 在生成过程中保留不可变的视觉锚点,同时将已生成的视频和音频片段压缩为固定容量

#架构#webrtc
Agent-VUI 设计:写在语音智能体的「ChatGPT 时刻」前夜|Voice Agent 学习笔记

OpenAI 的 GPT-Realtime/GPT-Live、Google 的 Gemini Live,以及 Thinking Machines Lab 的 Interaction Models,均围绕实时语音与多模态交互,构建全双工、端到端体系,提升推理、工具调用与响应速度。语音则是一条单通道、强占用的交互媒介。一方面,Front-desk VUI 需要将用户在多轮对话中逐步形成的目标、约束和

#学习
一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点丨Voice Agent 学习笔记

桌面上的 SKI、Qwen-Audio-Agent、Zoku 还假设人至少在电脑附近,拥有 4G 网络的 Disbrief 则把同样的问题带到了走路、通勤和离开屏幕之后:多个 Agent 继续在后台工作,人通过语音保持联系。前台的对话不断流动,后台的任务也在持续推进,两者同时发生,却互不阻塞。,做法很直接:不自己做 Coding Agent,而是连接 Claude Code、Codex、Curso

#学习#人工智能
    共 360 条
  • 1
  • 2
  • 3
  • 36
  • 请选择