logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Cocos Creator WebSocket 实战:从连接到优化的完整指南

把 WebSocket 塞进 Cocos Creator 只是起点:帧同步、预测回滚、LOD 网络、服务器帧率……多人实时每往下走一步,都会冒出更细的挑战。你可以试着把这套 NetManager 移植到微信小游戏的小程序环境,或者把 protobuf 换成 FlatBuffers 做零拷贝,甚至用 WebWorker 把解码线程独立出来。当延迟 <16 ms、掉线率 <1% 时,玩家才会真正觉得“

从零构建AI语音聊天Demo:技术选型与实战避坑指南

基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通 ASR(语音识别)→ LLM(大脑思考)→ TTS(语音合成)的完整 WebSocket 链路。对于想要掌握 AI 原生应用架构的同学来说,这是个绝佳的练手项目。架构理解:掌握实时语音应用的完整技术链路(ASR→LLM→TTS)技能提升:学会申请、配置与调用火山引擎AI服务定制能力:通过代码修改自定义角色性

ChatTTS音色克隆实战:从零构建个性化语音合成系统

本文针对开发者快速实现个性化语音合成的需求,详细解析ChatTTS音色克隆技术的核心原理与实现方案。通过PyTorch实战演示,你将掌握声学特征提取、对抗训练等关键技术,并学习如何避免数据偏差和过拟合问题。最终可部署具备自然音色的实时语音合成系统,支持自定义音色库管理。

Android FunASR 入门指南:从零搭建语音识别应用

基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通 ASR(语音识别)→ LLM(大脑思考)→ TTS(语音合成)的完整 WebSocket 链路。对于想要掌握 AI 原生应用架构的同学来说,这是个绝佳的练手项目。架构理解:掌握实时语音应用的完整技术链路(ASR→LLM→TTS)技能提升:学会申请、配置与调用火山引擎AI服务定制能力:通过代码修改自定义角色性

AI语音交互开发实战:从零构建高可用语音处理流水线

基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通 ASR(语音识别)→ LLM(大脑思考)→ TTS(语音合成)的完整 WebSocket 链路。对于想要掌握 AI 原生应用架构的同学来说,这是个绝佳的练手项目。架构理解:掌握实时语音应用的完整技术链路(ASR→LLM→TTS)技能提升:学会申请、配置与调用火山引擎AI服务定制能力:通过代码修改自定义角色性

Ollama Auth Token 实战指南:从零构建安全的 Anything LLM 身份验证

基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通 ASR(语音识别)→ LLM(大脑思考)→ TTS(语音合成)的完整 WebSocket 链路。对于想要掌握 AI 原生应用架构的同学来说,这是个绝佳的练手项目。架构理解:掌握实时语音应用的完整技术链路(ASR→LLM→TTS)技能提升:学会申请、配置与调用火山引擎AI服务定制能力:通过代码修改自定义角色性

Android Launcher语音交互实战:基于AI辅助开发的架构设计与实现

基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通 ASR(语音识别)→ LLM(大脑思考)→ TTS(语音合成)的完整 WebSocket 链路。对于想要掌握 AI 原生应用架构的同学来说,这是个绝佳的练手项目。架构理解:掌握实时语音应用的完整技术链路(ASR→LLM→TTS)技能提升:学会申请、配置与调用火山引擎AI服务定制能力:通过代码修改自定义角色性

Android 接入 ChatTTS 实战指南:从零开始实现语音合成

通过本文介绍的方法,你应该已经能够在 Android 应用中实现高质量的语音合成功能。如果想进一步探索 AI 语音交互的可能性,可以尝试从0打造个人豆包实时通话AI实验,那里提供了从语音识别到智能对话的完整实现方案。在实际开发中,建议多进行真机测试,不同设备的表现可能会有差异,持续优化才能获得最佳用户体验。基于火山引擎豆包大模型,从零搭建一个实时语音通话应用。它不是简单的问答,而是需要你亲手打通

用Unity做一个有语音交互的有场景的毕设作品:从技术选型到完整实现

用Unity做一个有语音交互的有场景的毕设作品:从技术选型到完整实现摘要:许多学生在毕业设计中希望集成语音交互与3D场景,但常因缺乏端到端方案而陷入碎片化尝试。本文基于Unity引擎,结合本地/云端ASR与TTS服务,构建一个低延迟、可部署的语音交互系统。通过模块化解耦设计,实现语音指令识别、语义解析与场景响应联动,并提供完整代码结构与性能优化建议,帮助开发者高效完成具备真实交互能力的毕设作品。

ComfyUI 与 ChatTTS 实战:从零构建语音合成工作流

ComfyUI 把 Stable Diffusion 的“节点式”玩法带到语音领域,再接入专为对话场景微调的 ChatTTS,正好把“环境+流程+生产”串成一条可拖拽的透明管线,让入门门槛瞬间降到“会点 Python 就能玩”。语音合成(TTS)早已不是“朗读文本”这么简单:短视频自动配音、客服机器人、有声书批量生产,甚至游戏 NPC 的实时对话,都在把“秒级、低成本、高自然度”的语音当成刚需。先

    共 86 条
  • 1
  • 2
  • 3
  • 9
  • 请选择