logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

音诺ai翻译机联动ESP32-S3与电容感应提升用户操作体验

音诺AI翻译机通过ESP32-S3与电容感应技术融合,实现非接触式交互升级,提升响应速度与用户体验,支持手势识别、低功耗运行及多模态融合,具备广泛智能硬件应用前景。

AI智能棋盘集成AMS AS3935检测雷击事件

AI智能棋盘集成AS3935闪电传感器,实现雷暴预警与安全响应,提升户外设备环境感知与用户安全保障能力。

vLLM能否作为大模型训练辅助推理工具?

vLLM虽为推理框架,却通过PagedAttention、连续批处理和量化支持,显著加速RLHF、在线评估等训练相关高频推理任务。其高吞吐、低延迟特性大幅提升训练效率,降低资源消耗,成为大模型训练流水线中的关键辅助工具。

#vLLM
如何通过开源大模型博客引流至GPU和Token销售?以Qwen3-14B为例

本文以Qwen3-14B为例,剖析如何通过高质量技术内容吸引用户,并将其转化为GPU租赁和Token订阅的付费客户。核心在于构建‘知识即营销’闭环,利用开源模型的部署门槛与优化服务实现商业变现。

Kotaemon + Docker Compose:一键部署智能问答系统

本文介绍如何结合Kotaemon框架与Docker Compose实现智能问答系统的模块化构建与容器化部署,支持知识注入、多服务协同和生产级运维,提升系统可复现性与可维护性。

EmotiVoice语音合成引擎的微服务架构拆分建议

将EmotiVoice语音合成引擎拆分为文本处理、声音克隆和语音生成三个微服务,结合动态批处理与GPU调度优化,提升系统弹性与稳定性。通过异步分级响应、缓存复用和全链路监控,实现高并发下的低延迟与高质量输出,推动情感化TTS落地生产环境。

私有文档智能问答新选择:Langchain-Chatchat + 大模型Token高效调用

通过Langchain-Chatchat结合RAG架构与国产大模型,企业可在本地高效构建安全可控的智能问答系统。利用向量检索精准定位关键信息,显著降低Token消耗,实测节省超90%成本。支持中文优化、增量更新与离线部署,已在法律、医疗、科研等场景落地应用,助力组织实现数据不出域的智能知识服务。

#RAG
通过Dify实现大模型响应延迟监控与告警机制

借助Dify平台的结构化执行日志,可轻松构建大模型响应延迟监控系统。通过定时拉取API日志,提取耗时、状态、Token量等关键指标,计算P95、均值并触发告警,实现对AI应用性能的精细化观测与主动干预,提升生产环境稳定性。

手机端大模型太耗电?云端TensorRT镜像分流减负

手机运行大模型耗电快、发热严重,体验差。通过将推理任务卸载到云端,利用NVIDIA TensorRT镜像加速,实现高效、低延迟的AI服务。TensorRT通过图优化、精度量化和内核调优显著提升性能,容器化部署则解决了环境依赖问题,支持快速扩展与持续集成,形成轻终端+重云端的智能架构,兼顾效率与稳定性。

PyTorch-CUDA-v2.6镜像在云服务器上的最佳实践配置

PyTorch-CUDA-v2.6镜像为云上AI开发提供开箱即用的环境,避免常见GPU识别与性能问题。掌握其架构原理、Jupyter与SSH两种使用模式,结合实例选型、显存优化与安全配置,可显著提升深度学习研发效率,降低部署成本。

    共 740 条
  • 1
  • 2
  • 3
  • 74
  • 请选择