logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

sam3 提示词 图片分割和视频分割 docker 懒人整合包

因为win兼容性问题,改为docker懒人包第一次把镜像打包了,一些第三方依赖不在,依旧报错第二次才把带环境的容器打包,这样一个极简的可以正常的工作的docker懒人包就制作完成在win上使用这个懒人包,默认是安装了wsl2和docker桌面,以及可以docker正常使用win的gpu也默认用户是了解使用docker的基本命令,比如docker compose启动和停止。

文章图片
#docker#容器#运维
Qwen3 ASR 流式转写 Docker 懒人整合包

本文是第二个docker懒人包,依旧是win兼容问题,不得不用docker这个懒人包有40GB左右,在docker容器里,环境依赖和模型都在,界面为官方的流式demo同样的,要么在linux上使用(x86),要么在win上使用wsl2和docker桌面版,目前不支持mac arm。

文章图片
#docker#eureka#容器
OpenDataLoader 开源 PDF 解析工具 懒人整合包

是一个面向 AI 文档处理的开源 PDF 解析工具(由 Hancom 相关团队开源维护)。它的核心使命是将 PDF 等非结构化文档,精准地转换为最适合大语言模型(LLM)和 RAG(检索增强生成)系统读取的结构化数据(如 Markdown、JSON、HTML)。核心定位PDF→→→→RAG 知识库 / AI Agent 输入。

文章图片
Vosk:开源离线语音识别 懒人整合包

Vosk 的核心价值在于完全离线 + CPU 友好 + 实时流式输出。对于预算有限、硬件低配、或是对隐私有极致要求的本地化 AI 项目,它依然是目前最实用的基石之一。

文章图片
#开源#语音识别#人工智能
边缘端语音全能王 sherpa-onnx 懒人整合包

Sherpa-ONNX:全栈离线语音AI解决方案 Sherpa-ONNX是基于ONNX Runtime的高性能离线语音推理框架,由Next-gen Kaldi团队开发,支持语音识别(ASR)、语音合成(TTS)、语音唤醒(KWS)和说话人识别(Speaker ID)。其核心优势在于完全脱离云端依赖,可在CPU或低功耗ARM设备(如树莓派)上高效运行,支持多平台(Windows/Linux/macO

文章图片
#人工智能
3个免费开源的项目管理/甘特图软件

原文链接:https://dsx2016.com/?p=1634公众号:大师兄2016软件支持中文无需注册客户端跨平台GanttProject✔️✔️✔️✔️TeamGantt❌❌❌✔️ProjectLibre✔️✔️✔️✔️NO.1 GanttProject官网地址https://www.ganttproject.biz/特点.

#甘特图
Qwen3-ASR 1.7B 音频转字幕 懒人整合包

Qwen3-ASR提供0.6B和1.7B两个语音识别模型版本。0.6B版本主打高效低延迟,适合边缘设备和实时场景,具有极快推理速度(~92ms首字响应)和低显存需求。1.7B版本则在准确率上达到SOTA水平,尤其在噪声环境、方言和长语音处理方面表现优异,但需要更强算力支持。两者均支持52种语言识别,开发者可根据业务需求选择:效率优先选0.6B,精度优先选1.7B。使用懒人包可快速体验,但需注意30

文章图片
#人工智能#音视频#算法
Qwen3-ASR 多语言语音音乐歌曲识别 懒人整合包 重新安装

从之前的fastapi转gradio界面,已经重新打包了3个左右的懒人包核心是为了把编程api转为可视化操作交互网页,更加方便,同时也是为了重新优化项目结构,方便后续更改和优化,比如添加python依赖和添加其他界面功能如果不重新制作懒人包结构,那么后面要做改动,会花费10倍的时间也达不到一个预期的效果,重新制作后,可能几分钟半小时就能大改版现在fastapi的界面几乎没了,开始第二阶段,就是把之

文章图片
#人工智能
qwen3-tts 文字转语音 懒人整合包

Qwen3-TTS是团队开发的开源语音合成模型系列,支持多音色、多语种与多方言的语音生成懒人包界面注意,建议显存8GB以上下载并解压懒人包,点击一键启动WebUi.bat等待终端执行执行成功后会自动打开网页网页为https,因为证书问题,需要点击高级,运行,才能正常访问界面本文只演示声音设计比如声音描述为甜美的萝莉音或者可爱的小孩音,都行,声音会按描述的内容生成生成后可以点击试听或者下载目前语音克

文章图片
Qwen_ImageEdit_2511 图片多角度 分镜 懒人整合包

Qwen-Image-Edit-2511 是阿里通义千问团队推出的一个开源图像编辑模型,属于 Qwen-Image 系列中的“编辑(Image Editing)”版本。它的核心定位非常明确:专注于基于文本指令修改图片。简单理解:它 = “比 Stable Diffusion 更擅长改图、而不是单纯生成图”的模型。Qwen-Image-Edit-2511 = 当前开源里“最强调一致性和可控编辑”的图

文章图片
#人工智能
    共 46 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择