logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

阿里发布 EchoMimicV2 :从数字脸扩展到数字人 可以通过图片+音频生成半身动画视频

EchoMimicV2 是由阿里蚂蚁集团推出的开源数字人项目,旨在生成高质量的数字人半身动画视频。:EchoMimicV2 能够使用音频剪辑驱动人物的面部表情和身体动作,实现音频与动画的同步。:项目从仅生成头部动画扩展到生成包括上半身的动画。:EchoMimicV2 减少了动画生成过程中所需的复杂条件,让动画制作更为简便。:基于手部姿势序列与音频的结合,生成自然且同步的手势和面部表情。:支持中文和

文章图片
#音视频
PaddleOCR-V6 便携版:把离线文字识别 OCR 装进 U 盘,双击即用

PaddleOCR-V6 便携版摘要: 这是一款完全离线的OCR工具(约140MB),基于PP-OCRv6模型开发,专为Windows设计。其核心优势包括: 即插即用:解压至U盘即可运行,无需安装Python或联网; 隐私保护:所有识别在本地完成,图片不上传; 多场景适配:支持印刷体文字提取,导出JSON/TXT/Markdown/Word等格式; 双模式操作:提供浏览器可视化界面(拖拽识别)和命

文章图片
#文字识别
OpenRouter 39款免费大模型深度评测与选型指南

OpenRouter平台39款免费大模型评测与选型指南 本文基于OpenRouter平台最新数据,对39款免费大模型进行深度评测,覆盖文本、代码、视觉等全场景需求。评测结果显示: 中文创作首选GLM 4.5 Air(语感自然),Trinity系列虽热但不适合创意写作 代码生成推荐Qwen3 Coder 480B(支持92种语言),Gemma系列慎用 视觉理解Qwen3 VL 235B表现最佳,轻量

神仙项目!一键本地搭建AI大模型统一网关,OpenAI/Gemini/Claude全打通

是一款开源的AI模型统一API网关,支持将OpenAI、Gemini、Claude、Grok、千问等主流大模型封装为标准OpenAI API格式,本地一键部署,零成本搭建私有AI接口服务。🔹GitHub地址🔹开源协议:Apache-2.0(完全免费)AIClient2API是我近期用过的最顺手的AI网关工具,开源、免费、功能全。如果你也经常多模型切换、担心API稳定性、或者想本地化部署AI服务

文章图片
#开源软件#github
开源html-video:在笔记本电脑上把 HTML 变成视频的 Agent 元层

摘要 html-video是一个将HTML内容转换为视频的工具,通过AI代理自动选择引擎和模板,实现从内容到MP4视频的一键生成。该项目整合了多种视频引擎(如Hyperframes、Remotion等),支持本地渲染,避免了云端费用和供应商锁定。核心功能包括多帧编排、自动适配不同引擎、14种AI代理调用以及21种预设模板。用户只需提供内容或链接,系统即可自动完成从素材抓取到最终视频渲染的全流程。项

文章图片
#开源#html#AI
FunASR:阿里达摩院开源的工业级语音识别工具包(4 款模型 + Gradio 可视化)

FunASR便携版是一款开箱即用的离线语音识别工具包,整合了阿里达摩院开源的FunASR项目,内置4款主流模型(SenseVoice、Paraformer中英文版和Fun-ASR-Nano),提供OpenAI兼容API和Gradio可视化界面。该便携版最大特点是免配置:自带Python解释器、预装依赖库和预下载模型(约5GB),解压后双击脚本即可启动服务。支持中文场景下的高精度转写,具备情感识别、

文章图片
#开源#语音识别#人工智能
Hermes Agent 桌面版发布!18万Star的AI Agent终于出客户端了(附Windows离线便携包)

2024 年是"AI 对话年",2025 年是"AI Agent 工具爆发年",2026 年开始是“自进化 Agent 普及年”。Hermes Agent 是这条赛道里唯一一个把学习循环做到产品级的开源项目,加上桌面端的发布,基本上把"开箱即用"这块短板补齐了。开发者 → 装 CLI + 桌面端组合效率党 → 直接用桌面端 + 6 平台接入重度用户 → 自建沙箱 + 子 Agent 流水线尝鲜玩家

文章图片
#人工智能
OpenClaw官方:OpenClaw Windows Node 实战(1.5K ★ 开源推荐)

摘要: OpenClaw Windows Node 是一款开源(1.5K ★,MIT协议)的轻量级工具(启动<1s,占用<80MB),可将Windows设备转化为AI Agent的可控节点。支持x64/ARM64架构,通过WebSocket实现远程控制,提供截屏、摄像头拍照、语音播报、命令执行等功能,并采用Ed25519加密保障安全。其亮点包括极简性能、6步向导开箱即用、一站式诊断中心及跨平台控制

文章图片
#windows#开源#github
Hallo 2:通过单张图像与音频生成1小时4K分辨率人像视频的人工智能技术解析

Hallo 2是一种全新的人工智能视频生成技术,它突破了传统视频生成的限制。与依赖大量视频素材或复杂动画的方式不同,Hallo 2只需要一张图像和一段音频输入,便能生成高质量、时长可达一小时的4K分辨率人像视频。这为包括虚拟主播、影视制作、广告等多个行业提供了极大的便利。Hallo 2技术的出现,无疑是视频生成领域的一次重大革新。它不仅能够通过单张图像和音频生成长达一小时的4K分辨率人像视频,还极

文章图片
#音视频#人工智能
FunASR:阿里达摩院开源的工业级语音识别工具包(4 款模型 + Gradio 可视化)

FunASR便携版是一款开箱即用的离线语音识别工具包,整合了阿里达摩院开源的FunASR项目,内置4款主流模型(SenseVoice、Paraformer中英文版和Fun-ASR-Nano),提供OpenAI兼容API和Gradio可视化界面。该便携版最大特点是免配置:自带Python解释器、预装依赖库和预下载模型(约5GB),解压后双击脚本即可启动服务。支持中文场景下的高精度转写,具备情感识别、

文章图片
#开源#语音识别#人工智能
    共 45 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择