logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

过去换脸现在换头?ComfyUI+LTX2.3+BFS In Context LoRA

BFS是一套基于LTX的视频换脸流程,通过持续注入参考脸实现高一致性与稳定生成。

文章图片
#ComfyUI
继续提速:Llama.cpp 已经正式支持 Gemma4 MTP

摘要:本文测试了多个 Gemma4 模型在原版llama.cpp支持MTP(Multi-Token Prediction)后的性能表现。各个规模的模型均有提升,有些模型提升挺大的,值得使用。

文章图片
声音克隆开源项目VoxCPM

VoxCPM 2.0是一款支持多语言/方言的语音合成系统,相比1.x版本在音质和功能上有显著提升。同时资源占用也大了些。

文章图片
#开源
用docker方式安装openGauss数据库的事项记录

我们的国产化们:panweiDB,openGauss,Postgres。GoldenDB,mySQL……

文章图片
#docker#数据库#容器
本地跑LLM模型哪家强:Qwen3.5+3.6 vs Gemma4 的个人实测

本地大模型部署评测报告 本文对比测试了Qwen和Gemma系列模型在本地环境(i9-12900F/RTX4060Ti/64GB)下的表现。通过llama.cpp框架评测了7款量化模型,重点考察了RAG能力和视觉识别表现。

文章图片
企业知识库RAG到底有多难:实战3:向量化与存储

这篇文章重点讲解了如何通过LlamaIndex实现向量数据库的抽象统一和数据处理流程。作者强调了调试模式的重要性,建议在正式入库前先人工检查node质量,包括metadata完整性、文本长度合理性等。文章详细说明了初始化向量数据库、构建文档node、统计分析metadata以及观察最大最小node等关键步骤,并指出这些预处理工作能有效避免后续检索质量问题。整个工具设计注重灵活性和可维护性,支持多种

文章图片
#RAG
记一次失败的本地部署 LLM MTP 模型的过程

本文实测了Gemma-4-26B模型在多token预测(MTP)技术下的性能表现。通过ik_llama.cpp分支测试发现,当显存不足24GB时,MTP加速效果受限:在4060Ti显卡(16GB显存)上运行会触发共享显存机制,导致生成速度反而降至3分44秒,远慢于原版llama.cpp的1分34秒。测试数据显示,MTP技术虽在理想条件下可实现2倍加速(如作者测试的49t/s),但实际应用中显存容量

文章图片
记一次成功的本地部署 LLM MTP 模型的过程

官方llama.cpp现已支持MTP模型,无需单独draft模型。使用最新二进制程序和Qwen3.6-35B-A3B-UD-IQ2_M.gguf模型,通过添加--spec-type draft-mtp和--spec-draft-n-max 2参数可显著提升推理速度。测试显示,关闭推理模式后,RAG性能接近在线LLM,生成速度大幅提升(draft接受率达88.6%)。建议显存充足的用户尝试MTP优化

文章图片
#RAG
到底谁更快:MTP 对比 DFlash:英文居然最重要?

实测MOE模型加MTP的速度比较可观。而 beellama 的 DFlash 存在重复字符循环问题,接受率和生成速度可能被异常放大,关于DFlash部分速度的结果,暂不具备参考价值。

文章图片
本地模型都这么强了?16GB级别LLM工具能力不完全体验

本文对比测试了本地部署的Qwen和Gemma语言模型在工具调用任务中的表现。通过理论评测和实际场景测试发现: 当前本地小模型已能较好地自主调用工具,展现了本地模型应用的可能性。

文章图片
    共 83 条
  • 1
  • 2
  • 3
  • 9
  • 请选择