
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
BFS是一套基于LTX的视频换脸流程,通过持续注入参考脸实现高一致性与稳定生成。

摘要:本文测试了多个 Gemma4 模型在原版llama.cpp支持MTP(Multi-Token Prediction)后的性能表现。各个规模的模型均有提升,有些模型提升挺大的,值得使用。

VoxCPM 2.0是一款支持多语言/方言的语音合成系统,相比1.x版本在音质和功能上有显著提升。同时资源占用也大了些。

我们的国产化们:panweiDB,openGauss,Postgres。GoldenDB,mySQL……

本地大模型部署评测报告 本文对比测试了Qwen和Gemma系列模型在本地环境(i9-12900F/RTX4060Ti/64GB)下的表现。通过llama.cpp框架评测了7款量化模型,重点考察了RAG能力和视觉识别表现。

这篇文章重点讲解了如何通过LlamaIndex实现向量数据库的抽象统一和数据处理流程。作者强调了调试模式的重要性,建议在正式入库前先人工检查node质量,包括metadata完整性、文本长度合理性等。文章详细说明了初始化向量数据库、构建文档node、统计分析metadata以及观察最大最小node等关键步骤,并指出这些预处理工作能有效避免后续检索质量问题。整个工具设计注重灵活性和可维护性,支持多种

本文实测了Gemma-4-26B模型在多token预测(MTP)技术下的性能表现。通过ik_llama.cpp分支测试发现,当显存不足24GB时,MTP加速效果受限:在4060Ti显卡(16GB显存)上运行会触发共享显存机制,导致生成速度反而降至3分44秒,远慢于原版llama.cpp的1分34秒。测试数据显示,MTP技术虽在理想条件下可实现2倍加速(如作者测试的49t/s),但实际应用中显存容量

官方llama.cpp现已支持MTP模型,无需单独draft模型。使用最新二进制程序和Qwen3.6-35B-A3B-UD-IQ2_M.gguf模型,通过添加--spec-type draft-mtp和--spec-draft-n-max 2参数可显著提升推理速度。测试显示,关闭推理模式后,RAG性能接近在线LLM,生成速度大幅提升(draft接受率达88.6%)。建议显存充足的用户尝试MTP优化

实测MOE模型加MTP的速度比较可观。而 beellama 的 DFlash 存在重复字符循环问题,接受率和生成速度可能被异常放大,关于DFlash部分速度的结果,暂不具备参考价值。

本文对比测试了本地部署的Qwen和Gemma语言模型在工具调用任务中的表现。通过理论评测和实际场景测试发现: 当前本地小模型已能较好地自主调用工具,展现了本地模型应用的可能性。








