
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文通俗解释了大模型量化技术,重点解析了int4、Q4、Q8等常见术语的含义。量化通过将模型参数从高精度浮点数(如FP16)转换为低位整数(如4位),显著减小模型体积和运行资源需求。例如27B模型从FP16的54GB缩减到int4约13.5GB,使普通电脑也能运行大模型。文章对比了不同量化级别的特点:Q4最节省资源但精度损失较大,Q8更接近原模型质量,并给出了量化版本选择建议。量化虽会带来一定精度

大模型知识库(RAG)构建实践:FastGPT/Dify/RAGFlow选型指南 本文针对企业内部专业知识库(如电力市场)的智能客服场景,分析三大开源RAG工具的选型策略。核心选型维度包括:文档解析能力(PDF/Word/Excel等复杂格式)、检索质量(混合检索/重排)、引用溯源、权限管理和部署成本。FastGPT适合快速搭建可用服务,Dify擅长长期平台化迭代,RAGFlow专精复杂文档理解与

摘要:openclaw-termux项目将OpenClaw AI Gateway移植到Android设备,提供Flutter App和Termux CLI两种使用方式。该项目通过proot-distro运行Ubuntu用户态环境,集成Node.js和OpenClaw,解决了Android上环境配置复杂、操作分散等问题。Flutter App提供可视化仪表盘、日志查看和手机能力调用功能,Termux

本文记录了将draw.io的MCP功能接入VS Code Codex并生成带动画连接器的LSTM架构图的全过程。测试证实:1) MCP服务器可在VS Code中正常运行;2) 生成的图表是真正的draw.io工程文件而非静态图片;3) 动画连接器等复杂效果能完整保留到导出的SVG文件中。文章详细介绍了配置方法、技术实现原理以及最终的测试结果,验证了AI直接生成可编辑、可交付的专业图表的可行性。

上一篇我们讲了 Tool Use——让 LLM 能「调工具」。让 LLM 自主完成多步任务——也就是Agent。2025-2026 业界普遍把这两年称为「Agent 元年」。Claude 4 / GPT-5 / o3 推理能力突破→ 多步规划可靠Tool Use 标准化(MCP)→ 工具生态成熟Cursor / Devin / Manus 等爆款→ 验证商业价值→ 突破纯文字交互但 Agent 应

前两篇我们聊的都是「企业级部署」——vLLM、SGLang、TensorRT-LLM,动辄需要 H100 集群。这一篇我们换个视角,聊本地化部署——也就是在自己笔记本、台式机、小型服务器上跑大模型。为什么这件事在 2026 年仍然重要?✓ 数据隐私:金融、医疗、法律团队不允许数据出域✓ 离线可用:飞机上、地铁里、内网环境也要能用✓ 零成本试错:开发期不想花 API 费用✓ 端侧应用:手机、PC 本

Codex 诊断日志高频写入 SSD 问题及解决方案 摘要:Codex 客户端存在一个严重问题,其诊断日志会持续高频写入本地 SQLite 数据库(logs_2.sqlite及相关文件),导致SSD写入量异常增大。有用户报告21天内产生约37TB写入,年化可达640TB,接近消费级SSD的寿命极限。该问题主要影响诊断日志而非用户对话历史。 解决方案: 检查是否受影响:查看日志文件大小及内容,确认T

文章摘要 本文深度解析MoE(混合专家)架构,揭示其在DeepSeek、Mixtral等模型中的关键作用。MoE通过稀疏激活机制实现高效计算:将FFN层拆分为多个专家,每个token仅激活部分专家(如DeepSeek V3激活9/256专家),从而以37B激活参数实现671B模型容量。相比Dense模型,MoE在训练/推理算力节省方面优势显著,但显存需求更高且复杂度提升。文章详细解析了路由机制、负

系列前 33 篇我们讲的都是技术——架构、训练、部署、应用。这一篇换个视角,聊产业开源大模型 vs 闭源大模型,谁会赢?这个问题没有标准答案,但 2026 年的格局已经比 2023 年清晰得多。2022.11 ChatGPT ── 闭源开局2023.02 LLaMA-1 ── 开源被迫加入2023.07 Llama 2 ── 商用开源2024.03 Claude 3 / GPT-4 Turbo ─

本文通俗解释了大模型量化技术,重点解析了int4、Q4、Q8等常见术语的含义。量化通过将模型参数从高精度浮点数(如FP16)转换为低位整数(如4位),显著减小模型体积和运行资源需求。例如27B模型从FP16的54GB缩减到int4约13.5GB,使普通电脑也能运行大模型。文章对比了不同量化级别的特点:Q4最节省资源但精度损失较大,Q8更接近原模型质量,并给出了量化版本选择建议。量化虽会带来一定精度








