
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
文章摘要 本文探讨低算力环境下微调与压缩大模型的技术方案,聚焦参数高效微调(PEFT)和知识蒸馏(KD)两大主线。针对全参微调显存消耗大(如7B模型需120GB+)的问题,提出以下解决方案: PEFT:通过LoRA(低秩适配)、QLoRA(4bit量化)等方法,仅训练0.4%参数,显存需求降至24G消费级显卡可承受范围; KD:利用大模型指导小模型,结合On-Policy Distillation

预训练数据采集实战:大模型到底吃什么长大 本文深入解析大模型预训练数据的核心要点。大模型能力主要取决于喂养的语料质量而非架构,预训练数据决定模型下限,数据质量决定上限。训练分三阶段:预训练(万亿token通识教育)、微调(千百万样本岗前培训)和对齐(人类偏好三观塑造)。重点分析了22类常见语料的特性(如书籍长文本连贯、学术数据专业深入、网页数据覆盖广但噪声大),并提供公开数据集获取渠道。核心观点:

本文介绍了一个把掌纹识图做成可复盘流水线的 AI 技能。它针对线下手相师无法追问、手相 App 模板化不分男女、通用大模型幻觉严重三大痛点,采用中西合参、性别独立分流、本地几何可算加云端补标双轨并行的方案,输出有依据、有温度的三幕叙事报告。文章同时坦白了它的局限——非医学、非命运定论,细纹识别有上限,并展望了序列追踪、完全本地化等未来方向。

摘要 本文介绍如何利用IMA零代码平台快速搭建财务制度RAG问答助手,实现财务文档的智能检索与问答。作者通过实际案例展示了从文档准备到系统落地的完整流程,重点包括: 源文档分类整理(报销制度、会计准则、内控手册) 内容结构化处理(条款编号、清晰标题、表格单独存储) IMA平台配置(预设问答模板常驻生效) 质量提升方法(优化源文档而非调整参数) 文章强调IMA已内置完整的RAG流程(文档切片、向量化

这篇文章手把手教小白在 Windows 上装好 DeepSeek Harness(dsh,一个能用浏览器指挥、帮你干活的本地 AI 管家)。核心结论:别在 WorkBuddy 里装(它的沙箱有中文路径乱码 bug、且是临时的),要在自己电脑、纯英文路径、用官方 Node + pnpm 装。全文分四块坑:环境坑:讲清为什么 WorkBuddy 沙箱装不了;技术坑:npm 对 500+ 大依赖树会「假

本文深入浅出地解析了AI应用内存占用的原因及优化策略,并给出了未来AI时代硬件配置建议。主要内容包括: AI应用内存占用高的四大原因:模型权重本体大、推理中间态缓存、后台常驻服务、多会话并发叠加。 针对性优化方案: 量化技术可将模型内存降至1/4 FlashAttention等技术优化KV缓存 改常驻为按需加载 会话瘦身和多任务错峰 DeepSeek Harness等编排工具的内存优化思路与Wor

小样本学习与元学习实战:低数据场景下的高效模型训练 摘要: 本文针对实际业务中常见的小样本场景(如医疗影像、工业缺陷检测、小语种NLP),系统介绍了在低数据条件下训练可用模型的核心方法。文章提出四条关键路径:(1)迁移学习与预训练微调,(2)数据增强技术,(3)小样本学习(包括度量学习、优化学习和模型学习三种范式),(4)主动学习策略。重点解析了Prototypical Networks和MAML

这篇文章介绍了一个解决排版痛点的工具技能,主要功能是将HTML/Markdown内容转换为公众号兼容的格式。文章首先指出了编辑器会丢失复杂样式的问题根源(如div标签被吞),然后介绍了该工具的四大功能:内容获取、格式转换、排版美化和发布前诊断。工具能自动将div转为section、内联CSS样式、渐变降级为实色,并生成预览文件和诊断报告。针对更封闭的平台,还提供了将内容转为图片的解决方案。文章详细

摘要: DeepSeek Harness(DSH)是一种新型AI操作系统层,旨在动态重组AI的工作方式,而不仅仅是优化输出内容。与传统方法(如Prompt、RAG、微调)不同,DSH通过可插拔的组件结构("一切皆插件")和可回退效应机制,让AI能像专家一样调整工作流程、记忆管理和任务编排。其核心创新在于递归式自我改进(RHI),通过细粒度依赖追踪和信用分配,实现AI行为的持续优化。DSH不仅改"答

摘要: DeepSeek Harness(DSH)是一种新型AI操作系统层,旨在动态重组AI的工作方式,而不仅仅是优化输出内容。与传统方法(如Prompt、RAG、微调)不同,DSH通过可插拔的组件结构("一切皆插件")和可回退效应机制,让AI能像专家一样调整工作流程、记忆管理和任务编排。其核心创新在于递归式自我改进(RHI),通过细粒度依赖追踪和信用分配,实现AI行为的持续优化。DSH不仅改"答








