登录社区云,与社区用户共同成长
邀请您加入社区
在 Agent 系统里,Skill 可以理解为一种可版本化的能力包。它通常以一个目录存在,核心入口是 SKILL.md。这个文件包含元信息和任务指令,也可以配合参考文档、模板、示例和脚本一起使用。按照 Agent Skills 的设计,一个 Skill 大致可以分成三层:第一层是路由层,包括 name、description 和路径,用来帮助 Agent 判断当前任务是否适合调用这个 Skill;
本文详细介绍了Wanda剪枝技术在LLaMA-2 70B大模型上的实战应用,实现零成本模型压缩。通过单次前向传播即可完成剪枝,保留90%以上原始性能,并能在消费级GPU上运行。文章包含环境配置、核心原理、代码实现及性能对比,帮助开发者高效压缩大模型。
7B/13B原生FP16大模型显存占用动辄十几GB,云端推理成本高、本地消费级显卡无法部署。本文基于MIT/CMU顶会论文完整拆解量化、剪枝、蒸馏三大压缩技术数学底层逻辑;通过PyTorch仿真验证量化误差规律,补充AutoAWQ、LLM-Pruner、DistilLlama真实大模型可运行工程代码;
SparseGPT 不是全模型一起优化所有权重,而是逐层处理。第一,收集校准数据在当前层的输入激活。第二,对当前线性层计算近似 Hessian。第三,对该层权重做稀疏剪枝和误差补偿。第四,把剪枝后的输出继续传给下一层。第五,处理下一层。第一,内存可控。如果对整个 175B 模型同时构造二阶信息,完全不可行。逐层处理只需要当前层的激活统计和权重。第二,误差逐层传播更现实。剪完前一层后,后一层看到的是
本文是一份面向ACM/ICPC算法竞赛的C++17模板速查手册,涵盖了竞赛中常用的14大类算法模板与技巧。主要内容包括基础输入输出、数据结构、图论、动态规划、数学、字符串处理等核心算法,以及调试技巧和赛前检查清单。手册采用模块化设计,所有代码基于C++17标准,可直接用于竞赛环境。特别整理了从题面特征到算法选择的速查表,并强调正确性优先于代码美观性的竞赛原则。附有复杂度分析、整数范围提醒等实用内容