logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Agent 帮我写 CUDA:一个 Softmax Attention 算子的开发全记录

本文介绍了在GTX 1660 Ti GPU上开发Softmax Attention算子的四步优化过程,并探讨了AI辅助开发的价值。文章首先从Naive版本开始,通过Agent生成基础CUDA代码实现功能;随后分析瓶颈,引入Tiled版本利用共享内存减少显存访问;再通过向量化加载和填充优化进一步提升性能。整个开发过程采用人机协作模式:Agent负责代码生成、性能分析和优化建议,开发者负责需求定义、代

Agent 帮我写 CUDA(续):当 Self-Attention 遇上 Causal Mask 和 Cross-Attention

本文基于前文开发的CUDA Attention算子,进一步扩展其功能以支持实际应用场景。主要内容包括: 问题分析:原算子仅支持简单场景,无法处理因果掩码和交叉注意力; 功能实现: 通过修改计算循环支持因果掩码,使decoder自回归生成时只能看到历史信息 拆分Q和K/V的全局偏移量计算,支持Q与K/V不等长的交叉注意力场景 性能验证:新算子(VecFused)在保持原有性能的同时: 正确性测试全部

Agent 不是工具调用器——理解 Agent 的工作机制

本文通过150行Python代码拆解了一个最小Agent系统的核心机制:当用户提问"查KV Cache优化方法"时,Agent会经历多轮循环处理。关键环节包括:1)System Prompt将普通LLM转化为Agent,定义工具使用规则;2)自然语言描述工具功能,引导模型正确调用;3)循环执行"思考-行动-观察"流程,通过JSON交互实现工具调用;4)模型基于知识完备性自主决策是否调用工具。整个过

#人工智能
Agent 不是工具调用器——理解 Agent 的工作机制

本文通过150行Python代码拆解了一个最小Agent系统的核心机制:当用户提问"查KV Cache优化方法"时,Agent会经历多轮循环处理。关键环节包括:1)System Prompt将普通LLM转化为Agent,定义工具使用规则;2)自然语言描述工具功能,引导模型正确调用;3)循环执行"思考-行动-观察"流程,通过JSON交互实现工具调用;4)模型基于知识完备性自主决策是否调用工具。整个过

#人工智能
Kimi K3 技术分析——2.8T 参数的 MoE 猛兽,到底有多强?

摘要: Moonshot AI于2026年7月16日发布Kimi K3模型,参数规模达2.8万亿(MoE架构,896专家,每token激活16个),支持100万token上下文,并计划7月27日前开源。其核心创新Kimi Delta Attention(KDA)显著降低KV Cache需求(压缩12.5倍),提升解码速度6.3倍。评测显示K3综合能力位列全球第三,仅次于Claude Fable 5

GLM-5.2 推理数据流——70 亿行代码里发生了什么?

本文解析了GLM-5.2大模型的推理数据流,重点拆解其核心架构与计算过程。GLM-5.2是智谱AI开源的744B参数MoE模型,采用MIT协议,支持1M上下文长度。模型包含78层(前3层Dense MLP+后75层MoE),关键组件包括:1)MLA低秩压缩注意力机制,将KV Cache缩小16倍;2)DSA稀疏注意力配合IndexShare优化,使1M上下文的计算量降低2.9倍;3)MoE结构含2

DeepSeek V4-Pro 推理数据流——三层注意力 + Hyper-Connections 详解

DeepSeek V4-Pro架构解析 本文深入剖析了当前最复杂的开源MoE模型之一——DeepSeek V4-Pro(1.6T参数/49B激活)的推理架构。该模型通过三层混合注意力(滑动窗口+CSA+HCA)、Hyper-Connections替代残差、FP4专家等设计,实现了极致的工程优化。与GLM-5.2对比,V4-Pro在注意力机制、KV Cache压缩和专家精度等方面表现更优,推理FLO

Kimi K3 核心算子拆解——KDA、FlashKDA、Attention Residuals 的实现算法

文章摘要: Kimi K3(2.8T MoE)正式开源,其核心技术报告详细解析了Kimi Delta Attention(KDA)的创新设计与实现。KDA通过引入细粒度遗忘门(每特征维度独立控制)和DPLR状态更新方程,显著优化了线性注意力的效率,支持百万级长上下文处理。报告对比了KDA与Gated DeltaNet等方案的差异,并给出PyTorch风格伪代码,详解三步计算法如何利用低秩分解将复杂

从零到一:用 AI Agent 辅助在 6GB 显卡上本地部署大模型实战

本文记录了在配备GTX 1660 Ti 6GB显卡的Ubuntu 20.04系统上本地部署Qwen3-8B大语言模型的完整过程。文章从硬件评估、模型选型(选择GGUF格式的Q4_K_M量化版)开始,详细介绍了使用Ollama工具的部署流程,包括驱动升级、Python环境配置等常见问题的解决方案。重点分析了KV Cache原理对显存的影响,展示了不同上下文长度下的性能表现(最佳19-38 tok/s

文章图片
只有 B 级能力的大模型,怎么干出 A 级的活?

摘要: 实验通过任务拆解将B级模型(Qwen3-8B)的性能提升至接近A级水平。测试要求实现Flash Attention,一次性提问时模型输出错误代码(低于B级表现),而拆分为4个步骤(概念解释、框架构建、算法实现、整合验证)后,前3步达到A-级质量,仅整合环节需人工修正,综合可用性达75%。对比A级模型(DeepSeek)一次性完成的完美表现,说明B级模型的短板并非知识储备,而是并行处理多任务

    共 67 条
  • 1
  • 2
  • 3
  • 7
  • 请选择