登录社区云,与社区用户共同成长
邀请您加入社区
哈喽,我是子牙老师。前面花了五年时间通关了计算机:手写操作系统、手写CPU虚拟机、手写Linux系统、手写GDB调试器、手写编程语言…,后面准备通关AI,研发出所有大家想学却没人教或者学不到的AI领域课程。如果你感兴趣,可以关注我的公众号【硬核子牙】
摘要 昇腾 CANN 推出的 ATB(Ascend Transformer Boost)加速库专为 Transformer 算子优化设计,通过算子融合、内存调度等底层优化提升计算效率。ATB 位于 CANN 软件栈中间层,提供高性能算子实现,覆盖 Multi-Head Attention、LayerNorm、RoPE 等核心模块,相比传统 PyTorch 实现减少 40%-70% 执行时间。其特点
这不是一段可运行的应用代码,而是架构层面的 C++ 结构体声明,用于展示如何管理分布式环境中的 Rank(秩)、World Size(通信域大小)以及底层的链路句柄。这体现了。
本文深入浅出地解析了Transformer模型中的核心组件——自注意力机制。文章通过四个关键步骤(线性变换、相似度计算、缩放与Softmax、加权聚合)详细阐述了注意力机制如何让模型理解词语间的关联性。以句子"I ate the cake and it was delicious"为例,生动展示了"it"如何通过注意力机制正确关联到"cake"而非其他词语。全文以直观的矩阵运算为基础,循序渐进地拆
AI Agent 千行实战:6 个设计套路,从代码看懂 Agent 怎么跑
DeepSeek新手必看!DeepSeek个人应用全攻略|最全的 DeepSeek 使用指南(建议收藏)
智能体开发方案覆盖从低代码可视化到专业编程框架的多个层级,不同方案在抽象程度、灵活度、开发成本与定制能力上存在明确差异,对应不同的业务场景与开发团队。
本文梳理了Transformer位置编码从RoPE到MRoPE的技术演进路径。RoPE通过旋转嵌入解决文本相对位置问题,成为主流LLM的基础。为适应多模态需求,mRoPE扩展至时空多维位置编码,交错mRoPE优化了维度融合,最终MRoPE实现了文本、图像、视频位置的统一表示。这一发展路线反映了从纯文本到多模态大模型的位置编码需求变化,Qwen-VL系列模型是典型应用案例。核心趋势是从单一文本位置向
该项目提供的100+模板覆盖了从简单聊天机器人到多代理协作系统的完整谱系。今日新增Star数最高(+4,349),显示出开发者对开源创意工具的强烈需求,尤其是在CapCut等商业工具主导的市场中。项目反映了开发者对AI辅助编程的成熟态度——不再满足于"能跑就行",而是追求工程规范、测试驱动和代码质量。项目将多位传奇投资者的策略编码为AI代理,虽仅供教育用途,但展示了AI在量化投资领域的探索方向。以
如今,各家模型在 Backbone 上已经高度趋同,真正拉开差距的因素反而变成了数据和算力支持等基础设施,比如更大规模、更高质量的预训练数据、更复杂的数据清洗与配比策略、更多、更高效的硬件支持、更完善的后训练流程等。而真正意义上的完全开源模型,需要同时公开训练数据、数据处理流程以及训练代码,不仅涉及复杂的数据版权问题,也意味着主动开放大量核心训练资产,因此目前更多由研究机构推动,其研究价值往往高于
Transformer:先进神经网络架构;Pre‑trained:先用海量数据自学语言规律;Generative:通过逐字预测,生成通顺的回答。
Transformer 让 AI 拥有了“上帝视角”和“瞬间抓重点”的能力。它一眼扫过整句话,用“注意力”算出词和词之间谁跟谁关系最铁,从而真正理解语言的含义和上下文。这就是 ChatGPT 等大模型能如此聪明对话的核心秘密!
本文详细分析了当前大模型推理中KV Cache显存占用的性能瓶颈问题,对比了MHA、GQA、MQA三种传统注意力机制的优缺点,并重点介绍了DeepSeek提出的MLA(Multi-head Latent Attention)创新解决方案。MLA通过三大核心技术突破: 1)低秩键值联合压缩技术,将高维K/V压缩为低维隐向量存储; 2)权重吸收机制,通过矩阵合并消除额外计算开销; 3)解耦RoPE策略
Transformer 架构以其核心的自注意力机制,为序列建模提供了强大、并行且可扩展的解决方案。它不仅是当今大语言模型(如 GPT、ChatGPT)的引擎 ,也正在重塑计算机视觉等领域。尽管面临计算成本、幻觉等挑战 ,但其作为基础架构的潜力仍在不断被挖掘,持续推动着人工智能技术的发展。理解 Transformer是深入现代 AI,尤其是 NLP 和 CV 前沿应用的关键。
Transformer是一种序列到序列(Seq2Seq)深度学习模型,专为处理大数据量的序列数据(文本、语音、时序数据等)设计,核心解决传统RNN/LSTM串行计算、长距离依赖建模困难的问题。🏆 并行计算:摆脱RNN串行依赖,适配大数据量高效处理🏆 长距离依赖:自注意力机制精准捕捉全局关联🏆 通用适配:跨NLP/CV/多模态/时序的通用架构🏆 可扩展:支持深层堆叠、海量参数扩展,适配大模型
本文深入解析了Transformer架构及其在大模型时代的核心地位。文章首先回顾了RNN的局限性(无法并行、长程依赖丢失、状态压缩瓶颈),并指出2017年Transformer通过Self-Attention机制解决了这些问题,实现了完全并行计算和长序列直接关联。核心内容包括: 架构原理:详细拆解Self-Attention、多头注意力、位置编码(重点分析RoPE优势)和完整Transformer
这份笔记重写自 Harvard NLP 的 The Annotated Transformer,并使用官方 GitHub 中的源码作为讲解对象。源码块按原文代码顺序保留,讲解部分用中文重新组织,不做英文逐字翻译。读这篇时建议同时打开前一篇Transformer详解,前一篇偏“看图理解 Transformer 是什么”,这一篇偏“看代码理解 Transformer 怎么跑起来”。最重要的学习路线是:
Day07 | BERT 中文微调实战:Transformer 的另一半
Transformer架构详解摘要 Transformer是2017年提出的革命性模型,彻底改变了序列建模方式。与RNN/LSTM不同,它完全基于注意力机制,解决了传统模型的三大痛点:序列依赖导致的无法并行训练、长期依赖问题和计算效率低下。Transformer采用编码器-解码器结构,核心创新包括: 自注意力机制:允许模型直接建立任意位置间的关联 多头注意力:并行学习多种注意力模式 位置编码:弥补
transformer
——transformer
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net