登录社区云,与社区用户共同成长
邀请您加入社区
本文系统梳理了深度学习从基础到前沿的完整演进脉络。首先揭示深度学习的本质是矩阵运算与参数拟合,解析神经网络的核心参数与训练调优逻辑,重点剖析过拟合问题及其解决方案。接着对比CNN与RNN如何针对图像空间特征和文本时序任务进行优化,分析各自的优势与局限。最后深入解读Transformer架构的三大核心模块——嵌入层、Transformer Block和概率输出层,阐明其如何通过自注意力机制解决长距离
本文围绕 Transformer 架构展开分析,系统介绍编码器—解码器结构、词嵌入、位置编码、自注意力、多头注意力、前馈神经网络、残差连接、层归一化及掩码机制,并结合训练与推理过程梳理数据流,帮助读者理解各模块的作用、连接方式及其在序列建模中的意义。
这几年,Transformer 几乎已经成为人工智能领域绕不开的一个名字。无论是我们熟悉的大语言模型,还是文本生成、机器翻译、图像理解、多模态模型,背后都能看到 Transformer 的影子。AttentionQ、K、VEncoderDecoderTransformer 好像就是由一堆复杂的矩阵运算拼起来的。如果只是停留在这个层面,我们确实可以把 Transformer 的公式背下来,甚至把代码
内部协变量偏移(Internal Covariate Shift)是深度学习中的一种现象,指在神经网络训练过程中,由于前面层参数更新,导致后续层输入数据的分布(均值、方差等)持续变化,使后续层难以稳定学习,降低训练效率。关键理解:● 协变量:指神经网络的输入特征(如像素值、词向量)。● 内部:特指网络中间隐藏层的输入数据,而非原始输入。● 偏移:中间层输入数据的统计特性(均值、方差)在训练中持续变
AI-Python前沿深度学习核心架构与科学计算实战——PINN正反问题求解、Transformer多领域建模、图神经网络时空推理、深度强化学习、进化深度学习与扩散模型、自进化Agent数据科学应用
大模型#智能体#关键能力#提示词#实用方法。中国人工智能培训网—AI系列录播课。
看到这个词第一反应GPU做大量并行计算的硬件RTX 4090一种 NVIDIA GPUVRAM / 显存GPU 自己的内存Driver控制 GPU 的驱动CUDA让程序使用 NVIDIA GPU 计算PyTorch深度学习框架nvidia-smi查看 GPU 状态nvccCUDA 编译器Conda管理独立软件环境pip安装 Python 包环境安装配方Sandbox权限受限的安全运行环境Check
把Agent 面试题整理了一版。这份主要按模块把高频题归类了一下,适合面试前快速扫一遍,看看哪些方向自己还不熟
- 启用 pgvector 扩展以支持向量索引-- 1. 用户表-- 2. 会话表-- 3. 对话消息表-- 4. 知识库切片向量表 (RAG Vector Store)embedding vector(1536), -- 匹配 OpenAI / 通用 Embedding 维度-- 对向量字段建立 HNSW 索引以加速 Cosine 相似度检索-- 5. Tool Call 审计日志表大语言模型(
在这篇文章中,我不会只给你一个代码,而是会带你“穿越”整个研究过程:从为什么我们要做这个预测(背景意义),到我们如何处理棘手的数据(预处理),再到我们为什么选择LSTM-Transformer这个“黄金组合”(模型逻辑),最后教你如何像写故事一样解读你的结果,并让你的结论无懈可击(稳健性检验)。别担心,这篇文章正是为你而来。因此,本研究旨在构建一种全新的混合预测方法,深度挖掘GHI时间序列数据的内
在Agentic AI快速演进的今天,“Agent Skills会取代MCP”或“MCP已经过时”的声音不绝于耳。这种二元对立的叙事,看似犀利,实则掩盖了智能体架构设计中最本质的真相:Agent Skills与MCP并非对手,而是搭档。前者是人类智慧的结晶——将业务规则、决策逻辑与合规要求,以声明式、可读、可维护的方式注入AI代理;后者是技术能力的桥梁——让AI能安全、可靠地触达现实世界的数据、工
拿了腾讯、字节、京东3个offer后,想聊聊Web开发怎么转Agent最近在系统复盘自己这段时间的学习路径。
实验结果表明,在三个竞赛级与两个基础代码数据集上,AgentConductor取得了最先进的准确率,在pass@1准确率上最高超越最强基线14.6%,同时实现13%的密度降低与68%的令牌成本缩减。为解决上述问题,我们提出AgentConductor——一种以基于大语言模型的编排智能体为核心的强化学习优化多智能体系统,能够实现端到端的、基于反馈的交互拓扑动态生成机制。由大语言模型驱动的多智能体系统
我发了一句话:“帮我做个视频”Agent 自己拆任务调 Image2 出图调 MiniMax CLI 配音、配乐、把图变成视频把结果取回来。
DeepSeek-V4-Flash 正式版通过仅重做后训练,在未改变13B激活参数结构的情况下,实现了9项Agent基准的显著提升,部分指标反超自家Pro版并逼近顶级闭源模型。其DeepSWE长程软件工程能力提升7.5倍至54.4分,终端操作达82.7分,安全攻防达76.7分。第三方评测显示其智能指数达50分(接近GPT-5.6的51分),前端代码竞技排名第3。成本仅为旗舰模型的1/90,但升级仅
你说"我喜欢上海" → 路由器判断:这话跟"地理"和"情感"相关 → 激活"地理专家"和"情感专家" → 他们加工后得出结论:"这人可能也喜欢大城市"的意思:派 8 个(或更多)"阅读理解小工"同时看这句话,每人关注不同方面,最后把结论拼起来——比一个人看更全面。模型脑子里一堆数字,有的特别大有的特别小,直接往下传会"数值爆炸"。:重复惩罚 → 已经说过的词扣分 → 别让模型"我喜欢上海,我喜欢上
【大模型时代的三大奠基性突破】本文解析了奠定当前AI大模型发展的三大里程碑式研究:1. Transformer(2017)通过自注意力机制实现模型并行化训练,为规模化扩展奠定工程基础;2. BERT(2018)确立预训练-微调范式,使模型能力可迁移复用;3. GPT-3(2020)突破few-shot学习阈值,开创无需微调的prompt应用范式。这三项突破分别解决了模型可扩展性、能力可迁移性和使用
通用人工智能(AGI)底层构建的核心瓶颈,在于缺失一套可自洽、可涌现、可验证的最小空间生成骨架,传统标量种子模型与统计拟合范式无法解释智能的空间分化、记忆累积与轨迹演化机制。本文提出M178向量化AGI种子框架,构建了AGI得以完整展开的最小代数空间体系,完成从一维标量时序、二维自指记忆向量到三维宏观涌现张量的层级闭环。本文严格证明:一维时序的最小自指记忆闭包必须依托二维Fibonacci矩阵空间
transformer注意力架构基础入门微小版GPT
缩小每层输出投影的初始值,防止深层网络的初始输出过大。直觉:输入"词→向量"和输出"向量→词概率"是互逆操作,共享参数减少参数量且语义一致。PyTorch 自动完成:从损失出发,沿着计算图反向遍历,用链式法则计算每个参数的梯度。分40次跑,效果等同。:如果差距太大,说明过拟合(记住了训练数据,不会泛化)。📍 源码:model.py →。📍 源码:model.py →。📍 源码:model.p
Codex 与 Draw.io 的结合,本质上是将自然语言理解、项目分析、XML 生成、图形编辑和质量检查串成一条完整工作流。如果追求稳定和通用性,优先选择 Draw.io 官方的。如果经常绘制深度学习模型、复杂系统架构和论文插图,可以选择。如果只需要普通流程图、UML 图和 ER 图,可以选择更轻量的。如果重点关注正式文档中的视觉质量,可以参考 Sunwood 方案中的布局和 SVG 检查规则。
我们还注意到,近期不少同学反馈Codex安装中遇到各种报错,我们整理了近期的真实问题反馈,按 Windows 和 Mac 分类,并附上经过验证的解决步骤。为避免各位在下载过程中遇到的困难,我们还准备了 Mac 和 Win 的安装包。如果你也在安装过程中出现问题,欢迎后台私信我【B636】,这份问题解决指南和安装包会免费发送给您。
打开账单,那个 AI 知识库会员又扣了三百多块。不多,但每次看到这笔钱,我心里都会冒出一个念头:这个月我打开过它几次?答案是:不超过三次。而且其中两次搜出来的东西,说实话,不太对。每个月续费的时候我都会犹豫一下。打开账单,那个 AI 知识库会员又扣了三百多块。不多,但每次看到这笔钱,我心里都会冒出一个念头:这个月我打开过它几次?答案是:不超过三次。而且其中两次搜出来的东西,说实话,不太对。这就是我
摘要 论文《PatentGPT: A Large Language Model for Intellectual Property》提出了一套面向知识产权领域的领域大模型训练流程,而非全新架构。针对知识产权领域三大核心挑战——专业知识强、隐私要求高、文本极长,研究团队以LLaMA2/Mixtral等开源模型为基础,通过240B+token的IP领域数据继续预训练、指令微调(SFT)、强化学习对齐(
仅供参考,未经实验验证。问题1:Transformer、DETR、ViT解释一下Transformer、DETR、ViT各自有什么作用,是什么原理,区别和联系是什么?这三个概念是深度学习领域中从基础架构到具体应用的递进关系。概念一句话总结一种基于自注意力的通用神经网络架构,是 ViT 和 DETR 的共同基础。ViT把图像切成块当句子处理,用 Transformer 做图像分类。DETR用 Tra
长文档摘要是 DeepSeek-V3.2 DSA 稀疏注意力最能兑现优势的场景。典型任务画像:单文档 30K-120K tokens,任务是提取核心论点、生成结构化摘要,或对 RAG 检索 top-K 文档做二次改写以提升检索质量。这个场景 4 维打分:成本敏感度 0.8、上下文密度 0.9、质量容忍度 0.6、时延容忍度 0.7,加权分数0.765。同样处理 100K tokens 单文档,V3
本文记录了作者从零开始训练一个MiniGPT的学习过程。首先介绍了机器学习的基本概念,通过一个三次函数拟合的极简示例展示了梯度下降原理。然后重点解析了Transformer架构,特别是Decoder-only模型中多头自注意力的工作机制,包括其解决长距离依赖问题的优势。在实现部分,作者使用Qwen2分词器处理文本数据,并详细说明了预训练阶段的数据准备过程(添加结束符、分块切分等)。最后展示了带ma
本篇聚焦 Transformer 解码器 Decoder、掩码自注意力与跨注意力机制,完整还原机器翻译端到端推理流程;结合检索落地场景,对比区分仅 Encoder 的 BERT、仅 Decoder 的 GPT、拼接输入交互的 Cross-Encoder 三类主流衍生模型,清晰说明 Bi-Encoder 粗召回与 Cross-Encoder 精排的工程分工;最后汇总 Transformer 全部核心
写到这里,一个客观事实已经很清楚——国产 MoE 三强的分化不是收敛,而是发散。合同抽取用 Kimi K2、代码生成用 DeepSeek V3.1、中文客服用 Qwen3,这在选型上是最优解,但在工程落地上却制造了新的复杂度:三套 SDK、三种计费单元、三份密钥、三种限流策略。每接入一家,都在给应用层增加一份技术债。这也是我们做点点词元这件事的初心——当模型侧的分化已成定局,价值就沉淀到调度层。