
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本篇聚焦 Transformer 解码器 Decoder、掩码自注意力与跨注意力机制,完整还原机器翻译端到端推理流程;结合检索落地场景,对比区分仅 Encoder 的 BERT、仅 Decoder 的 GPT、拼接输入交互的 Cross-Encoder 三类主流衍生模型,清晰说明 Bi-Encoder 粗召回与 Cross-Encoder 精排的工程分工;最后汇总 Transformer 全部核心

大模型是一个由海量数据训练而来、拥有超千亿参数的“超级文字接龙高手”,它通过计算概率生成内容,并借助RAG、函数调用等“外挂”技术,正进化为能独立完成复杂任务的AI智能体。

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选

本文从传统 Seq2Seq 模型的固有缺陷切入,梳理 Transformer 诞生的技术背景,完整介绍 Transformer 基础输入处理逻辑(词嵌入 + 位置编码),逐层拆解 Encoder 编码器结构与核心多头自注意力机制,讲解 QKV 计算、多头注意力原理、残差连接与前馈网络的作用,阐明自注意力如何解决 RNN 长依赖、信息压缩丢失等痛点,搭建起 Transformer 编码器的完整知识框

大模型Chain-of-Thought(CoT)仅依赖内部知识推理,易产生事实幻觉;纯行动式Agent仅执行工具调用,缺少高层规划导致任务迷失。ICLR 2023论文《ReAct: Synergizing Reasoning and Acting in Language Models》提出**推理+行动交错生成**的全新范式,通过「Thought(思考)-Action(动作)-Observatio

传统RAG存在致命缺陷:文档切割成小块后代词、实体、时间等上下文信息断裂,向量检索极易漏召回关键段落,大幅降低知识库问答准确率。Anthropic 2024推出**上下文检索(Contextual Retrieval)**,通过**上下文嵌入+上下文BM25**双核心技术,在分块预处理阶段用Claude为每段文本生成专属前置说明,补齐丢失背景信息。多领域实测数据显示:仅上下文嵌入可降低35%检索失

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选








