logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Transformer详解·下】解码生成逻辑!BERT/GPT/Cross-Encoder架构差异全梳理

本篇聚焦 Transformer 解码器 Decoder、掩码自注意力与跨注意力机制,完整还原机器翻译端到端推理流程;结合检索落地场景,对比区分仅 Encoder 的 BERT、仅 Decoder 的 GPT、拼接输入交互的 Cross-Encoder 三类主流衍生模型,清晰说明 Bi-Encoder 粗召回与 Cross-Encoder 精排的工程分工;最后汇总 Transformer 全部核心

文章图片
#transformer#bert
终于有人把大模型讲明白了:一个正在改变世界的“超级大脑”

大模型是一个由海量数据训练而来、拥有超千亿参数的“超级文字接龙高手”,它通过计算概率生成内容,并借助RAG、函数调用等“外挂”技术,正进化为能独立完成复杂任务的AI智能体。

文章图片
#人工智能
别再混淆机器学习与深度学习!从底层原理到业务选型全解析

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选

文章图片
#机器学习#深度学习#人工智能
从Seq2Seq到Transformer,彻底读懂AI大模型底层基石

本文从传统 Seq2Seq 模型的固有缺陷切入,梳理 Transformer 诞生的技术背景,完整介绍 Transformer 基础输入处理逻辑(词嵌入 + 位置编码),逐层拆解 Encoder 编码器结构与核心多头自注意力机制,讲解 QKV 计算、多头注意力原理、残差连接与前馈网络的作用,阐明自注意力如何解决 RNN 长依赖、信息压缩丢失等痛点,搭建起 Transformer 编码器的完整知识框

文章图片
#人工智能#transformer#深度学习
ReAct 深度解析:让大模型边思考边行动,打通推理与工具交互的Agent底层范式

大模型Chain-of-Thought(CoT)仅依赖内部知识推理,易产生事实幻觉;纯行动式Agent仅执行工具调用,缺少高层规划导致任务迷失。ICLR 2023论文《ReAct: Synergizing Reasoning and Acting in Language Models》提出**推理+行动交错生成**的全新范式,通过「Thought(思考)-Action(动作)-Observatio

文章图片
#人工智能
Anthropic Contextual Retrieval 深度拆解:根治RAG分块上下文丢失难题,检索失败率直降67%

传统RAG存在致命缺陷:文档切割成小块后代词、实体、时间等上下文信息断裂,向量检索极易漏召回关键段落,大幅降低知识库问答准确率。Anthropic 2024推出**上下文检索(Contextual Retrieval)**,通过**上下文嵌入+上下文BM25**双核心技术,在分块预处理阶段用Claude为每段文本生成专属前置说明,补齐丢失背景信息。多领域实测数据显示:仅上下文嵌入可降低35%检索失

文章图片
#人工智能
别再混淆机器学习与深度学习!从底层原理到业务选型全解析

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选

文章图片
#机器学习#深度学习#人工智能
到底了