logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

终于有人把大模型讲明白了:一个正在改变世界的“超级大脑”

大模型是一个由海量数据训练而来、拥有超千亿参数的“超级文字接龙高手”,它通过计算概率生成内容,并借助RAG、函数调用等“外挂”技术,正进化为能独立完成复杂任务的AI智能体。

文章图片
#人工智能
别再混淆机器学习与深度学习!从底层原理到业务选型全解析

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选

文章图片
#机器学习#深度学习#人工智能
从Seq2Seq到Transformer,彻底读懂AI大模型底层基石

本文从传统 Seq2Seq 模型的固有缺陷切入,梳理 Transformer 诞生的技术背景,完整介绍 Transformer 基础输入处理逻辑(词嵌入 + 位置编码),逐层拆解 Encoder 编码器结构与核心多头自注意力机制,讲解 QKV 计算、多头注意力原理、残差连接与前馈网络的作用,阐明自注意力如何解决 RNN 长依赖、信息压缩丢失等痛点,搭建起 Transformer 编码器的完整知识框

文章图片
#人工智能#transformer#深度学习
ReAct 深度解析:让大模型边思考边行动,打通推理与工具交互的Agent底层范式

大模型Chain-of-Thought(CoT)仅依赖内部知识推理,易产生事实幻觉;纯行动式Agent仅执行工具调用,缺少高层规划导致任务迷失。ICLR 2023论文《ReAct: Synergizing Reasoning and Acting in Language Models》提出**推理+行动交错生成**的全新范式,通过「Thought(思考)-Action(动作)-Observatio

文章图片
#人工智能
告别“失忆AI”:HINDSIGHT——一套能区分事实、记忆与主观观点的Agent结构化记忆架构

现有 Agent 记忆方案基于简单 RAG 向量检索,存在事实与主观观点混淆、长时序信息丢失、Agent 偏好前后不一致等痛点,MemGPT、Zep、Mem0 等主流架构均未从底层解决认知分层问题。Vectorize.io 等机构提出HINDSIGHT结构化记忆架构,将记忆划分为世界事实、Agent 经历、实体摘要、主观观点四大独立网络,实现客观信息与主观信念彻底隔离;依托 TEMPR、CARA

文章图片
#人工智能#架构
【Transformer详解·下】解码生成逻辑!BERT/GPT/Cross-Encoder架构差异全梳理

本篇聚焦 Transformer 解码器 Decoder、掩码自注意力与跨注意力机制,完整还原机器翻译端到端推理流程;结合检索落地场景,对比区分仅 Encoder 的 BERT、仅 Decoder 的 GPT、拼接输入交互的 Cross-Encoder 三类主流衍生模型,清晰说明 Bi-Encoder 粗召回与 Cross-Encoder 精排的工程分工;最后汇总 Transformer 全部核心

文章图片
#transformer#bert
终于有人把大模型讲明白了:一个正在改变世界的“超级大脑”

大模型是一个由海量数据训练而来、拥有超千亿参数的“超级文字接龙高手”,它通过计算概率生成内容,并借助RAG、函数调用等“外挂”技术,正进化为能独立完成复杂任务的AI智能体。

文章图片
#人工智能
别再混淆机器学习与深度学习!从底层原理到业务选型全解析

当下生成式大模型普及,多数技术从业者仍分不清机器学习与深度学习的本质边界。本文从AI、机器学习、深度学习、大模型四层从属体系切入,拆解传统机器学习依赖人工特征工程的完整业务流程,结合金融风控、电商用户运营真实落地案例分析其优劣;同时系统讲解深度学习端到端自动特征提取核心能力,从神经元、激活函数、正反传播梳理神经网络底层运行逻辑,对比两类技术算力、数据、可解释性、适用场景的核心差异,给出标准化工程选

文章图片
#机器学习#深度学习#人工智能
从Seq2Seq到Transformer,彻底读懂AI大模型底层基石

本文从传统 Seq2Seq 模型的固有缺陷切入,梳理 Transformer 诞生的技术背景,完整介绍 Transformer 基础输入处理逻辑(词嵌入 + 位置编码),逐层拆解 Encoder 编码器结构与核心多头自注意力机制,讲解 QKV 计算、多头注意力原理、残差连接与前馈网络的作用,阐明自注意力如何解决 RNN 长依赖、信息压缩丢失等痛点,搭建起 Transformer 编码器的完整知识框

文章图片
#人工智能#transformer#深度学习
ReAct 深度解析:让大模型边思考边行动,打通推理与工具交互的Agent底层范式

大模型Chain-of-Thought(CoT)仅依赖内部知识推理,易产生事实幻觉;纯行动式Agent仅执行工具调用,缺少高层规划导致任务迷失。ICLR 2023论文《ReAct: Synergizing Reasoning and Acting in Language Models》提出**推理+行动交错生成**的全新范式,通过「Thought(思考)-Action(动作)-Observatio

文章图片
#人工智能
    共 12 条
  • 1
  • 2
  • 请选择