logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型三大架构详解:Encoder-only、Decoder-only 与 Encoder-Decoder

Transformer架构主要有三种变体:Encoder-only(如BERT)擅长双向理解,适用于分类、实体识别等任务;Decoder-only(如GPT)专注自回归生成,适合对话、文本创作;Encoder-Decoder(如T5)结合两者优势,专精翻译、摘要等输入输出转换任务。选择架构时需考虑任务特性:理解任务选Encoder-only,生成任务选Decoder-only,结构化转换任务则用E

#transformer#人工智能
提示词工程:大模型应用开发的核心“胶水层”

如果你和我一样,刚完成了 BERT 分类、微调、评估,熟悉了 Transformer、注意力机制,那么恭喜——你已经掌握了传统 NLP 的基石。但现在,我们要正式进入大模型应用开发的核心实战:提示词工程。之前(模型训练阶段)现在(提示词工程阶段)重心在修改代码、调整参数重心在设计输入输出、优化指令评估指标:损失、准确率、F1评估指标:任务完成度、稳定性、成本需要 GPU、大量数据、长时间训练只需

#transformer#人工智能#性能优化
混合专家模型(MoE)详解:大模型效率革命的基石

你想了解的角度核心答案是什么一种通过多专家分工 + 动态路由来减少计算量的模型架构。为什么重要让大模型在保持强大能力的同时,大幅降低推理成本。怎么工作每个 token 由路由器选择 1-2 个专家处理,其他专家不参与计算。有什么挑战训练负载不均衡、通信开销大、专家知识冗余。代表模型DeepSeek-V3, Mixtral, Qwen3, GPT-4(传闻)参考资料。

#人工智能#transformer
Transformer入门知识

摘要:Transformer架构彻底改变了自然语言处理领域,解决了传统RNN存在的长距离依赖和无法并行计算问题。其核心是自注意力机制,通过查询、键、值向量计算词间相关性,并采用多头注意力增强表达能力。Transformer还包含残差连接、层归一化和前馈网络等关键组件。这种架构支持并行计算,具有全局感受野,可解释性强且易于扩展。如今BERT、GPT等主流大模型都基于Transformer,使其成为N

#transformer#深度学习#人工智能
大模型三大架构详解:Encoder-only、Decoder-only 与 Encoder-Decoder

Transformer架构主要有三种变体:Encoder-only(如BERT)擅长双向理解,适用于分类、实体识别等任务;Decoder-only(如GPT)专注自回归生成,适合对话、文本创作;Encoder-Decoder(如T5)结合两者优势,专精翻译、摘要等输入输出转换任务。选择架构时需考虑任务特性:理解任务选Encoder-only,生成任务选Decoder-only,结构化转换任务则用E

#transformer#人工智能
混合专家模型(MoE)详解:大模型效率革命的基石

你想了解的角度核心答案是什么一种通过多专家分工 + 动态路由来减少计算量的模型架构。为什么重要让大模型在保持强大能力的同时,大幅降低推理成本。怎么工作每个 token 由路由器选择 1-2 个专家处理,其他专家不参与计算。有什么挑战训练负载不均衡、通信开销大、专家知识冗余。代表模型DeepSeek-V3, Mixtral, Qwen3, GPT-4(传闻)参考资料。

#人工智能#transformer
知识蒸馏(Knowledge Distillation)完全指南:原理、实践与进阶

知识蒸馏是一种模型压缩技术,通过让轻量级"学生模型"模仿高性能"教师模型"的输出行为,在保持小体积和低延迟的同时获得接近大模型的能力。其核心在于利用教师模型输出的软标签(包含类别间相似性信息)而非传统硬标签来训练学生模型,通过温度参数T控制软标签平滑度,并结合KL散度和交叉熵损失函数。典型流程包括教师模型训练、软标签生成、学生模型训练和部署。知识蒸馏可与量化

#transformer#深度学习#人工智能
Transformer入门知识

摘要:Transformer架构彻底改变了自然语言处理领域,解决了传统RNN存在的长距离依赖和无法并行计算问题。其核心是自注意力机制,通过查询、键、值向量计算词间相关性,并采用多头注意力增强表达能力。Transformer还包含残差连接、层归一化和前馈网络等关键组件。这种架构支持并行计算,具有全局感受野,可解释性强且易于扩展。如今BERT、GPT等主流大模型都基于Transformer,使其成为N

#transformer#深度学习#人工智能
基于路由的RAG问答系统:智能分流简单、复杂与无关问题

简单问题快速响应,节省资源。复杂问题精准处理,动用多步推理。无关问题友好回应,避免检索噪声。参考资料LangChain 文档:Agents, RetrievalQA论文:ReAct: Synergizing Reasoning and Acting in Language Models本文为原创,转载请注明出处。欢迎在评论区交流讨论!

#人工智能#数据库
混合专家模型(MoE)详解:大模型效率革命的基石

你想了解的角度核心答案是什么一种通过多专家分工 + 动态路由来减少计算量的模型架构。为什么重要让大模型在保持强大能力的同时,大幅降低推理成本。怎么工作每个 token 由路由器选择 1-2 个专家处理,其他专家不参与计算。有什么挑战训练负载不均衡、通信开销大、专家知识冗余。代表模型DeepSeek-V3, Mixtral, Qwen3, GPT-4(传闻)参考资料。

#人工智能#transformer
    共 16 条
  • 1
  • 2
  • 请选择