
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文梳理了2018-2024年知识图谱在各行业的落地应用案例,涵盖贝壳找房、美团、百度等企业实践,涉及推荐系统、智能问答等多个场景。全文既展示知识图谱技术发展脉络,又突出与读者的深度连接,体现专业性与互动性的结合。

GraphSAGE是一种基于图的归纳学习方法,由斯坦福大学于2017年提出。它通过采样和聚合节点的邻居特征来生成节点嵌入,适用于大规模动态图。相比传统方法,GraphSAGE能高效处理新节点,支持节点分类和链接预测任务。其核心包括随机采样邻居、多跳聚合及四种聚合器(平均、归纳式、LSTM、Pooling)。实验表明,GraphSAGE在多个数据集上性能显著优于基线方法,尤其LSTM和Pooling

本文系统介绍了模型压缩与高效推理的五大类方法:1)量化技术;2)网络剪枝;3)知识蒸馏(按训练阶段分类);4)紧凑架构设计(重点优化注意力机制和Transformer);5)动态网络(含提前退出、级联推理和专家混合MoE)。其中动态网络部分详解了三种策略的计算优化原理。

【摘要】OpenAI提出Weak-to-Strong新对齐方法,通过弱监督引导强模型能力,解决传统RLHF对超人类模型监督失效问题。核心方案采用辅助置信度损失(Auxiliary Confidence Loss),使强模型能纠正弱监督错误。实验显示7B模型外挂可使GPT-4安全性提升26.9%。该方法虽未带来显著性能突破,但为模型对齐提供了新思路,强调应理性看待其作用。

大模型压缩技术主要分为剪枝、知识蒸馏、量化和低秩分解四大类。其中剪枝分为深度剪枝(移除整个层)和宽度剪枝(减少权重矩阵大小),研究表明深度剪枝结合LoRA重训练能显著提升推理速度。量化技术通过降低数值精度来减小模型体积,包括线性/非线性量化和不同应用阶段的量化方法。知识蒸馏则用于训练小型语言模型。这些方法在保持模型性能的同时,有效解决了大模型在计算资源和推理速度方面的问题,为实际应用提供了重要技术

本文介绍了大模型融合的5种方法:1)模型整合(如EoT跨模型通信);2)概率集成(词表输出概率融合);3)嫁接学习(结构权重嫁接+继续预训练);4)众包投票;5)MoE(如GShard、Switch Transformers等)。重点解析了各类方法的技术原理与应用场景,如GShard的Top-2门控、Switch的Top-1策略等。

本文系统介绍了大模型训练中的并行优化策略,重点对比了FSDP和DeepSpeed两种主流方案。主要内容包括:1) PyTorch FSDP借鉴DeepSpeed ZeRO和FairScale思想,实现参数/梯度/优化器状态的分片管理;2) 详细解析数据并行(DDP)的通信优化机制和ZeRO三阶段(优化器/梯度/参数分片)的显存优化原理;3) 对比3D并行(TP+PP+DP)与ZeRO的协同使用;4

【AI前沿技术综述】本文汇集了18篇关于DeepResearch技术的前沿研究,涵盖超级搜索智能体、多智能体架构、RAG优化等核心方向。重点包括:1)OpenAI等机构的80种系统全面综述;2)Google基于LangGraph的全栈实现方案;3)动态子查询与循环搜索优化技术;4)百度TURA架构较RAG提升8.9%性能的突破。特别推荐LangChain的实战教程和Zilliz开源项目,为开发者提

大模型幻觉是AI生成与事实不符内容的现象,在创作场景中可能有益,但在医疗等专业领域需避免。幻觉可分为语境冲突性和事实冲突性两类,产生原因包括数据缺陷、训练不当和生成策略问题。评估方法包括生成事实陈述和判别式基准评估。缓解策略主要有:构建高质量微调数据、强化诚实对齐、优化解码策略和外挂知识库增强。需注意大模型无法自知其知识边界,现有方法只能缓解而无法根除幻觉。不同应用场景需采取针对性措施,知识图谱等

本文系统介绍了扩散模型的核心内容与发展脉络。在基本原理部分,详细阐释了DDPM模型的前向/反向扩散过程、噪声预测优化目标及其与VAE的关联。发展历程方面,梳理了从基础模型到多模态生成的技术演进,包括采样加速、CLIP引导等关键突破。应用领域覆盖计算机视觉、时序预测、NLP及科学计算等多个场景。实战环节提供从零构建MNIST扩散模型、Diffusers库实现、图像生成优化等具体指导,特别介绍了Sta








