logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

TransE、DistMult、ComplEx有什么区别?知识图谱嵌入方法如何选择?

本文对比了三种主流知识图谱嵌入方法TransE、DistMult和ComplEx的核心差异。TransE将关系建模为平移向量,适合一对一关系但无法处理一对多;DistMult采用双线性点积解决了一对多问题,但丧失了方向性;ComplEx在复数域扩展中通过共轭操作,既保留灵活性又引入非对称性。选择方法时需考虑关系类型:一对一用TransE,一对多用DistMult,复杂关系用ComplEx。理解评分

文章图片
#知识图谱#人工智能#transformer +1
RAG向量数据库如何实现增量更新?

本文探讨了RAG向量数据库的增量更新机制。增量更新通过细粒度的增删改操作实现向量库与源文档的实时同步,避免了批量重建的高成本和服务中断问题。文章详细介绍了插入、删除、修改文档的具体实现策略,包括软删除、全量替换和差分更新等方法,并分析了并发冲突处理和实际应用场景。最后指出增量更新是RAG系统从实验走向生产的关键技术,需要在一致性、性能和成本之间取得平衡。未来向量数据库将与传统数据库进一步融合,向自

文章图片
#数据库#人工智能#nlp +1
什么是知识图谱?实体、关系、属性分别是什么?

本文介绍了知识图谱的概念、核心要素和应用场景。知识图谱是一种结构化语义知识库,通过实体(节点)、关系(边)和属性构建知识网络。实体代表客观事物或抽象概念,关系描述实体间的语义关联,属性提供实体特征描述。相比传统数据库,知识图谱具有语义理解强、查询效率高、灵活性好等优势,但也面临构建成本高、数据依赖性强的挑战。实际应用于智能搜索、问答系统、金融风控和个性化推荐等领域。未来发展趋势包括与深度学习融合、

文章图片
#知识图谱#人工智能#算法 +1
利用maven实现有关Jsoup的简单爬虫

一、Jsoup的简介jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据二、我们可以利用Jsoup做什么2.1从URL,文件或字符串中刮取并解析HTML查找和提取数据,2.2使用DOM遍历或CSS选择器操纵HTML元素,属性和文本2.3从而使我们输出我们想要的整洁

文章图片
#java
Spark SQL Catalyst 优化器详解

Spark SQL Catalyst优化器详解:Spark SQL语句通过Catalyst优化器转换为RDD执行,包含Parser、Analyzer和Optimizer三个模块。Parser使用ANTLR将SQL解析为AST;Analyzer进行元数据绑定和类型检查;Optimizer是核心,分为RBO和CBO。RBO通过谓词下推、列裁剪等规则优化,CBO基于统计信息选择最优执行计划。Cataly

文章图片
#spark#sql#大数据 +2
RAG 入门指南:让大模型从“闭卷“变“开卷“

RAG(检索增强生成)是一种结合信息检索与大语言模型的技术架构,通过"开卷考试"机制让AI在回答前先查阅资料。它能解决大模型的知识时效性、幻觉问题和专业深度不足等局限。RAG工作流程包含检索、增强和生成三个阶段,通过外挂知识库获取最新信息。该技术广泛应用于企业知识库、智能客服和专业AI助手等领域,具有提升准确性、动态更新等优势,但也面临检索质量依赖、延迟增加等挑战。RAG使AI

文章图片
#大数据#人工智能#RAG
一文读懂 MoE:大模型如何用“专家分工“实现降本增效

MoE(混合专家)模型通过将多个"专家"网络与门控网络结合,实现了高效的大模型训练。门控网络根据输入选择最匹配的Top-K专家进行加权计算,既保留了大规模模型的参数容量,又通过稀疏激活降低了计算成本。MoE通常替换Transformer中的FFN层,保持注意力机制不变。虽然MoE解决了传统稠密模型的计算效率问题,但也面临负载均衡和高资源需求等挑战。这种架构为超大规模AI模型提供

文章图片
#人工智能#transformer#大数据 +1
大模型到底「有多困惑」?一文彻底搞懂 Perplexity

困惑度(Perplexity,PPL)是评估大语言模型性能的核心指标,用于量化模型对文本序列的预测不确定性。数值越低,表示模型预测越准确。PPL通过交叉熵计算得出,理论最小值为1,实际应用中常见范围为5-50(现代模型通常在5-15)。该指标在模型预训练中用于监控学习效果和过拟合,也是学术对比的黄金标准。但需注意PPL值受测试集、词表等因素影响,跨场景对比无意义。PPL解决了人工评估的主观性、低效

文章图片
#人工智能#大数据
玩转 PySpark 自定义函数:UDF、UDAF、UDTF 全解析与实战

本文介绍了PySpark中三类用户自定义函数的实现与应用:UDF(用户自定义标量函数)、UDAF(用户自定义聚合函数)和UDTF(用户自定义表函数)。首先搭建了包含Python 3.10、PySpark 3.5.1等组件的开发环境。UDF部分演示了分数等级转换函数;UDAF实现了去极值均值计算,有效抵抗异常值干扰;UDTF展示了将句子拆分为多行分词结果的表函数。文章包含完整代码示例,展示了三种函数

文章图片
#python#数据库#spark +1
一文读懂 n-grams:大模型出现前,语言模型就靠它

在深度学习时代之前,让机器理解人类语言是一个巨大的挑战。早期的AI系统面对文本时,就像一个完全不懂中文的外国人看一本中文小说——每个字都认识,但组合起来就懵了。

文章图片
#语言模型#人工智能#自然语言处理
    共 111 条
  • 1
  • 2
  • 3
  • 12
  • 请选择