logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【论文解读】Deep Biaffine Attention for Neural Dependency Parsing(基于深层双仿射注意力的神经网络依存解析)

文章目录代码实现:github参考文献:https://www.hankcs.com/nlp/parsing/deep-biaffine-attention-for-neural-dependency-parsing.html

Transformer-XL: 非固定长度上下文的注意力语言模型(Attentive Language Models Beyond a Fixed-Length Context)

Transformers可潜在地学习长期依赖关系,但受到固定上下文的限制,当待处理的文本长度超过固定长度时:训练阶段,需将输入文本分割成不同分段,不同分段独立训练,由于分段未考虑语义边界,可能造成模型缺乏上下文信息预测分段中的前几个字符,产生上下文碎片问题;预测阶段,每次移动一个输入单元,引入大量重复计算,预测效率低;Transformer-XL基于 循环分段机制 和 相对位置编码,克服vanil

【论文解读】Deep Biaffine Attention for Neural Dependency Parsing(基于深层双仿射注意力的神经网络依存解析)

文章目录代码实现:github参考文献:https://www.hankcs.com/nlp/parsing/deep-biaffine-attention-for-neural-dependency-parsing.html

图卷积神经网络(GCN)论文笔记与Geometric源码解释

1 引言主要解决问题图半监督分类问题(如引用网络)。一般解决方案及缺点使用确定形式的基于图的正则化平滑标签信息,如在损失函数中使用一个拉普拉斯项:L=L0+λLreg , with Lreg =∑i,jAij∥f(Xi)−f(Xj)∥2=f(X)⊤Δf(X),(1)\mathcal{L}=\mathcal{L}_{0}+\lambda \mathcal{L}

自然语言处理:序列标注(BiLSTM-CRF)

文章目录Tagging SchemeBidirectional LSTM NetworksWhy use the CRF Networks?CRF NetworksBiLSTM-CRF networksEmission scoreTransition scoreDecodingLoss functionBi-LSTM-CRF NetworksReference:1. Bidirectional..

#自然语言处理
自然语言处理:依存句法解析(Dependency Parsing)

文章目录Phrase Structure GrammarsDependency StructureDependency Grammar and Dependency StructureGreed Transition-Based ParsingWhy train a neural dependency parser?What kind of structures do human languag.

自然语言处理:关键词提取(TF-IDF、Textrank)

文章目录TF-IDFModelSmoothingRegularizationImplemetationPageRankAlgrithm sourceModelTerminal nodeTrap NodeSolving IdeaDeficiencyTextRankTF-IDF词频-逆文档频率(Term Frequency-Inverse Document Frequency, TF-IDF),基..

深度学习:词向量和句向量(Embedding)

文章目录Word VectorSkip-grams model with negative samplingContinuous Bag of WordsDocument VectorWord Vector词向量模型可表示为含有一层隐藏层的前向神经网络,词向量为输入层到隐藏层的参数,即参数矩阵的行向量.语料库总词数为|V|embedding后的单词维度为n输入层为n维向量输入层到隐藏...

LLM量化方法:ZeroQuant、LLM.int8()、SmoothQuant、GPTQ、AWQ、QLoRA

介绍了主流的LLM量化方法,包括ZeroQuant、LLM.int8()、SmoothQuant、GPTQ和AWQ。

    共 25 条
  • 1
  • 2
  • 3
  • 请选择