
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
第三章 中文分词
概念说明在处理特定领域的文本(如医疗、金融、游戏)或网络新词时,基础分词词典往往会因为未收录这些专业术语(未登录词)而导致切分错误。通过加载用户自定义词典,可以人为干预并强制分词器将特定的字符串作为一个完整的词汇保留下来,从而大幅提升垂直领域的切分准确率。代码演示讲解text = "小明是创新办主任也是云计算方面的专家"# 不使用自定义词典时的默认分词print("默认分词:", "/ ".joi
第七章 文本表示:嵌入表示(三)
例如,“AI 正在学习人类语言”中的“学习”和“学生在学习”中的“学习”,虽然词面相同,但模型可以结合上下文生成更符合语义的表示。例如,在句子“人工智能正在改变教育方式”中,如果上下文是“人工智能”“改变”,模型需要预测中间的词“正在”。例如,给定中心词“人工智能”,模型需要预测它附近可能出现的词,如“技术”“模型”“应用”“教育”等。例如,在新闻推荐系统中,可以先训练新闻语料的词向量,再根据新闻
第二章 NLP工程工具介绍
例如,一个文本分类任务可能需要先用文档解析工具读取 PDF、Word 或网页内容,再用 NLP 工具完成分词、词性标注、命名实体识别,随后使用机器学习或深度学习模型进行分类,最后将结果保存到数据库中,便于查询、统计和展示。本章围绕常见的 NLP 相关工具展开介绍,重点覆盖 NLP 工具、文档解析工具、机器学习工具、深度学习工具、大模型与预训练模型工具、数据库工具和科学计算工具。在 NLP 项目中,
到底了







