
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本章讲解语音识别(ASR)的核心原理与工程实践。首先通过百度 API、Whisper、SpeechRecognition 三种技术路线的快速演示建立直观认知;随后介绍语音识别的概念、技术难点与基础理论(语音信号处理、声学模型与语言模型);接着对比 GMM-HMM 传统方法、深度学习端到端方法与云服务 API 三类主流方案;最后是一个完整的会议录音转写系统案例。
本章讲解语音识别(ASR)的核心原理与工程实践。首先通过百度 API、Whisper、SpeechRecognition 三种技术路线的快速演示建立直观认知;随后介绍语音识别的概念、技术难点与基础理论(语音信号处理、声学模型与语言模型);接着对比 GMM-HMM 传统方法、深度学习端到端方法与云服务 API 三类主流方案;最后是一个完整的会议录音转写系统案例。
本章系统讲解情感分析的核心技术。首先通过情感词典、朴素贝叶斯与大模型零样本三种方法的对比演示建立直观认知;随后介绍概念、技术难点与基础理论,并深入剖析词典规则、传统机器学习、深度学习与大模型四类主流方法的原理与选型。最后是电商评论情感分析系统案例。
概念说明在处理特定领域的文本(如医疗、金融、游戏)或网络新词时,基础分词词典往往会因为未收录这些专业术语(未登录词)而导致切分错误。通过加载用户自定义词典,可以人为干预并强制分词器将特定的字符串作为一个完整的词汇保留下来,从而大幅提升垂直领域的切分准确率。代码演示讲解text = "小明是创新办主任也是云计算方面的专家"# 不使用自定义词典时的默认分词print("默认分词:", "/ ".joi
例如,“AI 正在学习人类语言”中的“学习”和“学生在学习”中的“学习”,虽然词面相同,但模型可以结合上下文生成更符合语义的表示。例如,在句子“人工智能正在改变教育方式”中,如果上下文是“人工智能”“改变”,模型需要预测中间的词“正在”。例如,给定中心词“人工智能”,模型需要预测它附近可能出现的词,如“技术”“模型”“应用”“教育”等。例如,在新闻推荐系统中,可以先训练新闻语料的词向量,再根据新闻
例如,一个文本分类任务可能需要先用文档解析工具读取 PDF、Word 或网页内容,再用 NLP 工具完成分词、词性标注、命名实体识别,随后使用机器学习或深度学习模型进行分类,最后将结果保存到数据库中,便于查询、统计和展示。本章围绕常见的 NLP 相关工具展开介绍,重点覆盖 NLP 工具、文档解析工具、机器学习工具、深度学习工具、大模型与预训练模型工具、数据库工具和科学计算工具。在 NLP 项目中,







