logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

苏宁易购评价文本分析:基于 Python 的分词与停用词处理实战

文本读取→jieba 分词→结果保存→停用词过滤,逻辑简洁,聚焦文本预处理的核心步骤;jieba.lcut的精确分词模式适配电商短文本,pd.read_table能高效读取 “每行一条评价” 的文本格式;停用词过滤的核心是 “遍历判断 - 保留非停用词”,是文本分析中去除噪声、聚焦核心语义的关键步骤。这套原生代码虽无复杂优化,但完整实现了电商评价文本预处理的基础需求,是后续情感分析、词云可视化、关

文章图片
#python#开发语言
解锁 Python 实用编程技巧:线程、视觉识别、正则匹配与装饰器实战

多线程编程解决了 “异步执行” 的问题,提升程序处理多任务的效率;OpenCV 结合 NumPy 实现了视觉层面的颜色识别,落地到物体检测场景;正则表达式实现了字符串的精准筛选,是数据清洗的必备工具;装饰器则体现了 Python 的 “函数式编程” 思想,实现了代码的解耦与复用。在实际开发中,这些技巧可以组合使用:比如在多线程爬虫中,用正则表达式解析爬取的字符串,用装饰器记录每爬取 N 页后的状态

文章图片
#python#开发语言#opencv +1
Python 实战:基于朴素贝叶斯的苏宁易购评价情感分析

本文基于苏宁易购电商平台的用户评价数据,采用朴素贝叶斯算法构建情感分析模型。通过Pandas读取GBK编码的评价文本,使用Jieba进行中文分词并过滤停用词,将差评标记为1、好评标记为0。利用Scikit-learn的CountVectorizer将文本向量化,采用MultinomialNB分类器进行训练。实验结果显示该模型能有效区分好评与差评,并提供了交互式预测功能。整个过程严格遵循原生代码逻辑

文章图片
#python#开发语言#机器学习
基于 Python 的聚类分析实践:K-Means 与 DBSCAN

特征K-MeansDBSCAN聚类类型划分式(基于距离)密度式需指定参数簇数量 k邻域半径 eps、最小样本数离群点处理无(强制划分)自动识别(标签 - 1)适用数据分布凸形簇任意形状簇。

文章图片
#python#kmeans#开发语言
朴素贝叶斯算法实战:用 Python 实现鸢尾花数据集分类

本文从贝叶斯定理的核心理论出发,拆解了正向概率与逆向概率的区别,通过经典实例推导了贝叶斯定理的计算过程,再通过 Python 实战实现了朴素贝叶斯对鸢尾花数据集的分类,完整覆盖了理论→推导→实战的全流程。贝叶斯算法作为机器学习的基础算法,不仅是入门的必学内容,其逆概推理的思想也影响了众多进阶算法(如贝叶斯网络、隐马尔可夫模型)。在实际应用中,我们需要根据特征的分布类型选择合适的朴素贝叶斯实现方式:

文章图片
#算法#python#分类 +1
从《红楼梦》文本挖掘到关键词提取:Python 自然语言处理实战

本文以《红楼梦》为研究对象,展示了基于Python的自然语言处理技术应用全流程。通过文本分卷、结构化存储、中文分词和TF-IDF关键词提取四个核心步骤,实现了对古典文学文本的量化分析。重点介绍了jieba分词结合自定义词库提升专有名词识别准确率,以及TF-IDF算法提取章节核心关键词的方法。实验结果显示,该方法能有效识别各卷核心人物、情节和场景,验证了NLP技术在经典文学分析中的实用性。整套方案仅

文章图片
#自然语言处理#机器学习
Python 网络爬虫实战:豆瓣电影 TOP250 数据抓取与分析

在大数据与人工智能快速发展的今天,网络爬虫已经成为数据获取最核心、最常用的技术手段之一。无论是数据分析、机器学习、毕业设计、课程设计,还是日常信息汇总,我们都需要从网页中自动采集所需数据。Python 凭借简洁的语法、丰富的第三方库,成为爬虫开发的首选语言。本文以豆瓣电影 TOP250为实战目标,从零讲解爬虫原理、网页分析、代码编写、数据保存、简单可视化,全程不跳步、不晦涩,零基础也能直接运行。文

文章图片
#python#爬虫#信息可视化
从零开始学 OpenCV:Python 图像处理核心操作实战

OpenCV 默认以 BGR 格式读取图像,可通过参数读取灰度图,读写显示需配合与窗口管理imread/imshow/imwrite函数;视频处理本质是逐帧读取与处理,需注意循环终止条件和资源释放;图像的 ROI 提取、色彩通道拆分 / 合并、像素修改、缩放均基于 numpy 数组操作,是 OpenCV 处理的核心逻辑;单通道显示为灰度图,若需彩色效果需将其他通道置 0,通道合并需按 BGR 顺序

文章图片
#opencv#人工智能#计算机视觉
基于 Qwen2.5-1.5B-Instruct 大模型实现文本分类、多轮对话与信息抽取实战

本文详细介绍了如何基于阿里云通义千问的轻量级大模型Qwen2.5-1.5B-Instruct实现本地化部署与典型NLP任务开发。首先讲解了环境配置和模型加载方法,随后通过四个核心案例展示了模型应用:文本分类采用上下文学习实现金融文本分类;多轮对话功能支持连续提问并保持语境;历史语境问答可模仿预设示例风格;商品信息抽取能输出结构化JSON数据。文章提供了完整的代码实现和关键参数解析,展示了轻量级大模

文章图片
#分类#数据挖掘#人工智能 +1
基于 TextRNN 的微博情绪分类系统实现与解析

本文介绍了一个基于LSTM模型的微博情绪分类系统,实现了对"喜悦、愤怒、厌恶、低落"四种情绪的自动识别。系统采用字符级处理方式,通过双向LSTM捕捉文本上下文语义信息,并包含完整的数据预处理、模型训练和交互预测流程。项目亮点包括轻量化设计、可复现性和交互式演示功能,为NLP入门者提供了文本分类的实战案例。文章还探讨了将该系统扩展为预训练模型和可视化工具的可行性。

文章图片
#分类#数据挖掘#人工智能 +1
    共 95 条
  • 1
  • 2
  • 3
  • 10
  • 请选择