logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【文本数据获取】Python+Selenium3/4自定义检索词,从微博网页版检索,批量获取微博文本数据

本文介绍了一个基于Selenium的微博评论爬取脚本。主要内容包括:1) 准备工作:安装必要库并配置浏览器驱动,通过修改searchWord变量设置检索关键词;2) 网页内容获取:自动登录后展开全文、翻页爬取,最多可获取50页数据;3) 数据保存:将用户名、时间和评论内容导出为Excel文件。该脚本实现了微博评论的自动化采集,用户可通过高级检索设置时间范围获取更多数据。完整代码已提供,包含30秒登

#python#selenium
【经管论文复现】Python+Pytorch微调BERT预训练模型,使用大语言模型完成文本分类任务——金星晔等(2024)《经济研究》大语言模型方法的复现

金星晔老师等在《经济研究》2024年第3期发表了一篇题为《企业数字化转型的测度难题:基于大语言模型的新方法与新发现》,使用替代了传统的以词频为依据的企业数字化转型、数字技术能力等一系列变量的测量方法。金星晔,左从江,方明月,李涛,聂辉华.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,59(3):34-53.根据此篇论文第五作者,人大教授聂辉华老师的预测,以及这

文章图片
#python#pytorch#语言模型
【经管论文复现】Python+FactSet Revere全球供应链数据库,测度供应链断裂与重构变量——丁浩员等(2024)《经济研究》复现

丁浩员等在《经济研究》2024年第8期发表了一篇题为《贸易政策冲击下的跨国供应链断裂与重构研究》的文章,提出了跨国供应链断裂与重构两个变量的测度方式,但是稍微有点儿说得不够清楚。下文将对其所采用的FastSet Revere全球供应链数据库和其测度方式进行简单解读,并基于Python,结合Excel操作实现。

文章图片
#python
Word让目录页码和正文页码独立分开计算,分隔符中分页符、“下一页”分节符的区别与使用选择

目录在计划书排版时,合理利用分隔符能让文本更加清晰有条理,但是分隔符又分好多种,其中最常用的是红框的分页符和“下一页”分节符,次常用的奇数页、偶数页分节符,那么它们之间有什么区别呢?使用时该怎么选择呢?分节符分节符使用场景章节结束,另开新章节对页码章节末尾目录末尾分节符章节末尾目录末尾分节符章节末尾目录末尾分节符章节末尾目录末尾分节符章节末尾目录末尾分节符章节末尾目录末尾分节符章节末尾目录末尾分节

#经验分享
【上市公司文本分析】Python批量提取上市公司年报文本中的“MD&A”和董事会报告部分

一些做文本分析的经管类文章里在介绍时简单得用“MD&A”(即管理层讨论与分析)部分作为文本分析样本,但实际上在很多年报中并无叫该名的章节,可能还会叫董事会报告等一系列名称,所以按照下方文献的思路,重新编制代码,提取相应部分。[1]姚加权,张锟澎,郭李鹏,等.人工智能如何提升企业生产效率?——基于劳动力技能结构调整的视角[J].管理世界,2024,40(02):101-116+133+117-122

文章图片
#python#开发语言
【经管论文复现】Python+FactSet Revere全球供应链数据库,测度供应链断裂与重构变量——丁浩员等(2024)《经济研究》复现

丁浩员等在《经济研究》2024年第8期发表了一篇题为《贸易政策冲击下的跨国供应链断裂与重构研究》的文章,提出了跨国供应链断裂与重构两个变量的测度方式,但是稍微有点儿说得不够清楚。下文将对其所采用的FastSet Revere全球供应链数据库和其测度方式进行简单解读,并基于Python,结合Excel操作实现。

文章图片
#python
【上市公司文本分析】python批量处理PDF文档,输出自定义关键词的出现次数

目录序言函数模块介绍对文件进行批量重命名将PDF转化为txt删除txt中的换行符添加自定义词语分词与词频统计主函数本地文件结构全部代码结果预览序言做这个的背景是研究生导师要批量处理社会责任报告,提取出一些共性的关键词,大多数批量提出关键词次数的任务都能够完成代码能够运行,但效率不一定最优(我的配置能够实现2.5s一份),Anaconda里自带的库就够用,无需安装其他库函数模块介绍具体的全部代码可见

文章图片
#中文分词
【经管论文复现】Python+Pytorch微调BERT预训练模型,使用大语言模型完成文本分类任务——金星晔等(2024)《经济研究》大语言模型方法的复现

金星晔老师等在《经济研究》2024年第3期发表了一篇题为《企业数字化转型的测度难题:基于大语言模型的新方法与新发现》,使用替代了传统的以词频为依据的企业数字化转型、数字技术能力等一系列变量的测量方法。金星晔,左从江,方明月,李涛,聂辉华.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,59(3):34-53.根据此篇论文第五作者,人大教授聂辉华老师的预测,以及这

文章图片
#python#pytorch#语言模型
【上市公司文本分析】Python+Selenium获取互动易平台投资者提问与上市公司回应文本数据

需要提前下载好三个库,都可以用pip install轻松下载,稍微麻烦点儿的是需要去下载个对应版本的chromedriver.exe驱动,放到python或者Anaconda的文件夹目录下,然后添加环境变量(这部分报错了自行百度即可,操作起来不麻烦的)注意time.sleep()是必要的,一是为了避免频繁操作被浏览器提醒,二是在网络不好的情况下让网页加载完全,否则都会导致报错,一定不要图快,建议在

文章图片
#python#开发语言
【经管论文复现】Python训练Word2Vec词嵌入模型,将语句转化为词向量,计算问答数据间的软余弦相似度(softcosine)——卞世博和阎志鹏(2020)《财经研究》方法的复现

本篇的参考文献主要有以下两篇卞世博,阎志鹏.“答非所问”与IPO市场表现——来自网上路演期间的经验证据[J].财经研究,2020,46(01):49-63.这是文献里对软余弦相似度的描述,说明软余弦相似度在问答数据的相关性表示中优于传统的余弦相似度本篇依据卞世博和阎志鹏(2020)的文献逐步复现。

文章图片
#python#word2vec#开发语言
    共 13 条
  • 1
  • 2
  • 请选择