logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

在没有spark集群的条件下,pandas处理上亿行数据的过程探索

nlp萌新,最近在尝试一个AIDD的项目,期间遇到了一个有趣的问题,当把从zinc,enamine,ChemBL,CDDI等库中收集到的数据合并到一起后,是一个60多G的txt文件,是的,您没看错,60多G的txt,几亿行。果真如文献上所说,可探索的化学空间可达到10^80……这种东西,最好的处理方式应该是分布式,用spark集群来处理,pyspark里就有很多pandas指令。碍于手头没有可用的

#spark#big data#大数据
分享一些人工智能、大数据方向常见的比赛平台

1.kagglehttps://www.kaggle.com/数据发掘和预测竞赛的在线平台。业界影响力最大的数据挖掘比赛平台,赛程奖金丰厚,赛题也非常的丰富。平均每个赛事持续时间在2-3个月左右。kaggle上一些高排名选手会分享代码和经验,是比较好的开源平台,不仅适合比赛,更适合初学者的学习。一些经典的项目,泰坦尼克号,楼市分析等都是很好的入门项目。2.阿里云天池https://tianchi.

#人工智能#神经网络#big data
分享一些人工智能、大数据方向常见的比赛平台

1.kagglehttps://www.kaggle.com/数据发掘和预测竞赛的在线平台。业界影响力最大的数据挖掘比赛平台,赛程奖金丰厚,赛题也非常的丰富。平均每个赛事持续时间在2-3个月左右。kaggle上一些高排名选手会分享代码和经验,是比较好的开源平台,不仅适合比赛,更适合初学者的学习。一些经典的项目,泰坦尼克号,楼市分析等都是很好的入门项目。2.阿里云天池https://tianchi.

#人工智能#神经网络#big data
colab使用过程中环境配置踩坑

问题描述: 最近用colab跑一个模型,配置环境过程中有两个包能通过conda安装,还有一个非二进制包(需要!python setup.py install安装),当我环境配置好后,conda list发现所有包都在,但import XXX的时候却提醒不存在这个modle。解决:被这个问题困扰了将近一天,我真的好悲伤,我躺在地上拉肖邦……试了博客上很多方法,包括什么重新启动conda内核激活环境,

#深度学习#tensorflow#pytorch
到底了