
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
nlp萌新,最近在尝试一个AIDD的项目,期间遇到了一个有趣的问题,当把从zinc,enamine,ChemBL,CDDI等库中收集到的数据合并到一起后,是一个60多G的txt文件,是的,您没看错,60多G的txt,几亿行。果真如文献上所说,可探索的化学空间可达到10^80……这种东西,最好的处理方式应该是分布式,用spark集群来处理,pyspark里就有很多pandas指令。碍于手头没有可用的
1.kagglehttps://www.kaggle.com/数据发掘和预测竞赛的在线平台。业界影响力最大的数据挖掘比赛平台,赛程奖金丰厚,赛题也非常的丰富。平均每个赛事持续时间在2-3个月左右。kaggle上一些高排名选手会分享代码和经验,是比较好的开源平台,不仅适合比赛,更适合初学者的学习。一些经典的项目,泰坦尼克号,楼市分析等都是很好的入门项目。2.阿里云天池https://tianchi.
1.kagglehttps://www.kaggle.com/数据发掘和预测竞赛的在线平台。业界影响力最大的数据挖掘比赛平台,赛程奖金丰厚,赛题也非常的丰富。平均每个赛事持续时间在2-3个月左右。kaggle上一些高排名选手会分享代码和经验,是比较好的开源平台,不仅适合比赛,更适合初学者的学习。一些经典的项目,泰坦尼克号,楼市分析等都是很好的入门项目。2.阿里云天池https://tianchi.
问题描述: 最近用colab跑一个模型,配置环境过程中有两个包能通过conda安装,还有一个非二进制包(需要!python setup.py install安装),当我环境配置好后,conda list发现所有包都在,但import XXX的时候却提醒不存在这个modle。解决:被这个问题困扰了将近一天,我真的好悲伤,我躺在地上拉肖邦……试了博客上很多方法,包括什么重新启动conda内核激活环境,
colab上的环境管理







