刚开始我也觉得Git在ML项目里用处不大,毕竟数据集和模型文件动不动就几个GB,Git根本存不下。但后来发现,真正需要严格版本控制的其实是代码、配置文件和实验记录。只要把大文件排除在Git之外,用Git来管理ML项目简直再合适不过了。

我们团队现在每个实验都对应一个Git分支。比如说,我在dev分支上开发基础模型,想尝试新的特征组合就直接新建一个feature/adding_time_features分支。在这个分支上随便折腾,改坏了也不会影响主分支。如果实验结果比之前好,就把这个分支合并回去,清清楚楚。

更多推荐