先简单自我介绍一下:

  • 本科是机械专业出身;
  • 第一份工作做工业缺陷检测,主要是传统机器视觉 + 深度学习;
  • 现在在互联网公司做计算机视觉算法(分类、检测、分割、OCR 外加 TensorRT/OpenVINO 部署)。

绕了一大圈,其实一直都是在「看图」这条路上。所以,我给自己定了一个新的方向:

在现有 CV 算法的基础上,系统性地转向大模型 / 多模态方向。
目前还在探索阶段,谈不上“转行成功”,但我不想等到完全确定了才开始记录。

于是我先做了一件比较笨但踏实的事:
把自己从 0 开始学多模态大模型的过程,全部整理成一个 GitHub 仓库,边学边记,边踩坑边写。

GitHub 仓库:From0to1-MLLM-StudyLog
👉 仓库地址:
https://github.com/wz940216/From0to1-MLLM-StudyLog.git
这个仓库主要是我的「多模态大模型学习日志」,特点有几点:

  • 从机械专业转过来的视角: 不会扯太虚的理论,更偏工程、偏“怎么跑起来、怎么部署”。
  • 按周记录: 仓库按 Week1–Week24 组织,每周会尽量放上:
    • 这一周我大概在学什么(LLM、多模态、部署相关);
    • 看过的论文/文档/视频链接;
    • 跑通的代码、小 demo 或踩过的坑。
  • 覆盖方向大致包括:
    • LLM 基础(Qwen/LLaMA 等开源模型的使用与微调)
    • 多模态基础(CLIP、BLIP、LLaVA 这些经典框架)
    • 简单多模态小项目(比如图像-文本检索、图像问答等)
    • 推理与部署(vLLM、TensorRT、OpenVINO 等)

目前仓库还在持续更新,很多东西也在边学边补充,不是教程,更像给自己和同样想转型的人留一份可以复盘的轨迹。

想说给同样在纠结「要不要转大模型」的你
我不是科班 AI 出身,中间也走了机械 → 工业视觉 → 互联网 CV 这一大圈;
现在开始正式补多模态和大模型,说早不早,说晚不晚。
如果你也:

  • 本科专业不对口;
  • 在传统 CV / 工业视觉 / 算法岗位;
  • 对大模型很感兴趣,又有点不知道从哪下手;

可以先不用给自己「转行成功」的压力,我们可以先做两件小事:

  1. 承认这是趋势,允许自己慢慢靠过去;
  2. 让学习过程有迹可循——不管是记在本子上,还是像我一样丢在 GitHub 上。

如果你对多模态大模型感兴趣,或者也在准备往大模型方向转,可以:

  • 先收藏 / Fork 我的仓库: https://github.com/wz940216/From0to1-MLLM-StudyLog.git
  • 在评论区留个「一起学」, 后面我会继续把每周的学习记录、踩坑经验(包括机械狗视角下的弯路)陆续更新到仓库和这里。

希望半年、一年之后,我们都能回头看到一条清晰的成长曲线,而不是“当时也想学来着”的遗憾。

更多推荐