人工智能求职指南(职业规划)、预训练、稠密模型、Moe
文章目录
ai横行,传统程序员更不好干,这是风险,也是机遇。
正常来说,35岁是一个槛,传统程序员到这基本就干不下去了。机遇是ai提供的这个风口,给了新机会,如果能够抓住,未来5年,甚至10年都是可以做的。
ai分为哪几层
大体可以分为三层。
第一层:核心研发层(造轮子的人)
定位:处于金字塔顶端,负责突破理论边界、设计新算法、训练基础大模型。
主要工作:
研究新的神经网络架构(如Transformer的变体)。
训练千亿级参数的大语言模型(LLM)、多模态模型。
解决数学难题,优化底层算力效率。
典型岗位:
AI 科学家 (AI Scientist)
算法研究员 (Research Scientist)
大模型架构师
能力要求:
学历门槛极高:通常需要顶尖高校的博士学位,甚至在顶级会议(NeurIPS, ICML, CVPR等)发表过论文。
数学与理论基础:深厚的线性代数、概率论、优化理论功底。
创新能力:能从0到1提出新思路。
现状:人才极度稀缺,薪资最高,主要集中在大厂研究院(如Google DeepMind, 微软研究院, 华为诺亚, 百度研究院)或头部AI初创公司。
预训练-稠密模型
预训练的难度极高,一般人别说做了,看都看不懂。
这属于神仙打架了,根本不考虑做这个,稍微了解下吧。
预训练-Moe
Moe(mixture of experts)(混合专家模型)。
它的核心特点是稀疏性,更准确地说是结构化稀疏激活。
Moe和稠密模型的对比
稠密大模型预训练难点:
海量显存、规整张量并行、数据治理、超参和收敛。系统复杂度可控,通信是规整的,没有路由问题。
MoE 预训练难点:
稠密全部难点 + 路由优化 + 专家负载均衡 + 不规则 AllToAll 通信 + 路由分布漂移。算法和系统耦合度高,更难调。
稠密大模型训练最难的三件事:
1、管好海量高质量数据
2、搞定大规模多卡并行
3、稳住训练收敛
MoE在此基础上,额外还要训练一套动态token调度系统,并且平衡调度带来的各种副作用。
对比:
| 维度 | 稠密(Dense)模型 | MoE(混合专家)模型 |
|---|---|---|
| 核心机制 | 所有参数在每次推理时全部激活并参与计算,计算图固定 | 将前馈网络拆分为多个“专家”子网络,通过门控/路由网络为每个 token 动态选择 Top-K 个专家进行稀疏激活,其余专家保持休眠 |
| 参数量特征 | 总参数 = 激活参数,参数量与计算量强耦合 | 总参数量可以极大(可达万亿级),但每 token 激活参数仅占总参数的很小比例(通常 1%~10%) |
| 推理算力(FLOPs) | 正比于总参数,计算开销随模型规模线性增长 | 正比于激活参数,单位 token 计算成本显著更低 |
| 显存/内存占用 | 显存占用正比于总参数,需求更易预测 | 推理时需将所有专家权重加载到显存,显存需求 ≈ 总参数量,不省显存 |
| 推理延迟 | 计算路径固定,推理延迟稳定可预测,小 Batch 下实测吞吐量往往优于 MoE | 大并发/大批次下吞吐量优势明显;小批次或单请求下因路由决策和专家间通信,首 Token 延迟通常比稠密高 100~200ms |
| 训练难度 | 低。全激活模式下梯度传播路径确定,优化过程相对稳定 | 高。需同时优化专家网络和门控网络,面临专家负载均衡、路由坍缩、All-to-All 通信等工程挑战 |
| 微调难度 | 中。流程成熟(LoRA、Adapter 等轻量化方法可用),超参数调整相对简单 | 高。易出现专家利用率不均、部分专家坍缩、路由漂移,需额外设计负载均衡损失等机制 |
| 逻辑连贯性 | 全参数联动,逻辑连贯性强,输出一致性高 | 不同 token 可能路由到不同专家,复杂推理任务中易出现逻辑断裂 |
| 创意/发散能力 | 全脑联动,自由联想、跨界混搭能力强 | 路由器像“严格保安”,只放行相关专家,跨界联想和创意发散能力较弱 |
| 多模态融合 | 像素进来所有参数一起分析,多模态深度融合能力更强 | 图像与语义之间易出现“两张皮”现象,端到端深度融合难度大(除非大幅增加激活比例) |
| 部署生态 | 部署生态成熟,工具链完善,适合私有化部署 | 工具链(蒸馏、量化、分布式训练)仍在完善,工程边际成本高,中小企业难以承担 |
| 典型代表 | GPT-3、LLaMA 系列、BERT、Qwen2.5-7B、Claude Opus 4、Qwen3.6-27B | DeepSeek-V3(671B/37B)、DeepSeek V4 Pro(1.6T/49B)、Mixtral 8×7B、Qwen3-MoE、GPT-5.5、Kimi K2 |
| 适用场景 | 中小参数规模(≤32B)、端侧/边缘设备部署、低延迟实时交互、高可靠性私有化部署、数学/法律/医疗等复杂逻辑任务 | 超大规模训练、高并发长序列处理、代码生成、多语言翻译、云端超大通用大模型 |
第二层:工程应用层(造车的人)
定位:处于金字塔中部,也是目前需求量最大、就业机会最多的层级。负责将第一层的理论模型落地,转化为实际可用的产品。
主要工作:
模型微调 (Fine-tuning):针对特定场景(如医疗、法律、客服)对基础模型进行训练。
工程化部署:解决模型在服务器上的推理速度、显存占用、高并发问题(MLOps)。
应用开发:利用API或开源模型构建RAG(检索增强生成)系统、Agent(智能体)、推荐系统、自动驾驶感知模块等。
数据工程:清洗高质量数据,构建数据飞轮。
典型岗位:
AI 应用工程师 / LLM 应用工程师
机器学习工程师 (MLE)
NLP/CV/推荐算法工程师
MLOps 工程师
数据工程师
能力要求:
学历:硕士为主,优秀的本科生也有机会。
工程能力:精通 Python, C++, PyTorch/TensorFlow, Docker, Kubernetes, 向量数据库等。
业务理解:懂得如何将AI技术与具体行业痛点结合(如“如何用AI降低电商客服成本”)。
现状:这是目前招聘的主力军。随着大模型开源(如Llama, Qwen),这一层的门槛正在从“会训练模型”转向“会用好模型”和“能解决实际问题”。
第三层:产品与使用层(开车的人)
定位:处于金字塔基座,人数最庞大。负责定义AI产品的形态,或者在日常工作中利用AI工具提升效率。
主要工作:
AI 产品经理 (AI PM):定义产品功能,设计Prompt(提示词)策略,评估模型效果,平衡技术可行性与商业价值。
AI 标注与运营:数据标注(RLHF人类反馈强化学习)、模型效果评测、内容安全审核。
AI 赋能者 (AI Native User):非技术岗位的员工(设计师、程序员、文案、分析师),熟练使用Copilot、Midjourney、数据分析AI等工具,将工作效率提升10倍。
典型岗位:
AI 产品经理
提示词工程师 (Prompt Engineer) - 注:此岗位正逐渐融入PM或开发职责中
数据标注专员 / 质检员
各类“AI+”岗位(如AI绘画师、AI辅助程序员)
能力要求:
洞察力:深刻理解用户需求和行业逻辑。
工具熟练度:不需要写代码,但必须极其熟悉各类AI工具的能力边界。
逻辑思维:能够拆解复杂任务,设计合理的AI工作流。
现状:边界正在模糊。未来可能不再单独设立“AI使用者”岗位,因为不会用AI的传统岗位将被淘汰。
职业路径建议
职业路径建议:
**如果你是博士生/科研大神:**冲击第一层,去大厂研究院或高校。
**如果你是计算机硕士/本科:**深耕第二层,重点加强工程落地能力(如高并发推理、RAG架构、Agent开发)和行业认知(如金融AI、医疗AI)。
**如果你是转行者/非技术背景:**切入第三层,成为AI产品经理或行业专家+AI,利用你对行业的深刻理解,指挥AI干活。
总结:AI就业不再是单一的“算法岗”,而是一个“算法为核,工程为骨,产品为肉”的完整生态。对于大多数人来说,第二层(工程应用)和第三层(产品/业务结合)是未来5-10年最大的机会所在。
简历
年限:
10年 java
1年 AI
落地的项目
必须要有,项目是最好的名片。
技能栏
先把这些堆出来,写简历的时候看着选。
1、大模型框架:
精通 LangChain, LangChain4j, LlamaIndex, Spring AI。熟悉 Prompt Engineering、CoT (思维链)、ReAct 模式。
2、向量数据库:
熟练掌握 Milvus, Elasticsearch (Vector), Faiss, Chroma。精通 HNSW 索引调优及混合检索(关键词+向量)策略。
3、模型与算法:
深入理解 Transformer 架构、Self-Attention 机制。熟悉 Bert, M3E, BGE 等 Embedding 模型及 Llama3, Qwen, ChatGLM 等大语言模型。了解 PyTorch 张量运算及模型微调 (LoRA/P-Tuning) 流程。
4、后端与架构:
精通 Java (Project Loom), Python, Spring Boot。熟悉 Redis 缓存策略、Kafka 消息队列、Docker/K8s 容器化部署。
5、监控与运维:
熟悉 Prometheus+Grafana 监控体系,具备 Token 成本核算、链路追踪 (Trace) 及幻觉检测能力。
技能栏-版本2
- 核心框架:精通 LangChain, LlamaIndex,熟悉 Prompt Engineering (提示词工程) 及上下文管理。
- 向量技术:熟练使用 Chroma, Faiss, Milvus (单机版);理解 Embedding 原理,掌握 BGE/M3E 等开源向量模型。
- 开发语言:熟练 Python (FastAPI/Flask),了解基础 SQL 与 Redis 缓存使用。
- 模型应用:熟悉 ChatGLM3, Qwen, Llama3 等开源模型的本地部署与 API 调用;了解 Ollama 容器化运行。
- 数据处理:擅长非结构化数据 (PDF/Word/Markdown) 的清洗、解析与智能切片。
AIGC是什么,和大模型应用有什么关系?
很多岗位里描述AIGC,那么这个AIGC是什么呢?
aigc(ai generated content)(ai生成内容),AIGC 指的是利用人工智能技术来自动生成文字、图片、音频、视频、代码等各种形式内容的技术和应用集合。
看到了吧,这是个很宽的概念范围。
那么和大模型应用有什么关系呢?
大模型应用是基础,aigc也属于大模型应用的范畴。aigc相当于大模型+业务,相当于将业务落地了。
如果应聘这样的岗位,只有理论知识是不够的,需要有一定的套路或成熟的经验。
说实话,这两个范围都不小。
第一层
第一层最高,但是离普通人最远,所以放在最后面。
loss不收敛是什么意思?
随着训练轮数(Epoch)的增加,==模型的损失函数值(Loss)==没有像预期那样逐渐下降并稳定在一个较低的水平,而是出现了异常波动、一直很高、甚至不降反升。
更多推荐

所有评论(0)