ai横行,传统程序员更不好干,这是风险,也是机遇。
正常来说,35岁是一个槛,传统程序员到这基本就干不下去了。机遇是ai提供的这个风口,给了新机会,如果能够抓住,未来5年,甚至10年都是可以做的。

ai分为哪几层

大体可以分为三层。

第一层:核心研发层(造轮子的人)

定位:处于金字塔顶端,负责突破理论边界、设计新算法、训练基础大模型。
主要工作:
研究新的神经网络架构(如Transformer的变体)。
训练千亿级参数的大语言模型(LLM)、多模态模型。
解决数学难题,优化底层算力效率。
典型岗位:
AI 科学家 (AI Scientist)
算法研究员 (Research Scientist)
大模型架构师
能力要求:
学历门槛极高:通常需要顶尖高校的博士学位,甚至在顶级会议(NeurIPS, ICML, CVPR等)发表过论文。
数学与理论基础:深厚的线性代数、概率论、优化理论功底。
创新能力:能从0到1提出新思路。
现状:人才极度稀缺,薪资最高,主要集中在大厂研究院(如Google DeepMind, 微软研究院, 华为诺亚, 百度研究院)或头部AI初创公司。

预训练-稠密模型

预训练的难度极高,一般人别说做了,看都看不懂。
这属于神仙打架了,根本不考虑做这个,稍微了解下吧。

预训练-Moe

Moe(mixture of experts)(混合专家模型)。
它的核心特点是稀疏性,更准确地说是结构化稀疏激活。

Moe和稠密模型的对比

稠密大模型预训练难点:
海量显存、规整张量并行、数据治理、超参和收敛。系统复杂度可控,通信是规整的,没有路由问题。
MoE 预训练难点:
稠密全部难点 + 路由优化 + 专家负载均衡 + 不规则 AllToAll 通信 + 路由分布漂移。算法和系统耦合度高,更难调。

稠密大模型训练最难的三件事:
1、管好海量高质量数据
2、搞定大规模多卡并行
3、稳住训练收敛

MoE在此基础上,额外还要训练一套动态token调度系统,并且平衡调度带来的各种副作用。

对比:

维度稠密(Dense)模型MoE(混合专家)模型
核心机制所有参数在每次推理时全部激活并参与计算,计算图固定将前馈网络拆分为多个“专家”子网络,通过门控/路由网络为每个 token 动态选择 Top-K 个专家进行稀疏激活,其余专家保持休眠
参数量特征总参数 = 激活参数,参数量与计算量强耦合总参数量可以极大(可达万亿级),但每 token 激活参数仅占总参数的很小比例(通常 1%~10%)
推理算力(FLOPs)正比于总参数,计算开销随模型规模线性增长正比于激活参数,单位 token 计算成本显著更低
显存/内存占用显存占用正比于总参数,需求更易预测推理时需将所有专家权重加载到显存,显存需求 ≈ 总参数量,不省显存
推理延迟计算路径固定,推理延迟稳定可预测,小 Batch 下实测吞吐量往往优于 MoE大并发/大批次下吞吐量优势明显;小批次或单请求下因路由决策和专家间通信,首 Token 延迟通常比稠密高 100~200ms
训练难度低。全激活模式下梯度传播路径确定,优化过程相对稳定高。需同时优化专家网络和门控网络,面临专家负载均衡、路由坍缩、All-to-All 通信等工程挑战
微调难度中。流程成熟(LoRA、Adapter 等轻量化方法可用),超参数调整相对简单高。易出现专家利用率不均、部分专家坍缩、路由漂移,需额外设计负载均衡损失等机制
逻辑连贯性全参数联动,逻辑连贯性强,输出一致性高不同 token 可能路由到不同专家,复杂推理任务中易出现逻辑断裂
创意/发散能力全脑联动,自由联想、跨界混搭能力强路由器像“严格保安”,只放行相关专家,跨界联想和创意发散能力较弱
多模态融合像素进来所有参数一起分析,多模态深度融合能力更强图像与语义之间易出现“两张皮”现象,端到端深度融合难度大(除非大幅增加激活比例)
部署生态部署生态成熟,工具链完善,适合私有化部署工具链(蒸馏、量化、分布式训练)仍在完善,工程边际成本高,中小企业难以承担
典型代表GPT-3、LLaMA 系列、BERT、Qwen2.5-7B、Claude Opus 4、Qwen3.6-27BDeepSeek-V3(671B/37B)、DeepSeek V4 Pro(1.6T/49B)、Mixtral 8×7B、Qwen3-MoE、GPT-5.5、Kimi K2
适用场景中小参数规模(≤32B)、端侧/边缘设备部署、低延迟实时交互、高可靠性私有化部署、数学/法律/医疗等复杂逻辑任务超大规模训练、高并发长序列处理、代码生成、多语言翻译、云端超大通用大模型
第二层:工程应用层(造车的人)

定位:处于金字塔中部,也是目前需求量最大、就业机会最多的层级。负责将第一层的理论模型落地,转化为实际可用的产品。
主要工作:
模型微调 (Fine-tuning):针对特定场景(如医疗、法律、客服)对基础模型进行训练。
工程化部署:解决模型在服务器上的推理速度、显存占用、高并发问题(MLOps)。
应用开发:利用API或开源模型构建RAG(检索增强生成)系统、Agent(智能体)、推荐系统、自动驾驶感知模块等。
数据工程:清洗高质量数据,构建数据飞轮。
典型岗位:
AI 应用工程师 / LLM 应用工程师
机器学习工程师 (MLE)
NLP/CV/推荐算法工程师
MLOps 工程师
数据工程师
能力要求:
学历:硕士为主,优秀的本科生也有机会。
工程能力:精通 Python, C++, PyTorch/TensorFlow, Docker, Kubernetes, 向量数据库等。
业务理解:懂得如何将AI技术与具体行业痛点结合(如“如何用AI降低电商客服成本”)。
现状:这是目前招聘的主力军。随着大模型开源(如Llama, Qwen),这一层的门槛正在从“会训练模型”转向“会用好模型”和“能解决实际问题”。

第三层:产品与使用层(开车的人)

定位:处于金字塔基座,人数最庞大。负责定义AI产品的形态,或者在日常工作中利用AI工具提升效率。
主要工作:
AI 产品经理 (AI PM):定义产品功能,设计Prompt(提示词)策略,评估模型效果,平衡技术可行性与商业价值。
AI 标注与运营:数据标注(RLHF人类反馈强化学习)、模型效果评测、内容安全审核。
AI 赋能者 (AI Native User):非技术岗位的员工(设计师、程序员、文案、分析师),熟练使用Copilot、Midjourney、数据分析AI等工具,将工作效率提升10倍。
典型岗位:
AI 产品经理
提示词工程师 (Prompt Engineer) - 注:此岗位正逐渐融入PM或开发职责中
数据标注专员 / 质检员
各类“AI+”岗位(如AI绘画师、AI辅助程序员)
能力要求:
洞察力:深刻理解用户需求和行业逻辑。
工具熟练度:不需要写代码,但必须极其熟悉各类AI工具的能力边界。
逻辑思维:能够拆解复杂任务,设计合理的AI工作流。
现状:边界正在模糊。未来可能不再单独设立“AI使用者”岗位,因为不会用AI的传统岗位将被淘汰。

职业路径建议

职业路径建议:
**如果你是博士生/科研大神:**冲击第一层,去大厂研究院或高校。
**如果你是计算机硕士/本科:**深耕第二层,重点加强工程落地能力(如高并发推理、RAG架构、Agent开发)和行业认知(如金融AI、医疗AI)。
**如果你是转行者/非技术背景:**切入第三层,成为AI产品经理或行业专家+AI,利用你对行业的深刻理解,指挥AI干活。
总结:AI就业不再是单一的“算法岗”,而是一个“算法为核,工程为骨,产品为肉”的完整生态。对于大多数人来说,第二层(工程应用)和第三层(产品/业务结合)是未来5-10年最大的机会所在。

简历

年限:
10年 java
1年 AI

落地的项目

必须要有,项目是最好的名片。

技能栏

先把这些堆出来,写简历的时候看着选。
1、大模型框架:
精通 LangChain, LangChain4j, LlamaIndex, Spring AI。熟悉 Prompt Engineering、CoT (思维链)、ReAct 模式。
2、向量数据库:
熟练掌握 Milvus, Elasticsearch (Vector), Faiss, Chroma。精通 HNSW 索引调优及混合检索(关键词+向量)策略。
3、模型与算法:
深入理解 Transformer 架构、Self-Attention 机制。熟悉 Bert, M3E, BGE 等 Embedding 模型及 Llama3, Qwen, ChatGLM 等大语言模型。了解 PyTorch 张量运算及模型微调 (LoRA/P-Tuning) 流程。
4、后端与架构:
精通 Java (Project Loom), Python, Spring Boot。熟悉 Redis 缓存策略、Kafka 消息队列、Docker/K8s 容器化部署。
5、监控与运维:
熟悉 Prometheus+Grafana 监控体系,具备 Token 成本核算、链路追踪 (Trace) 及幻觉检测能力。

技能栏-版本2
  • 核心框架:精通 LangChain, LlamaIndex,熟悉 Prompt Engineering (提示词工程) 及上下文管理。
  • 向量技术:熟练使用 Chroma, Faiss, Milvus (单机版);理解 Embedding 原理,掌握 BGE/M3E 等开源向量模型。
  • 开发语言:熟练 Python (FastAPI/Flask),了解基础 SQL 与 Redis 缓存使用。
  • 模型应用:熟悉 ChatGLM3, Qwen, Llama3 等开源模型的本地部署与 API 调用;了解 Ollama 容器化运行。
  • 数据处理:擅长非结构化数据 (PDF/Word/Markdown) 的清洗、解析与智能切片。

AIGC是什么,和大模型应用有什么关系?

很多岗位里描述AIGC,那么这个AIGC是什么呢?
aigc(ai generated content)(ai生成内容),AIGC 指的是利用人工智能技术来自动生成文字、图片、音频、视频、代码等各种形式内容的技术和应用集合。
看到了吧,这是个很宽的概念范围。

那么和大模型应用有什么关系呢?
大模型应用是基础,aigc也属于大模型应用的范畴。aigc相当于大模型+业务,相当于将业务落地了。
如果应聘这样的岗位,只有理论知识是不够的,需要有一定的套路或成熟的经验。

说实话,这两个范围都不小。

第一层

第一层最高,但是离普通人最远,所以放在最后面。

loss不收敛是什么意思?

随着训练轮数(Epoch)的增加,==模型的损失函数值(Loss)==没有像预期那样逐渐下降并稳定在一个较低的水平,而是出现了异常波动、一直很高、甚至不降反升。

更多推荐