logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

PyTorch数据加载卡壳?从自定义数据集到多线程加速,手把手教你玩转深度学习框架

自定义数据集:生成y = 2x + 3的样本# 初始化:生成数据(相当于“整理仓库货物”)self.x = torch.randn(num_samples, 1) # 输入特征self.y = 2 * self.x + 3 + torch.randn(num_samples, 1) * 0.1 # 带噪声的标签# 返回数据集大小# 根据索引返回单条样本# 测试数据集len。

#深度学习#pytorch#人工智能 +3
PyTorch语音识别:Wav2Vec2.0+Conformer,方言语音转文字实战

方言语音识别的核心是“利用通用数据解决小数据问题,利用结构优化解决变异问题”——Wav2Vec2.0的预训练解决前者,Conformer的局部+全局特征融合解决后者,再加上方言特有的数据处理和适配技巧,才能实现落地可用。如果大家在实战中遇到“数据标注、模型微调、口音适配”等具体问题,欢迎在评论区交流,我会定期回复。

#pytorch#语音识别#人工智能 +3
PyTorch大模型(LLM)开发指南:从Hugging Face Transformers到vLLM,微调/推理效率翻倍

output_dir="./llama2-finance-qlora", # 输出目录per_device_train_batch_size=4, # 单卡batch size(RTX 4090可设4-8)gradient_accumulation_steps=4, # 梯度累积,模拟大batch(4×4=16)learning_rate=2e-4, # LoRA学习率通常比全参数高10倍eval

#pytorch#人工智能#深度学习 +1
PyTorch与MoE架构全解析:混合专家模型训练+推理,千亿参数大模型落地避坑手册

MoE架构的核心价值不是“炫技”,而是**“用有限硬件实现大模型能力”的工程智慧**通过稀疏激活打破参数量壁垒,通过专家并行降低硬件成本,通过动态路由提升推理效率。对中小团队而言,掌握MoE是“弯道超车”落地千亿级大模型的关键。如果大家在MoE训练中遇到“负载均衡调试、专家并行配置、推理延迟优化”等问题,欢迎在评论区交流,我会定期分享踩坑经验。我是南木 提供人工智能系统课程学习、学习规划和就业指导

#pytorch#人工智能#深度学习 +1
GCN实战|从原理到PyTorch代码:用社交网络数据搞定节点分类(GNN图神经网络丨深度学习)

我们用PyG内置的GCNConv第一层(GCNConv):输入维度1433(Cora的特征维度),输出维度16(隐藏层),激活函数ReLU;第二层(GCNConv):输入维度16,输出维度7(Cora的类别数),无激活函数(因为后续要接交叉熵损失,PyTorch的CrossEntropyLoss会自动加Softmax)。# 第一层GCN:输入特征数 → 隐藏层维度# 第二层GCN:隐藏层维度 →

#深度学习#pytorch#神经网络 +1
基于 LLaMA-3的大模型 LoRA 微调:秩选择 + 学习率设置 + 训练代码

LoRA秩(r)学习率(lr)训练Loss验证LossPPLMT-Bench评分显存占用过拟合程度81.5e-41.651.785.97.08.5GB无162e-41.481.625.07.59.8GB轻微323e-41.351.856.47.211.2GB明显644e-41.222.108.26.814.5GB严重结论r=16+lr=2e-4是LLaMA-3 8B指令跟随任务的最优配置,兼顾效果

#人工智能#深度学习#机器学习
AI算法工程师:大模型微调+多模态训练,2025年企业最看重的5项技能(附面试题)

大家好 我是南木我观察到2025年的AI人才市场正经历着深刻变革。随着大模型技术从实验室走向产业落地,企业对算法工程师的技能要求已从单一的模型调优转向"技术深度+工程落地+领域认知"的复合型能力体系。本文将结合最新行业报告和技术突破,系统解析2025年企业最看重的5项核心技能,并配套实战面试题,为你的职业发展提供清晰指引。同时需要学习规划、就业指导、技术答疑和系统课程学习的同学 欢迎扫码交流。

#人工智能#多模态#深度学习
Transformer模型全拆解:自注意力/多头注意力/前馈网络,看透大模型“基石”的底层逻辑(附公式推导+代码)

首先明确三个核心向量的来源和含义(假设输入序列的嵌入维度为d_modelQuery(查询向量,Q):代表“当前位置需要什么信息”,维度d_k(如64);Key(键向量,K):代表“当前位置提供什么信息”,维度d_k;Value(值向量,V):代表“当前位置的具体信息”,维度d_v(通常d_v = d_k它们的生成方式很简单:对输入序列的嵌入矩阵X(维度QXWQQ = X W_QQXWQ​KXWKK

#transformer#深度学习#人工智能 +3
非计算机专业转行大模型可行吗?需要补哪些知识?

大模型领域的核心需求是“落地到行业”,而非计科同学的专业知识,正是落地的关键——科班生能部署模型,但不懂金融风控的逻辑;你懂风控,学部署的速度远比他们学风控快。不用怕“基础差”,按“基础工具→岗位定向→行业融合”的路径,4个月就能做出可展示的项目;不用和科班生卷算法,靠“行业+工程化”的差异化优势,反而能拿到更适合的offer。记住,转行的核心不是“补全所有知识”,而是“用有限的知识做出有价值的成

#java#人工智能
工程师转AI别先学深度学习!这2个基础技能没补,避坑才能学进去

工程师转AI的优势的是工程思维、问题解决能力,但这些优势要建立在AI基础技能之上。深度学习是强大的工具,但工具要用好,必须先懂底层逻辑——数据怎么处理、数学原理是什么。跳过基础直接学深度学习,就像拿着高级工具却不会用,只能机械模仿;先补Python+数据处理、AI数学通识,再学深度学习,才能真正理解模型、解决问题,形成自己的核心竞争力。不用羡慕那些快速上手深度学习的人,他们大多是“表面会用”,遇到

#人工智能#深度学习#机器学习
    共 567 条
  • 1
  • 2
  • 3
  • 57
  • 请选择