
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
参数量浪费:词嵌入层参数 = 词表大小 × 嵌入维度(如 32k×512=16.38M),占 MiniMind2-Small 总参数(26M)的 63%,导致模型「头重脚轻」;编码效率低:大词表适合多语言、复杂文本,MiniMind 聚焦中文对话,无需冗余词汇,小词表编码更快、更精准。词表大小:6400(仅为 Llama3 的 1/20);训练算法:SentencePiece(Unigram 模型

1、参数从 "最小" 开始试batch_size:RTX3050 4G 建议 4-8(超过必爆)hidden_size:64-128(再大显存扛不住)layers:2-4(层数越多,训练时间越长)2、显存不够就 "砍"优先砍 batch_size(最影响显存)再砍 hidden_size 和 layers(缩小模型)禁用多线程(--num_workers 0)、用 float16 精度3、部署不用

1、参数从 "最小" 开始试batch_size:RTX3050 4G 建议 4-8(超过必爆)hidden_size:64-128(再大显存扛不住)layers:2-4(层数越多,训练时间越长)2、显存不够就 "砍"优先砍 batch_size(最影响显存)再砍 hidden_size 和 layers(缩小模型)禁用多线程(--num_workers 0)、用 float16 精度3、部署不用

大厂大模型动辄百亿参数,个人 GPU 跑不动、训练成本上万,连部署都难;想学底层原理,却被trl高度封装,10 行代码跑完训练,完全看不懂内部逻辑;网上教程要么付费割韭菜,要么漏洞百出,只能学 LoRA 微调, never 真正从零训一个模型;想入门 LLM,却找不到低成本、可复现、全开源、代码纯白盒的实战项目。今天给大家带来一个颠覆入门门槛的开源项目 ——MiniMind单卡 3090,2 小时

StepFun(阶跃星辰)是国内本土自研通用大模型厂商,自研 Step 系列基座大模型,主打Agent 智能体、代码工程开发、超长上下文任务。区别于很多通用大模型,阶跃从底层就面向自动化开发、项目批量重构场景优化,也是少数主动适配各类主流代码 Agent 终端的国产模型平台。纵观目前市面国产大模型,能同时做到「免费体验额度、长上下文代码能力、原生适配 Claude Code」的产品并不多。如果你一

不存在绝对 “最强” 的工具,只有匹配自身场景的最优选择:如果核心需求是本地大型项目 AI 辅助编码、代码重构,优先选择 Claude Code 或者 OpenCode;如果你需要代码之外的各类自动化任务,选择 OpenClaw;如果你追求简单可视化操作、不想敲命令,选择 Trae;Codex CLI 受生态和网络限制,国内开发者谨慎尝试。
不存在绝对 “最强” 的工具,只有匹配自身场景的最优选择:如果核心需求是本地大型项目 AI 辅助编码、代码重构,优先选择 Claude Code 或者 OpenCode;如果你需要代码之外的各类自动化任务,选择 OpenClaw;如果你追求简单可视化操作、不想敲命令,选择 Trae;Codex CLI 受生态和网络限制,国内开发者谨慎尝试。
StepFun(阶跃星辰)是国内本土自研通用大模型厂商,自研 Step 系列基座大模型,主打Agent 智能体、代码工程开发、超长上下文任务。区别于很多通用大模型,阶跃从底层就面向自动化开发、项目批量重构场景优化,也是少数主动适配各类主流代码 Agent 终端的国产模型平台。纵观目前市面国产大模型,能同时做到「免费体验额度、长上下文代码能力、原生适配 Claude Code」的产品并不多。如果你一

普通人也能亲手训练一个可用的语言模型。训练过程中,你不仅能看到 Loss 一步步下降,还能见证模型从「只会词语接龙」到「能流畅对话」的神奇转变 —— 这种成就感,是调包使用大模型无法比拟的。建议大家动手修改训练参数(如学习率、batch size、序列长度),对比不同参数下的训练速度和模型效果,加深对小模型训练的理解。遇到问题不要怕,3090 单卡训练的容错率很高,大不了重新训练一次(也就 2 小

选 Decoder-Only:省掉 Encoder,参数量减半;用 RMSNorm:省算力,训练更稳定;用 SwiGLU:提升表达能力,不增加太多计算;用 RoPE:支持长文本,无额外参数;预归一化:加速收敛,提升深层网络效果。在小模型的算力 / 参数量限制下,追求「性价比最高」的性能提升—— 这也是我们学习小模型的核心价值:不是死磕参数规模,而是理解「如何用最少的资源,实现最优的效果」。








