logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

MiniMind 第 4 篇:《数据工程|Tokenizer 训练 + 预训练 / SFT/DPO 全数据集处理》

参数量浪费:词嵌入层参数 = 词表大小 × 嵌入维度(如 32k×512=16.38M),占 MiniMind2-Small 总参数(26M)的 63%,导致模型「头重脚轻」;编码效率低:大词表适合多语言、复杂文本,MiniMind 聚焦中文对话,无需冗余词汇,小词表编码更快、更精准。词表大小:6400(仅为 Llama3 的 1/20);训练算法:SentencePiece(Unigram 模型

文章图片
#AI#python#人工智能
破除大模型 “神秘感“—— 低配电脑也能练出自己的模型

1、参数从 "最小" 开始试batch_size:RTX3050 4G 建议 4-8(超过必爆)hidden_size:64-128(再大显存扛不住)layers:2-4(层数越多,训练时间越长)2、显存不够就 "砍"优先砍 batch_size(最影响显存)再砍 hidden_size 和 layers(缩小模型)禁用多线程(--num_workers 0)、用 float16 精度3、部署不用

文章图片
破除大模型 “神秘感“—— 低配电脑也能练出自己的模型

1、参数从 "最小" 开始试batch_size:RTX3050 4G 建议 4-8(超过必爆)hidden_size:64-128(再大显存扛不住)layers:2-4(层数越多,训练时间越长)2、显存不够就 "砍"优先砍 batch_size(最影响显存)再砍 hidden_size 和 layers(缩小模型)禁用多线程(--num_workers 0)、用 float16 精度3、部署不用

文章图片
MiniMind第 1 篇:别再只会调包!3 元 + 2 小时从零训出 26M 对话小 LLM

大厂大模型动辄百亿参数,个人 GPU 跑不动、训练成本上万,连部署都难;想学底层原理,却被trl高度封装,10 行代码跑完训练,完全看不懂内部逻辑;网上教程要么付费割韭菜,要么漏洞百出,只能学 LoRA 微调, never 真正从零训一个模型;想入门 LLM,却找不到低成本、可复现、全开源、代码纯白盒的实战项目。今天给大家带来一个颠覆入门门槛的开源项目 ——MiniMind单卡 3090,2 小时

文章图片
#AI
阶跃星辰大模型,免费可用,完美兼容Trae、Claude Code等主流开发终端

StepFun(阶跃星辰)是国内本土自研通用大模型厂商,自研 Step 系列基座大模型,主打Agent 智能体、代码工程开发、超长上下文任务。区别于很多通用大模型,阶跃从底层就面向自动化开发、项目批量重构场景优化,也是少数主动适配各类主流代码 Agent 终端的国产模型平台。纵观目前市面国产大模型,能同时做到「免费体验额度、长上下文代码能力、原生适配 Claude Code」的产品并不多。如果你一

文章图片
#AI#ide
别再踩坑!6 款主流 AI 代码 Agent 工具完整对比:Claude Code / OpenCode / OpenClaw / OpenClaude / Codex / Trae 一文分清

不存在绝对 “最强” 的工具,只有匹配自身场景的最优选择:如果核心需求是本地大型项目 AI 辅助编码、代码重构,优先选择 Claude Code 或者 OpenCode;如果你需要代码之外的各类自动化任务,选择 OpenClaw;如果你追求简单可视化操作、不想敲命令,选择 Trae;Codex CLI 受生态和网络限制,国内开发者谨慎尝试。

别再踩坑!6 款主流 AI 代码 Agent 工具完整对比:Claude Code / OpenCode / OpenClaw / OpenClaude / Codex / Trae 一文分清

不存在绝对 “最强” 的工具,只有匹配自身场景的最优选择:如果核心需求是本地大型项目 AI 辅助编码、代码重构,优先选择 Claude Code 或者 OpenCode;如果你需要代码之外的各类自动化任务,选择 OpenClaw;如果你追求简单可视化操作、不想敲命令,选择 Trae;Codex CLI 受生态和网络限制,国内开发者谨慎尝试。

阶跃星辰大模型,免费可用,完美兼容Trae、Claude Code等主流开发终端

StepFun(阶跃星辰)是国内本土自研通用大模型厂商,自研 Step 系列基座大模型,主打Agent 智能体、代码工程开发、超长上下文任务。区别于很多通用大模型,阶跃从底层就面向自动化开发、项目批量重构场景优化,也是少数主动适配各类主流代码 Agent 终端的国产模型平台。纵观目前市面国产大模型,能同时做到「免费体验额度、长上下文代码能力、原生适配 Claude Code」的产品并不多。如果你一

文章图片
#AI#ide
MiniMind 第 5 篇:《核心训练|单卡 3090 极速复现:预训练 + SFT 从零跑通》

普通人也能亲手训练一个可用的语言模型。训练过程中,你不仅能看到 Loss 一步步下降,还能见证模型从「只会词语接龙」到「能流畅对话」的神奇转变 —— 这种成就感,是调包使用大模型无法比拟的。建议大家动手修改训练参数(如学习率、batch size、序列长度),对比不同参数下的训练速度和模型效果,加深对小模型训练的理解。遇到问题不要怕,3090 单卡训练的容错率很高,大不了重新训练一次(也就 2 小

文章图片
#AI#人工智能
MiniMind第 3 篇:底层原理|Decoder-Only 小模型核心:RMSNorm/SwiGLU/RoPE 极简吃透

选 Decoder-Only:省掉 Encoder,参数量减半;用 RMSNorm:省算力,训练更稳定;用 SwiGLU:提升表达能力,不增加太多计算;用 RoPE:支持长文本,无额外参数;预归一化:加速收敛,提升深层网络效果。在小模型的算力 / 参数量限制下,追求「性价比最高」的性能提升—— 这也是我们学习小模型的核心价值:不是死磕参数规模,而是理解「如何用最少的资源,实现最优的效果」。

文章图片
#人工智能
    共 17 条
  • 1
  • 2
  • 请选择