登录社区云,与社区用户共同成长
邀请您加入社区
请大家把屏幕放大,死死凝视我上面精心梳理的这幅 《16位实模式 MD 模拟器全局软件架构与数据流向图》。这,就是我们花费了数篇心血,在这片只有 640KB 常规内存的荒原上,徒手构筑起来的‘模拟器帝国全景沙盘’。每一个方框,都是我们用 Large 模式远指针焊死的一道合金承重墙;每一个箭头,都是我们用纯位运算和内联汇编开辟的硬件级高速公路!
1. 准备好硬件(GPU)、数据;通过各方面的资讯选中你想要微调的基座模型2. 准备好代码:输入数据 + 模型 -> 在GPU上反复训练3. 训练结束以后,得到训练过程中的checkpoint + 一些log信息4. 根据log信息选一些比较有希望的checkpoint在自己的测试集上推理,获得相应的结果5. 分析结果,获得下一轮实验(数据、训练方案的迭代)思路而LLaMA-Factory就是一个
vLLM是一个高性能LLM推理引擎,其核心创新PagedAttention借鉴操作系统分页思想,将KV Cache按固定大小的块管理,解决了传统连续分配导致的显存浪费问题。通过块表映射虚拟块到物理块池,实现显存利用率从30-40%提升至90%以上,吞吐量提高2-4倍。此外,Copy-on-Write机制优化了并行生成场景,避免重复存储共享前缀。这套设计已被Chatbot Arena等生产环境采用,
本文简要介绍下基于LLaMA-Factory的llama3 8B模型的微调过程升级到24.0版本创建微调脚本Step 6. 测试微调效果。
做AI开发的小伙伴,大概率都被这几个问题折磨过:❌ 对接通义千问、文心一言、GPT,要花钱、要充值、有调用次数限制❌ 依赖外网API,延迟高、联网才能用、隐私数据容易泄露❌ 调试代码频繁调用接口,账单悄悄爆表❌ 内网开发环境,无法访问外网大模型接口今天给大家解锁终极免费方案:Spring AI + Ollama 本地大模型全程0付费、0联网、0API密钥、0复杂配置。
不只是「调了一次 API」。你完成了一个程序员跟 LLM 通信的完整链路:```你的 Go 程序→ HTTP POST(JSON 格式的 Prompt + 参数)→ DeepSeek 服务器→ 模型推理← SSE 流式响应← 你的程序逐字打印```**这个链路是所有 AI 应用的基础。** 后面不管你写多复杂的 Agent,底层都是这个东西。