
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
(任意 OpenAI 兼容端点,适合接 DeepSeek、通义、Moonshot 等)
本文是「LLM Wiki 实战」系列第 2 篇。—— 跑通了安装到问答的完整闭环。本篇用一批真实的行业报告,演示如何从「一堆 PDF」变成「一个能跨文档问答、能看图谱聚类的知识库」。
本文是「LLM Wiki 实战」系列第 4 篇(完结篇)。前三篇分别讲了入门全流程、火电报告实战、四大亮点。本篇把镜头拉到底层,讲透整个系统是怎么运作的:三层架构的职责边界、四阶段检索管线的数据流、关联度算法的计算、级联删除与可靠性工程。适合想理解「为什么这样设计」的读者,也是你二次开发或借鉴思路的参考。
本文是「LLM Wiki 实战」系列第 3 篇。上一篇用一批火电报告跑了完整实战。本篇拆解四个最有工程含金量的功能,讲清楚它们——算法、依赖、配置、代码组织,而不只是「点这个按钮」。如果你只看 UI,LLM Wiki 像是个「导入 PDF → 聊天」的普通应用。
前两篇我们建立了两件事:① VLM 的三组件架构;② CLIP 如何训练出那双"眼睛"。架构图和损失函数都懂了,可一张图到底是怎么一步步变成 LLM 能处理的 token 序列的,脑子里还是糊的。这很正常——因为中间隔着太多 shape 变换,光看公式记不住。写一个玩具 VLM,打印每一个中间张量的 shape,跟着数据走一遍。零依赖:纯 Python,不用 torch/numpy,复制就能跑玩具
上一篇建立了 VLM 的三组件心智模型:图像 →视觉编码器其中视觉编码器被形容为"租来的眼睛"——其权重在 VLM 训练开始前便已固定。那这双眼睛是怎么训练出来的?答案就是CLIP它开创的对比学习范式,至今仍是绝大多数 VLM(LLaVA、Qwen-VL、InternVL)视觉编码器的训练基础,SigLIP 更是它的直接改进版、当前 VLM 的默认编码器。✅ 画出 CLIP 的双塔架构,说清图文如
本文概述了视觉语言多模态大模型(VLM)的核心架构与训练流程,将其提炼为三个关键组件:视觉编码器、投影器和LLM。文章通过一张发票识别的实例,详细拆解了图像从输入到输出的完整处理流程,包括预处理、编码、位置编码、维度映射和序列拼接等步骤。同时揭示了VLM训练特有的三阶段渐进解冻策略,强调了投影器预训练阶段的必要性。最后提供了专栏的路线图,涵盖视觉基础、对齐机制、训练优化及评测部署等主题,为读者构建
第④篇(上)我们搞定了 Projector:视觉特征(N, d_v)被翻译成(N, d_h),塞进 LLM 文本流。但还差最后一块拼图——位置。文本 token 用 1D-RoPE 就够了,因为文本天然是一维序列。但图像 patch 是二维网格:第 0 号 patch 和第 1 号 patch 是左右相邻,第 0 号和第 3 号(下一行第一个)是上下相邻——几何上它们等距,但拍平后 1D 序号差分
前三篇已依次讲完:架构全景 → CLIP 如何训练视觉编码器 → 张量如何一路流动。由此可知,视觉特征最终都要"塞进" LLM 的文本流。但有个关键问题一直被我们悬置了:视觉编码器输出是(N, d_v)(比如 SigLIP 的729 × 1152),而 LLM 的每个 token 必须是d_h维(比如 Qwen2.5 的3584这个维度差的桥,到底怎么搭?这就是对齐机制(alignment)——V
前八篇完成了从架构理解到训练、对齐、评测、部署的完整闭环。本篇作为完结篇,做两件事:一是聚焦 VLM 的下一代范式——early fusion(早期融合);二是速览其余前沿方向,并回顾整个专栏的路径。本篇无配套可运行 demo(前沿方向多为外部库起步),偏概念与趋势论述,辅以可上手的研究机会。✅ 区分 late fusion(拼接)与 early fusion(统一)两大范式及其权衡✅ 理解 ea







