
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本周优化聚焦提升PDF文档问答系统的工程能力,主要包含以下改进: 双层缓存机制:通过文档哈希缓存OCR中间结果,通过问题参数哈希缓存最终答案,大幅减少重复处理耗时。文档缓存默认开启,答案缓存按需启用。 性能监控:新增TimingRecorder模块,精确记录PDF解析、OCR处理、VLM生成等11个阶段的耗时,便于性能分析和优化定位。 提示词优化:实现prompt类型自动推断(通用/表格/标题/总

摘要 该项目实现了一个文档问答系统的alpha版本,采用"传统OCR+VLM"混合方案处理PDF文档。核心流程包括:PDF拆分成页面图片→OCR提取结构化文本→基于关键词检索相关页面→结合OCR文本和页面图片调用Qwen3-VL模型进行问答。系统将中间结果(PDF、页面图片、OCR JSON等)按请求ID保存,便于调试和追踪问题来源。关键技术点包括:PyMuPDF渲染PDF(默认180DPI)、P

本文介绍了现代OCR技术的演进与多模态文档问答系统DocuMind-VL的设计。传统OCR仅实现图片转文字,而现代OCR已发展成完整的文档理解流程,包括:文档方向分类、文本检测/识别、文档布局分析、表格/公式/图表识别等模块。文章对比了传统OCR与视觉语言模型(VLM)的差异,前者适合快速文字提取,后者擅长复杂文档理解。实战部分展示了如何结合PaddleOCR和Qwen3-VL构建文档结构化系统,
第六周结束,CLIP和BLIP系列模型告一段落,完成CLIP、BLIP、BLIP2、LORA原理、多模态SFT,Attention逐行拆解,qformer拆解,CLIP、BLIP、BLIP2的实现和微调。输出一个图像captain和文搜图的小demo。源码已更新:https://github.com/wz940216/From0to1-MLLM-StudyLog/

本篇是minillava系列的起始篇,week07开始将从零搭建一个mini的llava模型,本周我们先设计minillava的模型框架,下载必要的微调数据集,串好数据流,验证forward功能。并将参数配置到config.yaml中。
从零开始搭建了minillava中的三大组件,vision encoder,projector,llmdecoder。完善训练pipline。包括dataset、trainloop、infer三个部分。实现完整的minillava的训练和推理。
重新梳理llava的结构细节,从源码出发再次理解llava的核心原理。结合week08的简单实现,重构代码为更合理的结构,并在此过程中加深对llava模型的印象,补充一些细节上的知识点。
本周在 week13 的 OpenAI Chat 三角色对齐基础上,继续补齐 Mini-LLaVA 的多轮对话工程能力。主要包括四件事:推理侧增加历史轮数截断,训练侧增加轮次级和 token 级截断,针对 JSON 业务输出补充 few-shot prompt 模板,并封装 JSON 提取、校验和失败重试模块。最后通过固定多轮测试脚本,把每轮问题、回答、JSON 校验状态和截断后的 history
本文记录了minillava多模态大模型的三阶段微调实验:1)使用视觉描述和VQA数据对齐视觉语言模型,冻结视觉编码器和语言模型,训练投影层;2)用多模态指令数据微调投影层并添加LoRA适配器;3)采用DPO优化指令跟随能力。实验使用4张3090显卡进行分布式训练,实现了验证集监控和最优模型保存机制,通过选择性参数存储节省显存。作者将持续更新多模态大模型学习笔记,相关代码和配置已开源。该工作为多模
本文介绍了vLLM框架的核心原理与应用场景。vLLM是一个针对大语言模型推理优化的服务引擎,通过PagedAttention技术实现KV缓存的高效管理,采用类似操作系统分页的内存分配策略减少显存浪费。相比原生Transformers推理,vLLM支持动态批处理(continuous batching),能显著提升多并发场景下的吞吐量,特别适合长上下文、多采样和beam search等复杂推理任务。







