logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零到一 | CV转多模态大模型 | week23 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(三)

本周优化聚焦提升PDF文档问答系统的工程能力,主要包含以下改进: 双层缓存机制:通过文档哈希缓存OCR中间结果,通过问题参数哈希缓存最终答案,大幅减少重复处理耗时。文档缓存默认开启,答案缓存按需启用。 性能监控:新增TimingRecorder模块,精确记录PDF解析、OCR处理、VLM生成等11个阶段的耗时,便于性能分析和优化定位。 提示词优化:实现prompt类型自动推断(通用/表格/标题/总

文章图片
#计算机视觉#深度学习
从零到一 | CV转多模态大模型 | week22 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(二)

摘要 该项目实现了一个文档问答系统的alpha版本,采用"传统OCR+VLM"混合方案处理PDF文档。核心流程包括:PDF拆分成页面图片→OCR提取结构化文本→基于关键词检索相关页面→结合OCR文本和页面图片调用Qwen3-VL模型进行问答。系统将中间结果(PDF、页面图片、OCR JSON等)按请求ID保存,便于调试和追踪问题来源。关键技术点包括:PyMuPDF渲染PDF(默认180DPI)、P

文章图片
#计算机视觉#深度学习#机器学习 +1
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)

本文介绍了现代OCR技术的演进与多模态文档问答系统DocuMind-VL的设计。传统OCR仅实现图片转文字,而现代OCR已发展成完整的文档理解流程,包括:文档方向分类、文本检测/识别、文档布局分析、表格/公式/图表识别等模块。文章对比了传统OCR与视觉语言模型(VLM)的差异,前者适合快速文字提取,后者擅长复杂文档理解。实战部分展示了如何结合PaddleOCR和Qwen3-VL构建文档结构化系统,

#人工智能#计算机视觉#深度学习
从零到一 | CV转多模态大模型 | week06 | Clip Blip web demo

第六周结束,CLIP和BLIP系列模型告一段落,完成CLIP、BLIP、BLIP2、LORA原理、多模态SFT,Attention逐行拆解,qformer拆解,CLIP、BLIP、BLIP2的实现和微调。输出一个图像captain和文搜图的小demo。源码已更新:https://github.com/wz940216/From0to1-MLLM-StudyLog/

文章图片
#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week07 | Minillava Design从零搭建一个MiniLlava

本篇是minillava系列的起始篇,week07开始将从零搭建一个mini的llava模型,本周我们先设计minillava的模型框架,下载必要的微调数据集,串好数据流,验证forward功能。并将参数配置到config.yaml中。

#人工智能#深度学习#计算机视觉
从零到一 | CV转多模态大模型 | week08 | Minillava Training_v1手搓MiniLlava训练推理完整流程

从零开始搭建了minillava中的三大组件,vision encoder,projector,llmdecoder。完善训练pipline。包括dataset、trainloop、infer三个部分。实现完整的minillava的训练和推理。

#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week09 | Minillava Refactor结合手搓和llava源码深入理解多模态大模型原理

重新梳理llava的结构细节,从源码出发再次理解llava的核心原理。结合week08的简单实现,重构代码为更合理的结构,并在此过程中加深对llava模型的印象,补充一些细节上的知识点。

#机器学习#人工智能#深度学习 +2
从零到一 | CV转多模态大模型 | week14 | Mini-LLaVA多轮对话稳定性与JSON结构化输出控制

本周在 week13 的 OpenAI Chat 三角色对齐基础上,继续补齐 Mini-LLaVA 的多轮对话工程能力。主要包括四件事:推理侧增加历史轮数截断,训练侧增加轮次级和 token 级截断,针对 JSON 业务输出补充 few-shot prompt 模板,并封装 JSON 提取、校验和失败重试模块。最后通过固定多轮测试脚本,把每轮问题、回答、JSON 校验状态和截断后的 history

#人工智能#机器学习#改行学it +2
从零到一 | CV转多模态大模型 | week16 | 多模态大模型全流程训练过程

本文记录了minillava多模态大模型的三阶段微调实验:1)使用视觉描述和VQA数据对齐视觉语言模型,冻结视觉编码器和语言模型,训练投影层;2)用多模态指令数据微调投影层并添加LoRA适配器;3)采用DPO优化指令跟随能力。实验使用4张3090显卡进行分布式训练,实现了验证集监控和最优模型保存机制,通过选择性参数存储节省显存。作者将持续更新多模态大模型学习笔记,相关代码和配置已开源。该工作为多模

#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week17 | LLM 推理优化 & vLLM 详解

本文介绍了vLLM框架的核心原理与应用场景。vLLM是一个针对大语言模型推理优化的服务引擎,通过PagedAttention技术实现KV缓存的高效管理,采用类似操作系统分页的内存分配策略减少显存浪费。相比原生Transformers推理,vLLM支持动态批处理(continuous batching),能显著提升多并发场景下的吞吐量,特别适合长上下文、多采样和beam search等复杂推理任务。

#人工智能#机器学习#深度学习 +2
    共 29 条
  • 1
  • 2
  • 3
  • 请选择