
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
指标数值模型精度FP8(精度损失可忽略)上下文长度单卡权重占用~13.5 GiB单卡剩余显存~17.8 GiB服务端口20150。
2020-2025 年,文档解析技术完成了从 “传统 OCR 模块化流水线” 向 “多模态视觉语言模型(VLM)端到端解析” 再到 “智能体(Agent)驱动认知理解” 的三阶段跃迁,彻底跨越了 “像素抄录” 到 “内容理解” 的技术鸿沟。这一变革的核心驱动力,是 GPT-4V、Gemini、Qwen-VL 等多模态大模型的成熟 —— 这类模型具备原生图像处理能力,可直接将文档页面作为视觉输入,而
这个项目麻雀虽小,五脏俱全——配置校验、结构化日志、工具封装、Function Calling、国产模型迁移,一个 Agent 应用该有的要素都有了。如果你正在入门 LangChain,非常推荐照着这个结构搭一个自己的助手。🔧 把 if/elif 分发改成工具映射表,支持热插拔新工具🧠 把对话历史真正注入 LLM,实现多轮记忆🌐 加一个FastAPI 接口层,从 CLI 变成 Web 服务?
RAG(Retrieval-Augmented Generation,检索增强生成) 是一种结合检索和生成的 AI 技术架构。它的核心思想是:为什么需要 RAG?RAG 的工作流程:什么是嵌入模型(Embedding Model)?嵌入模型的作用是将文本转换为固定长度的向量(数字数组)。转换后的向量能够捕捉文本的语义信息——语义相似的文本,其向量在空间中的距离也更接近。BGE-large-zh-v

Ollama支持通过Modelfile来自定义模型,你可以修改模型的系统提示词、温度、上下文窗口大小等参数。示例Modelfile# 基础模型# 系统提示词SYSTEM "你是一个专业的技术助手,擅长回答编程和计算机相关的问题。回答要简洁、准确、有条理。# 温度参数(0-1,越低越确定,越高越有创造性)# 上下文窗口大小# 最大生成token数# 停止词创建自定义模型。

OCR的全称是Optical Character Recognition(光学字符识别),本质上是一种从视觉信号中恢复语言符号的任务。从底层技术来看,它是一个典型的计算机视觉任务:输入是图像信号(像素矩阵),输出是文本符号序列。但从上层目标来看,OCR更是一种视觉与语言的跨模态映射——模型需要将图像中的视觉特征(笔画、形状、布局)映射到人类可理解的语言空间。从1920年代的模板匹配到今天的多模态大
Ollama支持通过Modelfile来自定义模型,你可以修改模型的系统提示词、温度、上下文窗口大小等参数。示例Modelfile# 基础模型# 系统提示词SYSTEM "你是一个专业的技术助手,擅长回答编程和计算机相关的问题。回答要简洁、准确、有条理。# 温度参数(0-1,越低越确定,越高越有创造性)# 上下文窗口大小# 最大生成token数# 停止词创建自定义模型。

极简 API:3 行核心代码完成 RAG 全流程开箱即用:文档加载、切分、索引、检索一体化高度可扩展:支持自定义 Reader、Parser、Retriever、LLM生产就绪:支持持久化、流式输出、多轮对话。

当内置加载器不满足需求时,继承BaseReader# 自定义解析逻辑# ... 解析文件 ...text="解析后的文本",关键规则继承BaseReader实现方法返回通过extra_info传递元数据切分器切分依据适用场景是否需要 EmbeddingToken 数量英文/混合文本❌句子边界中文文档(通用)❌句子 + 窗口需要上下文的问答❌语义相似度长文档、主题切换✅Markdown 标题Mark

组件说明继承 BaseReader,封装 PaddleOCR 为 LlamaIndex Reader3 类测试图像扫描文档、屏幕截图、自然场景海报RAG 问答验证6/6 查询命中目标图像,回答准确OCR 精度三类图像平均置信度均 > 0.98。








