
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文系统介绍了大模型Token优化的实用技巧,从Prompt工程、上下文管理到模型路由与缓存策略。核心方法包括:精简系统提示词(可节省60% Token)、使用Few-Shot示例替代长指令、实施上下文压缩(成本降低高达91%)、按需加载工具和文档、建立智能记忆系统。同时提出模型路由策略,根据任务复杂度选择合适模型,并推荐级联调用和缓存技术(可降低90%成本)。这些方法在保证输出质量的前提下,能显

这篇论文用配合大规模高质量 OCR 数据,把一个 3B 的多模态大模型(MLLM)训练到在 DocVQA / TextVQA / ChartQA / OCRBench 等基准上达到同规模最优,并号称"首个超越专业 OCR 工具(TextIn / PaddleOCR)的 MLLM"。核心证据是与真实场景(文档抽取 / 场景文字 / 手写)多指标领先同规模乃至 7B–8B 模型。——优势无法干净归因到

ConfBench 是首个专门测试「VLM 在文档信息提取时自报的置信度可不可信」的基准。作者用 Augraphy 对 75 份真实发票做 20 种受控退化,把样本刻意推到现有干净基准测不到的「低精度区」,再用 7 个 VLM、3 种输入模态、4 种置信度策略跑出 7 万多条实体级评估。结论:OCR 文本加原图一起喂最准最可信;同厂家模型校准随规模变好,跨厂家参数量却不靠谱。作者还提出 ECARB

多模态大模型在视觉化任务指令下的表现鸿沟与解决方案 【核心发现】 当前主流多模态大模型(如Qwen3-VL、InternVL等)在任务指令从文本转为视觉形式时,平均性能下降17.8分(24个测试组合全掉分)。论文通过VTS(可视化任务语义)实验证明,这种下降主要源于模型"视觉读取能力"与"指令执行能力"的割裂——即使OCR准确率达87.6%,模型对视觉指令的响应准确率仅为48.4%。 【创新方法】

Q-CueGraph:让多模态大模型精准聚焦关键区域的独立决策框架 这篇论文提出了一种创新的视觉定位策略Q-CueGraph,通过将"看哪里"的决策过程从多模态大模型中剥离出来,形成独立的坐标级策略。该方法在冻结的Qwen2.5-VL模型上,仅使用19%的画面面积就将V*Bench基准的准确率从0.696提升至0.833。其核心价值在于: 问题定位:解决了现有方法中模型盲目放大或依赖无关显著性区域

中国电信AI团队最新发布的NaviDC-OCR在文档解析领域取得突破性进展。这个仅1.2B参数的小模型在四大基准测试中全面超越包括GPT-5.2、Qwen3-VL-235B等数十倍规模的大模型,尤其在处理手机拍摄的弯曲文档时优势显著。 核心创新点在于: 将文档几何矫正能力内化到模型中,通过1024个控制点实现高效的形变感知 用边界点序列替代传统矩形框,曲率引导采样实现弯曲区域的精准检测 内容-结构

OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊断;它最刺眼的发现是,多行公式一难,最强模型的字符错误也会失控。

Skill-α:通过回滚奖励实现智能体技能自动优化 本文提出Skill-α框架,解决智能体技能(skill)生成缺乏监督信号的难题。核心创新是渐进式编辑+回滚奖励机制: 问题本质:技能质量只能通过下游任务表现间接评估,但传统方法难以直接优化自然语言形式的技能文本; 关键技术: 将生成过程拆解为五类原子编辑动作(创建/更新/合并/修剪/保持) 通过对比编辑前后的任务执行效果(回滚奖励)评估每次编辑的

中国电信AI团队最新发布的NaviDC-OCR在文档解析领域取得突破性进展。这个仅1.2B参数的小模型在四大基准测试中全面超越包括GPT-5.2、Qwen3-VL-235B等数十倍规模的大模型,尤其在处理手机拍摄的弯曲文档时优势显著。 核心创新点在于: 将文档几何矫正能力内化到模型中,通过1024个控制点实现高效的形变感知 用边界点序列替代传统矩形框,曲率引导采样实现弯曲区域的精准检测 内容-结构

Skill-α:通过回滚奖励实现智能体技能自动优化 本文提出Skill-α框架,解决智能体技能(skill)生成缺乏监督信号的难题。核心创新是渐进式编辑+回滚奖励机制: 问题本质:技能质量只能通过下游任务表现间接评估,但传统方法难以直接优化自然语言形式的技能文本; 关键技术: 将生成过程拆解为五类原子编辑动作(创建/更新/合并/修剪/保持) 通过对比编辑前后的任务执行效果(回滚奖励)评估每次编辑的








