ThinkGeo:面向遥感任务的工具增强型 Agent 评测基准

最近读到一篇比较有意思的遥感 Agent 论文:ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks。这篇工作的重点不是再训练一个新的遥感大模型,而是提出一个专门用于评测 tool-augmented LLM agents 的遥感基准。

简单来说,它想回答一个问题:

当前大语言模型 Agent 在真实遥感图像任务中,能不能正确规划、调用工具,并完成多步空间推理?

过去的大模型 Agent 评测,比如 ToolBench、GAIA、GTA 等,更多关注通用 API 调用、网页任务或一般多模态任务。但遥感场景有自己的特殊性:它不只是“看图回答”,还经常涉及目标检测、区域描述、变化检测、距离计算、面积估计、GSD 单位换算、灾害评估等复杂操作。
在这里插入图片描述

因此,一个遥感 Agent 不能只会聊天,还要能在图像理解、工具调用和空间计算之间进行可靠衔接。

ThinkGeo 正是围绕这一点设计的:它把遥感任务组织成 ReAct-style reasoning / execution chain,让模型在回答问题前必须先进行多步推理和工具调用。


这篇论文要解决什么问题?

遥感应用中有很多任务很难靠单一步骤完成。比如:

  • 判断某个房屋是否被洪水包围;
  • 统计灾后图像中被完全摧毁的建筑比例;
  • 根据 GSD 计算房屋总建筑面积;
  • 检测图像中的施工废弃物并画出边界框;
  • 判断三艘船之间是否存在陆地;
  • 识别体育场地类型并结合 OCR 或搜索工具确认设施信息。

这些任务通常需要模型完成一整条链路:

理解用户问题 → 选择合适工具 → 正确填写工具参数 → 读取工具输出 → 继续推理 → 得到最终答案。

现有遥感大模型大多评估 caption、VQA、目标识别或开放问答能力,但很少系统评估这种 工具增强、多步骤、空间推理型任务

ThinkGeo 的价值就在于,它把遥感场景下的 Agent 能力拆得更细:不只看最后答案对不对,也看中间工具有没有选对、参数有没有填对、推理链是否合理。
在这里插入图片描述


ThinkGeo 数据集怎么构建?

ThinkGeo 共包含 486 个结构化 Agent 任务,对应 1,778 个专家验证的推理步骤。其中包括 436 个 optical RGB 任务50 个 SAR 任务

这些任务覆盖七类典型遥感应用场景:

  1. Urban Planning:城市规划,如住宅布局、停车区域、道路桥梁分析;
  2. Disaster Assessment & Change Analysis:灾害评估与变化分析,如洪水、飓风、野火、火山灾害后的建筑损毁判断;
  3. Environmental Monitoring:环境监测,如垃圾场、施工废弃物、水体邻近关系;
  4. Transportation Analysis:交通分析,如车辆检测、计数、方向和安全距离判断;
  5. Aviation Monitoring:航空监测,如飞机识别、跑道占用、机场布局分析;
  6. Recreational Infrastructure:娱乐基础设施,如网球场、篮球场、足球场识别;
  7. Industrial Sites:工业场景,如储罐定位、直径测量、面积估计和空间关系分析。

它的数据来源也比较丰富,包括 DOTA、NWPU-VHR-10、UCAS-AOD、AID、iSAID、xBD、FloodNet、Global-Dumpsite,以及 SSDD、SADD、SIVED 等 SAR 数据集。

值得注意的是,ThinkGeo 并不是简单复用原始数据集标注,而是在这些遥感图像基础上重新构造了面向 Agent 推理的任务和 ReAct-style 执行链。


工具集:让模型真的“动手做任务”

ThinkGeo 为 Agent 提供了一个工具环境,共包含 14 个工具,主要分为三类:

  • Perception tools:感知类工具,如目标检测、变化检测、分割、像素统计;
  • Logic tools:逻辑与数值工具,如 Calculator、Solver,用于面积、距离、比例等计算;
  • Operation tools:操作与可视化工具,如 DrawBox、AddText、GoogleSearch 等。

这让任务更接近真实遥感分析流程。

比如一个灾害评估问题,模型可能需要先用目标检测找到建筑,再用变化检测判断损毁类型,接着用 Calculator 结合 GSD 计算面积,最后生成总结性答案。

这类任务的难点不只是“会不会调用工具”,而是模型必须知道:

当前问题需要哪些工具,工具调用顺序是什么,每个工具的输入参数应该怎么写,以及如何把工具输出转化成最终答案。

因此,ThinkGeo 的 query 是 step-implicittool-implicit 的。也就是说,用户问题里不会直接告诉模型应该调用哪个工具,模型必须自己规划。


评测方式:不只看最终答案

ThinkGeo 采用两种评测方式。

第一种是 step-by-step evaluation,评估中间推理和工具执行过程,包括:

  • InstAcc:是否遵循指令;
  • ToolAcc:是否选对工具;
  • ArgAcc:工具参数是否正确;
  • SummAcc:中间总结是否合理。

第二种是 end-to-end evaluation,评估最终表现,包括:

  • 感知工具相关准确率;
  • 操作工具相关准确率;
  • 逻辑工具相关准确率;
  • 最终答案准确率;
  • 图像 grounding 条件下的答案准确率。

这一点非常重要。因为在 Agent 任务里,最终答案错了,可能有很多原因:可能是工具选错了,可能是参数格式错了,可能是检测框错了,也可能是计算步骤错了。

ThinkGeo 的 step-wise 评测能更细致地定位错误来源。


实验结果说明了什么?

论文评测了多个闭源和开源模型,包括 GPT-4o、GPT-4-1106、Claude-Sonnet、Qwen2.5-7B-Instruct、InternLM3-8B、LLaMA3-8B、Phi-3、Mistral、Qwen3-8B 等。

整体结果显示,GPT-4o 和 GPT-4-1106 的工具调用和规划能力最强

例如 GPT-4o 在 step-by-step 指标中表现较好,ToolAcc 达到 67.73,SummAcc 达到 84.00。但即使是 GPT-4o,最终答案准确率也并不高,Ans 只有 9.78,图像 grounding 条件下 Ans_I 为 20.40

这说明:即便是当前较强的闭源模型,在真实遥感工具链任务上也远未达到可靠水平。

开源模型的问题更明显。很多模型会频繁出现工具误用、参数格式错误、JSON 格式错误、重复调用工具、调用无效工具等问题。

比如论文中的错误案例显示,模型常见问题包括:

  • bounding box 选错;
  • CountGivenObject 参数不合法;
  • 重复调用工具;
  • 面积估算缺少空间依据;
  • GSD 换算或区域合并错误;
  • 最终答案与中间工具结果不一致。

一个很有价值的发现是:ToolAcc 与最终答案准确率的相关性最高。这说明,对于遥感 Agent 来说,能不能选对工具,是影响最终任务成功的关键因素之一。


ThinkGeo 的意义

我认为 ThinkGeo 的贡献主要有三点。

第一,它把遥感任务从传统的单步 VQA / caption 评测,推进到了 agentic evaluation。也就是说,模型不只是回答问题,而是要真正执行一个多步骤遥感分析流程。

第二,它提供了比较细的错误诊断方式。通过 InstAcc、ToolAcc、ArgAcc、SummAcc 等指标,我们可以知道模型到底是不会规划、不会选工具,还是不会组织参数。

第三,它揭示了当前遥感 Agent 的一个核心瓶颈:

工具可用并不等于任务可解。

模型即使拥有检测、分割、变化检测、计算器等工具,如果不能正确规划工具链、组织空间参数和处理单位换算,最终仍然会失败。
在这里插入图片描述

这对遥感大模型研究很有启发。未来遥感智能系统可能不会只是一个单独的 VLM,而是一个能联合调用多种遥感工具的 Agent。但要实现这一点,仅靠提升基础模型能力还不够,还需要提升:

  • 工具选择能力;
  • 参数 grounding 能力;
  • 空间关系推理能力;
  • GSD / 面积 / 距离等单位计算能力;
  • 多步执行中的错误恢复能力;
  • SAR 等非光学模态下的视觉 grounding 能力。

对遥感多模态大模型研究的启发

ThinkGeo 对遥感 MLLM 研究有一个很直接的启发:未来遥感智能系统不应只关注“模型能不能看懂图”,还要关注“模型能不能组织一个可靠的分析流程”。

传统遥感 VLM 更像是:

image + question → answer

而 ThinkGeo 关注的是:

image + question → plan → tool calls → observations → reasoning → answer

这意味着,遥感大模型的能力边界正在从单纯的视觉语言理解,扩展到工具使用、任务规划和空间计算。

对于灾害评估、港口监测、城市规划、交通分析等真实场景来说,这种能力非常关键。因为实际业务里,用户往往不会只问“图里有什么”,而是会问:

  • 某个区域是否受灾?
  • 受灾面积是多少?
  • 目标之间距离是否满足条件?
  • 某些目标是否在指定缓冲区内?
  • 某个变化是新增、消失还是损毁?
  • 最终是否可以生成一个结构化报告?

这些问题都需要 Agent 式推理。


总结

ThinkGeo 是一篇非常适合作为遥感 Agent 入门参考的工作。它没有提出复杂的新模型结构,而是抓住了一个目前非常关键的问题:

如何评估 LLM Agent 在真实遥感任务中的工具使用和多步空间推理能力?

这篇论文最重要的启发是:遥感智能不只是“看懂图像”,而是要能围绕具体任务完成一整套可执行的分析流程。对于城市规划、灾害评估、环境监测、交通分析等真实应用来说,模型必须能把视觉感知、工具调用、空间计算和语言推理连接起来。

一句话概括:

ThinkGeo 通过真实遥感图像、ReAct-style 执行链和细粒度工具评测,揭示了当前 LLM Agent 在遥感空间推理和工具调用上的关键短板,为遥感 Agent 的后续研究提供了一个系统测试床。

更多推荐