ClawdBot动态演示:从上传图片→OCR识别→自动翻译→发送结果全过程录屏

1. ClawdBot 是什么?一个能跑在你电脑上的“翻译工作台”

ClawdBot 不是一个云端服务,也不是需要注册账号的 SaaS 工具。它更像一台你亲手组装、随时开机就能用的「AI翻译工作站」——所有处理都在你自己的设备上完成,不上传图片、不外泄文字、不依赖网络 API(可选离线模式),连 Telegram 消息都只在本地解析。

它背后不是单个模型,而是一套协同工作的智能流水线:当你拖入一张菜单截图,ClawdBot 会自动调用 PaddleOCR 提取中文文字,再通过 LibreTranslate 或 Google Translate 引擎实时转成英文;如果你发来一段语音,它先用 Whisper tiny 本地转写成文字,再翻译;甚至群聊里有人贴出带文字的海报,它也能默默识别并回复译文——整个过程,你只需点一下、传一张、等两秒。

最关键的是:它不黑盒。配置文件是明文 JSON,模型路径可改、OCR 引擎可换、翻译后端可插拔。你不是在“使用一个机器人”,而是在“调度一个可定制的 AI 工作流”。

2. 和 MoltBot 的关系:ClawdBot 是“控制台”,MoltBot 是“执行终端”

2.1 它们不是同一个项目,但天生一对

MoltBot 是 2025 年开源的 Telegram 全能翻译机器人——轻量、开箱即用、一条 docker run 就能上线。它专注“交付”,把 OCR、语音转写、多语言翻译、天气汇率查询打包进一个 Telegram bot,树莓派都能扛住 15 人并发。

ClawdBot 则相反:它不直接对接 Telegram,也不提供 bot token。它是一个本地运行的 Web 控制台 + 模型网关,核心价值是「可视化编排」和「全链路调试」。你可以把它理解为 MoltBot 的“驾驶舱”:

  • MoltBot 负责在 Telegram 群里收消息、调接口、发回复;
  • ClawdBot 负责让你看清每一步发生了什么——图片传进来时 OCR 识别了哪几行字?翻译用了哪个引擎?响应耗时多少毫秒?错误日志在哪一行?

它们的关系,就像「示波器」和「电路板」:MoltBot 是实际工作的硬件电路,ClawdBot 是帮你观测信号、定位抖动、替换元件的调试工具。

2.2 为什么你需要这个组合?

单纯用 MoltBot,你得到的是结果;用 ClawdBot + MoltBot,你得到的是确定性可控性

  • 当 OCR 把“寿司”识别成“涛司”?你能在 ClawdBot 界面直接上传原图,实时查看 PaddleOCR 的识别框和置信度,调整预处理参数(灰度/二值化/旋转校正)再试一次;
  • 当某条翻译结果生硬?你可以在 ClawdBot 中切换 LibreTranslate 和 Google 引擎对比输出,甚至临时注入提示词:“请用餐厅服务员口吻翻译,简洁友好”;
  • 当群聊里多人同时发图卡顿?ClawdBot 的监控面板会显示当前 OCR 队列长度、GPU 显存占用、vLLM 推理吞吐,而不是让 MoltBot 黑着屏“假装还在思考”。

这不是炫技,而是把 AI 应用从“玄学调用”拉回“工程实践”。

3. 全流程动态演示:一张日料菜单如何被翻译成英文

我们不讲概念,直接走一遍真实操作——从你双击打开 ClawdBot 控制台,到最终在 Telegram 收到翻译结果。全程无跳步、无剪辑、无美化,就是你第一次上手会经历的全部。

3.1 启动与登录:三步拿到控制台

ClawdBot 默认不开放公网访问,首次使用需手动授权设备。这不是安全漏洞,而是隐私设计:它拒绝“默认联网”,坚持“你点头才通信”。

  1. 启动服务后,在终端执行:

    clawdbot devices list
    

    你会看到类似这样的 pending 请求:

    ID: 7a8b9cde-f012-3456-7890-abcdef123456
    Status: pending
    Created: 2026-01-24 14:22:03
    
  2. 复制 ID,执行批准命令:

    clawdbot devices approve 7a8b9cde-f012-3456-7890-abcdef123456
    
  3. 若仍无法访问网页,运行:

    clawdbot dashboard
    

    它会输出一个带 token 的本地链接,例如:

    http://localhost:7860/?token=23588143fd1588692851f6cbe9218ec6b874bb859e775762
    

    粘贴进浏览器,控制台就出现了。

小提醒:这个 token 是单次有效、短期过期的,且只用于本地回环(127.0.0.1)。它不会出现在任何日志或网络请求中,也不会被远程服务器记录。

3.2 上传图片:不是“拖进去就完事”,而是“告诉它你想怎么读”

进入界面后,左侧导航栏点击 Files → Upload,选择一张带日文的菜单图(比如寿司店价目表)。注意:ClawdBot 不会立刻开始 OCR——它先让你做三件事:

  • 选择 OCR 模式

    • Japanese(专精日文,识别假名+汉字更准)
    • Multilingual(支持中英日韩等 80+ 语种,但单语精度略低)
    • Custom(可上传自定义 PaddleOCR 字典)
  • 设置区域裁剪(可选):
    如果菜单上有大量无关信息(Logo、边框、二维码),你可以用鼠标框选仅含文字的区域,避免 OCR 被干扰。

  • 开启“增强识别”(推荐勾选):
    自动进行对比度拉伸 + 文字方向校正 + 噪点抑制——对手机拍摄的倾斜、反光、阴影图片特别有用。

点击上传后,右上角会出现一个实时进度条,同时下方日志区滚动显示:

[OCR] Loading PaddleOCR Japanese model...
[OCR] Preprocessing image (resize, denoise, rotate)...
[OCR] Running text detection...
[OCR] Running recognition on 12 text boxes...

整个过程约 1.8 秒(RTX 4060 笔记本实测),比手机拍照翻译 App 还快。

3.3 查看识别结果:不只是“文字列表”,而是“可编辑的结构化数据”

OCR 完成后,页面自动跳转到 Results → OCR 标签页。这里不是简单罗列文字,而是以表格形式呈现每一块识别内容:

Box IDTextConfidenceLanguageBBox (x,y,w,h)
001マグロ(赤身)0.982ja[42, 87, 156, 28]
002¥1,2000.991en[210, 85, 82, 26]
003サーモン0.976ja[42, 125, 98, 27]

你可以:

  • 点击任意一行,高亮对应图片上的识别框;
  • 双击 Text 单元格,手动修正错字(比如把“サーモン”改成“サーモン(三文鱼)”);
  • 拖拽调整 BBox 坐标,重新划定识别范围;
  • 点击右侧 → Translate 按钮,将当前行单独提交翻译。

这种“所见即所得”的交互,让 OCR 不再是“一锤子买卖”,而是可验证、可干预、可迭代的环节。

3.4 自动翻译:双引擎 fallback + 上下文感知

点击整页的 Translate All,ClawdBot 开始调用翻译流水线。它不是简单把所有文字拼成一段扔给翻译 API,而是做了三层处理:

  1. 语言聚类:自动将日文(ja)、数字价格(en)、英文单位(g / pcs)分组,避免“¥1,200”被误译成“人民币1200元”;
  2. 上下文注入:在翻译请求中附带提示:“这是一份日本寿司店菜单,请用美式英语翻译,保留价格符号和单位,专业简洁”;
  3. 双引擎 fallback
    • 首选 LibreTranslate(完全离线,响应快);
    • 若返回空或置信度<0.85,则自动切到 Google Translate(需联网,质量更高)。

最终生成的翻译结果如下(左侧为原文,右侧为译文):

原文译文引擎耗时
マグロ(赤身)Tuna (Akami)LibreTranslate0.32s
¥1,200¥1,200
サーモンSalmonLibreTranslate0.28s
トロ(大トロ)Toro (Otoro)Google Translate0.76s

关键细节:价格行未被翻译,因为 ClawdBot 识别出它是纯数字+货币符号,属于“无需翻译的元信息”。这种判断不是靠规则硬编码,而是基于 vLLM 模型对文本语义的实时理解。

3.5 发送至 Telegram:不是“发消息”,而是“触发 MoltBot 工作流”

ClawdBot 本身不连接 Telegram。它的“发送”按钮,本质是向本地运行的 MoltBot 发起一个 HTTP POST 请求,载荷包含:

{
  "chat_id": "-1001234567890",
  "message": "【Sushi Menu Translation】\nTuna (Akami) — ¥1,200\nSalmon — ¥980\nToro (Otoro) — ¥2,500",
  "source_image_url": "http://localhost:7860/files/menu_jp_20260124.jpg"
}

MoltBot 收到后,会:

  • 自动添加来源水印(“via ClawdBot”);
  • 检查目标群是否启用“图片翻译”功能;
  • 若开启,则将原文图片+译文文本合并为一张带双语标注的卡片图,再发送;
  • 同时记录本次任务 ID,供后续在 ClawdBot 的 History 标签页追溯。

你不需要配置 webhook、不用管理 bot token、不碰 Telegram Bot API——ClawdBot 和 MoltBot 通过本地 Unix Socket 通信,零配置、零暴露、零中间代理。

4. 为什么这套流程值得你花时间部署?

很多人会问:手机拍照翻译 App 不香吗?为什么还要自己搭一套?

答案藏在三个被忽略的刚性需求里:

4.1 隐私不是“选项”,而是“默认状态”

  • 手机 App 上传的每张图,都经过厂商服务器;OCR 结果、翻译记录、使用频次,全在对方数据库里;
  • ClawdBot + MoltBot 的整个链路,图片只存在于你本地 /app/workspace 目录,OCR 模型在内存中加载,翻译请求若用 LibreTranslate 则全程离线——你的菜单图,永远不会离开你的硬盘。

4.2 稳定不是“大概率可用”,而是“故障可定位”

  • 当翻译突然变慢,App 只给你一个“加载中…”图标;ClawdBot 的 Monitoring 面板则实时显示:
    • OCR 队列深度:2(正常<5)
    • vLLM GPU 显存占用:62%
    • LibreTranslate 响应 P95 延迟:0.41s
    • 最近 10 分钟错误日志:0 条
  • 一切异常,都可归因到具体模块,而不是归咎于“网络不好”。

4.3 可控不是“只能开关”,而是“每个齿轮都可调”

  • 你想让 OCR 更侧重日文假名?改 clawdbot.json 里的 "ocr_lang": "ja"
  • 你觉得 Google 翻译太啰嗦?在 UI 的 Config → Translation 里,把提示词从“专业简洁”换成“口语化,带emoji”;
  • 你发现群聊里常发 PDF 菜单?在 Models → Providers 添加 pdf2image 插件,ClawdBot 就能自动转 PDF 第一页为图片再 OCR。

这不是“用一个工具”,而是“拥有一个工具链”。

5. 总结:ClawdBot 不是终点,而是你掌控 AI 的起点

ClawdBot 的价值,从来不在它能多快翻译一张图,而在于它把原本黑箱的 AI 流程,拆解成你肉眼可见、手指可触、逻辑可溯的每一个环节:

  • 你看到的不是“翻译结果”,而是 OCR 的识别框、翻译引擎的选择、上下文提示的注入;
  • 你操作的不是“一键生成”,而是对每张图做区域裁剪、对每行字做人工校验、对每次翻译做策略切换;
  • 你部署的不是“一个机器人”,而是本地可控的 AI 工作台,它随时听你调度,也随时为你留出调试入口。

它不承诺“取代你”,而是坚定地站在你身后,把技术的不确定性,变成你指尖的确定性。


获取更多AI镜像

想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐