ClawdBot动态演示:从上传图片→OCR识别→自动翻译→发送结果全过程录屏
ClawdBot动态演示:从上传图片→OCR识别→自动翻译→发送结果全过程录屏
1. ClawdBot 是什么?一个能跑在你电脑上的“翻译工作台”
ClawdBot 不是一个云端服务,也不是需要注册账号的 SaaS 工具。它更像一台你亲手组装、随时开机就能用的「AI翻译工作站」——所有处理都在你自己的设备上完成,不上传图片、不外泄文字、不依赖网络 API(可选离线模式),连 Telegram 消息都只在本地解析。
它背后不是单个模型,而是一套协同工作的智能流水线:当你拖入一张菜单截图,ClawdBot 会自动调用 PaddleOCR 提取中文文字,再通过 LibreTranslate 或 Google Translate 引擎实时转成英文;如果你发来一段语音,它先用 Whisper tiny 本地转写成文字,再翻译;甚至群聊里有人贴出带文字的海报,它也能默默识别并回复译文——整个过程,你只需点一下、传一张、等两秒。
最关键的是:它不黑盒。配置文件是明文 JSON,模型路径可改、OCR 引擎可换、翻译后端可插拔。你不是在“使用一个机器人”,而是在“调度一个可定制的 AI 工作流”。
2. 和 MoltBot 的关系:ClawdBot 是“控制台”,MoltBot 是“执行终端”
2.1 它们不是同一个项目,但天生一对
MoltBot 是 2025 年开源的 Telegram 全能翻译机器人——轻量、开箱即用、一条 docker run 就能上线。它专注“交付”,把 OCR、语音转写、多语言翻译、天气汇率查询打包进一个 Telegram bot,树莓派都能扛住 15 人并发。
ClawdBot 则相反:它不直接对接 Telegram,也不提供 bot token。它是一个本地运行的 Web 控制台 + 模型网关,核心价值是「可视化编排」和「全链路调试」。你可以把它理解为 MoltBot 的“驾驶舱”:
- MoltBot 负责在 Telegram 群里收消息、调接口、发回复;
- ClawdBot 负责让你看清每一步发生了什么——图片传进来时 OCR 识别了哪几行字?翻译用了哪个引擎?响应耗时多少毫秒?错误日志在哪一行?
它们的关系,就像「示波器」和「电路板」:MoltBot 是实际工作的硬件电路,ClawdBot 是帮你观测信号、定位抖动、替换元件的调试工具。
2.2 为什么你需要这个组合?
单纯用 MoltBot,你得到的是结果;用 ClawdBot + MoltBot,你得到的是确定性和可控性:
- 当 OCR 把“寿司”识别成“涛司”?你能在 ClawdBot 界面直接上传原图,实时查看 PaddleOCR 的识别框和置信度,调整预处理参数(灰度/二值化/旋转校正)再试一次;
- 当某条翻译结果生硬?你可以在 ClawdBot 中切换 LibreTranslate 和 Google 引擎对比输出,甚至临时注入提示词:“请用餐厅服务员口吻翻译,简洁友好”;
- 当群聊里多人同时发图卡顿?ClawdBot 的监控面板会显示当前 OCR 队列长度、GPU 显存占用、vLLM 推理吞吐,而不是让 MoltBot 黑着屏“假装还在思考”。
这不是炫技,而是把 AI 应用从“玄学调用”拉回“工程实践”。
3. 全流程动态演示:一张日料菜单如何被翻译成英文
我们不讲概念,直接走一遍真实操作——从你双击打开 ClawdBot 控制台,到最终在 Telegram 收到翻译结果。全程无跳步、无剪辑、无美化,就是你第一次上手会经历的全部。
3.1 启动与登录:三步拿到控制台
ClawdBot 默认不开放公网访问,首次使用需手动授权设备。这不是安全漏洞,而是隐私设计:它拒绝“默认联网”,坚持“你点头才通信”。
-
启动服务后,在终端执行:
clawdbot devices list你会看到类似这样的 pending 请求:
ID: 7a8b9cde-f012-3456-7890-abcdef123456 Status: pending Created: 2026-01-24 14:22:03 -
复制 ID,执行批准命令:
clawdbot devices approve 7a8b9cde-f012-3456-7890-abcdef123456 -
若仍无法访问网页,运行:
clawdbot dashboard它会输出一个带 token 的本地链接,例如:
http://localhost:7860/?token=23588143fd1588692851f6cbe9218ec6b874bb859e775762粘贴进浏览器,控制台就出现了。
小提醒:这个 token 是单次有效、短期过期的,且只用于本地回环(127.0.0.1)。它不会出现在任何日志或网络请求中,也不会被远程服务器记录。
3.2 上传图片:不是“拖进去就完事”,而是“告诉它你想怎么读”
进入界面后,左侧导航栏点击 Files → Upload,选择一张带日文的菜单图(比如寿司店价目表)。注意:ClawdBot 不会立刻开始 OCR——它先让你做三件事:
-
选择 OCR 模式:
Japanese(专精日文,识别假名+汉字更准)Multilingual(支持中英日韩等 80+ 语种,但单语精度略低)Custom(可上传自定义 PaddleOCR 字典)
-
设置区域裁剪(可选):
如果菜单上有大量无关信息(Logo、边框、二维码),你可以用鼠标框选仅含文字的区域,避免 OCR 被干扰。 -
开启“增强识别”(推荐勾选):
自动进行对比度拉伸 + 文字方向校正 + 噪点抑制——对手机拍摄的倾斜、反光、阴影图片特别有用。
点击上传后,右上角会出现一个实时进度条,同时下方日志区滚动显示:
[OCR] Loading PaddleOCR Japanese model...
[OCR] Preprocessing image (resize, denoise, rotate)...
[OCR] Running text detection...
[OCR] Running recognition on 12 text boxes...
整个过程约 1.8 秒(RTX 4060 笔记本实测),比手机拍照翻译 App 还快。
3.3 查看识别结果:不只是“文字列表”,而是“可编辑的结构化数据”
OCR 完成后,页面自动跳转到 Results → OCR 标签页。这里不是简单罗列文字,而是以表格形式呈现每一块识别内容:
| Box ID | Text | Confidence | Language | BBox (x,y,w,h) |
|---|---|---|---|---|
| 001 | マグロ(赤身) | 0.982 | ja | [42, 87, 156, 28] |
| 002 | ¥1,200 | 0.991 | en | [210, 85, 82, 26] |
| 003 | サーモン | 0.976 | ja | [42, 125, 98, 27] |
你可以:
- 点击任意一行,高亮对应图片上的识别框;
- 双击
Text单元格,手动修正错字(比如把“サーモン”改成“サーモン(三文鱼)”); - 拖拽调整
BBox坐标,重新划定识别范围; - 点击右侧
→ Translate按钮,将当前行单独提交翻译。
这种“所见即所得”的交互,让 OCR 不再是“一锤子买卖”,而是可验证、可干预、可迭代的环节。
3.4 自动翻译:双引擎 fallback + 上下文感知
点击整页的 Translate All,ClawdBot 开始调用翻译流水线。它不是简单把所有文字拼成一段扔给翻译 API,而是做了三层处理:
- 语言聚类:自动将日文(ja)、数字价格(en)、英文单位(g / pcs)分组,避免“¥1,200”被误译成“人民币1200元”;
- 上下文注入:在翻译请求中附带提示:“这是一份日本寿司店菜单,请用美式英语翻译,保留价格符号和单位,专业简洁”;
- 双引擎 fallback:
- 首选 LibreTranslate(完全离线,响应快);
- 若返回空或置信度<0.85,则自动切到 Google Translate(需联网,质量更高)。
最终生成的翻译结果如下(左侧为原文,右侧为译文):
| 原文 | 译文 | 引擎 | 耗时 |
|---|---|---|---|
| マグロ(赤身) | Tuna (Akami) | LibreTranslate | 0.32s |
| ¥1,200 | ¥1,200 | — | — |
| サーモン | Salmon | LibreTranslate | 0.28s |
| トロ(大トロ) | Toro (Otoro) | Google Translate | 0.76s |
关键细节:价格行未被翻译,因为 ClawdBot 识别出它是纯数字+货币符号,属于“无需翻译的元信息”。这种判断不是靠规则硬编码,而是基于 vLLM 模型对文本语义的实时理解。
3.5 发送至 Telegram:不是“发消息”,而是“触发 MoltBot 工作流”
ClawdBot 本身不连接 Telegram。它的“发送”按钮,本质是向本地运行的 MoltBot 发起一个 HTTP POST 请求,载荷包含:
{
"chat_id": "-1001234567890",
"message": "【Sushi Menu Translation】\nTuna (Akami) — ¥1,200\nSalmon — ¥980\nToro (Otoro) — ¥2,500",
"source_image_url": "http://localhost:7860/files/menu_jp_20260124.jpg"
}
MoltBot 收到后,会:
- 自动添加来源水印(“via ClawdBot”);
- 检查目标群是否启用“图片翻译”功能;
- 若开启,则将原文图片+译文文本合并为一张带双语标注的卡片图,再发送;
- 同时记录本次任务 ID,供后续在 ClawdBot 的 History 标签页追溯。
你不需要配置 webhook、不用管理 bot token、不碰 Telegram Bot API——ClawdBot 和 MoltBot 通过本地 Unix Socket 通信,零配置、零暴露、零中间代理。
4. 为什么这套流程值得你花时间部署?
很多人会问:手机拍照翻译 App 不香吗?为什么还要自己搭一套?
答案藏在三个被忽略的刚性需求里:
4.1 隐私不是“选项”,而是“默认状态”
- 手机 App 上传的每张图,都经过厂商服务器;OCR 结果、翻译记录、使用频次,全在对方数据库里;
- ClawdBot + MoltBot 的整个链路,图片只存在于你本地
/app/workspace目录,OCR 模型在内存中加载,翻译请求若用 LibreTranslate 则全程离线——你的菜单图,永远不会离开你的硬盘。
4.2 稳定不是“大概率可用”,而是“故障可定位”
- 当翻译突然变慢,App 只给你一个“加载中…”图标;ClawdBot 的 Monitoring 面板则实时显示:
- OCR 队列深度:2(正常<5)
- vLLM GPU 显存占用:62%
- LibreTranslate 响应 P95 延迟:0.41s
- 最近 10 分钟错误日志:0 条
- 一切异常,都可归因到具体模块,而不是归咎于“网络不好”。
4.3 可控不是“只能开关”,而是“每个齿轮都可调”
- 你想让 OCR 更侧重日文假名?改
clawdbot.json里的"ocr_lang": "ja"; - 你觉得 Google 翻译太啰嗦?在 UI 的 Config → Translation 里,把提示词从“专业简洁”换成“口语化,带emoji”;
- 你发现群聊里常发 PDF 菜单?在 Models → Providers 添加
pdf2image插件,ClawdBot 就能自动转 PDF 第一页为图片再 OCR。
这不是“用一个工具”,而是“拥有一个工具链”。
5. 总结:ClawdBot 不是终点,而是你掌控 AI 的起点
ClawdBot 的价值,从来不在它能多快翻译一张图,而在于它把原本黑箱的 AI 流程,拆解成你肉眼可见、手指可触、逻辑可溯的每一个环节:
- 你看到的不是“翻译结果”,而是 OCR 的识别框、翻译引擎的选择、上下文提示的注入;
- 你操作的不是“一键生成”,而是对每张图做区域裁剪、对每行字做人工校验、对每次翻译做策略切换;
- 你部署的不是“一个机器人”,而是本地可控的 AI 工作台,它随时听你调度,也随时为你留出调试入口。
它不承诺“取代你”,而是坚定地站在你身后,把技术的不确定性,变成你指尖的确定性。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
更多推荐



所有评论(0)