以专用小模型为主、大模型为辅,朗镜科技ShelfMind确保“零售货架SKU识别”批量稳定上线
多模态大模型像一位全科医生,专用小模型像一位专科医生,二者各有所长。有合作伙伴问:“在门店稽查、货架陈列检核环节,朗镜科技的图像识别方案到底用哪个?”
答案是:两个都用。
朗镜科技ShelfMind的架构是以专用小模型为识别主力,大模型在复杂理解和语义汇总等环节辅助配合。各司其职,图像识别才能真正常量产出。
为什么这么设计?因为很多客户在通用大模型上试完单张货架图识别觉得“太强了”,但一谈到批量落地就发现:纯靠大模型做零售图像识别,又慢又贵还不稳定。
单图演示效果好,和批量稳定上线,是两码事。

LENZ:为什么大模型单图识别看着好,批量容易翻车?
在通用大模型上随手发一张货架图问“XXSKU有几个排面”,它答得头头是道。但是:
· 那是单张图,不是几千张;
· 那是一次性提问,不是7×24小时稳定调用;
· 答案对不对是人眼判断的,系统不会自动校验;
· 单图验证的是方向,验证不了量产。
批量上线,至少还要补这些:
· 效果能不能量化?——准确率多少?一致吗?
· 速度跟得上吗?——高峰期会超时吗?
· 成本算得清吗?——一天几万张图花多少钱?
· 结果能用吗?——大模型给一段话,业务系统要结构化数据。
· 出错了怎么办?——谁来兜底?
这些不测清楚,POC(概念验证)好看,上线必翻。
LENZ:复杂场景,大模型只是其中一环,小模型才是主力
举个真实例子:货架照片 → 输出每个商品售价。
听起来简单?实际要7步:价签检测(小模型)→ SKU识别(小模型)→ OCR(大模型)→ 几何匹配(算法)→ 语义汇总(大模型)→ 数据补全(算法)→ 出表。

大模型只负责其中2步。SKU识别离不开专用小模型,两者配合,才是零售图像识别的正解。缺任何一步,结果都可能出问题。
零售图像识别批量落地,得把效果、速度、成本、解析、兜底都跑通。复杂场景更要搭流水线——小模型干能干的活,大模型做它擅长的事。
这就是朗镜科技ShelfMind一直在做的事。不迷信大模型,也不死守小模型,能稳定出数的方案,才是好方案。
「免责声明」:以上页面展示信息由第三方发布,目的在于传播更多信息,与本网站立场无关。我们不保证该信息(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关信息并未经过本网站证实,不对您构成任何投资建议,据此操作,风险自担,以上网页呈现的图片均为自发上传,如发生图片侵权行为与我们无关,如有请直接微信联系g1002718958。
更多推荐
所有评论(0)