登录社区云,与社区用户共同成长
邀请您加入社区
前面六篇分别讲了 OCR、超分、文搜图、人脸检测、截图分类和处理链。这篇是系列最后一篇,把所有能力整合起来,做一个完整可用的智能截图整理工具。这个工具的最终形态很简单:用户导入截图,App 自动识别内容、分类、打标签、建索引,用户可以按分类浏览、用文字搜索、查看详情。所有处理都在本地完成,不上传图片。这篇不讲单个 API 怎么调,而是讲怎么把前面六篇的能力组装成一个完整的产品。从项目结构到页面设计
前面五篇分别讲了 OCR、超分、文搜图、人脸检测、截图分类。每篇单独都能跑,但真要用到产品里,得把它们串成一条完整的处理链。用户导入一张截图,从图片到最终可搜索、可分类的结构化数据,中间要经过好几个步骤,每一步都可能失败。这篇就讲怎么设计这条处理链:怎么安排步骤顺序,怎么做状态管理,失败了怎么重试,怎么让整个流程既高效又稳定。
前面几篇把 OCR、超分、文搜图、人脸检测都单独讲了一遍。这篇开始把它们串起来,做一个实际的功能:截图自动分类。我们的智能截图整理工具的核心需求就是:用户截了一堆图,App 自动帮你分类——哪些是聊天记录、哪些是文档、哪些是截图、哪些是人脸照片。分好类之后用户找起来方便,也不用自己手动整理。这个功能的难点不在于调单个 API,而在于怎么把多个视觉能力组合起来,做一套分类规则,并且分类结果要稳定、准
相册应用里有个常见功能:检测图片里有没有人脸,有的话自动归到"人物相册"里,或者给人脸打标签。我们在做智能截图整理工具的时候,也需要判断截图里有没有人脸——有截图是聊天记录,有的是人脸照片,分类逻辑不一样。HarmonyOS 7 的人脸检测能力在 VisionKit 里,端侧运行,速度很快。这篇就讲讲怎么把人脸检测集成到我们的图片处理流程里,从检测位置到多目标处理,再到隐私边界怎么把控。
做了 OCR 和超分之后,产品又提了个需求:用户能不能用一句话找图片?比如输入"去年在海边拍的那张",相册就能把海边的照片筛出来。这个功能在 iOS 和安卓上已经有了,鸿蒙端侧能不能做?研究了一下,HarmonyOS 7 的端侧多模态能力支持文搜图——把文字描述和图片做向量匹配,返回相似度最高的几张。这个能力完全在本地跑,不用上传图片到云端,隐私安全有保障。这篇就讲讲我们怎么把它集成到相册应用里。
上一篇做了 OCR 文字识别,实际用下来发现一个问题:用户拍的图片经常是模糊的、低分辨率的,OCR 识别率就上不去。尤其是票据、截图这类内容,原始分辨率不高的时候,文字边缘都是锯齿,识别出来全是错的。这时候就需要先把图片做超分增强,把低清图放大变清晰,再去做识别。HarmonyOS 7 有端侧的图像超分能力,这篇就讲讲怎么把它集成到我们的图片处理流程里。
做笔记应用的时候,经常有用户提需求:能不能拍一张票据或者截图,直接把上面的文字识别出来,不用手动敲?这个需求听起来简单,真做起来才发现,鸿蒙的 OCR 能力虽然开箱即用,但要做到识别准、不卡顿、异常兜底到位,还是有不少细节要抠的。这篇是端侧 AI 视觉系列的第一篇,就从最基础的文字识别开始讲。我们做的是一个笔记类应用,需要从用户拍的图片里提取文字,自动填充到笔记里。从最开始调 API 的 Demo