Harmony Intelligence AI 开放能力深度解读 | 图像超分 + 文搜图:端侧视觉的“放大镜“与“搜索引擎“

HarmonyOS 7.0.0(API 26)· Core Vision Kit 端侧视觉 AI 新能力
开篇:当"系统级能力"变成几行代码
HarmonyOS 7.0.0(API 26)的 Core Vision Kit 悄悄补上了两块原本属于"重投入"的端侧视觉拼图:图像超分(Image Super-Resolution) 与 文搜图(Text-to-Image Search)。前者把一张低清图在端侧重建为 4 倍高清,后者让你用一句"海边日落"从本地相册里捞出对应照片——两者最大的共同点是:推理跑在设备 NPU 上,图片与文本数据全程不出设备。
这些能力正在把"造奇迹"的门槛削平。在 HDC 2026 极客赛决赛里,20 支团队借助 HarmonyOS 7(API 26)的空间计算、端侧 AI 等系统级能力,在 36 小时内完成极限编码。参赛者里有工艺美院的学生、师范专业的大一新生,也有独立开发者——当底层模型被收进 import { ... } from '@kit.CoreVisionKit' 这样的几行代码,写奇迹的人,就不再是只有大厂的算法团队。
上期我们拆解了 Core Vision Kit 的人脸检测与通用文字识别能力,看清了端侧智能感知如何"看得清脸、认得出字"。本期把镜头拉到更日常的两件事上:让模糊的图变清晰,让找不到的图被一句话唤出。
一、两种新能力,到底是什么?
1.1 图像超分:端侧 4 倍高清重建
图像超分(Image Super-Resolution)不是"放大",而是"重建"。
传统插值把周围像素取平均,像素变多了、信息没变多,所以放大后发虚;端侧超分用的是系统预置的视觉模型,模型在海量"清晰图—模糊图"配对上训练过,它做的是基于上下文预测并补全合理细节——边缘被锐化、纹理被还原、压缩噪点被压住。API 26 里它把输入图的像素同步放大 4 倍,整条链路在设备内完成。
它的关键边界很清晰:
- 归属:
@kit.CoreVisionKit下的imageSuperResolution,分析器(Analyzer)模式。 - 起始版本:26.0.0(HarmonyOS 7 / API 26),仅 Stage 模型。
- 设备:Phone / PC·2in1 / Tablet。
- 倍率:固定 4 倍,不可配置;输入原图最大 2048×2048,超限需先等比缩放。
- 运行位置:端侧 NPU/XPU 异构推理,图片不出设备。
1.2 文搜图:自然语言检索本地图片
文搜图(Text-to-Image Search)解决的是"找图"这件事。
传统相册搜索是"文本对文本"——搜文件名、搜手动备注,没打过标签的照片等于不存在。文搜图是文本对图像的跨模态检索:端侧模型把每张图编码成一个语义向量,把你说的一句话也编码进同一语义空间,两个向量算相似度,语义越接近分越高。所以"海边日落"不需要出现在任何文件名里,只要画面里真有海边和日落,就能被捞出来。
它的能力规格如下:
- 归属:
@kit.CoreVisionKit下的textSearchImage。 - 起始版本:26.0.0,仅 Stage 模型;支持 Phone / Tablet / PC·2in1。
- 区域:仅适用于中国境内(香港特别行政区、澳门特别行政区、中国台湾除外)。
- 输入约束:
imagePath为沙箱绝对路径(不带file://,长度 1–128);scope作用域仅字母/数字、长度 1–32;query查询词长度 1–100,不支持纯数字与纯字母,支持中文;topKey返回上限 0–100,默认 100。 - 返回:
ImageObject数组,含imagePath(沙箱路径)、scope(作用域)、similarity(相似度,范围 [-1, 1],越大越相似)。
二、能用在哪?典型场景
图像超分覆盖一切"图不够清晰"的现场:
- 老照片修复:低清扫描件、旧手机拍的合影,一键补出细节。
- 电商素材放大:后台存缩略图、前端超分看大图,用"查看时算力"换"存储空间"。
- 截图 / 文档增强:聊天截图、PPT 截图放大后文字边缘依旧利落。
- 证件照放大:小图放大用于打印预览,省去重新拍摄。
- 压缩存、超分看:传输只走低清图,显示端 4 倍重建,弱网也顺滑。
文搜图覆盖一切"图找不到"的现场:
- 智慧相册:“去年海边日落的那张”“猫趴在窗台”,一句话定位。
- 聊天 / 社交检索:对话里以图搜图,按语义召回相关图片。
- 电商以文搜图:用描述词从商品图库里挑图,无需提前标注。
- 私密 / 本地图库:数据不出设备,敏感图也能语义检索。
- 素材库管理:设计稿、截图按内容分组(scope)过滤,零标注可检索。
三、行业普遍痛点:模糊的图救不回,找不到的图捞不出
开发者自研或接入传统方案时,常被两件事卡住:
图像超分侧
- 云端超分有延迟、有隐私、有成本:上传原图到服务器再下高清,弱网卡顿、流量消耗、敏感图出设备。
- 传统插值只是放大不是增强:平均像素,越放越糊,文字边缘发虚。
- 自研模型门槛高:算法团队、训练数据、端侧功耗与多机型适配,都是重投入。
文搜图侧
- 靠文件名 / 标签检索,语义理解弱:没打过标签的照片等于"隐身",“橘猫窗台"搜不出"cat_window.jpg”。
- 云端搜索隐私风险高:把整座相册上传做特征提取,触碰隐私红线,降低用户信任。
- 无标签图不可检索:随手拍、截图、未分类素材,传统方案基本束手无策。
共性痛点:端侧算力不足、模型体积大、接入链路长——这三点把视觉 AI 锁在了大厂机房里。
四、端侧一站式方案:本地闭环,两个能力各自成环
图像超分:端侧 NPU/XPU 异构推理,不依赖云端。系统负责三件核心事——
- 边缘增强:锐化物体轮廓、文字边界、线条。
- 纹理补全:依据上下文重建产品表面、建筑线条、照片细节。
- 降噪:压制压缩图常见的块效应与模糊噪点。
开发者要做的只是"把图转成 PixelMap,交给分析器",create → process → destroy 三段式即可。
文搜图:端侧建索引 + 自然语言查询,全程闭环。
- 建索引:
insertImage把沙箱图片写入端侧特征库,按scope分组。 - 自然语言查询:
search接收一句中文描述,返回按相似度降序的命中列表。 - 作用域过滤:同一句话可在不同
scope(如album/pet/work)里分别检索,互不串扰。
注意:超分本质是"模型在猜"——它可能猜错。商品图上模糊的一行小字,超分后可能变成清晰但错误的字。因此它适合提升观感,不建议用于身份证件、证据类强真实细节场景。
五、三大差异化优势,打通行业瓶颈
- 隐私安全可控:超分与文搜图全流程在端侧执行,图片、文本数据不出设备,从源头规避泄露风险,适配私密相册、个人证件、办公票据等高敏感业务。
- 极简开发接入:开发者无需自研算法、训练模型、做端侧功耗与机型适配,直接调用系统 AI 能力,开发周期与运维成本同步压缩。
- 实时离线可用:本地 NPU 推理,无云端排队、无网络延迟、无额外流量,弱网甚至飞行模式下照样可用。
六、双向价值:开发者轻松构建,消费者体验跃升
对开发者:降本增效
- 快速复用:直接接入成熟系统级模型,省去算法自研、训练、调参、设备适配。
- 稳健兼容:系统模型经多终端、多场景打磨,识别/检索准确率与容错有保障。
- 轻量低耗:端侧算力调度执行,不占云端服务器与带宽,运营成本可控。
对消费者:体验升级
- 极速响应:本地实时处理,即拍即超分、即说即找图,无卡顿。
- 随手可用:不用刻意摆正角度、不用先打标签,随手拍的图也能被检索、被增强。
- 内容可复用:超分结果可保存分享,检索结果可一键打开、复制、转发。
七、开发接入指引
以下为 API 26 调用范式示意(类型与方法名对齐官方文档),点击可查看完整指南:
- 图像超分 开发指南:https://developer.huawei.com/consumer/cn/doc/harmonyos-guides/core-vision-image-super-resolution
- 图像超分 API 参考:https://developer.huawei.com/consumer/cn/doc/harmonyos-references/core-vision-image-super-resolution-api
- 文搜图 API 参考:https://developer.huawei.com/consumer/cn/doc/harmonyos-references/core-vision-text-search-image-api
7.1 图像超分(ArkTS)
import { imageSuperResolution, visionBase } from '@kit.CoreVisionKit';
import { image } from '@kit.ImageKit';
import { fileIo } from '@kit.CoreFileKit';
// 1. 创建图像超分分析器(建议在页面创建时调用一次,可页面内复用)
const analyzer: imageSuperResolution.ImageSRAnalyzer =
await imageSuperResolution.ImageSRAnalyzer.create();
// 2. 将本地图片解码为 RGBA_8888 的 PixelMap
const file = await fileIo.open(path, fileIo.OpenMode.READ_ONLY);
const imageSource = image.createImageSource(file.fd);
const inputPixelMap = await imageSource.createPixelMap({
desiredPixelFormat: image.PixelMapFormat.RGBA_8888,
});
// 3. 组装请求:图片先包成 visionBase.ImageData,再放进 Request
const imageData: visionBase.ImageData = { pixelMap: inputPixelMap };
const request: visionBase.Request = { inputData: imageData };
// 4. 执行端侧超分,返回像素同步放大 4 倍的结果
const response: imageSuperResolution.ISPResponse = await analyzer.process(request);
const outputPixelMap: image.PixelMap = response.pixelMap; // 直接交给 Image 组件显示或保存
// 5. 用完释放分析器(页面退出或不再使用时调用,避免常驻内存)
await analyzer.destroy();
7.2 文搜图(ArkTS)
import { textSearchImage } from '@kit.CoreVisionKit';
// 1. 初始化端侧检索服务(返回 true 表示就绪)
const ok: boolean = await textSearchImage.init();
if (!ok) {
// 初始化失败:检查设备型号、系统版本与区域支持(仅中国境内可用)
}
// 2. 把沙箱图片写入端侧特征库(scope 为分组标识,仅字母/数字,长度 1-32)
await textSearchImage.insertImage(sandboxImagePath, 'album');
// 3. 用自然语言检索,返回按相似度降序的命中列表
const hits: textSearchImage.ImageObject[] =
await textSearchImage.search('海边日落', 'album', 10);
// hits[].imagePath 沙箱路径
// hits[].similarity 图文相似度,范围 [-1, 1],越大越相似
// hits[].scope 插入时写入的作用域
// 4. 能力更新或不再使用时释放服务
await textSearchImage.release();
八、下期预告
Harmony Intelligence AI 开放能力深度解读下一期,我们将继续拆解 Core Vision Kit 与更多 Harmony Intelligence 系统级能力,把"端侧 AI 还能做什么"讲透。敬请期待。
本文为原创技术解读,聚焦 HarmonyOS 7.0.0(API 26)Core Vision Kit 端侧视觉新能力,代码示例为调用范式示意,实际接口以华为官方文档为准。
更多推荐


所有评论(0)