java识别图片文字视频_使用单模板工作流开发应用-华为云

使用单模板工作流开发应用

Pro的文字识别套件提供了通用单模板工作流，通过工作流指引可构建文字识别模板，识别单个板式图片中的文字，快速实现文档、票证等场景的文字识别。本章节提供一个身份证样例，帮助您快速熟悉使用文字识别套件中的通用单模板工作流开发应用的过程。通过上传模板图片、框选参照字段和识别区，自动训

来自：帮助中心

查看更多 →
约束与限制

能处理反光、暗光等干扰的图片但影响识别精度。目前支持识别单张身份证的正面或者反面。支持居民身份证的正反面同时识别，不支持存在两张及以上同面身份证的图片识别。文字识别服务属于公有云服务，线上用户资源共享，如果需要多并发请求，请提前联系我们。户口本识别只支持识别PNG、JPG、JPEG、BMP、TIFF格式的图片。

来自：帮助中心

查看更多 →
框选参照字段

框选参照字段在文字识别过程中，套件会检查所识别图片与模板图片是否为同一种模板，并将识别图片校正后再提取结构化信息，支持图片平移、旋转与拉伸变换。为了检查并校正待识别的图片，这就需要在模板图片中指定参照字段。通过参照字段的文字内容来判断是否属于同一种模板，通过参照字段的位置来校正待识别图片。

来自：帮助中心

查看更多 →
什么情况下可以使用自定义模板？

业证上的文字信息。自定义模板支持识别单模板应用或是多模板应用，单模板仅支持一种版式，多模板支持识别多种版式。单模板的前提：识别图片需与模板图片版式相同，具体而言，图片中要存在文字内容和位置均固定不变的文字（参照字段）。识别文字内容不能偏离设定的识别区域，包括打印偏移、由上下文长度变化引起的偏移等。

来自：帮助中心

查看更多 →
上传模板图片

需要定制识别的字段。例如上传某一格式的发票图片作为模板，配置文字识别模型就能识别并提取同格式发票上的关键字段。前提条件已在“自定义OCR”控制台选择“通用单模板工作流”创建应用，详情请见6.2新建应用。提前准备待识别的图片，图片要求请见图片要求。图片要求保证图片质量：不

来自：帮助中心

查看更多 →
最新动态

识别的结构化结果。银行卡识别：识别银行卡上的关键文字信息，并返回识别的结构化结果。营业执照识别：识别营业执照图片中的文字信息，并返回识别的结构化结果。商用 - 3 新增护照识别、道路运输证识别护照识别：识别护照图片中的文字信息，并返回识别的结构化结果。道路运输证识别：识

来自：帮助中心

查看更多 →
框选参照字段

框选参照字段在识别文字的过程中，套件会先对图片进行模板分类，再检查所识别图片与模板图片是否为同一种模板，并将识别图片校正后再提取结构化信息，支持图片平移、旋转与拉伸变换。为了正确分类并校正待识别的图片，这就需要在模板图片中指定参照字段。通过参照字段的文字内容来判断识别图片属于哪一种

来自：帮助中心

查看更多 →
自定义OCR介绍

自定义OCR基于丰富的文字识别算法和行业知识积累，帮助客户快速构建满足不同业务场景需求的文字识别服务，实现多种版式图像的文字信息结构化提取。工作流自定义OCR当前提供了单模板工作流和多模板工作流，自主构建文字识别模板，识别模板图片中的文字，提供高精度的文字识别模型，保证结构化信息提取精度。

来自：帮助中心

查看更多 →
行业套件介绍

行业套件介绍文字识别套件基于丰富的文字识别算法和行业知识积累，帮助客户快速构建满足不同业务场景需求的文字识别服务，实现多种版式图像的文字信息结构化提取。文字识别套件的介绍请参见产品介绍。预置工作流文字识别套件当前提供了单模板工作流和多模板工作流，自主构建文字识别模板，识别模板图片

来自：帮助中心

查看更多 →
准备算法相关信息

算法封面、视频封面和多媒体介绍图片，可使用同一张图片，具体要求参见算法封面的图片要求。图片分辨率不小于800*600，推荐比例4：3，支持JPG/JPEG/PNG/GIF格式，≤5M。视频分辨率1280*720，支持MP4格式，20s以内，≤100M。仅支持上传一个视频，图片和视频一共≤5个。

来自：帮助中心

查看更多 →
评估应用

评估应用确定模板图片的参照字段和识别区后，需要对模板图片进行评估和考察。您可以通过上传测试图片，在线评估模板的识别情况，保证能正确识别同样模板下其他图片中的识别区文字。前提条件已在文字识别套件控制台选择“通用单模板工作流”新建应用，并完成框选识别区步骤，详情请见框选识别区。进入评估页面

来自：帮助中心

查看更多 →
框选识别区

框选识别区在文字识别过程中，需要确定图片中识别的文字位置，这就需要在图片模板中框选识别区。识别区指图片中待识别的文字位置。所有需要识别的图片中都会包含此识别区的字段，且位置固定不变，因此模型可以通过识别区找到需要识别内容的位置。前提条件已在文字识别套件控制台选择“多模板分

来自：帮助中心

查看更多 →
准备数据

受技术与成本多种因素制约，文字识别服务存在一些约束限制。以通用文字识别API为例，输入数据存在以下约束。其他API的的使用约束请参见约束与限制。只支持识别PNG、JPG、JPEG、BMP、TIFF格式的图片。图像各边的像素大小在15px到8192px之间。图像中识别区域有效占比超过

来自：帮助中心

查看更多 →
使用多模板工作流开发应用

一步”。进入“应用开发>框选识别区”页面。步骤6：框选识别区在“应用开发>框选识别区”页面，通过单击左上方操作图标，调整当前模板图片到合适大小。单击框选操作图标，单击待识别文字的左上角，移动鼠标框选识别区，使得矩形框覆盖待识别的文字。识别区是对应字段内容所在区域。在框选

来自：帮助中心

查看更多 →
预置模板参数说明

角），则文字水印右上角到视频右顶点在水平方向上偏移距离为192。 trans_twm_dy 文字水印起点相对输出视频顶点的垂直偏移量。设置方法有如下两种：整数型：表示文字起点垂直偏移视频顶点的像素值，单位px。取值范围：[0，4096] 小数型：表示文字起点相对于视频分辨率高

来自：帮助中心

查看更多 →
算法包介绍

20 人员上衣长短袖识别 21 人员下装颜色检测 22 人员下装款式检测 23 人员朝向识别 24 边缘个体动作识别攀爬行为检测个体动作识别算法通过对监控视频流中的人物进行实时的检测与跟踪，并估计其人体骨架，结合单帧姿态识别和多帧动作识别实现高效准确的个体动作识别。算法可部署于工

来自：帮助中心

查看更多 →
如何提高识别精度

如何提高识别精度尽量使用文字清晰度高、无反光的图片。进行图片采集时，尽量提高待识别文字区域占比，减少无关背景占比，保持图片内文字清晰人眼可辨认。若图片有旋转角度，算法支持自动修正，建议图片不要过度倾斜。图片尺寸方面，建议最长边不超过8192像素，最短边不小于15像素，图像长宽比例维持常见水平

来自：帮助中心

查看更多 →
方案概述

FunctionGraph，用于实现调用文字识别服务业务逻辑，当收到OBS上传图片通知后，自动调用文字识别 OCR服务进行电子面单识别、网络图片识别并将结果存放在OBS桶内。使用文字识别 OCR，提供电子面单识别和网络图片识别。用户只需要将电子面单图片或含有收/寄件信息的截图上传至OBS桶，即可自动识别提取收/

来自：帮助中心

查看更多 →
框选识别区

框选识别区在文字识别过程中，需要确定图片中识别的文字位置，这就需要在图片模板中框选识别区。识别区指图片中待识别的文字位置。所有需要识别的图片中都会包含此识别区的字段，且位置固定不变，因此模型可以通过识别区找到需要识别内容的位置。前提条件已在文字识别套件控制台选择“通用单模

来自：帮助中心

查看更多 →
数字人回复图元

5时播报语速最快）， TTS 高级配置开启时可配。合成视频配置：“开启”、“关闭”。默认关闭。图5 合成视频配置动作：手动输入，配置数字人需要使用的动作，合成视频配置开启时可配置。图片视频设置：包括了前景图、后景图、前景视频、后景视频设置。图6 图片视频设置前景图：用于合成数字人视频时，配置需要在数字人

来自：帮助中心

查看更多 →
是否支持发送彩信，图片或视频？

是否支持发送彩信，图片或视频？国内短信仅支持发送文字形式的短信。不支持发送视频、图片与文字选择结合的短信。父主题：产品规格

来自：帮助中心

查看更多 →