更新时间:2026-09-23 GMT+08:00
分享

搭建图像理解工作流

场景介绍

用户上传图片,通过AgentArts工作流调用图像理解大模型Qwen2.5-VL-72B,自动识别图片中的可见内容,如建筑特征、自然风光等,并以文字形式返回识别结果。该场景适用于图片内容标注、图片信息提取等应用场景。

效果展示

上传图片,如图1所示,运行结果如图2所示。
图1 试运行配置
图2 效果展示

前提条件

操作步骤

搭建工作流详细步骤如下:

本工作流每次运行将调用图像理解大模型。图像理解大模型处理图片时,图片会消耗大量token,单次调用费用高于纯文本调用。建议先使用小尺寸图片进行调试,确认工作流正常后再使用正式图片。详情请参见计费说明。

步骤一:创建工作流

  1. 单击左侧导航栏“开发中心 > 智能体管理 ”,选择“工作流”页签,单击右上角“创建工作流”。
  2. 选择创建“任务型工作流”,在对应的创建页面,配置工作流相关信息,具体如图3所示,参数如表1所示。

    图3 创建工作流
    表1 参数说明

    参数名称

    示例

    说明

    名称

    图像理解工作流

    支持中英文、数字、下划线、中划线和空格,长度2~64个字符,但不允许以空格开头或结尾。

    描述

    根据用户上传图片,识别图片中内容,并以文字形式返回内容。

    描述工作流的功能,可直观呈现给用户,长度0~1024个字符。

  3. 配置完成后单击“立即创建”,进入工作流编排页面。

步骤二:配置工作流节点

工作流各个核心节点的配置方式如下:

表2 节点配置说明

节点类型

说明

示例

开始节点

添加1个必选的输入参数,接收用户上传的图片。
  • 参数名称:image
  • 参数类型:Array<File>/Image
  • 描述:图片
  • 必填:勾选。

大模型节点

该节点利用图像理解模型对图片进行内容识别。

  • 模型配置:选择图像理解模型Qwen2.5-VL-72B。
  • 视觉理解输入:单击,选择开始节点的image Array<File/Image>参数。
  • 输入参数:

    单击,新增定义内容如下:

    image,引用开始节点的image,描述为用户上传的图片。

  • 输出参数:

    保持默认。

  • 提示词配置:
    • 系统提示词

      保持默认。

    • 用户提示词:
      你是图像理解助手。
      根据提供的图片{{image}},回答用户的问题。
      
      用户问题:{{query}}
      
      要求:
      1. 回答必须严格基于图片中可见内容,不能编造图片不存在的信息;
      2. 如果图片信息不足、看不清、没有对应内容,如实说明,不得臆测;
      3. 回答简洁准确,不要冗余;
      4. 不要臆测图片以外的背景、时间、人物信息,只能使用图片视觉信息。

结束节点

此节点将图片内容输出。

  • 输入参数:result,引用“大模型”节点的raw_output。
  • 指定回复:
    {{result}}

步骤三:调试工作流

配置完成后,在工作流编排界面单击右上角,在试运行配置中的“image”框中,上传图片,如图4所示。配置完成后单击“开始运行”。
图4 试运行配置
图5 效果展示

步骤四:提交版本

  1. 工作流试运行成功后,在工作流编排页面,单击右上角“提交版本”。
  2. 输入版本号与版本描述,如图6所示。

    图6 提交版本

相关文档

  • 编排工作流时,画布相关的详细操作介绍,请参见创建工作流。
  • 在创建和运行工作流时,可能会遇到的常见问题,请参见《常见问题》。
  • 工作流创建完成后,如果需要通过API调用,则需要将提交的版本部署至实例,具体操作请参见发布并部署工作流。

常见问题

Q:报错“AgentArts.102056”,如何处理?

A:试运行工作流时,如果报错AgentArts.102056,请按如下操作进行处理:
图7 报错信息

检查输出参数的类型与提示词要求的类型是否一致。如果不一致,请同时调整参数类型和提示词中要求输出的类型,使二者匹配,从而解决该问题。

相关文档