# 配置服务信息
![](https://support.huaweicloud.com/inference-modelarts/public_sys-resources/note_3.0-zh-cn.png)
在线服务有新旧2个版本，推荐使用新版在线服务。
#### 场景描述
推理服务信息负责对外统一入口，确保模型迭代时调用地址永久稳定。支持配置认证方式、网络访问策略及全局流量开关。
#### 计费说明
服务信息不涉及计费。
 #### 配置服务信息
1. 登录[ModelArts管理控制台](https://console.huaweicloud.com/modelarts/)，在左侧导航栏中选择"模型推理 \> 在线推理"，默认进入"在线推理"列表。
2. 在"在线服务"列表中，单击"部署"。
3. 在"部署在线服务"页面，配置服务信息。
   图1基本配置   
   ![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002630675132.png)
   
   表1基础信息参数说明 
   | 参数名称   | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                 | 示例                                                                                                                                 |
   |:---|:---|:---|
   | 服务名称 | 在线服务的名称，用于标识和管理在线服务。请按照界面提示规则填写。支持大小写英文字母、数字、中划线、下划线及中文，长度限制为1\~128位。                                                                                                                                                                                                                                                                                                                                                                                                                                                              | service-e16d 系统自动生成，无需填写。 |
   | 描述    | 在线服务的简要说明。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         | /                                                                                                                                  |
   | 服务类型                                                   | 选择在线服务的服务类型，服务类型为文本生成的在线服务部署成功后，可支持对比推理服务效果。实时对比详情请见[实时比对](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0001.html)。 服务类型支持：其他、文本生成、图像理解、视频生成、图像生成、重排序、向量模型、Embedding模型。                                                                                                                                                                                                                                                                                                                          | 文本生成                                                                                                                              |
   | 服务调用模式                                                   | 在线服务支持同步调用和异步调用。 - 同步调用：您的请求发送后，将持续等待服务端返回处理结果，在此过程中连接保持不中断，直至获取最终响应或超时，适用于耗时较短、需要实时获取结果的推理任务。服务创建后，调用模式不支持修改。  - 异步调用：您的请求发送后，服务会立即确认接收，并在后台进行处理，后续通过轮询的方式来获取推理结果。适用于如AIGC、视频处理等推理耗时较长，存在长连接超时导致请求失败或实例负载不均衡的场景。服务创建后，调用模式不支持修改。详情请见[异步推理](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0079.html)。   | 同步调用                                                                                                                              |
   | 单服务最大任务数                                                | 当"服务调用模式"选择"异步调用"时，需要设置单个服务所能创建的最大任务数。范围为0-10000。任务状态为succeeded、failed、created_failed、start_failed、upgrade_failed、timeout、deleted均不占用任务配额数量。任务状态可通过调用"查看任务详情"API获取。                                                                                                                                                                                                                                                                                                                                                                                                                     | /                                                                                                                                  |
   | 自动停止                                                    | 勾选后，需设置服务自动停止时间，默认为1小时，设置时长最多为24小时。 开启后，当服务运行时开始计时，运行时间超出您预设的时长，它将自动停止运行。 在线服务部署后，可在控制台"模型推理 \> 在线推理"页面单击更多\>设置自动停止，重新设置自动停止。                                                                                                                                                                                                                                                                                                                                                          | 勾选                                                                                                                                 |
      
   图2网络配置
   ![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002687029729.png)
    表2网络配置参数说明 
   | 参数             | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 示例           |
   |:---|:---|:---|
   | 服务接入方式       | 默认使用ModelArts平台能力，提供限额的外网访问，使用平台提供的默认预测地址。支持在平台内进行认证鉴权。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                              | 保持系统默认值    |
   | 服务协议           | 在线服务提供的推理接口、模型进程提供的接口所使用的协议，请根据实际定义的推理接口进行配置。 可选协议：HTTPS、HTTP、WSS、WS。 HTTP/WS明文协议会导致数据泄露、数据篡改、流量劫持、钓鱼攻击等安全问题。请谨慎使用。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                      | "HTTPS"    |
   | 认证方式            | 支持"API KEY认证"、"IAM Token认证"、"无认证"方式。 选择API KEY认证方式需要您部署在线服务后，在"授权管理"页面完成API KEY的创建及绑定服务。 选择无认证，客户端可以直接调用API，安全性低，适合临时测试的场景/内网调用使用，不建议外网直接使用。 三种认证方式详细请参考[访问在线服务支持的认证方式](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0005.html)。                                                                                                                                                                                                                                                                                                                                                                                                                                                                             | "API KEY认证" |
   | 弹性负载均衡 ELB (可选) | 使用ELB实例的IP私有地址或弹性公网IP地址作为推理服务请求入口，用户的推理将请求通过ELB转发至推理链路网关。 开启后，系统将在指定ELB下创建监听器、后端服务器组及成员。如果用户接入的ELB所属的VPC是首次接入，则会在该VPC下自动创建一个VPC终端节点，用于打通该VPC与在线服务所在的网络。该VPC终端的IP地址将作为ELB的后端服务器。 所选ELB规格需满足以下要求：实例规格为独享型；负载类型为应用型或网络型+应用型；网络配置需勾选IP类型后端。 通过弹性负载均衡ELB访问推理服务的详细介绍请参见[1.8.3-通过负载均衡连接内网访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0104.html)。                                                                                                                                                                                                                                                                                                                                                            | 保持默认        |
   | 更多配置              | - 外网访问：在线服务是否允许外网访问。默认开启。开启后允许外网访问服务，调用URL请在服务详情页查看在线服务调用信息。关闭后，不允许通过互联网访问在线服务。  - 内网接入免审批：在线服务内网连接是否需要审批。 开启后，三方用户的内网接入申请自动生效，无需审批。关闭后，需要审批。内网访问服务请参见[通过内网访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0011.html)。   - 访问管控：勾选后，可指定白名单或黑名单进行访问管控。 白名单：仅允许匹配的用户IP进行访问，最多支持添加10个正则表达式。 黑名单：仅不允许匹配的用户IP进行访问，最多支持添加10个正则表达式。    | 保持默认       |
      
   图3高可用配置   
   ![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002660914453.png)
   
   表3高可用配置参数说明 
   | 参数        | 说明                                                                                                                        | 示例   |
   |:---|:---|:---|
   | 流控策略      | 流控策略由"策略类型"与"流控方式"组成，相同的策略不支持重复添加，多个策略将作为规则集组合生效。参数说明请见[表4]。           | 保持默认   |
   | 请求超时时间（秒） | 发送请求后等待系统返回首Token结果的最长等待时间，输入值必须在1到1200之间，单位：秒，超过该时间仍未收到回复，请求将被自动终止。流式传输场景下,每次收到请求响应时，会重新刷新该超时时间，但系统端到端响应超时时间固定为 3600 秒。 | 保持默认 |
      
    表4流控策略参数说明 
   | 参数     | 子参数    | 说明                                                   | 示例     |
   |:---|:---|:---|:---|
   | 策略类型 | 请求大小限制      | 单个请求所包含数据总量的大小上限。请求大小范围：1\~50。单位：MB。                  | 保持默认   |
   | 策略类型 | 每秒请求上限    | 每秒能够被访问的次数上限。单元：次。输入值必须在1到10,000之间。                  | 保持默认   |
   | 流控方式  | 服务级固定流控  | 为服务设置一个固定的速率上限，超过该阈值后，新的请求会被立即拒绝。                     | 保持默认 |
   | 流控方式  | 按部署副本动态计算 | 服务实际速率将根据其部署副本数量动态调整，服务实际速率上限 = 部署副本阈值 \* 运行中的部署副本数量。 | 保持默认   |
      
   图4高级配置   
   ![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002633742802.png)
    表5高级配置参数说明 
   | 参数     | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                    |
   |:---|:---|
   | 日志对接LTS | 当在部署服务界面未开启"日志对接LTS"，则查看的是服务实时日志数据。 打开该配置后日志会投递到云日志服务（Log Tank Service，简称LTS）进行管理。计费采用按需计费方式，详情可参考[LTS定价详情](https://www.huaweicloud.com/pricing/calculator.html#/lts)。LTS自动创建日志组和日志流，默认缓存7天内的运行日志。支持在LTS上对在线服务的运行日志进行搜索和分析。 - 日志搜索：通过输入搜索语句，在日志数据中查找包含特定关键词的日志记录。或者根据时间范围来检索日志数据，帮助您定位特定时间段内发生的事件和问题。  - 统计图表：日志上报LTS后，支持通过SQL分析语法搜索关键日志数据，并将查询结果通过统计图表的方式进行可视化展示。  - 日志分析：执行搜索与分析前，需要将上报的日志进行结构化配置和索引配置，方便进行搜索与分析。  - 实时日志：在线服务运行日志接入LTS后，每隔大约1分钟上报一次。因此，在实时日志页面，您最多需要等待1分钟左右，即可查看实时上报的日志，实现对日志数据的快速检索与分析。   详情请参考[云日志服务LTS](https://support.huaweicloud.com/lts/index.html)。 |
   | 采集容器标准输出                                                   | 勾选"日志对接LTS"后，系统默认勾选"采集容器标准输出"，不可以修改。 采集所有的容器标准输出并上报到云日志服务 LTS，日志保存时间为对应日志组的存储时间，默认为 30 天： - 针对专属资源池部署，LTS 日志组和日志流为安装资源池日志采集插件时创建并选择的日志组和日志流；  - 针对公共资源池部署，系统会自动创建 LTS 日志组和日志流，对应的 LTS 日志组和日志流命名规范为日志组： Modelarts-Infer-Log-Group-{NUM}，日志流: Inf-Stdout-{serviceName}-{serviceId 转换后前 8 位字符}。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                  |
   | 采集Kubernete事件                                                | 勾选"日志对接LTS"后，可以手动勾选"采集Kubernete事件"。 勾选后，会采集 Kubernetes 事件即Pod事件并上报到云日志服务LTS，日志默认保存 7 天。用户在推理服务详情页的事件列表可以查看Pod事件，具体操作请参见[查看在线服务的事件](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0019.html)。 如果不勾选，在推理服务详情页的事件列表仅可以查看最近1小时的Pod事件。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                              |
   | 采集容器文件日志                                                    | 勾选"日志对接LTS"后，可以手动勾选"采集容器文件日志"。 采集当前服务的容器日志文件并上报到云日志服务 LTS，日志保存时间为对应日志组的存储时间，默认为 30 天。需要填写日志文件在容器中存放的日志目录和日志名。 配置说明如下： - 日志目录为 /var/logs/\* ，文件名为 \*.log，表示 /var/logs下所有目录中后缀名为 .log 的文件。  - 日志目录为 /var/logs/app_\* ，文件名为 \*.log，表示 /var/logs 目录下所有符合 app_\* 格式的目录中后缀名为 .log 的文件。  - 重复的路径配置只生效一次。   常用路径说明： Device Log：/home/ma-user/ascend/log/run/device-\*/ Run PLog：/home/ma-user/ascend/log/run/plog/ Debug PLog：/home/ma-user/ascend/log/debug/plog/ 系统日志：/var/logs/ 异常日志：/home/ma-user/ascend/log/exceptionDump/                                                                                                                                          |
   | 标签                                                         | ModelArts支持对接标签管理服务TMS，在ModelArts中创建资源消耗性任务（例如：创建Notebook、训练作业、推理在线服务）时，可以为这些任务配置标签，通过标签实现资源的多维分组管理。 可以在标签输入框下拉选择TMS预定义标签，也可以自己输入自定义标签。预定义标签对所有支持标签功能的服务资源可见。租户自定义标签只对自己服务可见。 标签详细用法请参见[ModelArts如何通过标签实现资源分组管理](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0063.html)。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                      |
      
   
4. 配置完服务信息，单击"仅创建服务"，系统自动返回在线推理的服务列表页面。 ![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002555386164.png)
   也可以单击"下一步"，继续进行服务部署配置，具体请参见[后续操作](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0004.html#ZH-CN_TOPIC_0000002606698915__section7836647101713)。
   
 
#### 后续操作
在"在线推理"列表，单击操作列的"更多\>添加部署"，配置推理部署信息，具体请参见[推理在线服务单机部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0004.html)。
图5添加部署   
![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002592769678.png)
