查看在线服务详情
搜索在线推理服务
登录ModelArts管理控制台,在左侧菜单栏中选择“模型推理 > 在线推理”,进入“在线推理”管理页面。
在线推理服务列表页的搜索框中,支持通过各种筛选条件搜索,具体的筛选条件如下:
在线服务层级的筛选条件:
- 服务调用模式:在线服务的调用模式,包括同步调用、异步调用
- 认证方式:在线服务的的认证方式,包括API Key认证、IAM Token认证、无认证
- 名称:用户创建在线服务时,自定义的服务名称
- 服务ID:在线服务的ID,系统自动生成
- 创建者:在线服务的创建者账号
- 描述:用户创建在线服务时,自定义的服务描述信息
- 状态:在线服务的状态,包括部署中、运行中、停止中、升级中、停止、告警、删除中、失败、异常、待部署
- 资源标签:用户创建在线服务时,自定义的标签。
部署层级的筛选条件:
查看具体的在线推理服务详情
登录ModelArts管理控制台,在左侧菜单栏中选择“模型推理 > 在线推理”,进入“在线推理”服务列表页面。通过单击在线服务名称,进入在线服务的详情页面,通过切换页签查看更多详细信息,详情说明请参见表1。
| 参数 | 说明 |
|---|---|
| 服务 | 展现服务的服务拓扑图、基础信息、网络配置、流量权重和高级配置。 服务拓扑图请见查看服务部署拓扑图。 调用信息可以通过 |
| 部署 | 展现服务的部署信息,通过切换左侧卡片,可以查看不同部署的部署信息。 在部署详情页可以操作的部分关键信息如下:
|
| 预测 | 对在线服务进行预测。具体操作请参见使用预测功能测试在线服务。 |
| 监控 | 展现当前服务的监控数据。具体监控数据请见在ModelArts平台查看在线服务性能指标。 |
| Cloud Shell | 允许用户使用ModelArts控制台提供的CloudShell登录运行中在线服务实例容器,详情请见使用CloudShell调试在线服务实例容器。 |
| 事件 | 服务事件记录了服务层面在线服务在运行过程中产生的各种事件,包括但不限于服务启动、停止、升级、故障恢复等。服务事件保存周期为1个月,1个月后自动清理数据。 Pod事件记录了底层容器Kubernetes集群中Pod的生命周期事件和异常情况。Pod事件保存周期为1小时,1小时后自动清理数据。 查看服务的事件类型和事件信息,请参见查看在线服务的事件。 |
| 日志 | 在线服务的运行日志会输出存放到云日志服务LTS。LTS自动创建日志组和日志流,默认缓存7天内的运行日志。支持对在线服务的运行日志进行搜索和分析。
|
| 智能运维 | 在大模型部署规模持续扩大、跨节点部署及负载均衡需求日益复杂的背景下,传统基于Kubernetes原生HPA的资源扩缩策略已难以满足精细化的P(推理实例)与D(解码实例)配比调整需求。用户在实际业务运行中,常面临因P/D配比不合理导致的资源利用率低下或性能瓶颈问题,而现有工具无法提供基于仿真算法的动态配比建议。为解决这一矛盾,ModelArts资源池支持安装HRA插件,通过仿真算法计算并展示最优P/D配比推荐值,使用户能够在不依赖自动扩缩功能的前提下,基于实时指标分析手动调整实例配比,从而在资源容量范围内实现更高效的推理服务部署。 打开“检测”开关,单击“编辑”,可查看根据智能算法方针计算出的最佳推理单元配比。 仅在线服务使用安装HRA插件的物理资源池时,且在线服务的模型资产有“弹性配比推荐”标签,支持推理单元配比检测。 |
| 内网接入管理 | 展示需要当前账号审批的内网接入申请。 ModelArts提供内网接入功能,通过创建内网接入申请,实现自动创建VPCEP,打通VPC与推理在线服务的内网连接。详情请见通过内网访问在线服务。 |
| 标签 | 展示服务已添加的标签。支持添加、修改、删除标签。 标签详细用法请参见ModelArts如何通过标签实现资源分组管理。 |



