规则引擎跟推理引擎的区别

存储引擎

存储引擎存储引擎体系架构 Astore存储引擎 Ustore存储引擎

来自：帮助中心

查看更多 →
存储引擎

存储引擎存储引擎体系架构 Astore存储引擎 Ustore存储引擎数据生命周期管理-OLTP表压缩

来自：帮助中心

查看更多 →
引擎管理

引擎管理查询微服务引擎的规格列表查询微服务引擎列表创建微服务引擎查询微服务引擎的详情查询微服务引擎任务详情查询微服务引擎配额详情删除指定的微服务引擎升级微服务引擎更新微服务引擎配置变更微服务引擎规格重试ServiceComb引擎专享版失败任务更新微服务引擎详情

来自：帮助中心

查看更多 →
引擎管理

引擎管理查询微服务引擎专享版支持规格查询微服务引擎专享版列表创建微服务引擎专享版查询微服务引擎专享版详情删除微服务引擎专享版查询微服务引擎专享版任务详情父主题： CS E API

来自：帮助中心

查看更多 →
使用推理服务的权限配置示例

中包含了创建购买Ray资源订单的权限，但是不包含付费的权限，需要由客户指定的费用管理员来进行付费。王五算法工程师需要拥有DataArtsFabricFullPolicy权限、和必须的OBS权限来在DataArtsFabric服务中使用OBS中的模型文件，OBS权限需要由用户权限管理员张三为其授权

来自：帮助中心

查看更多 →
在推理生产环境中部署推理服务

--port：服务部署的端口8080。 -max-num-seqs：最大同时处理的请求数，超过后在等待池等候处理。 --max-model-len：推理时最大输入+最大输出tokens数量，输入超过该数量会直接返回。max-model-len的值必须小于config.json文件中的"seq_

来自：帮助中心

查看更多 →
在推理生产环境中部署推理服务

设置创建AI应用的相应参数。此处仅介绍关键参数，设置AI应用的详细参数解释请参见从OBS中选择元模型。根据需要自定义应用的名称和版本。模型来源选择“从对象存储服务（OBS）中选择”，元模型选择转换后模型的存储路径，AI引擎选择“Custom”，引擎包选择准备镜像中上传的推理镜像。系统运行架构选择“ARM”。

来自：帮助中心

查看更多 →
在推理生产环境中部署推理服务

nfig.json里面定义的“max_position_embeddings”和“seq_length”；如果设置过大，会占用过多显存，影响kvcache的空间。 --gpu-memory-utilization：NPU使用的显存比例，复用原vLLM的入参名称，默认为0.9。 -

来自：帮助中心

查看更多 →
发布推理服务

参数名称参数描述模型包名称发布成推理服务的模型包名称。版本推理服务的版本。版本建议格式为“xx.xx.0”，其中xx为0-99的整数。是否自动停止是否开启推理服务自动停止，如果开启，需要设置自动停止的时间，开启了自动停止的推理服务将会在设置时间后停止运行。计算节点规格计算节点资源，包括CPU和GPU。

来自：帮助中心

查看更多 →
推理场景介绍

如果没有下载权限，请联系您所在企业的华为方技术支持下载获取。支持的模型列表和权重文件本方案支持vLLM的v0.4.2版本。不同vLLM版本支持的模型列表有差异，具体如表3所示。表3 支持的模型列表和权重获取地址序号模型名称是否支持fp16/bf16推理是否支持W4A16量化是否支持W8A8量化

来自：帮助中心

查看更多 →
推理精度测试

ss使用humaneval数据集时，需要执行模型生成的代码。请仔细阅读human_eval/execution.py文件第48-57行的注释，内容参考如下。了解执行模型生成代码可能存在的风险，如果接受这些风险，请取消第58行的注释，执行下面步骤6进行评测。 # WARNING #

来自：帮助中心

查看更多 →
部署推理服务

每个输出序列要生成的最大tokens数量。 top_k 否 -1 Int 控制要考虑的前几个tokens的数量的整数。设置为-1表示考虑所有tokens。适当降低该值可以减少采样时间。 top_p 否 1.0 Float 控制要考虑的前几个tokens的累积概率的浮点数。必须在 (0

来自：帮助中心

查看更多 →
推理精度测试

行ppl精度测试。本质上使用transformers进行推理，因为没有框架的优化，执行时间最长。另一方面，由于是使用transformers推理，结果也是最稳定的。对单卡运行的模型比较友好，算力利用率比较高。对多卡运行的推理，缺少负载均衡，利用率低。在昇腾卡上执行时，需要在 o

来自：帮助中心

查看更多 →
部署推理服务

部署推理服务非分离部署推理服务分离部署推理服务父主题：主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.909）

来自：帮助中心

查看更多 →
推理精度测试

行ppl精度测试。本质上使用transformers进行推理，因为没有框架的优化，执行时间最长。另一方面，由于是使用transformers推理，结果也是最稳定的。对单卡运行的模型比较友好，算力利用率比较高。对多卡运行的推理，缺少负载均衡，利用率低。在昇腾卡上执行时，需要在 o

来自：帮助中心

查看更多 →
推理精度测试

行ppl精度测试。本质上使用transformers进行推理，因为没有框架的优化，执行时间最长。另一方面，由于是使用transformers推理，结果也是最稳定的。对单卡运行的模型比较友好，算力利用率比较高。对多卡运行的推理，缺少负载均衡，利用率低。在昇腾卡上执行时，需要在 o

来自：帮助中心

查看更多 →
推理精度测试

行ppl精度测试。本质上使用transformers进行推理，因为没有框架的优化，执行时间最长。另一方面，由于是使用transformers推理，结果也是最稳定的。对单卡运行的模型比较友好，算力利用率比较高。对多卡运行的推理，缺少负载均衡，利用率低。在昇腾卡上执行时，需要在 o

来自：帮助中心

查看更多 →
推理精度测试

于多模态模型的精度验证。多模态模型的精度验证，建议使用开源MME数据集和工具（GitHub - BradyFU/Awesome-Multimodal-Large-Language-Models at Evaluation）。配置需要使用的NPU卡，例如：实际使用的是第1张和第2张卡，此处填写为“0

来自：帮助中心

查看更多 →
推理精度测试

于多模态模型的精度验证。多模态模型的精度验证，建议使用开源MME数据集和工具（GitHub - BradyFU/Awesome-Multimodal-Large-Language-Models at Evaluation）。配置需要使用的NPU卡，例如：实际使用的是第1张和第2张卡，此处填写为“0

来自：帮助中心

查看更多 →
推理场景介绍

如果上述软件获取路径打开后未显示相应的软件信息，说明您没有下载权限，请联系您所在企业的华为方技术支持下载获取。支持的模型列表和权重文件本方案支持vLLM的v0.6.3版本。不同vLLM版本支持的模型列表有差异，具体如表3所示。表3 支持的模型列表和权重获取地址序号模型名称

来自：帮助中心

查看更多 →
推理精度测试

行ppl精度测试。本质上使用transformers进行推理，因为没有框架的优化，执行时间最长。另一方面，由于是使用transformers推理，结果也是最稳定的。对单卡运行的模型比较友好，算力利用率比较高。对多卡运行的推理，缺少负载均衡，利用率低。在昇腾卡上执行时，需要在 o

来自：帮助中心

查看更多 →