创建推理Target
创建Target时,支持创建推理Target。推理Target用于将LLM推理请求(如 /v1/chat/completions、/v1/messages)路由到外部模型提供商,实现多模型统一接入和认证管理。
推理Target的核心工作原理是将LLM推理请求通过独立路径(/inference/{path})路由到外部推理提供者,与MCP调用路径(/mcp)隔离,互不干扰。
前提条件
已完成创建网关。
约束与限制
- 一个网关最多可关联10个Target(包含MCP Target和推理Target)。
- 推理Target地址需以https://开头,确保传输层安全。
- 单个Target的操作最多可添加100个模型。
创建推理Target
- 在左侧导航栏选择“托管与运行 > 网关”,进入网关界面。
- 选择已创建的网关,单击网关名称,在“关联Target”区域,单击“创建Target”。
- 输入Target的配置信息,参数说明请参考表1,然后单击“确定”。
表1 参数说明 参数
说明
名称
Target的名称,同一网关下Target名称不可重复。
命名规则:
- 以字母或数字开头和结尾。
- 支持大小写字母、数字和连字符。
- 长度为 1-50 个字符。
系统会默认生成Target的名称,可根据需求自定义修改。
描述
用于说明该Target的内容与用途。此描述仅在网关层生效,不会覆盖或影响后端原始工具的描述。
规则:长度不大于200个字符。
Target协议
选择“推理”。
推理Target用于调用已定义提供商、模型和参数的LLM。
Inference地址
模型提供商的基础URL,用于转发 Inference 请求。必须以 https:// 开头的完整URL。
模型映射 (可选)
配置客户端模型ID转发给服务商前的转换逻辑。可要求客户端传入带服务商前缀的完整ID,或使用不带提供商前缀的模型ID,由网关自动补全服务商前缀,支持 . 和 / 两种分隔格式。
- 使用完整 ID:客户端请求时需传入带提供商前缀的完整模型ID(如 anthropic/claude-3-opus)。
- 省略前缀,分隔符:.:客户端可省略提供商前缀,网关自动补全。使用点号(.)作为分隔符(如 anthropic.claude-3-opus)。
- 省略前缀,分隔符:/:客户端可省略提供商前缀,网关自动补全。使用斜杠(/)作为分隔符(如 anthropic/claude-3-opus)。
说明:选择“省略前缀”,客户端可以使用不带提供商前缀的模型ID发起请求,网关会自动添加前缀转发到后端。例如配置了模型anthropic/claude-3-opus,客户端可以直接使用claude-3-opus发起请求,网关自动补全为 anthropic/claude-3-opus。
添加操作
配置Inference地址使用的路径和模型。
单击“添加操作”,配置如下信息,最多可添加10个操作。
操作路径:从下拉框中选择操作请求路径,如 /v1/chat/completions、/v1/messages 等。支持的操作路径请参见支持的操作路径。
提供商路径覆盖(可选):提供商实际路径,默认与操作路径相同。如配置了提供商路径覆盖,网关会将请求转发到该路径指定的地址。例如,操作路径为 /v1/messages,提供商路径覆盖配置为 /anthropic/v1/messages,则请求会被转发到 /anthropic/v1/messages。
模型:定义该操作支持的所有可用模型。模型名称必须与模型提供商定义的格式匹配。支持精确匹配和通配匹配(如 gpt-* 支持前缀通配,*-turbo 支持后缀通配)。可添加多个模型,单个操作最多可添加100个模型。
出站身份认证
配置出站身份认证方式,用于在网关将请求转发到后端服务(Target)时,对请求进行身份验证和授权。
支持以下认证方式:
- API Key:在转发请求时,将API Key附加到请求头或查询参数中。
- 选择出站身份,如下拉框无选项请单击“创建出站身份”,创建“API Key”类型的出站身份。
- 选择位置。
- 参数名称(可选):输入参数名称,在请求中传递API的密钥时使用的具体名称。
- 前缀(可选):在请求头中传递API Key时,API密钥值之前的前缀部分,如在授权标头中使用的“Bearer”。填写时不需要增加空格,平台会自动在密钥值前添加空格组装,例如填写“Bearer”,平台最终组装为“Bearer xxx”进行传递。
- OAuth
- 无认证:在网关将请求转发到Target时,不对请求进行身份验证和授权。
- 创建完成后,即可在列表展示已创建的Target。
Target的状态说明如下:
网关创建完成后,在网关列表中单击网关名称,进入基本信息页面,在“关联Target”区域即可查看Target状态。- 就绪可用状态:Target创建成功后,状态初始化为“就绪可用”。
- 在线状态:启动沙箱并探测Target连通性成功后,状态更新为“在线”,此时Target可正常调用。当关联该Target的沙箱被释放后,状态将回退至“就绪可用”。
- 离线状态:启动沙箱并探测Target连通性失败后,状态更新为“离线”,离线状态下Target无法正常调用。
支持的操作路径
推理Target支持以下操作路径,对应不同的模型类型和API协议:
| 操作路径 | 模型类型 | API协议 |
|---|---|---|
| /v1/chat/completions | 文本对话/图像理解(completions) | 标准OpenAI协议 |
| /v1/responses | 多模态对话(responses) | 标准OpenAI协议 |
| /v1/embeddings | 文本向量化(embeddings) | 标准OpenAI协议 |
| /v1/rerank | 文本排序(rerank) | 标准OpenAI协议 |
| /v1/messages | 文本对话/图像理解(messages) | Anthropic协议 |
| /v1/realtime | 实时语音对话(realtime) | 标准OpenAI协议 |
| /v1/messages/count_tokens | Token计数(token_count) | Anthropic协议 |