推理服务响应需遵从OpenAI标准格式,具体要求为:
响应必需为流式或非流式,且响应体须包含usage.prompt_tokens、usage.completion_tokens、usage.total_tokens字段(流式响应需在最后一个data chunk中携带)。
推理服务响应若不满足以上要求,Token相关指标将异常:
- 流式场景下,输入Token数和输出Token数均将显示为0,首Token时延仍可显示,每Token时延基于chunk数计算故存在偏差;
- 非流式场景下,所有Token相关指标均无法显示。