更新时间:2026-08-03 GMT+08:00
分享

Skill相关性

Skill相关性评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

Skill相关性

效果说明

功能概述

评估AI Agent Skill的能力与给定任务描述的匹配程度。通过分析Skill声明的能力边界与任务需求之间的对齐程度,识别能力溢出、能力不足及能力偏移等问题。

评估方式

LLM评估

评估目标

Skill

适用场景

离线评估

应用场景

AI Agent Skill包的质量评测,检验Skill的能力是否与任务需求精准匹配,适用于Skill选型、能力边界审核等场景。

评分标准

1.0分

精准匹配:Skill能力完美覆盖任务需求,无缺失无冗余。

0.75分

较好匹配:能力与任务需求基本对齐,仅有少量偏差。

0.5分

部分匹配:覆盖了部分核心能力,但存在明显的能力缺口或冗余。

0.25分

匹配度低:存在严重的能力缺失或偏移,无法有效完成任务。

0.0分

完全不匹配:Skill能力与任务需求毫无关联。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

skill_package

Skill包内容(JSON字符串),包含skill_name(Skill名称)、skill_manifest(Skill清单)、instruction_body(指令正文)、task_description(任务描述)。

输出参数

score

评估得分(0.0/0.25/0.5/0.75/1.0)。

reason

评分理由说明,涵盖能力覆盖度、能力精确度、能力冗余度三个维度的简要评价。

使用该评估器前,需要在评测集中为每条测试数据准备好skill_package(JSON字符串,包含skill_name、skill_manifest、instruction_body、task_description)。评估时平台会自动将数据传入评估Prompt,从能力覆盖度、能力精确度和能力冗余度三个维度评估Skill与任务需求的匹配程度。各字段的推荐映射方式如下:

输入格式示例:

{
  "skill_package": "{\"skill_name\":\"pdf-summarizer\",\"skill_manifest\":\"name: pdf-summarizer\\ndescription: 提取并摘要 PDF 文档内容(最多 10 页或 5,000 字)\",\"instruction_body\":\"# PDF Summarizer\\n## 前置条件\\n- pip install pdfplumber\\n## 步骤\\n1. 加载 PDF,检查页数≤10且字数≤5000\\n2. 按段落分块\\n3. 对每个分块生成摘要\\n4. 合并为最终结果\\n## 输出格式\\nMarkdown 摘要文档\\n## 边界情况\\n- 不支持的文件类型:返回错误提示\\n- 超出大小限制:提示用户缩减文档\",\"task_description\":\"对 PDF 文档进行自动摘要\"}"
}

输出格式示例:

{
  "score": 0.75,
  "reason": "能力覆盖度较好,核心PDF摘要功能完整;能力精确度良好,场景描述与任务一致;存在少量能力冗余,instruction_body中包含了不必要的内容分块细节。"
}

相关文档