Skill完整度
Skill完整度评估器
| 分类 | 详情 | |
|---|---|---|
| 基础信息 | 评估器名称 | Skill完整度。 |
| 效果说明 | 功能概述 | 评估AI Agent Skill是否提供了完成给定任务所需的充足步骤、输入/输出、前置条件和错误处理指导。通过系统性审查Skill描述的完整性,识别步骤缺失、定义不清、条件遗漏及处理不足等问题。 |
| 评估方式 | LLM评估。 | |
| 评估目标 | Skill。 | |
| 适用场景 | 离线评估。 | |
| 应用场景 | AI Agent Skill包的质量评测,检验Skill描述是否足够完整以指导Agent正确执行任务,适用于Skill上架审核、质量巡检等场景。 | |
| 评分标准 | 1.0分 | 优秀:步骤完整清晰,输入输出定义准确,前置条件充分,错误处理完善。 |
| 0.75分 | 良好:各维度表现较好,仅有少量可完善之处。 | |
| 0.5分 | 一般:基本框架存在,但在步骤细节、输入输出定义或错误处理上存在不足。 | |
| 0.25分 | 较差:存在多个维度的明显缺失,需要大幅补充才能使用。 | |
| 0.0分 | 不可用:Skill描述严重缺失,无法指导Agent完成任务。 | |
评估器参数说明:
| 参数类型 | 参数名称 | 是否必填 | 参数说明 |
|---|---|---|---|
| 输入参数 | skill_package | 是 | Skill包内容(JSON字符串),包含skill_name(Skill名称)、skill_manifest(Skill清单)、instruction_body(指令正文)、task_description(任务描述)。 |
| 输出参数 | score | 是 | 评估得分(0.0/0.25/0.5/0.75/1.0)。 |
| reason | 是 | 评分理由说明,涵盖步骤完整性、输入输出定义、前置条件、错误处理四个维度的简要评价及改进建议。 |
使用该评估器前,需要在评测集中为每条测试数据准备好skill_package(JSON字符串,包含skill_name、skill_manifest、instruction_body、task_description)。评估时平台会自动将数据传入评估Prompt,从步骤完整性、输入输出定义、前置条件和错误处理四个维度评估Skill的完整程度。各字段的推荐映射方式如下:
输入格式示例:
{
"skill_package": "{\"skill_name\":\"pdf-summarizer\",\"skill_manifest\":\"name: pdf-summarizer\\ndescription: 提取并摘要 PDF 文档内容(最多 10 页或 5,000 字)\",\"instruction_body\":\"# PDF Summarizer\\n## 前置条件\\n- pip install pdfplumber\\n## 步骤\\n1. 加载 PDF,检查页数≤10且字数≤5000\\n2. 按段落分块\\n3. 对每个分块生成摘要\\n4. 合并为最终结果\\n## 输出格式\\nMarkdown 摘要文档\\n## 边界情况\\n- 不支持的文件类型:返回错误提示\\n- 超出大小限制:提示用户缩减文档\",\"task_description\":\"对 PDF 文档进行自动摘要\"}"
} 输出格式示例:
{
"score": 0.5,
"reason": "步骤基本完整但缺少API调用失败的处理,输入参数缺少格式约束,前置条件未说明所需API权限,错误处理缺失。"
}