更新时间:2026-08-03 GMT+08:00
分享

Skill完整度

Skill完整度评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

Skill完整度

效果说明

功能概述

评估AI Agent Skill是否提供了完成给定任务所需的充足步骤、输入/输出、前置条件和错误处理指导。通过系统性审查Skill描述的完整性,识别步骤缺失、定义不清、条件遗漏及处理不足等问题。

评估方式

LLM评估

评估目标

Skill

适用场景

离线评估

应用场景

AI Agent Skill包的质量评测,检验Skill描述是否足够完整以指导Agent正确执行任务,适用于Skill上架审核、质量巡检等场景。

评分标准

1.0分

优秀:步骤完整清晰,输入输出定义准确,前置条件充分,错误处理完善。

0.75分

良好:各维度表现较好,仅有少量可完善之处。

0.5分

一般:基本框架存在,但在步骤细节、输入输出定义或错误处理上存在不足。

0.25分

较差:存在多个维度的明显缺失,需要大幅补充才能使用。

0.0分

不可用:Skill描述严重缺失,无法指导Agent完成任务。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

skill_package

Skill包内容(JSON字符串),包含skill_name(Skill名称)、skill_manifest(Skill清单)、instruction_body(指令正文)、task_description(任务描述)。

输出参数

score

评估得分(0.0/0.25/0.5/0.75/1.0)。

reason

评分理由说明,涵盖步骤完整性、输入输出定义、前置条件、错误处理四个维度的简要评价及改进建议。

使用该评估器前,需要在评测集中为每条测试数据准备好skill_package(JSON字符串,包含skill_name、skill_manifest、instruction_body、task_description)。评估时平台会自动将数据传入评估Prompt,从步骤完整性、输入输出定义、前置条件和错误处理四个维度评估Skill的完整程度。各字段的推荐映射方式如下:

输入格式示例:

{
  "skill_package": "{\"skill_name\":\"pdf-summarizer\",\"skill_manifest\":\"name: pdf-summarizer\\ndescription: 提取并摘要 PDF 文档内容(最多 10 页或 5,000 字)\",\"instruction_body\":\"# PDF Summarizer\\n## 前置条件\\n- pip install pdfplumber\\n## 步骤\\n1. 加载 PDF,检查页数≤10且字数≤5000\\n2. 按段落分块\\n3. 对每个分块生成摘要\\n4. 合并为最终结果\\n## 输出格式\\nMarkdown 摘要文档\\n## 边界情况\\n- 不支持的文件类型:返回错误提示\\n- 超出大小限制:提示用户缩减文档\",\"task_description\":\"对 PDF 文档进行自动摘要\"}"
}

输出格式示例:

{
  "score": 0.5,
  "reason": "步骤基本完整但缺少API调用失败的处理,输入参数缺少格式约束,前置条件未说明所需API权限,错误处理缺失。"
}

相关文档