
# Skill设计质量
**Skill设计质量评估器**
表1评估器信息 
| 分类          || 详情                                                                       |
|:---|---|:---|
| 基础信息 | 评估器名称 | Skill设计质量。                                                               |
| 效果说明 | 功能概述  | 评估AI Agent Skill的设计质量，覆盖知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度。       |
| 效果说明 | 评估方式  | LLM评估。                                                                   |
| 效果说明 | 评估目标  | Skill。                                                                   |
| 效果说明 | 适用场景  | 离线评估。                                                                    |
| 效果说明 | 应用场景  | AI Agent Skill包的设计质量评测，从多个维度评估Skill的设计是否专业、规范、实用，适用于Skill设计评审、最佳实践检查等场景。 |
| 评分标准 | 1.0分  | 优秀：七个维度均表现卓越，Skill设计专业、规范、实用。                                            |
| 评分标准 | 0.75分 | 良好：各维度表现较好，仅有少量可改进之处。                                                    |
| 评分标准 | 0.5分  | 一般：部分维度存在明显不足，需要改进。                                                      |
| 评分标准 | 0.25分 | 较差：多个维度存在明显问题，或D3规范合规性不合格。                                               |
| 评分标准 | 0.0分  | 不可用：Skill设计严重缺陷，无法有效使用。                                                  |
   
**评估器参数说明：**
表2评估器参数说明 
| 参数类型 | 参数名称          | 是否必填 | 参数说明                                                                                                           |
|:---|:---|:---|:---|
| 输入参数 | skill_package | 是    | Skill包内容（JSON字符串），包含skill_name（Skill名称）、skill_manifest（Skill清单）、instruction_body（指令正文）、task_description（任务描述）。 |
| 输出参数 | score         | 是    | 评估得分（0.0/0.25/0.5/0.75/1.0）。                                                                                   |
| 输出参数 | reason        | 是    | 评分理由说明，需列出各维度（D1-D7）的简要评价。                                                                                     |
   
使用该评估器前，需要在评测集中为每条测试数据准备好skill_package（JSON字符串，包含skill_name、skill_manifest、instruction_body、task_description）。评估时平台会自动将数据传入评估Prompt，从知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度评估Skill的设计质量。各字段的推荐映射方式如下：
**输入格式示例：**
```
{
  "skill_package": "{\"skill_name\":\"code-reviewer\",\"skill_manifest\":\"name: code-reviewer\\ndescription: 对提交的代码进行安全审查，适用于代码提交、合并请求等场景，关键词：代码审查、安全\",\"instruction_body\":\"# Code Reviewer\\n## 步骤\\n1. 解析代码差异\\n2. 识别安全风险\\n3. 生成审查报告\\n## NEVER\\n- 不要忽略SQL注入风险\",\"task_description\":\"代码安全审查\"}"
}
```
**输出格式示例：**
```
{
  "score": 0.75,
  "reason": "D1知识增量0.15：提供了安全审查的专家知识；D2思维模式0.1：有基本决策框架；D3规范合规0.2：description清晰；D4渐进式披露0.1：内容分层合理；D5自由度0.08：约束适当；D6实用性0.07：调用方式简洁；D7反模式0.05：NEVER列表具体有效。"
}
```
