Skill设计质量
Skill设计质量评估器
| 分类 | 详情 | |
|---|---|---|
| 基础信息 | 评估器名称 | Skill设计质量。 |
| 效果说明 | 功能概述 | 评估AI Agent Skill的设计质量,覆盖知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度。 |
| 评估方式 | LLM评估。 | |
| 评估目标 | Skill。 | |
| 适用场景 | 离线评估。 | |
| 应用场景 | AI Agent Skill包的设计质量评测,从多个维度评估Skill的设计是否专业、规范、实用,适用于Skill设计评审、最佳实践检查等场景。 | |
| 评分标准 | 1.0分 | 优秀:七个维度均表现卓越,Skill设计专业、规范、实用。 |
| 0.75分 | 良好:各维度表现较好,仅有少量可改进之处。 | |
| 0.5分 | 一般:部分维度存在明显不足,需要改进。 | |
| 0.25分 | 较差:多个维度存在明显问题,或D3规范合规性不合格。 | |
| 0.0分 | 不可用:Skill设计严重缺陷,无法有效使用。 | |
评估器参数说明:
| 参数类型 | 参数名称 | 是否必填 | 参数说明 |
|---|---|---|---|
| 输入参数 | skill_package | 是 | Skill包内容(JSON字符串),包含skill_name(Skill名称)、skill_manifest(Skill清单)、instruction_body(指令正文)、task_description(任务描述)。 |
| 输出参数 | score | 是 | 评估得分(0.0/0.25/0.5/0.75/1.0)。 |
| reason | 是 | 评分理由说明,需列出各维度(D1-D7)的简要评价。 |
使用该评估器前,需要在评测集中为每条测试数据准备好skill_package(JSON字符串,包含skill_name、skill_manifest、instruction_body、task_description)。评估时平台会自动将数据传入评估Prompt,从知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度评估Skill的设计质量。各字段的推荐映射方式如下:
输入格式示例:
{
"skill_package": "{\"skill_name\":\"code-reviewer\",\"skill_manifest\":\"name: code-reviewer\\ndescription: 对提交的代码进行安全审查,适用于代码提交、合并请求等场景,关键词:代码审查、安全\",\"instruction_body\":\"# Code Reviewer\\n## 步骤\\n1. 解析代码差异\\n2. 识别安全风险\\n3. 生成审查报告\\n## NEVER\\n- 不要忽略SQL注入风险\",\"task_description\":\"代码安全审查\"}"
} 输出格式示例:
{
"score": 0.75,
"reason": "D1知识增量0.15:提供了安全审查的专家知识;D2思维模式0.1:有基本决策框架;D3规范合规0.2:description清晰;D4渐进式披露0.1:内容分层合理;D5自由度0.08:约束适当;D6实用性0.07:调用方式简洁;D7反模式0.05:NEVER列表具体有效。"
}