更新时间:2026-08-03 GMT+08:00
分享

Skill设计质量

Skill设计质量评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

Skill设计质量

效果说明

功能概述

评估AI Agent Skill的设计质量,覆盖知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度。

评估方式

LLM评估

评估目标

Skill

适用场景

离线评估

应用场景

AI Agent Skill包的设计质量评测,从多个维度评估Skill的设计是否专业、规范、实用,适用于Skill设计评审、最佳实践检查等场景。

评分标准

1.0分

优秀:七个维度均表现卓越,Skill设计专业、规范、实用。

0.75分

良好:各维度表现较好,仅有少量可改进之处。

0.5分

一般:部分维度存在明显不足,需要改进。

0.25分

较差:多个维度存在明显问题,或D3规范合规性不合格。

0.0分

不可用:Skill设计严重缺陷,无法有效使用。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

skill_package

Skill包内容(JSON字符串),包含skill_name(Skill名称)、skill_manifest(Skill清单)、instruction_body(指令正文)、task_description(任务描述)。

输出参数

score

评估得分(0.0/0.25/0.5/0.75/1.0)。

reason

评分理由说明,需列出各维度(D1-D7)的简要评价。

使用该评估器前,需要在评测集中为每条测试数据准备好skill_package(JSON字符串,包含skill_name、skill_manifest、instruction_body、task_description)。评估时平台会自动将数据传入评估Prompt,从知识增量、思维模式、规范合规性、渐进式披露、自由度校准、实用性和反模式质量七个维度评估Skill的设计质量。各字段的推荐映射方式如下:

输入格式示例:

{
  "skill_package": "{\"skill_name\":\"code-reviewer\",\"skill_manifest\":\"name: code-reviewer\\ndescription: 对提交的代码进行安全审查,适用于代码提交、合并请求等场景,关键词:代码审查、安全\",\"instruction_body\":\"# Code Reviewer\\n## 步骤\\n1. 解析代码差异\\n2. 识别安全风险\\n3. 生成审查报告\\n## NEVER\\n- 不要忽略SQL注入风险\",\"task_description\":\"代码安全审查\"}"
}

输出格式示例:

{
  "score": 0.75,
  "reason": "D1知识增量0.15:提供了安全审查的专家知识;D2思维模式0.1:有基本决策框架;D3规范合规0.2:description清晰;D4渐进式披露0.1:内容分层合理;D5自由度0.08:约束适当;D6实用性0.07:调用方式简洁;D7反模式0.05:NEVER列表具体有效。"
}

相关文档