AI安全护栏概述
什么是AI安全护栏
AI安全护栏是面向AI应用场景研发的内容安全防护组件,通过API、SDK集成到AI调用链路,实现旁路检测,可有效拦截推理阶段有害指令注入、违规内容生成、敏感信息外泄、算力消耗防护等风险,系统性治理AI应用运营过程中存在的内容违规、数据泄露、监管不合规等安全隐患。
功能介绍
| 功能 | 文本检测 | 图片检测 |
|---|---|---|
| 语言检测 | 支持 | 不支持 |
| 豁免词配置 | 支持 | 支持 |
| 关键词词库检测 | 支持 | 支持 |
| 合规检测 | 支持 | 支持 |
| 提示词注入检测 | 支持 | 支持 |
| 敏感信息检测 | 支持 | 支持 |
| 算力消耗防护 | 支持 | 不支持 |
- 对话轮数:多轮长文本检测最大支持最近20轮上下文对话(包含当前轮)。超出20轮时,自动截断最早轮次。
- 文本长度:最大支持256K超长文本。
- 交互模式:仅支持同步拦截场景。
详细功能说明如下:
大模型防火墙的语言检测核心挑战是应对“安全盲区”——当攻击者转向非主流语言时,传统检测能力往往会大幅下降。
为应对这一挑战,AI安全护栏在原有针对中英文语言检测的基础上,摒弃“全量翻译”的粗放模式,避免传统“一刀切”模式引发的误杀或漏放。
- 拉美地区:西班牙语(ES)、葡萄牙语(PT)
- 中东与北非:阿拉伯语(AR)、土耳其语(TR)
- 东南亚:泰语(TH)、印尼语(ID)、马来语(MS)
豁免词即为安全词汇。MAF引擎会根据该类词汇,匹配并过滤输入文本和图片中的豁免词后,再对剩余内容进行合规检测和提示词注入检测等。
豁免词可根据业务需要自定义。
提示词注入攻击(Prompt Injection) 是针对大模型的核心安全攻击,攻击者通过构造恶意自然语言输入,让模型混淆指令与数据、覆盖系统规则、绕过安全护栏,执行非预期行为,常被称为AI时代的 “SQL 注入”。
对此,提示词注入检测内置具有针对性的多种检测项,可有效防御该类攻击。检测类别包括:
| 检测项 | 说明 |
|---|---|
| 目标劫持 | 强行替换模型原本任务,例如让模型放弃原有目标,执行攻击者指定的新任务。 |
| 角色扮演 | 伪装成某种角色,诱导模型放松限制,例如通过让模型扮演医生、黑客、编剧、开发者等,绕过安全规则。 |
| 反面诱导 | 攻击者不直接下达违规指令,而是利用话术、逻辑圈套、角色扮演、层层引导,一步步绕开大模型原有安全基线,反向 “说服/引诱” 模型主动突破规则、输出违规内容。 |
| 多步诱导 | 分步诱导,绕过单轮检测,例如每一步都合法,但多轮组合后达成恶意目标。 |
| 场景任务 | 构建虚拟场景,让模型在场景内违规,例如把恶意内容包装成故事、剧本、测试场景。 |
| 对立响应 | 用对抗样本让模型误判,例如通过语序、错别字、特殊符号、迷惑句式,绕过关键词检测。 |
| 虚拟对话 | 伪造多轮对话历史,例如构造假的用户/助手对话,让模型以为已经达成某种共识。 |
| DAN攻击 | 让模型放弃自己的安全准则,进行无限制的对话。 |
| 代码注入 | 在安全代码中混入违规的场景,让模型执行代码绕过安全准则输出违规内容。 |
敏感信息检测是针对个人身份信息的检测,通过在大模型输入和输出过程中,自动识别身份证号、手机号、银行卡等敏感数据,避免敏感信息泄露。
| 检测项 | 说明 |
|---|---|
| 个人信息 | 电话号码(中国内地)、手机号码(中国内地)、身份证号(中国内地)、护照号(中国内地)、驾照号(中国内地)、港澳通行证、军官证号、车牌号(中国内地)、车辆识别代码、居住证、银行卡号、信用卡号、证券账户、银行账户。 |
| 企业标识 | 统一社会信用代码。 |
| 设备信息 | 唯一设备识别码IMEI、MAC地址、SIM卡IMSI信息、IPv4地址、IPv6地址。 |
| 通用信息 | Linux-Passwd文件、Linux-Shadow文件、动态口令/短信验证码、SSL证书、SK密钥、AWS访问密钥、AWS秘密密钥、Facebook密钥、IAM账号密码、GitHub密钥、DSA私钥、EC私钥、加密私钥、RSA私钥、认证Token、密码。 |
算力消耗攻击,是针对AI大模型的一种新型“经济战”和“资源战”。攻击者并不窃取数据,而是通过精心构造的输入,诱导模型进行极其复杂的运算,以此来大量消耗服务器的计算资源(如GPU、CPU),导致服务响应极慢,甚至直接瘫痪,同时给服务提供方带来高昂的算力成本。
AI安全护栏支持基于用户输入、输出数据的算力消耗防护,针对用户某一时间段内,输入输出请求的调用次数或字符数,设置一个阈值,并对超过阈值的请求进行处置。
防护规格
| 项目 | 规格 |
|---|---|
| 应用数量(个) | 100 |
| 策略数量(条) | 100 |
| 规则数量(条) | 1,000 |
| 自定义词库数量(条) | 10,000 |
| 文本内容安全检测(QPS) | 50 |
| 图片内容安全检测(QPS) | 5 |

