更新时间:2026-08-07 GMT+08:00
分享

AI安全护栏概述

什么是AI安全护栏

AI安全护栏是面向AI应用场景研发的内容安全防护组件,通过API、SDK集成到AI调用链路,实现旁路检测,可有效拦截推理阶段有害指令注入、违规内容生成、敏感信息外泄、算力消耗防护等风险,系统性治理AI应用运营过程中存在的内容违规、数据泄露、监管不合规等安全隐患。

其部署架构如图1所示。
图1 AI安全护栏

功能介绍

AI安全护栏支持针对文本和图片的检测。支持的检测类型如下:

功能

文本检测

图片检测

语言检测

支持

不支持

豁免词配置

支持

支持

关键词词库检测

支持

支持

合规检测

支持

支持

提示词注入检测

支持

支持

敏感信息检测

支持

支持

算力消耗防护

支持

不支持

其中,文本检测支持多轮长文本检测,即不再只检测单条一句话、单次提问,而是把完整多轮对话上下文和超长篇幅文本整体纳入检测范围,并结合历史对话记录、长文档全文语义,识别违规、越狱诱导、敏感内容、AI生成文本、逻辑风险等问题。
  • 对话轮数:多轮长文本检测最大支持最近20轮上下文对话(包含当前轮)。超出20轮时,自动截断最早轮次。
  • 文本长度:最大支持256K超长文本。
  • 交互模式:仅支持同步拦截场景。

详细功能说明如下:

大模型防火墙的语言检测核心挑战是应对“安全盲区”——当攻击者转向非主流语言时,传统检测能力往往会大幅下降。

为应对这一挑战,AI安全护栏在原有针对中英文语言检测的基础上,摒弃“全量翻译”的粗放模式,避免传统“一刀切”模式引发的误杀或漏放。

小语种语言检测范围:
  • 拉美地区:西班牙语(ES)、葡萄牙语(PT)
  • 中东与北非:阿拉伯语(AR)、土耳其语(TR)
  • 东南亚:泰语(TH)、印尼语(ID)、马来语(MS)

豁免词即为安全词汇。MAF引擎会根据该类词汇,匹配并过滤输入文本和图片中的豁免词后,再对剩余内容进行合规检测和提示词注入检测等。

豁免词可根据业务需要自定义。

关键词即为违规词汇。MAF引擎在检测到该类词汇后,会进行相关处置。系统内置以下检测类别:

表1 关键词类别

检测项

说明

暴恐伤害

暴力伤害与恐怖主义等内容。

违禁

违法与禁止的内容。

色情

性相关的内容。

恶意言论

恶意中伤,辱骂与诽谤类内容。

涉敏

个人隐私与知识产权泄露等内容。

政治敏感

政治相关内容。

关键词可根据业务需要自定义。

合规检测针对暴力、歧视、违法或违背社会公序良俗内容的检测。检测类别包括:

表2 合规检测类别

检测项

说明

政治敏感

政治相关内容。

暴恐伤害

暴力伤害与恐怖主义等内容。

违禁

违法与禁止的内容。

恶意言论

恶意中伤,辱骂与诽谤类内容。

涉敏

个人隐私与知识产权泄露等内容。

色情

性相关的内容。

其他风险

恶意算力消耗等内容。

宗教敏感

宗教相关内容。

提示词注入攻击(Prompt Injection) 是针对大模型的核心安全攻击,攻击者通过构造恶意自然语言输入,让模型混淆指令与数据、覆盖系统规则、绕过安全护栏,执行非预期行为,常被称为AI时代的 “SQL 注入”。

对此,提示词注入检测内置具有针对性的多种检测项,可有效防御该类攻击。检测类别包括:

表3 提示词注入检测类别

检测项

说明

目标劫持

强行替换模型原本任务,例如让模型放弃原有目标,执行攻击者指定的新任务。

角色扮演

伪装成某种角色,诱导模型放松限制,例如通过让模型扮演医生、黑客、编剧、开发者等,绕过安全规则。

反面诱导

攻击者不直接下达违规指令,而是利用话术、逻辑圈套、角色扮演、层层引导,一步步绕开大模型原有安全基线,反向 “说服/引诱” 模型主动突破规则、输出违规内容。

多步诱导

分步诱导,绕过单轮检测,例如每一步都合法,但多轮组合后达成恶意目标。

场景任务

构建虚拟场景,让模型在场景内违规,例如把恶意内容包装成故事、剧本、测试场景。

对立响应

用对抗样本让模型误判,例如通过语序、错别字、特殊符号、迷惑句式,绕过关键词检测。

虚拟对话

伪造多轮对话历史,例如构造假的用户/助手对话,让模型以为已经达成某种共识。

DAN攻击

让模型放弃自己的安全准则,进行无限制的对话。

代码注入

在安全代码中混入违规的场景,让模型执行代码绕过安全准则输出违规内容。

敏感信息检测是针对个人身份信息的检测,通过在大模型输入和输出过程中,自动识别身份证号、手机号、银行卡等敏感数据,避免敏感信息泄露。

AI安全护栏支持检测以下类别的敏感信息:
表4 敏感信息检测类别

检测项

说明

个人信息

电话号码(中国内地)、手机号码(中国内地)、身份证号(中国内地)、护照号(中国内地)、驾照号(中国内地)、港澳通行证、军官证号、车牌号(中国内地)、车辆识别代码、居住证、银行卡号、信用卡号、证券账户、银行账户。

企业标识

统一社会信用代码。

设备信息

唯一设备识别码IMEI、MAC地址、SIM卡IMSI信息、IPv4地址、IPv6地址。

通用信息

Linux-Passwd文件、Linux-Shadow文件、动态口令/短信验证码、SSL证书、SK密钥、AWS访问密钥、AWS秘密密钥、Facebook密钥、IAM账号密码、GitHub密钥、DSA私钥、EC私钥、加密私钥、RSA私钥、认证Token、密码。

算力消耗攻击,是针对AI大模型的一种新型“经济战”和“资源战”。攻击者并不窃取数据,而是通过精心构造的输入,诱导模型进行极其复杂的运算,以此来大量消耗服务器的计算资源(如GPU、CPU),导致服务响应极慢,甚至直接瘫痪,同时给服务提供方带来高昂的算力成本。

AI安全护栏支持基于用户输入、输出数据的算力消耗防护,针对用户某一时间段内,输入输出请求的调用次数字符数,设置一个阈值,并对超过阈值的请求进行处置。

防护规格

项目

规格

应用数量(个)

100

策略数量(条)

100

规则数量(条)

1,000

自定义词库数量(条)

10,000

文本内容安全检测(QPS)

50

图片内容安全检测(QPS)

5

快速使用AI安全护栏

西南-贵阳一支持提交工单申请开通。

参考如下步骤,快速使用AI安全护栏。

  1. 添加检测策略
  2. 添加AI应用
  3. 将业务接入AI安全护栏。

  4. 查看日志查看概览

相关文档