You need to enable JavaScript to run this app.
文档中心
ArkClaw 企业版

ArkClaw 企业版

复制全文
下载 pdf
助手防护配置
防护策略说明
复制全文
下载 pdf
防护策略说明
AgentSentry 提供多层次的 AI 助手安全防护策略,在用户输入、工具调用等环节识别潜在风险,并根据策略配置执行提示、拦截、记录。
通过配置不同类型的防护策略,您可以为 AI 助手建立更可控的安全边界,降低提示词攻击、高危工具调用、敏感数据泄露和第三方工具风险带来的影响。
注意事项
需要注意的是,AI 助手的实际运行效果会受到模型能力、上下文内容、工具配置、业务场景和策略阈值等因素影响。防护策略用于帮助识别和降低风险,但不能替代权限控制、人工复核、最小权限配置、数据隔离和其他安全治理措施。
策略对比
防护策略
适用场景
提示词攻击防护
需要识别用户是否尝试绕过系统指令、诱导模型输出不当内容或套取内部提示词的场景。
高危操作拦截
助手具备调用工具、执行命令或操作外部系统能力,尤其是涉及内部系统、数据库、文件和网络资源的场景。
敏感数据防护
交互内容可能触及个人信息的场景。
风险扫描
计划引入或已集成任何第三方/非自研技能、插件或 MCP 服务的助手。
策略分类详情
以下分类用于帮助您理解不同防护策略的覆盖范围和典型风险。由于模型行为、运行环境、工具权限、安全策略和样本表达方式存在差异,示例仅用于说明风险类型,不代表在所有场景下都能稳定触发相同检测结果。
建议在上线前结合真实业务样本进行测试,并根据误报、漏报和业务可接受风险调整策略。
高危操作拦截
高危操作拦截用于识别 AI 助手在调用工具、执行命令、访问系统资源或连接外部网络时可能产生的高风险行为。该策略可帮助管理员降低误操作、越权操作、恶意指令或受污染插件导致的业务影响。
二级分类
防护说明
插件投毒
识别可能包含恶意攻击、可疑链接、敏感信息窃取、数据泄露或混淆隐藏意图的 Skill 或插件,帮助降低第三方工具接入带来的供应链和运行期风险。
静默窃取
识别隐蔽网络请求、远程数据采集、自动上传等可能导致数据在用户无感知情况下外发的行为,帮助发现潜在的数据泄露路径。
文件删除与系统破坏
识别文件、目录删除以及可能破坏系统资源的操作,帮助降低误操作或恶意指令导致文件丢失、系统损坏或服务异常的风险。
系统控制与关机重启
识别系统关机、重启、服务停止或服务控制类操作,帮助减少未经授权的系统中断对业务运行的影响。
修改权限
识别权限提升、权限放宽或权限修改行为,帮助降低权限被滥用、异常扩大或篡改的风险。
远程代码下载执行
识别从远程地址下载并执行脚本、二进制文件或其他可执行内容的行为,帮助降低外部恶意代码被引入和执行的风险。
反向连接与远程控制
识别反向连接、远程控制通道或远控命令执行行为,帮助发现可能导致外部控制、横向移动或持续访问的高风险操作。
用户与权限管理
识别系统用户创建、权限变更、角色调整或权限提升行为,帮助降低未经授权的账户管理操作带来的风险。
批量执行与自动化破坏
识别批量执行命令、循环操作、自动化任务或大规模变更行为,帮助降低大范围系统破坏、批量删除或批量修改带来的影响。
禁用安全插件
识别禁用、卸载、停止或绕过安全插件和安全组件的行为,帮助降低攻击者规避安全检测和防护机制的风险。
公网暴露
识别开放公网访问端口、配置隧道、端口转发或公开内部服务的行为,帮助减少系统或服务被意外暴露至公网环境的风险。
内网扫描
识别网络扫描、端口探测、服务枚举或内网资产发现行为,帮助发现可能用于横向移动前置探测的异常操作。
持久化
识别创建定时任务、启动项、系统服务或其他可能用于长期驻留的行为,帮助发现异常持久化配置。
数据外传
识别向外部网络发送敏感数据、导出业务数据、上传文件或通过隐蔽通道传输数据的行为,帮助降低数据泄露风险。
敏感操作
识别访问系统关键配置文件、密钥文件、凭据文件或其他敏感资源的行为,帮助降低敏感信息被非预期读取或暴露的风险。
工具链风险
对多个工具调用过程中形成的连续操作行为进行关联分析,识别可能导致恶意下载、命令执行、数据外传或系统控制等安全风险的链式高危行为,帮助发现分散操作逐步串联形成多阶段组合攻击的风险。
提示词攻击防护
提示词攻击防护用于识别用户是否尝试通过伪装、诱导、角色设定、指令覆盖、上下文操纵、编码混淆或远程资源调用等方式影响模型行为。该策略可帮助降低模型偏离系统指令、泄露内部信息、执行异常目标或生成不当内容的风险。
二级分类
防护说明
提示词攻击默认标签
识别其他未明确归类的提示词攻击行为,通常包括通过异常输入干扰模型安全策略执行、诱导模型输出违反既定限制内容的请求。
角色扮演
识别通过设定特定角色或恶意身份来诱导模型绕过既定行为边界的请求,帮助降低模型因角色设定而输出不当内容的风险。
权限提升
识别试图突破模型既有权限边界、访问未授权数据或诱导模型执行高权限行为的请求,帮助降低越权访问和越权操作风险。
对抗前后缀
识别在提示词前后添加干扰性文本、结构或特殊片段来影响模型解析的请求,帮助发现可能导致模型忽略安全限制或执行异常指令的输入。
目标劫持
识别通过重置上下文、覆盖任务目标或引导模型忽略原始系统目标的请求,帮助降低模型执行攻击者指定新目标的风险。
混淆和编码
识别通过编码、变形、拆分、替换或语义混淆方式表达潜在恶意内容的请求,帮助发现试图绕过安全检测的输入。
少量示例攻击
识别通过提供多个示例在提示语境中诱导模型模仿特定违规行为的请求,帮助降低模型被上下文示例带偏的风险。
窃取提示词
识别诱导模型输出系统提示词、隐藏策略、内部规则或开发者指令的请求,帮助降低内部安全策略和提示词信息被暴露的风险。
URL 渲染和请求
识别利用 HTML 渲染、资源加载或链接参数拼接进行数据外发的请求,帮助降低用户个人信息、对话上下文或企业机密被嵌入外部资源请求的风险。
指令补齐
识别通过提供不完整指令、片段或语句诱导模型补全敏感或受限内容的请求,帮助降低模型被动生成不当内容的风险。
反向诱导
识别以反向问题、否定式请求、研究、过滤、教育或反驳为名诱导模型输出潜在敏感或违规信息的请求。
代码化描述
识别通过编程语言、脚本、伪代码或结构化代码隐藏潜在恶意意图的请求,帮助发现包装在代码逻辑中的高风险指令。
诱导生成有害内容
识别直接或间接诱导模型生成违法违规、危险、攻击性或其他不符合安全策略内容的请求,帮助减少不当输出风险。
远程代码执行
识别诱导模型下载、加载或执行远程代码的请求,帮助降低恶意代码在目标系统中运行的风险。
敏感数据防护
敏感数据防护用于识别文本中可能包含的个人信息、金融信息、账号信息或业务敏感信息,并根据策略配置执行提示、拦截、脱敏或记录。该策略可帮助降低敏感信息在用户输入、模型响应或工具调用过程中被暴露的风险。
二级分类
防护说明
身份证号
识别文本中的身份证号等身份标识信息,帮助降低身份信息被泄露或滥用的风险。
电话号码
识别文本中的手机号码或电话号码信息,帮助降低联系方式被非预期暴露或传播的风险。
银行卡号
识别文本中的银行卡号等金融账号信息,帮助降低金融信息被暴露或滥用的风险。
电子邮箱
识别文本中的电子邮箱地址信息,帮助降低邮箱地址被用于发送垃圾邮件、进行钓鱼攻击的风险。
风险扫描
风险扫描用于对 Skill、插件或其他工具资产进行自动化安全检测,帮助管理员在接入前或运行过程中发现潜在供应链风险和运行期风险。
二级分类
防护说明
风险扫描
对工具代码、配置和行为进行自动化安全检测,识别敏感文件访问、外部网络请求、高危操作、可疑依赖等风险,帮助降低第三方或非自研工具带来的供应链及运行期安全风险。
最近更新时间:2026.07.22 20:32:06
这个页面对您有帮助吗?
有用
有用
无用
无用