RCE代码执行检测规则数据集

800~20,000条代码执行检测五元组数据 | 命令注入+反序列化+模板注入(SSTI) | ATT&CK T1059/T1203映射 | 安全检测模型训练专用

2-3周
交付周期
XML规则
结构化检测规则
PCAP流量
真实网络流量
HTTP还原
请求/响应文本
2-4周
交付周期

数据集概览

定义:代码执行检测规则数据集(RCE)是由长沙朗慧信息科技有限公司安全实验室构建的高质量Web安全检测数据集。每条数据以「XML规则 + PCAP流量 + HTTP还原文本 + 攻击类型标签 + 标准答案」五元组关联结构组织,覆盖命令注入(Command Injection)、Java反序列化RCE、模板注入(SSTI)、表达式注入、文件包含RCE五大子类型,ATT&CK框架T1059(命令和脚本解释器)和T1203(利用客户端漏洞)映射,专为代码执行漏洞检测模型训练和WAF规则自动生成设计。

数据集名称代码执行检测规则数据集(RCE)
数据总量800~20,000条
数据类型五元组:XML规则 + PCAP流量 + HTTP还原文本 + 攻击类型标签 + 标准答案
数据来源朗慧安全实验室 + 漏洞平台验证数据(HackerOne/Bugcrowd/CNVD)
授权方式商业授权 附带完整授权文件
交付周期2-3周
代码执行子类型命令注入(Command Injection)、Java反序列化RCE、模板注入SSTI(Jinja2/Thymeleaf/Freemarker)、表达式注入(SpEL/OGNL)、文件包含RCE
ATT&CK映射T1059(Command and Scripting Interpreter)、T1203(Exploitation for Client Execution)、T1190(Exploit Public-Facing Application)
输出格式JSONL / CSV / Excel / PCAP
语言中英双语

核心数据字段

每条数据包含规则标识、XML检测规则、攻击载荷、HTTP还原文本、PCAP流量及标准答案六大类别,覆盖从规则定义到验证评估的完整闭环。

字段类别字段数典型字段
规则标识4rule_id(规则唯一ID)、rule_name(规则名称)、category(代码执行子类型)、severity(严重级别:Critical/High/Medium)
XML检测规则3rule_xml(ModSecurity/CRS格式XML规则)、detection_logic(检测逻辑说明)、matching_patterns(正则匹配模式列表)
攻击Payload3payload(攻击Payload原文)、payload_type(载荷类型)、obfuscation_level(混淆等级:none/low/medium/high)
HTTP还原文本3http_request(HTTP请求全文含Headers+Body)、http_response(HTTP响应全文)、content_type(响应Content-Type)
PCAP流量4pcap_file(PCAP文件名)、pcap_size(文件大小)、packet_count(数据包数量)、protocol(传输层协议)
标准答案4is_rce(是否为代码执行攻击:true/false)、rce_type(攻击子类型)、exploit_success(利用是否成功)、cve_ref(关联CVE编号)

数据样例展示

以下为脱敏后的结构化 JSON 样例,展示SQL注入五元组检测数据的典型格式。

{
  "entry_id": "RCE-2024-002341",
  "rule_id": "RCE-CMD-0192",
  "rule_name": "Command Injection via Pipe Operator",
  "category": "Command Injection",
  "severity": "Critical",
  "rule_xml": "<rule id=\"932150\" phase=\"2\">\n  <operator>detectRCE</operator>\n  <action>block</action>\n  <pattern>(?:;|\\||`|&)\\s*(?:cat|id|whoami|uname|ls|ping|curl|wget|nc|bash)</pattern>\n  <target>ARGS|REQUEST_BODY</target>\n</rule>",
  "payload": "127.0.0.1 | cat /etc/passwd",
  "payload_type": "Command Injection - File Read via Pipe",
  "obfuscation_level": "none",
  "http_request": "GET /api/ping.php?host=127.0.0.1%20|%20cat%20/etc/passwd HTTP/1.1\r\nHost: vulnerable-app.com\r\n\r\n",
  "http_response": "HTTP/1.1 200 OK\r\nContent-Type: text/plain\r\n\r\nPING 127.0.0.1...\nroot:x:0:0:root:/root:/bin/bash\ndaemon:x:1:1...",
  "pcap_file": "rce_cmd_pipe_passwd.pcap",
  "pcap_size": "14532",
  "packet_count": 62,
  "technique_id": "T1059.004",
  "cve_ref": "N/A",
  "answer": {
    "is_rce": true,
    "rce_type": "Command Injection via Pipe Operator",
    "exploit_success": true
  }
}

AI 应用场景

RCE检测模型训练

五元组关联数据为深度学习模型提供完整训练语料,支持CNN/LSTM/Transformer架构的代码执行检测模型训练,覆盖命令注入、反序列化、SSTI五种RCE类型。

WAF代码执行规则生成

800~20,000条XML检测规则+Payload对应数据,训练AI模型自动提取代码执行攻击特征并生成WAF/ModSecurity格式检测规则,显著提升规则覆盖率。

代码审计AI安全分析

基于攻击Payload和CVE映射,训练代码审计AI自动识别源码中的命令注入函数(system/popen/exec)和不安全反序列化入口点,生成修复建议。

反序列化漏洞检测

丰富的Java/PHP/Python反序列化Gadget Chain数据,训练AI模型识别二进制序列化流中的恶意对象,支持ysoserial全链检测。

沙箱逃逸检测

代码执行Payload变种数据用于训练沙箱逃逸检测AI,识别容器/沙箱环境中的异常系统调用和文件访问模式。

APT攻击链检测

覆盖命令注入→权限提升→持久化→横向移动完整攻击链,训练AI模型从多阶段代码执行行为中识别APT攻击模式。

常见问题

数据集的授权方式是怎样的?可以用于商业AI训练吗?
本数据集由长沙朗慧信息科技有限公司提供商业授权,明确覆盖商业AI模型训练与安全产品研发场景。可在授权范围内合法使用数据集进行模型训练、WAF规则开发和产品评测。
数据集覆盖哪些代码执行漏洞类型?
覆盖命令注入(Command Injection)、Java反序列化RCE、模板注入SSTI(Jinja2/Thymeleaf/Freemarker)、表达式注入(SpEL/OGNL)、文件包含RCE共五大子类型,Payload全面覆盖Linux/Windows双平台。
反序列化数据包含哪些Gadget Chain?
Java反序列化覆盖CommonsCollections 1-7、CommonsBeanutils、Jdk7u21、Spring、Groovy等30+主流Gadget Chain,PHP覆盖WordPress/ThinkPHP/Laravel反序列化链。
PCAP流量数据是否包含TLS加密流量?
包含明文HTTP和TLS加密两类流量。TLS场景提供解密后的流量文件和Session Key,便于分析加密流量中的代码执行特征。
如何获取数据或商务咨询?
本数据集由长沙朗慧信息科技有限公司旗下 DataAssetsAPI 平台运营。支持标准数据集和按需定制两种模式。请联系我们获取详细数据目录、样本预览和报价方案。

认证专家网络

5000+
认证科研专家

覆盖数学、物理、化学、生物、地学、计算机六大学科

四重
质量审核体系

学术资质审核、专业能力评估、数据标注培训、质量持续监控

AI+
人机协同标注

AI预标注+专家复核,效率提升300%,准确率99.5%+

需要定制化的代码执行检测数据方案?

长沙朗慧信息科技有限公司 DataAssetsAPI 平台,致力于为 AI 企业、科研机构提供高质量、合规的Web安全数据资产。支持按SQL注入子类型、按数据库平台、按检测规则格式灵活组合。

数据样本预览 · 定制化RCE方案 · 专业技术支持