大模型时代攻防对抗数据基础设施

AI+安全
数据集矩阵

为安全大模型(Security LLM)构建攻防对抗训练数据基础设施。覆盖SQL注入XSSRCE缓冲区溢出路径穿越综合威胁检测等8大安全数据集,五元组结构化标注,MITRE ATT&CK全映射。

security-llm@langhui:~$
# 加载朗慧安全数据集训练Security LLM
$ python train_security_llm.py --dataset langhuiai/security-suite
[INFO] Loading 8 datasets...
[INFO] ATT&CK techniques covered: 200+
[INFO] Five-tuple structured samples: 153,000+
[TRAIN] Epoch 1/10 | Loss: 0.342 | Acc: 99.5%
$
8
安全数据集矩阵
6已上线2即将上线
153K+
五元组结构化样本
PCAP+HTTPXML规则
200+
ATT&CK技术覆盖
14大战术T1190
99.5%
标注准确率
AI预标注专家复核
向下滚动
前沿安全动态

AI+安全 最新前沿进展

生成式AI既是攻击利器也是防御革命。从LLM驱动的自动化漏洞挖掘到Security LLM的崛起,从对抗性机器学习到AI红队,AI正在重塑网络安全的攻防格局。

Security LLM 2026

Security LLM:专用安全大模型崛起

微软Security Copilot、Google Sec-PaLM、Palo Alto Cortex XSIAM等专用安全大模型相继落地,基于GPT-4/Claude架构在威胁情报、SOC告警研判、攻击链推理上达到甚至超越人类专家水平。Security LLM时代,高质量攻防对抗数据成为核心壁垒。

威胁情报 告警研判 攻击链推理
APT检测 95%+

深度学习APT检测准确率突破95%

基于Transformer和GNN的APT攻击检测系统在DARPA TC、CIC-APT等公开基准上准确率突破95%,大幅超越传统规则引擎。多阶段攻击链识别、TTP推理、异常行为基线建模成为研究热点,亟需大规模高质量APT样本。

APT检测准确率 95%+
AI红队 对抗性

LLM红队与对抗性机器学习

OpenAI、Anthropic、Google DeepMind成立专业AI红队,针对Prompt Injection、Jailbreak、Data Poisoning、Model Extraction等攻击开展对抗性测试。NIST AI RMF与OWASP LLM Top 10将对抗性机器学习列为AI安全核心议题。

Prompt注入 越狱攻击 数据投毒
AI攻击 300%↑

生成式AI使钓鱼攻击成功率提升300%

FBI/IC3年度报告显示,生成式AI使钓鱼邮件成功率提升300%,Deepfake语音诈骗损失超5亿美元。WormGPT、FraudGPT等黑产LLM在暗网流通,AI驱动的自动化漏洞挖掘、自适应攻击编排正在重塑威胁格局。

AI钓鱼 Deepfake 黑产LLM
MITRE ATT&CK 80%+

MITRE ATT&CK成为威胁狩猎核心框架

MITRE ATT&CK框架已被全球80%以上的SOC团队采用,覆盖14大战术、200+技术。ATT&CK Navigator、ATT&CK Eval、CTRAC等工具推动ATT&CK产业化,安全大模型必须深度理解ATT&CK才能进行有效的TTP推理与威胁狩猎。

14战术 200+技术 威胁狩猎
市场趋势 $215B

AI网络安全市场2030年将突破2150亿美元

Gartner预测,AI驱动的网络安全市场将在2030年前突破2150亿美元,年复合增长率22.8%。安全运营自动化、AI威胁情报、零信任AI将成为三大核心赛道,高质量攻防对抗数据是AI安全的核心战略资源。

安全运营 威胁情报 零信任
朗慧科技安全数据集矩阵

8大安全数据集,构建Security LLM训练闭环

从Web攻击到系统漏洞,从单点检测到综合威胁,从ATT&CK训练到检测能力缺口,五元组结构化标注,全量映射MITRE ATT&CK框架。

LIVE CRITICAL

SQL注入检测规则数据集

1,000~30,000条五元组数据,覆盖联合查询/盲注/报错/时间注入等7大子类型,支持MySQL/PostgreSQL/MSSQL/Oracle多数据库。ATT&CK T1190映射,含XML检测规则+PCAP流量+HTTP还原文本+标准答案。

30K
最大样本量
7
注入子类型
T1190
ATT&CK
WAF规则生成 SQLi检测 SOAR
查看详情
LIVE HIGH

XSS跨站脚本检测规则数据集

1,000~30,000条五元组数据,覆盖反射型/存储型/DOM型/mXSS等5大子类型。含bypass技巧标注(编码绕过/大小写混淆/标签拆分/事件变异),ATT&CK T1189映射,覆盖HTML/JS/CSS/URL多上下文。

30K
最大样本量
5
XSS子类型
T1189
ATT&CK
WAF规则 前端安全 CSP生成
查看详情
LIVE CRITICAL

RCE远程命令执行检测规则数据集

800~20,000条五元组数据,覆盖命令注入/反序列化/SSTI等5种RCE类型。含Java/PHP/Python反序列化Gadget Chain数据,支持ysoserial全链检测。ATT&CK T1059/T1203映射,覆盖命令注入→提权→持久化→横向移动完整攻击链。

20K
最大样本量
5
RCE类型
T1059
ATT&CK
代码审计 反序列化 APT链检测
查看详情
LIVE CRITICAL

缓冲区溢出检测规则数据集(BOF)

500~10,000条五元组数据,覆盖栈溢出/堆溢出/格式化字符串/整数溢出4类系统级漏洞。ATT&CK T1203映射,二进制安全AI训练专用,含规则定义到验证评估完整闭环,支持CGC训练语料生成。

10K
最大样本量
4
溢出类型
T1203
ATT&CK
二进制漏洞 模糊测试 代码审计
查看详情
LIVE HIGH

路径穿越检测规则数据集

800~20,000条五元组数据,覆盖目录穿越/LFI/RFI/路径规范化绕过4类攻击。含丰富编码绕过Payload(URL/Double/Unicode/UTF-8 overlong/null byte/路径截断),ATT&CK T1083/T1005映射。

20K
最大样本量
4
攻击类型
T1083
ATT&CK
WAF规则 文件访问AI 渗透测试
查看详情
LIVE CRITICAL

综合威胁检测规则数据集

2,000~50,000条多类型威胁五元组数据,覆盖Web/网络/主机/云/API/0day 6大类别。完整ATT&CK映射+杀伤链阶段标注,是Security LLM预训练的完整语料基础,实现"One Model for All Threats"。

50K
最大样本量
6
威胁类别
全映射
ATT&CK
Security LLM XDR 威胁狩猎
查看详情
SOON TRAINING

MITRE ATT&CK 安全技能训练数据集

1,000~20,000条ATT&CK攻防技能训练数据,14战术/200+技术全覆盖。每条含ATT&CK技术元数据、攻击描述、检测方法、缓解措施、过程示例、PCAP关联。安全大模型预训练/SFT专用语料,覆盖知识注入到实战训练全场景。

20K
最大样本量
14
ATT&CK战术
200+
技术覆盖
SFT训练 TTP推理 SOC自动化
查看详情
SOON GAP

ATT&CK 检测差距与TTP推理数据集

500~1,500条高价值检测差距分析+TTP推理链,日志数据源映射。覆盖从差距识别到规则生成的完整链路,五元组关联结构,检测工程自动化训练专用,支撑SIEM规则智能生成与红蓝对抗仿真。

1.5K
最大样本量
TTP
推理链
SIEM
规则生成
检测工程 SIEM规则 红蓝对抗
查看详情
五元组结构化标注

统一的五元组关联结构

所有安全数据集均采用统一的五元组(实际为六元组)关联结构,覆盖从规则定义到流量验证的完整闭环,为Security LLM提供结构化训练基础。

Tuple 1

规则标识

唯一规则ID、ATT&CK技术ID映射、攻击类别、严重等级、CVE关联等元数据标识

Tuple 2

XML检测规则

结构化XML格式的检测规则定义,含正则特征、匹配条件、动作类型,可被WAF/IDS/SIEM直接消费

Tuple 3

攻击载荷

真实攻击Payload样本,含bypass技巧、编码变种、Gadget Chain等,覆盖主流攻击手法与变种

Tuple 4

HTTP还原文本

完整的HTTP请求/响应还原文本,含Header、Body、Cookie、URL等全量字段,便于NLP模型理解

Tuple 5

PCAP流量

原始PCAP抓包数据,保留网络层完整信息(TCP/IP、TLS握手、时序等),支持流量分析模型训练

Tuple 6

标准答案

人工专家标注的标准答案(攻击/正常、类型、严重度),用于模型SFT/RLHF训练与评估

MITRE ATT&CK 覆盖矩阵

14大战术 200+技术全覆盖

朗慧安全数据集全面映射MITRE ATT&CK框架,覆盖从初始访问到影响的完整攻击Kill Chain。绿色单元格表示已覆盖的技术领域。

TA0043
侦察
TA0042
资源开发
TA0001
初始访问
TA0002
执行
TA0003
持久化
TA0004
提权
TA0005
防御绕过
TA0006
凭据访问
TA0007
发现
TA0008
横向移动
TA0009
收集
TA0011
命令控制
TA0010
数据外传
TA0040
影响
T1190
SQL注入
T1189
XSS
T1059
RCE
T1203
缓冲区溢出
T1083
路径穿越
T1005
数据收集
已覆盖战术/技术 未覆盖 共覆盖14大战术、200+技术
五元组数据样例

结构化安全数据格式预览

每条数据采用五元组结构化格式,从ATT&CK元数据到PCAP流量的全方位标注。

sqli-five-tuple.json
{
  "rule_id": "SQLI-2026-UNION-0001",
  "attack_type": "SQL Injection",
  "sub_type": "Union-based",
  "mitre_attack": "T1190",
  "severity": "CRITICAL",
  "xml_rule": "UNION.+SELECT",
  "payload": "1' UNION SELECT username,password FROM users--",
  "http_request": "GET /login?id=1'%20UNION%20SELECT...",
  "pcap_ref": "pcap/sqli-union-0001.pcap",
  "label": "malicious",
  "db_type": "MySQL"
}
应用场景

赋能AI安全全场景应用

从WAF规则生成到Security LLM训练,从SOC自动化到红蓝对抗,朗慧安全数据集覆盖AI安全的每一个关键环节。

Security LLM预训练与SFT

综合威胁检测数据集作为Security LLM的完整语料基础,覆盖Web/网络/主机/云/API/0day 6大类别,实现"One Model for All Threats"。配合ATT&CK训练数据集进行SFT,注入TTP推理能力。

WAF规则智能生成

SQL注入/XSS/RCE/路径穿越数据集的XML检测规则可直接被WAF消费,训练LLM自动生成针对新型攻击的检测规则,覆盖率提升40%+,误报率降低60%+。

SOC自动化与告警研判

基于ATT&CK框架的多攻击混合数据集训练SOC AI分析师,自动化告警分诊、威胁狩猎、攻击链推理。检测差距数据集帮助识别SIEM检测盲区,智能生成补全规则。

红蓝对抗仿真

ATT&CK训练数据集支撑红队TTP模拟与蓝队检测验证,自动生成攻击剧本与检测规则。检测差距数据集精准定位防御盲区,量化红蓝对抗覆盖度。

代码安全审计AI

RCE/缓冲区溢出数据集训练代码审计模型,自动识别反序列化Gadget Chain、栈溢出、格式化字符串等漏洞,支持Java/PHP/Python/C/C++多语言。

威胁情报与TTP推理

ATT&CK训练数据集赋予LLM深度理解TTP(战术/技术/流程)的能力,从单条告警推理完整攻击链,关联威胁情报,预测攻击者下一步行动。

常见问题

关于AI+安全数据集

五元组结构与传统安全数据集有什么区别?
五元组结构(规则标识+XML检测规则+攻击载荷+HTTP还原文本+PCAP流量+标准答案)是朗慧首创的安全数据标注范式,覆盖从规则定义到流量验证的完整闭环。传统数据集通常只提供Payload或日志,而五元组结构使Security LLM能够同时学习规则生成、Payload识别、流量分析、攻击判定等多维能力,训练效果显著提升。
数据集如何保证与MITRE ATT&CK的对齐质量?
所有数据集均由持有OSCP/CISSP/CEH等认证的安全专家标注,每条数据映射到具体的ATT&CK技术ID(如T1190/T1189/T1059等)。我们采用三重审核机制:AI预标注→专家复核→ATT&CK一致性校验,确保映射准确率99.5%+。综合威胁检测数据集覆盖全部14大战术、200+技术。
PCAP流量数据是否包含真实攻击流量?
PCAP流量数据由专业红队人员在隔离靶场环境中真实发起攻击产生,保留完整的TCP/IP、TLS握手、时序等网络层信息。所有流量均经过脱敏处理(去除真实IP/域名),确保合规可用。同时提供HTTP还原文本,便于NLP模型直接消费。
是否支持定制化攻击场景数据?
支持。朗慧科技可针对客户特定业务场景(如金融、政务、医疗、工业互联网)定制攻击数据集,包括特定框架漏洞(Spring/Struts/Shiro等)、特定云环境(AWS/阿里云/华为云)、特定ATT&CK战术覆盖。请联系 137-5502-0164 咨询定制方案。
数据集的授权与合规性如何保障?
所有攻击数据均在授权靶场环境产生,不涉及任何真实生产系统。Payload样本经过脱敏与去标识化处理,PCAP流量去除真实IP/域名/MAC等敏感信息。朗慧科技提供完整的授权文件与合规声明,符合《网络安全法》《数据安全法》《个人信息保护法》要求。
开启AI安全数据之旅

让攻防对抗数据驱动
下一代Security LLM

长沙朗慧信息科技有限公司 DataAssetsAPI 平台,致力于为安全团队、AI企业提供高质量、合规的攻防对抗数据基础设施。从SQL注入到综合威胁,从ATT&CK训练到检测能力缺口,构建Security LLM训练闭环。

数据样本预览 定制化攻击场景 ATT&CK对齐报告 合规授权保障