为安全大模型(Security LLM)构建攻防对抗训练数据基础设施。覆盖SQL注入、XSS、RCE、缓冲区溢出、路径穿越、综合威胁检测等8大安全数据集,五元组结构化标注,MITRE ATT&CK全映射。
生成式AI既是攻击利器也是防御革命。从LLM驱动的自动化漏洞挖掘到Security LLM的崛起,从对抗性机器学习到AI红队,AI正在重塑网络安全的攻防格局。
微软Security Copilot、Google Sec-PaLM、Palo Alto Cortex XSIAM等专用安全大模型相继落地,基于GPT-4/Claude架构在威胁情报、SOC告警研判、攻击链推理上达到甚至超越人类专家水平。Security LLM时代,高质量攻防对抗数据成为核心壁垒。
基于Transformer和GNN的APT攻击检测系统在DARPA TC、CIC-APT等公开基准上准确率突破95%,大幅超越传统规则引擎。多阶段攻击链识别、TTP推理、异常行为基线建模成为研究热点,亟需大规模高质量APT样本。
OpenAI、Anthropic、Google DeepMind成立专业AI红队,针对Prompt Injection、Jailbreak、Data Poisoning、Model Extraction等攻击开展对抗性测试。NIST AI RMF与OWASP LLM Top 10将对抗性机器学习列为AI安全核心议题。
FBI/IC3年度报告显示,生成式AI使钓鱼邮件成功率提升300%,Deepfake语音诈骗损失超5亿美元。WormGPT、FraudGPT等黑产LLM在暗网流通,AI驱动的自动化漏洞挖掘、自适应攻击编排正在重塑威胁格局。
MITRE ATT&CK框架已被全球80%以上的SOC团队采用,覆盖14大战术、200+技术。ATT&CK Navigator、ATT&CK Eval、CTRAC等工具推动ATT&CK产业化,安全大模型必须深度理解ATT&CK才能进行有效的TTP推理与威胁狩猎。
Gartner预测,AI驱动的网络安全市场将在2030年前突破2150亿美元,年复合增长率22.8%。安全运营自动化、AI威胁情报、零信任AI将成为三大核心赛道,高质量攻防对抗数据是AI安全的核心战略资源。
从Web攻击到系统漏洞,从单点检测到综合威胁,从ATT&CK训练到检测能力缺口,五元组结构化标注,全量映射MITRE ATT&CK框架。
1,000~30,000条五元组数据,覆盖联合查询/盲注/报错/时间注入等7大子类型,支持MySQL/PostgreSQL/MSSQL/Oracle多数据库。ATT&CK T1190映射,含XML检测规则+PCAP流量+HTTP还原文本+标准答案。
1,000~30,000条五元组数据,覆盖反射型/存储型/DOM型/mXSS等5大子类型。含bypass技巧标注(编码绕过/大小写混淆/标签拆分/事件变异),ATT&CK T1189映射,覆盖HTML/JS/CSS/URL多上下文。
800~20,000条五元组数据,覆盖命令注入/反序列化/SSTI等5种RCE类型。含Java/PHP/Python反序列化Gadget Chain数据,支持ysoserial全链检测。ATT&CK T1059/T1203映射,覆盖命令注入→提权→持久化→横向移动完整攻击链。
500~10,000条五元组数据,覆盖栈溢出/堆溢出/格式化字符串/整数溢出4类系统级漏洞。ATT&CK T1203映射,二进制安全AI训练专用,含规则定义到验证评估完整闭环,支持CGC训练语料生成。
800~20,000条五元组数据,覆盖目录穿越/LFI/RFI/路径规范化绕过4类攻击。含丰富编码绕过Payload(URL/Double/Unicode/UTF-8 overlong/null byte/路径截断),ATT&CK T1083/T1005映射。
2,000~50,000条多类型威胁五元组数据,覆盖Web/网络/主机/云/API/0day 6大类别。完整ATT&CK映射+杀伤链阶段标注,是Security LLM预训练的完整语料基础,实现"One Model for All Threats"。
1,000~20,000条ATT&CK攻防技能训练数据,14战术/200+技术全覆盖。每条含ATT&CK技术元数据、攻击描述、检测方法、缓解措施、过程示例、PCAP关联。安全大模型预训练/SFT专用语料,覆盖知识注入到实战训练全场景。
500~1,500条高价值检测差距分析+TTP推理链,日志数据源映射。覆盖从差距识别到规则生成的完整链路,五元组关联结构,检测工程自动化训练专用,支撑SIEM规则智能生成与红蓝对抗仿真。
所有安全数据集均采用统一的五元组(实际为六元组)关联结构,覆盖从规则定义到流量验证的完整闭环,为Security LLM提供结构化训练基础。
唯一规则ID、ATT&CK技术ID映射、攻击类别、严重等级、CVE关联等元数据标识
结构化XML格式的检测规则定义,含正则特征、匹配条件、动作类型,可被WAF/IDS/SIEM直接消费
真实攻击Payload样本,含bypass技巧、编码变种、Gadget Chain等,覆盖主流攻击手法与变种
完整的HTTP请求/响应还原文本,含Header、Body、Cookie、URL等全量字段,便于NLP模型理解
原始PCAP抓包数据,保留网络层完整信息(TCP/IP、TLS握手、时序等),支持流量分析模型训练
人工专家标注的标准答案(攻击/正常、类型、严重度),用于模型SFT/RLHF训练与评估
朗慧安全数据集全面映射MITRE ATT&CK框架,覆盖从初始访问到影响的完整攻击Kill Chain。绿色单元格表示已覆盖的技术领域。
每条数据采用五元组结构化格式,从ATT&CK元数据到PCAP流量的全方位标注。
{
"rule_id": "SQLI-2026-UNION-0001",
"attack_type": "SQL Injection",
"sub_type": "Union-based",
"mitre_attack": "T1190",
"severity": "CRITICAL",
"xml_rule": "UNION.+SELECT ",
"payload": "1' UNION SELECT username,password FROM users--",
"http_request": "GET /login?id=1'%20UNION%20SELECT...",
"pcap_ref": "pcap/sqli-union-0001.pcap",
"label": "malicious",
"db_type": "MySQL"
}从WAF规则生成到Security LLM训练,从SOC自动化到红蓝对抗,朗慧安全数据集覆盖AI安全的每一个关键环节。
综合威胁检测数据集作为Security LLM的完整语料基础,覆盖Web/网络/主机/云/API/0day 6大类别,实现"One Model for All Threats"。配合ATT&CK训练数据集进行SFT,注入TTP推理能力。
SQL注入/XSS/RCE/路径穿越数据集的XML检测规则可直接被WAF消费,训练LLM自动生成针对新型攻击的检测规则,覆盖率提升40%+,误报率降低60%+。
基于ATT&CK框架的多攻击混合数据集训练SOC AI分析师,自动化告警分诊、威胁狩猎、攻击链推理。检测差距数据集帮助识别SIEM检测盲区,智能生成补全规则。
ATT&CK训练数据集支撑红队TTP模拟与蓝队检测验证,自动生成攻击剧本与检测规则。检测差距数据集精准定位防御盲区,量化红蓝对抗覆盖度。
RCE/缓冲区溢出数据集训练代码审计模型,自动识别反序列化Gadget Chain、栈溢出、格式化字符串等漏洞,支持Java/PHP/Python/C/C++多语言。
ATT&CK训练数据集赋予LLM深度理解TTP(战术/技术/流程)的能力,从单条告警推理完整攻击链,关联威胁情报,预测攻击者下一步行动。
长沙朗慧信息科技有限公司 DataAssetsAPI 平台,致力于为安全团队、AI企业提供高质量、合规的攻防对抗数据基础设施。从SQL注入到综合威胁,从ATT&CK训练到检测能力缺口,构建Security LLM训练闭环。