进阶任务 · ADVANCED TASK

知识库 & Knowledge Agent

统一威胁情报库 · 蓝队专用 RAG 注入 · 持续学习闭环

将分散在 PhishingDetector 与 CyberOrion 中的攻击手法、ATT&CK 技术、近期真实案例与法律法规汇聚为统一知识库;Knowledge Agent 在此基础上提供 RAG 双路检索 + 联网增强 + 自动入库的端到端智能闭环,让蓝队推理始终扎根于权威、可追溯、可进化的知识。

--
统一知识库条目
--
覆盖分类
8K+
ATT&CK 技术词条
持续学习 · 越用越准
SECTION 01 · KNOWLEDGE BASE

统一威胁情报与法律法规知识库

汇聚 PhishingDetector 钓鱼专项(97+ 条目:攻击手法、品牌仿冒、近期真实案例、防御指南、法律法规、术语表等 9 大分类)与 CyberOrion 攻防底座(8126 条 ATT&CK、4 条法规、107 条沙箱知识、关键 CVE)的统一索引。支持关键词 + 向量混合检索,毫秒级响应。

加载中…
SECTION 02 · KNOWLEDGE AGENT

Knowledge Agent · 持续学习闭环架构

Knowledge Agent 是 CyberOrion 项目中负责知识库 RAG 检索、联网搜索增强、自动入库与持续学习的核心智能体。它严格隔离蓝白红权限——只服务蓝队(triage / threat_hunter / host_harden),红队严禁调用,确保红队完全凭训练知识与现场侦察决策。架构图按 cyberorion/core/knowledge_injector.py 真实实现绘制。

KNOWLEDGE AGENT · RAG + CONTINUOUS LEARNING LOOP 01 TRIGGER 触发 蓝队 Agent 角色 triage · threat_hunter · host_harden inject_for(side=blue) 推断意图 + 角色 + 当前状态 红队 Agent blocked · SecurityError 严禁调用 RAG · 凭训练知识决策 02 INJECT 注入 KnowledgeInjector 单例 · 白名单校验 · KB 惰性初始化 ALLOWED_SIDES = {blue, host_harden} ① side check → SecurityError 否则继续 ② get_or_create 单例 ③ lazy load KB · 首次访问加载 ④ RAG 检索 + 联网增强 + LLM-as-Judge ⑤ context_text 注入蓝队 Prompt 03 QUERY 查询 Query Builder role + intent + techniques queries ≤ 5 (去重) 从当前 Agent 上下文抽取 候选 ATT&CK T-ID · IOC · IOC 域名 角色上下文(high-risk asset 等) 自然语言意图(why / how to) 语义向量统一编码 04 RETRIEVE 检索 Dual-Path Retrieve Path A · 精确查 · Path B · 语义查 Path A: lookup(tid) · Path B: search(q, k=3) TID_BOOST = 100 命中加权 embedding · 余弦相似度 · npz cache BM25 · 关键词通道 (fallback) 按 doc_id 去重合并 · top-k fused_score = 0.4·kw + 0.6·vec 05 TRUNCATE 截断 字符预算截断 贪心装填 LLM 上下文窗口 ≤ 8 docs blue 2500 chars host_harden 1800 chars 按 fused_score 降序贪心 记录命中 doc 供 SSE 推送 标题 + 摘要 + 关键片段 06 AUGMENT 联网增强 联网搜索增强 no_match / 低置信触发 VirusTotal · MITRE · NVD · 公开报告 外部证据回填到候选池 超时 5s · 失败回退纯 KB LLM-as-Judge 质量门控 · 入库决策 相关性 · 置信度 · 是否入库 相关性 ≥ 0.7 才入库 过滤营销噪声 / 过期情报 07 DELIVER 投递 · 注入蓝队推理 蓝队 LLM Prompt context_text 注入 推理链透明 · 可审计 Blue Team Only · 旁路红队 仅服务 triage / threat_hunter / host_harden SSE 事件流 前端可视化 · RAG 透明可追 rag_retrieval · rag_no_match · rag_unavailable 命中 doc + 中文标题 + 引用块 Studio 面板渲染命中片段 08 PERSIST 持久化 KB Auto-Write + Embed 入库 → 重算 → 失效缓存 title · category · content · embedding 幂等去重 · 按 title UPSERT 写入即触发 embed_kb_entries() 持续学习闭环 Continuous Learning Loop · 越用越准 检索 → 评估 → 联网补全 → 入库 → 重算 下一轮检索直接命中新增量 蓝队知识资产随时间指数增长 09 AttackKB 持久知识库 · 持续学习闭环底层 attack_kb.jsonl MITRE ATT&CK 企业矩阵 8,126 文档 v18 · STIX 3.x embedding · 余弦检索 cve_critical 关键 CVE 情报 实时同步 NVD CVSS ≥ 7.0 自动入库 关联 ATT&CK T-ID regulations 中国法律法规 42 条 网安法 / 数安法 / PIPL / 关基 条款级引用 · 蓝队合规依据 PhishingDetector kb_entries 钓鱼专项统一知识 · 本仓库自有 97+ 条 · 9 分类 攻击手法 / ATT&CK 映射 / IoC / 防御指南 / 案例 kb_expansion.json + KB_SEED_ENTRIES 双通道 inject_for() SecurityError side pass queries ≤ 5 top-k docs no_match / 低置信 → 联网补全 KB 命中片段 → Judge 外部证据 高价值 → 入库 context_text 注入 (蓝队) rag_retrieval event 写入 + 重算 embedding 持续学习 · 新向量回流 → 下次检索更准 read · lookup / search
持续学习闭环

检索 → 评估 → 联网补全 → 自动入库 → 嵌入重算 → 反馈回流。LLM-as-Judge 把控质量,写入即触发 embed_kb_entries 增量重算与向量缓存失效。

双路互补检索

Path A 精确查 ATT&CK 编号(T-ID 加权 100);Path B 语义查(embedding 余弦 + BM25 回退)。命中按 doc id 去重合并,字符预算贪心取满(blue 2500 / host_harden 1800)。

蓝白红权限隔离

ALLOWED_SIDES = {blue, host_harden} 硬性白名单,红队 inject_for 调用立即抛 SecurityError。LLM Prompt 注入仅对蓝队开放,推理链通过 SSE 事件透明可审计。

SECTION 03 · KNOWLEDGE BASE DESIGN

统一知识库 · 数据结构与检索策略

两个项目的知识资产经过统一索引,可被同一套 RAG 接口检索。PhishingDetector 专注于钓鱼专项,CyberOrion 提供底座(ATT&CK + 法规 + 沙箱知识),二者通过 kb_entries / attack_kb 双通道并行服务。

PhishingDetector 钓鱼专项 PD · kb_entries

由 src/database.py 的 KB_SEED_ENTRIES 与 data/kb_expansion.json 共同驱动。条目按 title 幂等播种。

  • 攻击手法 · 品牌仿冒 · IoC 威胁指标
  • ATT&CK 映射 · 防御指南 · 术语表
  • 近期真实案例 · 法律法规(新增 4 条)
  • 每条 ≥ 300 字正文,含摘要 / 检测要点 / IoC / 处置建议
  • 三级严重度:critical / high / medium / low

CyberOrion 攻防底座 CO · attack_kb

由 cyberorion/kb/rag.py 加载。AttackKB 类提供 lookup(ATT&CK 编号) 与 search(语义查询) 双入口。

  • attack_kb.jsonl · 8126 条 ATT&CK 技术
  • cve_critical.json · 关键 CVE 情报
  • regulations.json · 中国法律法规 42 条
  • sandbox_knowledge.json · 沙箱环境 107 条
  • embedding 模式 · npz 缓存 · 自动回退 BM25

检索 API 统一接口 RAG · hybrid

由 src/api/routes.py 暴露。前端可直接调用,KnowledgeInjector 后端根据 side 决定是否注入。

  • GET /api/kb/entries?limit=200 · 列表
  • GET /api/kb/categories · 分类统计
  • GET /api/kb/search?q=&mode=hybrid · 混合检索
  • GET /api/kb/entries/{id} · 单条详情
  • fused_score = 0.4×kw + 0.6×vector

持续学习的工程意义 LOOP

Knowledge Agent 不只是检索器,而是"越用越准"的智能体——它把蓝队每天遇到的新威胁沉淀为 KB 条目。

  • 低置信度自动触发联网补全(无需人工)
  • LLM-as-Judge 把关入库质量(防噪声)
  • 写入即失效向量缓存(避免脏读)
  • 下一次检索直接受益于新条目
  • 蓝队知识资产随时间指数级增长