SECTION 01 · KNOWLEDGE BASE
统一威胁情报与法律法规知识库
汇聚 PhishingDetector 钓鱼专项(97+ 条目:攻击手法、品牌仿冒、近期真实案例、防御指南、法律法规、术语表等 9 大分类)与 CyberOrion 攻防底座(8126 条 ATT&CK、4 条法规、107 条沙箱知识、关键 CVE)的统一索引。支持关键词 + 向量混合检索,毫秒级响应。
SECTION 02 · KNOWLEDGE AGENT
Knowledge Agent · 持续学习闭环架构
Knowledge Agent 是 CyberOrion 项目中负责知识库 RAG 检索、联网搜索增强、自动入库与持续学习的核心智能体。它严格隔离蓝白红权限——只服务蓝队(triage / threat_hunter / host_harden),红队严禁调用,确保红队完全凭训练知识与现场侦察决策。架构图按 cyberorion/core/knowledge_injector.py 真实实现绘制。
持续学习闭环
检索 → 评估 → 联网补全 → 自动入库 → 嵌入重算 → 反馈回流。LLM-as-Judge 把控质量,写入即触发 embed_kb_entries 增量重算与向量缓存失效。
双路互补检索
Path A 精确查 ATT&CK 编号(T-ID 加权 100);Path B 语义查(embedding 余弦 + BM25 回退)。命中按 doc id 去重合并,字符预算贪心取满(blue 2500 / host_harden 1800)。
蓝白红权限隔离
ALLOWED_SIDES = {blue, host_harden} 硬性白名单,红队 inject_for 调用立即抛 SecurityError。LLM Prompt 注入仅对蓝队开放,推理链通过 SSE 事件透明可审计。
SECTION 03 · KNOWLEDGE BASE DESIGN
统一知识库 · 数据结构与检索策略
两个项目的知识资产经过统一索引,可被同一套 RAG 接口检索。PhishingDetector 专注于钓鱼专项,CyberOrion 提供底座(ATT&CK + 法规 + 沙箱知识),二者通过 kb_entries / attack_kb 双通道并行服务。
PhishingDetector 钓鱼专项 PD · kb_entries
由 src/database.py 的 KB_SEED_ENTRIES 与 data/kb_expansion.json 共同驱动。条目按 title 幂等播种。
- 攻击手法 · 品牌仿冒 · IoC 威胁指标
- ATT&CK 映射 · 防御指南 · 术语表
- 近期真实案例 · 法律法规(新增 4 条)
- 每条 ≥ 300 字正文,含摘要 / 检测要点 / IoC / 处置建议
- 三级严重度:critical / high / medium / low
CyberOrion 攻防底座 CO · attack_kb
由 cyberorion/kb/rag.py 加载。AttackKB 类提供 lookup(ATT&CK 编号) 与 search(语义查询) 双入口。
- attack_kb.jsonl · 8126 条 ATT&CK 技术
- cve_critical.json · 关键 CVE 情报
- regulations.json · 中国法律法规 42 条
- sandbox_knowledge.json · 沙箱环境 107 条
- embedding 模式 · npz 缓存 · 自动回退 BM25
检索 API 统一接口 RAG · hybrid
由 src/api/routes.py 暴露。前端可直接调用,KnowledgeInjector 后端根据 side 决定是否注入。
GET /api/kb/entries?limit=200 · 列表
GET /api/kb/categories · 分类统计
GET /api/kb/search?q=&mode=hybrid · 混合检索
GET /api/kb/entries/{id} · 单条详情
- fused_score = 0.4×kw + 0.6×vector
持续学习的工程意义 LOOP
Knowledge Agent 不只是检索器,而是"越用越准"的智能体——它把蓝队每天遇到的新威胁沉淀为 KB 条目。
- 低置信度自动触发联网补全(无需人工)
- LLM-as-Judge 把关入库质量(防噪声)
- 写入即失效向量缓存(避免脏读)
- 下一次检索直接受益于新条目
- 蓝队知识资产随时间指数级增长