智能体系统★ 评分 5.8
COHORT: Collaborative Orchestration for Hardening via Offensive Replay on Emulated Topologies
Chen Frydman, Aviram Zilberman, Rubin Krief, Abed Showgan, Andres Murillo, Sekiya Motoyoshi, Asaf Shabtai, Yuval Elovici, Rami Puzis
2026年7月4日
关键词
网络缓解自动化多智能体LLM攻击回放验证高保真网络仿真后渗透防御
核心发现
- 多智能体架构(角色分解+迭代批评)相比单智能体基线提升MSR从10.7%到46.7%,其中角色分解贡献
75%、批评循环贡献25%——体现工程优化而非算法突破 | 2. 主机加固控制达63.3% MSR,而网络过滤仅5.8%,根因在于LLM对网络拓扑路由的系统性理解缺陷(规则跳数/顺序错误),提示框架在现实网络层部署的局限性 | 3. 攻击固定假设与缓解优化间存在根本性悖论:攻击可回放但不自适应,使验证与对手真实对抗性脱钩;累积缓解采用贪心堆叠策略,累积ME仅达52%后平台化,非全局最优 | 4. 实验范围高度受限(Linux端点、3厂商设备、4预定义攻击、无真实拓扑自动转换)且缺强基线对标,46.7% MSR仅代表高度受控环境的成功率而非企业部署可行性
实验规模
1782次缓解尝试,跨3种拓扑规模(小/中/大企业)与4种攻击场景(数据盗取、勒索、DNS泄露、横向移动),单条件60次运行×5重复;每轮最多10次缓解尝试、单次最多5次实现-批评迭代、20条命令/迭代预算;采用GPT-5.4-mini(Azure OpenAI)驱动所有智能体角色;在Azure Standard D8s v3实例(8vCPU, 32GB RAM)上运行GNS3 v2.2.57,使用真实供应商固件(FortiGate v7.0.14、Cisco IOS 12.4、Open vSwitch 3.3.7)与Caldera v5.3.0进行攻击仿真;仅Linux端点评估,网络设备限于3种厂商品牌;对比三条件:单智能体(600次)、多智能体无批评(599次)、多智能体完整(583次)。
局限性
框架的适用前提过于苛刻:要求生产网络的手工配置副本拓扑(自动转换未实现)、仅支持Linux端点与3种网络设备厂商、无法应对自适应对手。网络层缓解表现极差(5.8% MSR)反映LLM在拓扑路由理解上的系统性缺陷,威胁框架在真实企业异构网络中的有效性。46.7% MSR虽相比基线提升显著,但基线为人为弱化的单轮设计,缺与既有SOAR/BAS商业工具的定量对标,且验证指标(仅LAN ping+HTTP探针)忽视应用层及用户可感知的回归表现。