智能体系统★ 评分 5.0
LLM Semantic Signaling Game and Mechanism Design: Systematic Blindness, Awareness Shaping, and Mindset Dynamics
Quanyan Zhu
2026年7月4日
关键词
语义信号博弈系统性盲目性钓鱼检测机制设计高斯近似
核心发现
- LLM生成的消息累积得分在消息长度充分大时近似高斯分布,基于鞅中心极限定理和有界增量条件,使闭形式决策规则和接受概率计算成为可能(命题3.5验证:KS距离0.016)——支撑逻辑:将token生成过程分解为可预测部分+鞅差分,标准化后趋于N(0,1)
- 接收方感知异质性的本质不是阈值差异,而是特征表示空间的差异;高觉察接收方访问更富的特征集(嵌套关键词集K_α),导致对恶意语义控制的统计可分性更强,而非仅调整决策边界(命题4.10完整刻画觉察排序→阈值单调性→接受率单调性→行为单调性的因果链)——实验验证:stealth攻击在naive接收方接受率0.541,高觉察仅0.157
- 系统性盲目性(systematic blindness)是接收方信息丧失的结构性根源:当接收方的特征集K_α不包含全部信息特征I时,无论统计规则多优,性能上界已被决定(命题5.3定量化)——推论:防御必须扩展特征空间(学习新检测信号),而非仅提高阈值
- 在异质接收方人口上实现良性(benign)语义控制的激励兼容存在充要条件(行主导条件,命题4.8),通过KL散度最小化的人口重加权可达成最小干预(命题4.15,指数倾斜形式p_n*∝p_n^0 exp(Λ_n*))——数值结论:高觉察接收方比例48%即可消除恶意偏离,加guardrail成本后只需18%
- 接收方心态演化(mindset dynamics)形成"移动的边界"而非静态阈值调整:接收方特征集K_α(t)单调扩展,检测能力递增,但自适应恶意者可将概率质量转向新学到特征之外,形成共进化动态——实验验证:固定stealth从57.2%接受率降至15.3%;自适应stealth在盲区期间维持96%接受率,完全特征覆盖后跌至20.9%
实验规模
合成受控LLM通道模型,包含3个语义控制(benign/aggressive/stealth)和3个接收方类型(naive/mid/aware)。每个控制-感知对生成10000条消息,消息长度L=96,每个token位置从8个特征类别(中性、合法、紧迫、行动、凭证、链接、权威、上下文不匹配)抽样。特征概率基于Hunting-Lists钓鱼关键词库设定,高斯近似在1万样本上验证(标准化得分与标准正态KS距离0.016)。阈值η_α设为中点(benign和malicious平均得分中点)。机制设计实验通过调整高觉察接收方比例q∈[0,1]和guardrail成本τ来测试激励条件。心态动态模型通过阶段式扩展特征集K_α(t)并对比固定策略和自适应策略的接受率演化来验证共进化假说。
局限性
首先,实验仅在8维特征的合成LLM通道上进行,未在真实大语言模型(GPT-4、Llama等)输出和真实用户行为上进行端到端验证,高斯近似、觉察分级和心态动态的现实适用性未知。其次,机制设计建议(人口重加权、成本惩罚)虽理论最优,但实践中如何执行(定向培训vs.硬过滤)、其成本(用户流失、体验下降)和恶意者对策(迁移到无约束模型)均未量化分析。第三,缺乏与传统钓鱼检测方法的对比基线、特征富度的边际贡献消融分析,以及恶意者通过释义或词汇替换规避特征检测的对抗鲁棒性测试。