智能体系统★ 评分 6.1

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang
2026年7月4日
关键词
多智能体反馈循环迭代数据构造策略文字渲染图像生成OCR质量优化拒绝样本诊断

核心发现

  1. 问题识别正确但非新颖:拒绝样本包含可复用的诊断信号(OCR失败、语义不匹配、布局破坏),这在工业数据工程中早已是常识,论文的价值在于系统化应用而非原理创新。
  2. 多智能体闭环设计具有工程价值但缺乏算法突破:Critic模块将拒绝统计转化为自然语言指导是关键贡献,但本质上是LLM-based的策略适配层,属于已知技术的组合应用。
  3. 实验结果呈现陷阱:虽然相对F1提升85.3%看似巨大,但(a)基线为2023年旧数据集,未与同期SOTA对标;(b)绝对F1仅8.45,远未达工业应用阈值(>90);(c)在Show-o2上性能跳水(F1=0.45),暗示对特定模型的过度拟合。
  4. 消融实验验证了模块必要性但暴露架构不均衡:移除Critic的F1下降(1.78→1.01)远大于移除Generator(1.78→1.40),证实改进的核心来自反馈机制而非生成补全,但论文对Generator的强调被夸大。
  5. 反馈循环收敛性与Critic可靠性缺乏理论保证:(a)多轮迭代后是否陷入局部最优未证明;(b)LLM生成的反馈可能存在幻觉,Table 4仅测试LLM大小而未测试不同品系(Claude/GPT-4)的稳定性。

实验规模

在TextScenesHQ和LongTextBench两个基准上进行多尺度评估。主实验在0.75M数据规模下进行,缩放分析覆盖0.1M、0.25M、0.5M、0.75M四个档次。使用PixArt-α和Show-o2两个下游生成模型进行fine-tuning。OCR质量通过PaddleOCR评估(模糊匹配阈值70%),语义一致性通过CLIP ViT-B/32评分。消融实验中固定数据预算,分别移除Critic和Generator模块。模型配置:Retriever采用Mistral-7B,Critic采用Qwen3.5-4B,Generator采用Qwen-Image。Verifier采用固定评估流程(PaddleOCR+CLIP+感知哈希去重)。构造工具链包含4个LLM agents的多轮迭代运行。

局限性

论文的根本局限在于:(1)方法论核心(LLM驱动的策略适配)缺乏算法创新,属于已知技术的工程组合,突破性有限;(2)实验基线选择不充分且过时(MARIO、AnyWord均为2023年数据集),未与同期SOTA数据源(如TextAtlas5M)对标,相对提升幅度的可信度存疑;(3)绝对性能仍然极低(F1<10),且在Show-o2上的性能大幅下降(F1=0.45),表明泛化能力薄弱,可能存在对特定下游模型的过度拟合。此外,Verifier作为单点故障的可靠性未经充分验证,噪音反馈会污染整个迭代循环。

Paper ID: 2606.31537