CS329Z中文学习站

"用于数据标注与合成的 LLM:综述"

"Large Language Models for Data Annotation and Synthesis: A Survey"

Zhen Tan, Dawei Li, Song Wang, et al. · "EMNLP 2024 · Arizona State / UVA / UIC"

推荐论文精读查看原文(PDF) ↗

导读

这是第 6 周「数据」一讲的文献综述(EMNLP 2024,28 页)。当 LLM 从"消费者"变成"生产者"——为下游模型生产训练数据——整个数据工程流程都改变了:传统标注昂贵、慢、需要领域专家;GPT-4 级模型却能自动化地打标签、写指令、生成推理链、构造偏好对。本综述把这片快速膨胀的文献组织成一条清晰的流水线:标注怎么生成 → 生成的东西怎么评估与筛选 → 拿去怎么用,最后讨论模型坍塌、幻觉、伦理与效率四大挑战。对课程而言,它是"数据飞轮"(同讲 Shankar 博客)与"数据选择"(第 7 周的 LIMA、SWE-smith)之间的理论地图:飞轮的每一圈,都在用这里的某类技术。阅读建议:抓分类框架与代表性方法,不必逐篇记忆。

论文精读

摘要(全译)

数据标注与合成泛指为原始数据标注或生成相关信息,可用于提升机器学习模型的效果,但该过程劳动密集且昂贵。以 GPT-4 为代表的先进 LLM 的出现,为自动化复杂的数据标注与合成过程提供了前所未有的机会。既有综述已广泛覆盖 LLM 架构、训练与一般应用,我们则独特地聚焦其在数据标注上的具体效用。本综述贡献三个方面:基于 LLM 的标注生成、LLM 生成标注的评估、LLM 生成标注的利用。此外还包括 LLM 可标注数据类型的深入分类、利用 LLM 标注的模型学习策略综述,以及主要挑战与局限的详细讨论,旨在帮助研究者与实践者探索最新 LLM 在数据标注上的潜力。

1. 引言

  • 数据标注远不止"贴类别标签":还包括中间上下文标签、置信度、对齐/偏好标签、实体关系、语义角色、时序标记,以及合成数据(指令、回复、推理、成对偏好、文本反馈)用于模型调优。
  • 痛点:复杂、主观、多样,需要领域专长,大规模人工标注成本高企。LLM 带来三重价值:自动化标注任务、跨大体量数据保持一致性、通过微调/提示适配特定领域。
  • 范围限定:聚焦纯语言模型(不覆盖多模态 LLaVA 类)。

2. 预备概念

两个核心角色:标注器 A(把输入映射为标注——通常是 GPT-4 级 LLM)与任务学习器 L(消费标注数据完成任务的模型,可以是另一个大模型或 BERT 级小模型)。LLM 生成的标注包括类别标签 + 丰富的辅助信号(置信度、上下文细节、元数据)。

3. 标注生成(五大类)

3.1 指令与回复(Instruction & Response)——微调与 ICL 数据的两大构件: - 指令多样性:混合样本再造、种子指令自举(Self-Instruct 式 generate-then-filter)、训练指令生成模型、多步提示(先任务描述后实例)、explain-then-generate、多视角改写、聚类选种子;AttrPrompt 平衡多样性与成本;Magpie 从对齐 LLM 中直接自合成大规模指令数据;Persona Hub 用 10 亿网络人格规模化生成多样合成数据;FANNO 全自主开源标注框架(无需预存标注)。 - 回复质量:阅读理解式提示、self-consistency 选最高置信回复、自蒸馏改写、多步提示(问题分析→回答引导→安全作答)、检索增强 ICL、原则驱动提示(对齐人类价值观)、Source2Synth(从真实数据源生成带推理步骤的合成点)。

3.2 标签(Label):LLM 作"专家标注器"做事件抽取、主题元数据增强;CoAnnotating 人机协同标注范式;COVID 疫苗推文标注 vs 人类对比;可靠的标注最佳实践标准;以及用 LLM 改进人类原始标注。

3.3 推理理由(Rationale): - 结构:把推理抽象为树(ToT)、图(GoT)、表、程序(PoT)、递归、概念。 - 质量:选项专属理由、对比解码、GPT-4 精心提示构造逻辑 CoT 集、苏格拉底 CoT(子问题分解)、知识密集任务的神经重排器补充文档。 - 类人理由:采样多条推理路径;反向逐一检验剔除错误路径的"消去推理";LLM 间同伴协作与辩论作为理由。

3.4 成对反馈(Pairwise Feedback):偏好对自动构造的两条路: - 用 LLM 排序:采样多回复让 LLM 按标准排序;原则引导选择;自评生成问题测事实性;West-of-N(Best-of-N 与 Worst-of-N 组对);机器人学中用自排序回复迭代更新奖励函数。 - 直接构造:对质量因素做假设再生成差异化对——大模型+多示例更好(Kim et al.)、SFT 模型优于基座、让 LLM 遵循/违反原则制造质量差、用基准分数定义优劣。

3.5 文本反馈(Textual Feedback):LLM 生成的改进建议用于打磨与评估回复——问答、机器翻译、幻觉检测;辩论与同行评审作反馈;错误归因分析促进反思学习。

3.6 其他领域数据:多轮对话蒸馏(高性价比对话数据集)、图/表格结构化数据的上下文化与结构洞察提取、机器人与智能体(计划、仿真任务、监督信号)、多模态、推荐系统、信息抽取、多语言标注等。

4. 标注评估与过滤

4.1 评估: - 通用:Turking Test(对照标注指南,基准 SNLI/SQuAD/NewsQA);人工审查 LLM 生成数据集的原创性/准确性/多样性;开源 LLM vs 人类标签的一致率。 - 任务特定:知识图谱补全用 token 排名;反事实生成用 Self-BLEU 多样性;代码生成用 Pass@k;小规模金标子集对照。 - LLM-as-a-Judge:多 LLM 辩论互评合成数据;I-SHEEP 迭代自增强中用裁判 LLM 打分设阈值收集高质量对——与第 8 周 LLM-as-Judge 讲直接呼应。

4.2 过滤与选择(三类): - 规则式:样本长度、关键词、格式模式;对话轮数阈值;真值解析过滤错误 CoT;语义相似度去冗余。 - 外部源式:预训练奖励模型只留高分样本;蒸馏时用学生模型反馈选数据;预训练分类器甄别。 - LLM 驱动式:用 LLM 自身信号(困惑度、置信度、logits)构造选择器;直接提示 LLM 评估质量;多候选排序取优;过滤"正确但分布偏移大(DSE)"的样本也有益于自我改进。

5. 标注利用(三阶段)

5.1 监督微调: - 自我进化:self-improve(LLM 既当标注器又当学习者,迭代自标注自微调);自精炼合成回复迭代微调;自蒸馏弥合任务分布差;自我博弈(self-play);小模型 self-training 学自己的输出。 - 蒸馏小模型:大 LLM 合成指令集训练中小模型(Alpaca/Llama 系生态);分类任务增广训练小双向模型;合成理由调优提升小模型推理;垂直领域(医学、金融、科学)知识蒸馏。

5.2 对齐调优: - 奖励建模:用 LLM 成对反馈算样本难度做数据课程;奖励模型引导的自我博弈;on-policy 响应对的正确标注概率最大化;机器人从零学奖励函数;可指令奖励模型(按任意人类原则打分)。 - 策略训练:合成成对反馈直接喂 DPO;预训练奖励模型过滤 + 迭代扩数据集的自举对齐;MoTE 混合专家增强合成回复各成分;带额外 NLL 项的修改版 DPO。

5.3 推理时: - 上下文学习(ICL):LLM 自动生成任务描述(APE 式人类级提示工程)、提示增扩、示例增广(标注数据少时尤其有用)、测试样本改写/分解。 - 推理:直接在答案前生成理由(zero-shot CoT);多路径的多数投票与消去;事后编辑精炼;程序解释器执行 PoT;ToT 的状态评估器。

6. 社会影响与未来工作

  • 伦理:高风险决策(金融、司法、医疗)中缺人类洞见可能导致偏见与不公;标注员岗位被替代加剧社会差距;需在技术进步与社会后果间求衡,保证公平与透明。
  • 模型坍塌(Model Collapse):在被其他 LLM 输出训练的 LLM 上性能逐渐退化——LLM 生成数据正占据信息生态,不可回避。模仿模型常复制风格而非事实精度;统计近似误差与函数近似误差在迭代训练中放大。解法:保证训练数据多样、高质量且保留相当比例人类生成内容;累积式混合真实+机器数据以维持多样性。
  • 幻觉:脱离事实的输出污染标注、扩散错误信息;模型不透明性使归因困难。解法:Reverse Validation(从回复构造查询反查内部知识)、CoT 提示生成可验证解释、CoAnnotating 不确定性引导的人机分工、人机协同标注。
  • 效率:模型规模带来算力负担。解法:剪枝(梯度信息选择性去冗余神经元)、MoE(输入只激活部分专家)、量化(32 位→16/8 位甚至更低)。

7. 结论

LLM 用于数据标注与合成为数据稀缺等长期难题提供了新解,提升了标注质量与流程效率;本综述系统回顾方法、应用与障碍,作为该关键领域的路标。

要点速览

  • 总框架:生成(5 类标注)→ 评估/过滤(3 类选择)→ 利用(3 个阶段)——任何"用 LLM 造数据"的系统都可对号入座。
  • 五类标注:指令+回复、标签、推理理由(结构/质量/类人三个维度)、成对反馈(排序 vs 直接构造)、文本反馈;外加对话/图/机器人等领域数据。
  • 过滤三招:规则启发式、外部模型信号(奖励模型/学生反馈)、LLM 自评(困惑度/置信度/排序)——合成数据必须过滤,不过滤不如不合成。
  • 利用三阶段:SFT(自我进化 + 蒸馏小模型)、对齐调优(奖励建模 + DPO 式策略训练)、推理时(ICL 增强 + CoT/ToT 推理)。
  • 四大挑战与解法:模型坍塌(保留人类数据、混合累积)、幻觉(反向验证、CoT 可验证解释、人机分工)、效率(剪枝/MoE/量化)、伦理(高风险领域人机协同)。
  • 与课程关联:向上承接"数据飞轮"(Shankar 博客)的闭环叙事,向下衔接第 7 周 LIMA(质量>数量)与 SWE-smith(规模化合成 SWE 数据);LLM-as-a-Judge 评估一节与第 8 周评测讲直接相连。