加载中...

合成数据(Synthetic Data)指由算法、仿真程序或 AI 模型生成,而非从真实世界直接采集的数据。在大模型领域,通常指用强模型批量生成的指令、对话、推理过程等训练样本。
后训练阶段应用最广:Self-Instruct 方法用模型自举生成指令数据,Alpaca 据此以少量成本构建微调集;蒸馏式做法让强模型生成带推理链的样本训练小模型;Constitutional AI 用模型自我批评修订生成对齐数据;数学与代码领域则可借助可验证性(判分器、单元测试)筛选高质量合成样本。此外,隐私敏感行业(医疗、金融)用合成数据替代真实数据以规避合规风险。
研究者提出「模型坍塌」(model collapse)警告:若持续用模型生成的数据训练后代模型,分布尾部信息会逐渐丢失。合成数据的多样性控制、去重与质量过滤因此至关重要。
随着高质量人类文本逐渐耗尽,合成数据被普遍视为扩展训练数据的主要途径之一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧