引言:数据不再是免费的午餐

过去几年,大模型的进步被一句口诀概括:规模、数据、算力。三者之中,算力可以堆、架构可以改,唯独数据——尤其是高质量的人类数据——是缓慢生长、无法速成的资源。当训练语料从千亿 token 膨胀到数十万亿 token 时,一个被忽视的问题浮出水面:互联网上能被合法、高质量采集的文本,正在被"读"完。

这并非危言耸听。多个研究团队(公开资料整理)估算,全球高质量英文公开语料的总量约在数十万亿 token 量级,而前沿模型的单次训练消耗正逐年逼近这一上限。单纯"爬更多的网页"已经撑不起下一代模型的进步。数据,正从"取之不尽的公共品"变成"稀缺的战略资源"。合成数据与数据飞轮,正是围绕这一矛盾生长出的两条路径:前者回答"数据从哪里来",后者回答"数据如何越用越多"。

公开语料的上限:高质量数据枯竭

数据枯竭的判断依据有三层。第一层是数量:公开网页、论文、书籍的存量是有限的,且其中大量内容是重复、低质或机器生成的噪声,真正有信息密度的"黄金语料"占比很小。第二层是质量:随着生成式 AI 普及,互联网上由模型产出的文本比例持续上升,若不加甄别地采集,训练数据的"信噪比"会系统性下降,模型学到的是"平均值"而非"真知"。第三层是法律:版权诉讼与平台条款收紧,使部分大型语料库的可用性存疑,爬取与使用的合规成本显著上升,靠"抓取"获取数据的灰色空间正在收窄。

由此形成的行业共识是:靠"开源存量"训练下一代模型,边际收益递减;必须主动"制造"数据。合成数据(Synthetic Data)正是在这一背景下从辅助手段升级为核心供给——它由程序、规则或模型本身生成,用于扩充、平衡或替换训练语料。据公开资料估算,头部实验室的新一代模型训练集中,合成数据占比已从早期的一成以下上升至约半数,且仍在攀升。值得注意的是,枯竭并非只发生在文本领域:高质量的图像、视频、语音数据同样供不应求,而多模态模型的训练需求还在以更快的速度增长,这使合成数据的价值从"补充"上升为"必需"。数据供给的范式,正在从"采集"转向"生产"。

合成数据的三种生成路径

合成数据的生成并非单一技术,按"谁来生成"可大致分为三类。

第一类是蒸馏(Distillation):用强模型(教师)的高质量输出训练弱模型(学生),或反过来用大模型产出精炼的问答对、推理链来微调小模型。最典型的形态是"思维链数据"——让大模型对题目给出逐步推理过程,再把这些过程作为训练语料回灌,显著提升小模型的推理能力。蒸馏的优点是质量可控、成本远低于人工标注;缺点是知识上限受制于教师模型,"学生永远超不过老师"是这类路径的天花板,需要与其他方法配合使用。

第二类是自生成(Self-Generation):模型围绕特定目标自我提问、自我作答、自我校验,形成大规模对话与任务数据。它与强化学习中的自博弈一脉相承——让模型在"生成—评估—修正"的循环中持续产出更高质量的样本。近年来推理模型训练普遍采用的"可验证奖励 + 自博弈"范式,本质上就是把自生成数据与策略优化绑定在一起:答案正确与否由程序或规则自动判定,模型据此反复试错,数据量随训练轮次指数级扩张,且几乎零人工成本。

第三类是世界模型(World Model)与仿真:不依赖文本,而是用物理引擎、3D 渲染或神经模拟器生成图像、视频、机器人操作轨迹等数据。具身智能训练需要海量"动作—反馈"对,真实采集成本极高,仿真环境的合成数据几乎是唯一可规模化的来源。这类数据的难点在于"真实性"——仿真与现实的差距(Sim-to-Real Gap)决定了合成数据在多大程度上能迁移到真实世界,如何缩小这一差距,是当前机器人领域最活跃的研究方向之一。

数据飞轮:用户反馈驱动的迭代闭环

合成数据解决了"量"的问题,数据飞轮则解决"质"与"持续"的问题。飞轮的核心逻辑是:模型被用户使用 → 使用过程沉淀反馈 → 反馈转化为训练数据 → 模型迭代升级 → 吸引更多用户。闭环每转一圈,数据质量与模型能力同步上升,形成对手难以复制的动态壁垒——因为壁垒不在静态的数据存量,而在持续运转的反馈回路。

实践中,飞轮的三个环节各有工程难点。采集环节,需要在不侵犯隐私的前提下记录用户行为、纠错、采纳与拒绝信号;转化环节,需要把原始交互清洗、标注、重写为高质量训练样本;回灌环节,则需要设计防止"自我强化偏见"的采样策略——若只学习用户满意的那部分,模型会逐渐丧失多样性与探索能力。做得好的团队,会把"在线反馈"与"离线合成"两条数据管道并行:前者保证方向正确,后者保证规模供给。

值得注意的是,数据飞轮的护城河并不来自"数据多",而来自"反馈真"。公开语料可以被任何后来者买到,但真实用户在高价值场景中的纠错与选择,是竞争对手无法购买的专有资产。这也是为什么越来越多企业把数据飞轮视为比模型参数更核心的竞争要素——模型可以开源,飞轮无法复制。更进一步,飞轮一旦转起来就自带复利:用户越多,反馈越丰富,模型越好用;模型越好用,又带来更多用户。这也是头部厂商敢于以低价甚至免费策略抢占入口的原因——入口即数据,数据即飞轮。

合成数据的暗面:模型坍缩、偏差放大与版权风险

合成数据并非免费的午餐,它携带三类结构性风险。

最著名的是模型坍缩(Model Collapse):当训练数据中合成样本比例过高,模型会逐渐遗忘真实世界的长尾分布,输出趋于同质化,甚至在一代代"自吃"中能力螺旋下降。多个研究团队(公开资料整理)的模拟实验表明,完全用模型自身输出迭代训练,几轮之后模型的语言多样性会明显衰减。坍缩的机制并不神秘——模型的输出是对已有分布的近似采样,近似误差在每一代训练中被放大并固化。防范手段包括:严格追踪语料来源、控制合成数据比例、保留"野生"人类数据作为锚点。

第二类是偏差放大:合成数据继承了生成模型的系统性偏见,若再用它训练新模型,偏见会被指数级固化。更隐蔽的是,合成数据擅长"平均化",天然压缩边缘群体与罕见场景的表示,导致模型对少数派用户的服务质量系统性下降。这要求数据管线内置偏差审计与分布校准,而不是事后补救。

第三类是版权与法律风险:合成数据的"原料"本身可能来自受版权保护的语料,其衍生品在法理上处于灰色地带。近年来欧美多起诉讼(公开资料整理)已将"训练数据的合法性"推上审判台,若判例确立"合成数据亦需溯源"的原则,当前许多训练流程都需要重构。风险管理的核心动作是同一件事:把数据的来龙去脉记录清楚。

2026 年数据治理趋势与企业数据资产化

风险催生治理。2026 年的数据治理呈现出三条清晰趋势。其一,数据溯源(Data Provenance)成为标配:主流训练框架开始为每条样本记录"来源—加工—使用"的全链路元数据,以应对监管审计与版权举证。其二,数据配比从"拍脑袋"走向"科学化":合成数据与人类数据的比例、去重策略、分布校准,开始被视为与模型架构同等重要的超参数,直接影响最终模型的能力曲线。其三,治理对象从"文本"扩展到"多模态":图像、视频、音频的合成数据同样需要可验证的来源与质量评估体系。

对企业而言,这意味着数据从"成本项"变为"资产项"。过去企业数据被当作内部资源,价值内隐;如今,高质量、可溯源、经过治理的行业数据,可以直接转化为模型能力与产品壁垒,甚至成为可定价、可交易的资产。一条典型的路径是:企业沉淀私有业务数据 → 用合成技术扩充与脱敏 → 构建行业专属数据集 → 微调或蒸馏出领域模型 → 通过 MaaS 或私有化部署变现。这条路径的关键前提是数据治理先行——未经治理的数据无法进入飞轮,更无法资产化。(延伸阅读:昆仑镜 aigc.fushtn.com 的 AI 中心提供全球主流模型的能力与价格数据,可作为企业做数据资产化与模型选型测算时的参考。)

结论:下一站不是"更多数据",而是"更好的数据循环"

数据枯竭的叙事容易让人悲观,但合成数据与数据飞轮给出了更乐观的答案:训练数据的下一站,不是寻找更多存量,而是构建更好的循环——用蒸馏与自生成扩大供给,用世界模型拓展模态,用真实反馈保证方向,用治理框架控制风险。当数据从"挖矿"变成"耕种",模型的进步就不再受限于人类文明的存量,而是取决于我们设计数据循环的能力。对于站在 2026 年门槛上的企业与个人而言,理解并建设这条循环,比追逐任何单一模型都更重要。