算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

AGI
AI语料、数据枯竭 、版权授权、内容产业、AI基础设施

文  | 舒书

2026年8月,A股AI语料板块集体爆发。读客文化触及20cm涨停,中信出版、中国出版等版权内容标的纷纷跟涨,数据服务商海天瑞声同步走强。

资本在追逐一个刚浮出水面的逻辑:AI大模型的燃料正在告急。

据Epoch AI等研究机构预测,高质量公开文本数据可能在2020年代中后期至2030年代初面临明显紧缺。国家数据局局长刘烈宏在2026世界智能产业博览会上的发言切中要害:“AI就像数据的精炼厂,竞争力从来不在于炉子多大,而在于矿石的品位有多高。”

算力有摩尔定律,数据没有。当大模型参数规模从千亿冲向万亿,它们吞噬的语料量级也在指数级膨胀。以文本模型为例,GPT-2的训练数据约数十GB量级,GPT-3约数百GB量级。而大模型正在从纯文本向多模态演进。据2026机器人全产业链接会披露信息,实现具备实用能力的具身智能,至少需要1000万小时量级多模态数据,叠加多场景适配、多模态类型、数据良率等因素,产业实际所需规模可能更高。据贵州省大数据局公开数据,当前国内真实物理交互场景合规数据仅50万小时,缺口超99%。

互联网上那点天然牧场正在被消耗;而常被舆论放大的风险在于:AI生成内容带来的数据自我污染,或将加速优质原生文本供给收紧。

一、AI生成内容的回旋镖效应

当AI生成的内容大量涌入互联网,再被下一代AI模型抓取训练时,会发生什么?一个越来越棘手的问题是模型坍缩——如果用AI生成的二手数据反复迭代训练,模型会逐渐偏离真实世界的分布,失去对罕见事件的理解能力。

这就像一个封闭的复印系统:用复印件去复印复印件,每一代都会丢失信息。不过,学术界对模型坍缩的严重性仍存在分歧——不加筛选、大规模纯AI生成数据循环训练才会诱发严重坍缩。现实中有多种缓解方案:严格过滤、数据清洗、去重、混合原生人类数据训练等策略均可有效抑制退化。AI内容并非天然有毒,关键在于如何治理。

为了获取未被AI生成内容污染的原生语料,硅谷科技巨头已经开始挖掘传统媒体文稿与纸质书籍的价值。据《华盛顿邮报》等媒体报道,Anthropic自2024年启动代号巴拿马计划的图书数字化项目。内部文件写道:“巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。”

此前,公司因从LibGen等盗版资源库下载超700万本电子书训练模型,被作者群体起诉。2026年7月20日,加州北区联邦法院法官Araceli Martínez-Olguín签署最终批准令,批准Anthropic就版权侵权指控支付15亿美元和解金,覆盖约48.2万至50万部作品,折合每部约3000美元。这是美国版权史上迄今规模最大的和解协议。

该案中,退休法官William Alsup在简易判决意见中提出:将合法购入的图书扫描用于内部模型训练具备转换性使用特征,属于合理使用范畴。但需要强调两点:其一,该裁定仅为地区法院审前观点,案件最终以和解收尾、未进入上诉程序,不构成在美国全境具备约束力的判例;其二,该意见针对合法获取图书后的训练行为,不能推导出破坏性销毁书籍的操作具备商业正当性。同时,整套裁判逻辑根植于美国版权体系,无法平移至中国著作权环境。

二、传统内容商的新角色:AI矿工

当原生语料从免费午餐变成稀缺矿产,价值链正在发生一次静默重构。但需要厘清的是,AI企业采购文本有两种截然不同的用途:一是用于模型预训练或SFT微调,二是仅用于上线后的RAG(检索增强生成)知识库检索。两者的法律授权范围、商业价格和版权风险天差地别。目前大量AI企业采购版权文本仅做检索而非训练,不能简单预期所有版权内容都能以训练语料的高价出售。

AI公司开始为高质量语料付费。哈珀·柯林斯与微软达成精选非虚构图书AI训练授权协议,仅限部分旧书书目,单本书三年授权总价5000美元,由出版社与作者对半分成,采取作者自愿选择加入模式,并且合同设置文本引用比例上限。泰勒-弗朗西斯达成1000万美元的学术内容授权协议。

据MarketIntelo预测,至2034年全球训练数据授权市场规模将达226亿美元(统计口径覆盖多类型训练数据集,不局限文字版权内容)。

但需要谨慎对待海外案例的参照意义:部分授权交易带有版权诉讼和解背景,价格不代表常态化市场化定价。

国内同样在提速。多位接近出版社、图片版权机构的人士透露,已有AI公司开始向传统内容机构采购合规数据集。国家数据局明确提出构建以词元(Token)为基础的数据集价值体系。

但这一切仍在早期。从拥有版权到成为AI矿工之间,隔着数字化、清洗、标注、脱敏、格式转换等大量工程与成本。中文语料不仅面临版权权属复杂的问题,还存在数据分散、流通机制不成熟、深层标注和垂类加工能力不足等现实约束。更重要的是,不是所有版权库都能享受价值重估——多数大众通俗文本的单Token价值很低,只有专业、独家、稀缺垂类内容才可能获得高溢价。

兴业证券研报判断:AI正在推动传媒内容产业从消费品转向“数据+IP资产”双重定价。但这一判断落地,需要确权、交易、溯源配套体系同步成熟。

三、替代路径:AI公司不需要抢书也能活

如果语料短缺真的成为硬约束,AI公司不会坐等出版社开矿。

合成数据的潜力正在被验证。已有研究表明,高质量合成数据可在数学、代码等领域部分替代真实数据,显著降低对原生人类文本的依赖。

数据效率的提升也在改变算账逻辑。模型架构改进(如MoE)、训练方法优化(如课程学习)正在降低单位智能所需的原始数据量。RAG与持续学习更大幅扩展了模型获取信息的边界——大模型不需要在预训练时记住所有知识,而是在推理时按需检索。

此外,AI公司还有多条备选路径:自建人工标注团队生产垂类数据、采购专业数据服务商(海天瑞声等)、抓取开放合规公共数据、海外多语种数据集采购,以及直接签约作者而非通过出版商。

传统图书版权只是数据源之一,并非不可替代。中文高质量公开文本相对分散,专业出版、学术、行业报告等数据流通机制不成熟,很多数据“有,但难合规流通”,出版机构有内容资产,但未必有数据工程能力。

四、三重壁垒:从矿脉到定价权

即便语料稀缺成立,从拥有版权库到掌握定价权之间,还有三重现实壁垒需要跨越。

第一,版权权属错综复杂。出版社大多只拥有出版版式权和信息网络传播权,文字著作权归属作者。要授权AI训练,需要逐一与作者谈判;大量老书作者失联、授权链条断裂。据业内人士透露,有头部出版社尝试将旗下图书授权给AI公司,但因大量作者合同中未包含AI训练权,最终完成授权的品种远低于预期,谈判周期长达数月。

出版机构要真正掌握定价权,不能只靠存量版权,还需要同时具备版权确权能力、数据清洗加工能力、合规授权能力和安全流转能力。存量古籍、旧书可以短期补充语料池,但长期可持续的干净原生语料,依赖持续不断的人类新创作。存量版权库只能起到缓冲作用,无法永久解决数据迭代需求。

第二,Token计价体系尚未成熟。如何统计一本书被抽取多少Token训练、如何溯源、如何分成、如何防止数据被盗用二次流转,全部缺少技术与规则支撑。当前海外大多采用打包授权(年费、整库采购),按Token计价的精准交易模式距离落地还有距离。

第三,AI公司的替代供给正在成形。合成数据、数据服务商、开源数据、直接签约作者——传统版权方议价能力被多条路径同时稀释。此外,大量古籍、近代公版文字、开放学术资源永久免费,持续压制大众普通图书的语料议价天花板。

未来,若国内推出AI训练数据的法定许可机制(统一费率、无需一对一谈判),将彻底改变当前博弈格局——AI企业无需逐一获取作者授权,出版社的独家议价权将被大幅削弱。

语料瓶颈更准确的说法或许是分层稀缺:未来真正稀缺的,可能不是普通公开文本,而是高质量、独家、合规、可溯源、专业垂类数据,以及多模态、交互型数据。例如,医学教材、法律判例、垂直行业深度报告更容易形成稀缺供给;大量同质化网络通俗小说、公版古籍、通用百科条目,则供给相对充裕。

回到8月的A股,语料板块的暴涨反映的是资本对AI语料这一新叙事的饥渴,而非业绩的兑现。在确权体系、计价规则、分润机制尚未跑通之前,出版企业的AI语料收入大概率仍停留在意向协议层面。

长期来看,AI竞争持续向多模态演进,图文、视频、机器人交互数据集需求将持续上行,纯文本版权语料的战略权重会逐步被稀释。所谓语料稀缺,也不止局限于文字素材。行业潜在解决方案包括著作权集体管理组织统一谈判、AI授权收益强制分成机制。如果长期收益集中在平台与出版机构、一线创作者难以获益,高质量原生内容创作动力终将持续衰减。

干净、合规、独家原生语料会成为重要竞争筹码。但单纯手握存量文字,不等于护城河。语料稀缺并不必然让传统出版商掌握定价权,定价权是多方持续博弈的动态结果。真正决定议价能力的是:谁能持续生产高质量原创内容,谁能把版权资产转化为合规、可溯源、可交易的数据资产,谁能在AI公司、平台、作者之间建立稳定分润机制。仅仅囤积存量文本,无法构筑AI时代可持续的竞争壁垒。

本文系作者 舒书 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App