AI训练版权费每本656美元,接下来是用量结算
我的书作为AI训练素材的使用费是每本300~656美元。本文梳理了苹果、微软、Perplexity转向按用量付费的趋势,以及Spotify与英国公共借阅权留下的启示。
商业我的书作为AI训练素材的使用费是每本300~656美元
不久前,我收到了一笔有些特别的入账。这是我写的书用于AI训练的版权使用费,每本300~656美元。按当前的汇率折算,最多也就90万韩元出头。这笔交易由出版社居间牵线,经由一家名为Mentat(Mentat)的美国公司售出。
第一次看到这个数字时,我脑海中浮现的念头既非“便宜”,也非“昂贵”。更准确地说,是**“这到底算是什么的对价,我完全摸不着头脑”**。
直到8月12日,我看到了《华尔街日报》的一篇报道。苹果为了改进Siri正在与多家新闻机构谈判,而开出的条件很陌生:不是一次性固定付费,而是每当内容被实际使用时才予以支付。
如今正在发生的变革,并不是创作物价值涨跌的问题。定价的衡量基准,正在从**“这本书被纳入了训练数据这一事实”转移到“这本书实际被引用了多少次”**。率先经历这一转型的行业是音乐,其结果也早已摆在眼前。
至今为止,定价都是以“整本书”为单位
想要看清 656 美元到底处于什么水平,我们需要把过去两年里公开的价格标签放在一起比一比。
最常被引用的基准线是哈珀柯林斯(HarperCollins)与微软的协议。该协议于 2024 年 11 月公开,条款相当具体:每本书 5,000 美元,作者与出版社五五分成,作者拿 2,500 美元。期限为 3 年,并设立了限制条件,规定模型输出不得连续复现原文超过 200 个单词,或超过全书内容的 5%。而且采用的是必须经作者同意才纳入的“选择性加入(opt-in)”模式。
新闻媒体方面的数据量级则完全不同。据报道,2024 年 5 月新闻集团(News Corp)与 OpenAI 达成的协议规模在 5 年内最高可达 2.5 亿美元。这是企业对企业的固定金额大单。
第三条基准线不是协议,而是赔偿。Anthropic 与作者们达成的 15 亿美元和解案于 2026 年 7 月 21 日获得最终批准,涉及约 50 万部作品,平均每部作品约 3,000 美元。重要的是,这并非正常交易价格,而是对未经授权使用行为所定的赔偿价码。
与这三者放在一起,我的 656 美元处于什么位置便一目了然。仅就作者所得部分而言,大约相当于哈珀柯林斯案例的四分之一略多,相当于 Anthropic 和解单价的五分之一左右。
看到这里,大家可能很容易立刻得出“韩国作者被贱卖了”的结论,但我认为如果这样解读,反而会错失关键。因为语言、类型、体量、期限、是否排他全都不同,很难进行简单粗暴的对比。哈珀柯林斯的案例限定为英文非虚构类作品且期限仅 3 年,而我的情况条件截然不同。
我更关注的不是金额,而是这三者都采用了相同的定价模式。每本多少钱,每部作品多少钱。换言之,仅仅凭借这本书被纳入了训练数据集这一事实,金额就已经敲定。之后无论这本书被引用多少次,抑或一次也没有被参考过,金额都是一样的。
这种模式对创作者而言相当有利,因为能提前预估自己能拿到多少钱。
苹果提出了按次计费的方案
现在让我们回到这篇报道。
据《华尔街日报》报道,苹果在最近几个月里接触了多家新闻机构,并提出了多年期合作协议。预算达到了 9 位数,也就是讨论了至少 1 亿美元以上。但其支付方式是浮动型的:只有当合作伙伴的内容实际被使用时,才会支付相应费用。
《华尔街日报》特别指出了这一点。大型 AI 公司与新闻机构之间的标准合同,通常是将保底固定金额与广泛访问权捆绑在一起,而苹果提出的方案并不符合这一标准。
不仅苹果如此,这股趋势已经在多个领域朝同一个方向发展。
微软正在试运行其出版商内容市场(Publisher Content Marketplace, PCM)。截至 2026 年 2 月,美联社(AP)、商业内幕(Business Insider)、康泰纳仕(Condé Nast)、赫斯特(Hearst)、《今日美国》(USA Today)以及 Vox Media 均已加入,并提出了“根据所传递价值”进行支付的基于使用量的报告机制。
Perplexity 为 Comet Plus 设立了一个规模达 4,250 万美元的分成池。其机制是将订阅收入的 80% 分配给出版商,自身保留 20%,而支付标准取决于三项使用信号:通过浏览器的直接访问、在搜索回答中被引用的情况,以及被 AI 助手用于处理任务的情况。
Cloudflare 正在基础设施层做着同样的事情。上一期讨论的面向 AI 智能体的支付手段与访问通行费就是典型例证。
在这里,我们必须区分“训练”与“扎根”(Grounding)。
苹果在 Siri 上需要的,与其说是模型训练,不如说是实时调用最新新闻与即时信息来作答的扎根(Grounding)1。训练是一次性的,但扎根在每次接收提问时都会重新发生。因此,它能够统计被引用的次数。
因此,按量计费对于新闻而言是一种顺理成章的合约模式。因为每天都会产生新报道,每次都需要重新引用。
问题在于,这种合约模式一旦成为标准,就会被直接照搬到其他内容协议中。如果像书籍、论文、讲义这种一旦被训练就极少再次被引用的内容,也转向同样的结算模式,会发生什么?对训练所做的贡献价值无法用引用次数来衡量,而结算系统却只统计引用次数。
从 Mentat 的商业结构中可以看出,这种转变已经开始。该公司代理了 38 家出版社、2.1 万余部图书,并向出版社列出了两种收益形式:针对数据集许可的一次性付款,以及基于引用频率的持续收益。我拿到的 656 美元属于前者,即一次性付款。这意味着,按引用频率获取持续收益的条款,已经赫然写进了合约说明中。
音乐与图书馆早已先行经历了同样的转型
音乐产业更早经历了同样的转型。因此,我们看到的不是预测,而是已经显现的结果。
唱片业从销售模式转向流媒体模式的过程中,结算标准从专辑销量变成了单曲播放次数。随后在2024年3月18日,Spotify公布了一项新政策:过去12个月内播放量不足1,000次的歌曲,将不再获得录音版税。
Spotify的解释自有其合理之处。未达标歌曲所占的份额仅占整体版税池的约0.5%,分摊到单首歌曲上,月均只有0.02美元。折合韩元也就30来块。然而中间分销商与银行的最低提现门槛在2美元至50美元之间,手续费在1美元至20美元之间,所以这笔钱在真正付给艺术家之前,就会因手续费和最低提现门槛而被吞噬殆尽。其逻辑在于:不如把这笔钱汇总起来,分发给真正在活跃创作的艺术家。
这套逻辑很难反驳。但从结果来看,按量计费机制制造出了一个结算金额无限趋近于0的区间,而Spotify直接将该区间彻底移出了支付对象名单。属于该区间的歌曲恰恰占了绝大多数。全平台99.5%的播放量都来自达标歌曲,反过来说,就意味着绝大多数歌曲只能去瓜分那区区0.5%的播放量。换句话说,处于长尾2部分的歌曲,在按量计费模式下很难继续作为支付对象存活。因为结算金额甚至抵不过前面提到的手续费和最低提现门槛。
然而,这种实验实际上历史更加悠久。只是形式温和得多。
有一项制度叫公共借阅权3,即根据图书在图书馆中被借阅的次数向作者提供补偿。它于1946年发源于丹麦,目前已有33个国家在推行,英国则于1979年引入。世界知识产权组织的数据显示,英国每年有约2.4万名创作者获得这项补偿。
本文所引用的WIPO访谈中介绍的英国制度,设有一项每年6,600英镑的上限。为什么要特意设限?因为如果完全按借阅次数来分摊,极少数畅销书作家就会卷走绝大部分资金。按借阅次数发放、但同时设定上限,正是为了修正资金过度向少数人倾斜的问题。
归纳起来便是如此:按使用量统一定价的实验绝非新鲜事物。而且凡是此前尝试过的领域,最终都证实了纯粹的按量计费机制根本无法运转,于是都以某种形式加入了修正机制。 Spotify划定下限,将播放量过低的歌曲剔除出结算名单;英国公共借阅权划定上限,限制高借阅量作者的领款总额。两者的方向截然相反,但共同点在于:都不再单纯依照使用量进行绝对结算。
而眼下AI内容协议中,还完全看不到这种修正机制的身影。
Oswarld视角
在制定 GTM 策略的过程中,我曾多次处理过将固定订阅制转为按用量计费的项目。每一次我都反复确认了一件事:转向按量计费表面上看是在调整价格,实际上却是由决定“何为一次使用”的那一方掌握了主导权。
在固定金额合同中,卖方就具体金额进行谈判。一旦转入按量计费,谈判的对象便从金额转向了计量方式。什么算作使用?由谁来统计?统计系统掌握在谁手里?而这三个问题的答案,几乎始终握在买方手中。
当 Perplexity 声称定义了三种使用信号时,设定这三项指标的正是 Perplexity 自己。当微软表示将“根据传递的价值”进行支付时,衡量这一价值的正是微软。当苹果表示将在内容被使用时进行支付时,内容究竟是否被使用,只有苹果自己知道。
在与数据打交道的过程中,我养成了一个习惯:每当看到某个指标时,首先确认统计该数字的系统归谁所有。因为负责统计的一方,最终会拥有该市场的定价权。在按量计费的内容协议中,用量统计完全在 AI 企业内部完成。截至目前,我还没见过由第三方对用量报告进行审计的先例。
上周我写了一篇文章,谈及中国外卖平台向骑手免费发放智能头盔的事。在那篇文章中写下的一句话,同样适用于当下的讨论:无论是劳动还是创作,危险发生的时刻不是报酬过低之时,而是交易不再被视作交易的那一刻。
656 美元或许是一笔微薄的金额。但那至少是把金额明确写在合同里的交易。正因为写明了金额,下次才能要求提价,才能与其他作者比较,才能向出版社据理力争分成比例。谈判因此成为可能。
一旦转向按引用次数结算,提出这类诉求就变得极其困难。因为我根本无从核实自己的书这个月究竟被引用了多少次。当结算金额显示为 0 韩元时,究竟是真的无人引用,还是统计中被遗漏了,根本无法分辨。
因此我认为,创作者眼下应当争取的绝非单价上涨,而是最低保底金额与用量报告访问权这两项。不是等 Spotify 那样由平台单方面划定下限,而是创作者主动要求设定底线。
结语
核心有三点:
- AI 训练数据合同的价格,迄今为止一直建立在“被纳入训练数据本身”这一事实之上。哈珀柯林斯每本 5,000 美元、Anthropic 和解协议中每部作品 3,000 美元、我的书 656 美元,都是按册或按作品一次性统一定价的方式。
- 苹果、微软和 Perplexity 正在转向的按量计费制,则是根据内容实际被引用的次数来定价。这种结构适用于每天都被重新引用的新闻,但一旦扩展到图书和学术论文,被引用频次较低的绝大多数作品的结算金额就会趋近于 0 韩元。
- 此前尝试过按量计费的地方,结果已经显而易见。Spotify 划定了下限门槛,将播放量较低的歌曲移出结算对象;英国公共借阅权制度则设立了年度上限,对受领金额加以限制。但目前的 AI 合同中并没有此类修正机制。
如果您眼下正在与出版社或所属机构商讨 AI 相关合同,建议您本周务必确认一句话:是否包含“报酬依据使用量核算”的条款,以及我方是否拥有核实该使用量的权利。 目前许多合同中,根本没有写明核实使用量的权利。
💬 您是否曾在合同中遇到过自己的文字、照片、讲座、音乐或代码被用于 AI 训练或服务的情况?比起金额是多少,我更想知道合同中究竟是用怎样的措辞写明的。是固定总额还是基于使用量?是否有办法核实使用量?欢迎在评论区分享。如果收集到足够的案例,我会在下一期中从韩国国内合同实务的角度对相关类型进行归纳整理。
📨 如果身边有从事文字、照片、音乐或代码创作与售卖的朋友,请把这篇文章转发给他们。
参考资料与延伸阅读
核心来源
- “Apple in Talks to Pay Publishers to Improve AI-Powered Siri”, The Wall Street Journal, 2026. 8. 12. ··· 本文的出发点。指明“标准合同是保底定额,而苹果并非如此”的部分是核心所在。这是一篇付费文章。
- MacRumors, “Apple in Talks to Pay Publishers for News Content to Power Siri AI”, 2026. 8. 12. ··· 推荐给无法查阅《华尔街日报》原文的读者。其中概括了高达 9 位数的预算和浮动支付结构。
- 9to5Mac, “Report: Apple seeks publisher deals to give Siri AI better access to current events”, 2026. 8. 12. ··· 从标题就明确指出了苹果想要的不是模型训练,而是“获取即时信息”。这与本文关于内容锚定的讨论直接相通。
- Transparency Coalition, “HarperCollins AI deal with Microsoft sets first public price for training data”, 2024. 11. ··· 整理了包括每本 5,000 美元、五五分成、为期 3 年以及 200 词输出限制在内的全部条款。至今仍是极具参考价值的价格基准线。
- Microsoft Advertising, “Building Toward a Sustainable Content Economy for the Agentic Web”, 2026. 2. ··· 这是微软亲自解释 PCM 基于使用量的支付逻辑的原文。建议大家亲自阅读,看看文中对“所传递的价值”究竟做出了何种界定。
- Digiday, “How Perplexity’s new revenue model works, according to its head of publisher partnerships” ··· 介绍了 4,250 万美元资金池、八二分成以及三种使用信号的定义。
- Spotify Loud & Clear, “Why don’t songs with fewer than 1,000 annual streams earn recording royalties anymore?”, 2024. 3. 18. ··· 这是每月 0.02 美元和 0.5% 资金池等数据的出处。该文档最直观地展示了按量计费的下限在现实中是如何划定的。
- Publishing Perspectives, “Court Grants Final Approval to Landmark $1.5 Billion Anthropic Settlement”, 2026. 7. ··· 阐述了每部作品约 3,000 美元的单价是如何测算出来的,并指出了该和解协议不具备判例约束力。
背景知识
- Jim Parker 专访, “The public lending right and what it does”, WIPO Magazine. ··· 梳理了该制度自 1946 年在丹麦发轫并拓展至 33 个国家的过程,以及英国设定的 6,600 英镑上限。如果把它当作按量计费制度长达 80 年的临床试验记录来读,会觉得趣味盎然。
- Authors Guild, “AI Licensing for Authors: Who Owns the Rights and What’s a Fair Split?” ··· 从创作者团体的立场梳理了作者与出版社之间的分成比例争议。如果您手头正摆着合同,建议先读一读这篇文章。
- eMarketer, “Usage-based deals could reshape AI content monetization models” ··· 提出了按量计费可能对小型出版商不利的反向论点。如果您想同时了解与本文相对立的视角,这篇文章非常实用。
推荐延伸阅读的往期内容
📝 术语说明
注释
-
内容锚定(Grounding):指 AI 在生成回答时,实时检索外部最新资料并以此作为事实依据的方式。与将知识预先注入模型内部的训练不同,每当收到提问时,系统都会发起一次全新的参考检索。因此,“使用了多少次”是可以被计数的。 ↩
-
长尾(Long tail):指排在少数热门项目之后长长延展的大量长尾项目,它们单项规模虽小,但汇聚起来体量庞大。以图书市场为例,就相当于畅销书背后成千上万种的非畅销书。 ↩
-
公共借阅权(Public Lending Right, PLR):指图书每在图书馆被借阅一次,便向作者支付一定补偿金的制度。因其不是按销售而是按使用来定价,属于本文所讨论的按量计费模式的最古老形态。 ↩
