返回行业情报

首部作者自克隆声音有声书制作纪实

1st author-narrated audiobook with her own cloned voice

ProVideo Coalition报道了首部由作者本人克隆声音 narrated 的有声书制作过程。作者Anna Pittman的308页、63325字著作《Remembering》通过ElevenLabs Pro克隆其英语声音完成有声书录制,并在多平台发行。文章详述了克隆流程、ElevenLabs的主动发音词汇表功能,以及通过Remembering.info直接销售M4B和ePUB格式的发行策略。

深度解读

全球第一本由作者本人克隆声音亲自“ narrated ”的有声书已经完成制作与发行,这意味着AI语音克隆技术正式从实验性演示跨入了完整的商业出版工作流。

一个308页、63,325字的真实项目

Anna Pittman的书《Remembering: Wholeness and Awakening through the Twelve Steps》最终手稿为308页、63,325字。这个体量意味着什么?即使专业配音演员每天也只能维持数小时的高质量输出,考虑到录制、重录和编辑,传统方式下这将是一个极其庞大的工程。Allan Tépper的TecnoTur团队此前已经制作和发行过大量有声书,涵盖卡斯蒂利亚语、英语和意大利语,但大多是短篇或中等长度。这次是他们面对的最长项目之一。

Anna希望有声书的叙述听起来像她自己的声音,因此出于实际和预算的双重考量,她决定让团队用英语克隆她的声音来完成第一版。

这不是“用AI随便生成一个声音”,而是“用她本人的克隆声音”来叙述她自己的书。这个区别至关重要——它保留了作者对作品的声音主权,同时规避了传统录音的物理限制。

克隆前的原始录音:一支MXL 770麦克风

在Tépper第一次通过视频会议与Anna讨论项目之前,Ernesto Morales-Ramos已经为她录制了一个较小项目的音频——Anna的冥想音频。Morales-Ramos使用的是一支MXL 770麦克风,这是一款Tépper本人尚未亲自使用或评测过的电容麦克风。幸运的是,它产出了良好的录音质量。

这里有一个容易被忽略但极其关键的细节:克隆声音的质量上限,取决于原始录音的质量。无论ElevenLabs的算法多么先进,如果输入的是低质量、有噪声、压缩过度的音频样本,克隆结果必然受限。Anna的案例之所以成功,部分原因就在于前期录音环节没有偷工减料。

Morales-Ramos本人也是《The Disciple》一书的作者,此前曾在ProVideo Coalition上被报道过两次。这个跨角色的参与——他既是录音师又是作家——暗示了一个正在形成的创作者协作网络。

为什么选ElevenLabs Pro:一场枪战后的选择

Tépper此前写过一篇题为《Cloned Voice Shootout: FlexClip, ElevenLabs, Descript, DaVinci Resolve Studio》的对比文章,在测试了多个平台之后,他为这个项目选择了ElevenLabs Pro plan。

他特别强调了一点:每次使用ElevenLabs,都能感受到它在变好。这不只是指通用质量的提升,而是他称之为“主动式配音词汇表”(proactive voiceover glossary)的功能。

具体来说:导入书的ePUB版本后,ElevenLabs分析了全部63,325个词,自动生成了一份它不确定发音的术语或人名列表。每个列出的词旁边有一个播放按钮,可以听到ElevenLabs的“首次猜测”发音,后面跟着一个可选字段,允许用户以音标方式输入正确发音。Tépper对此功能给予了高度评价——它不能替代人工逐章逐节的审听和手动修改,但它是一个极好的起点。

这个“主动式配音词汇表”不替代必要的人工审听,但它是流程中一个巨大的先发优势。

这意味着什么?对于任何处理长篇内容的AI语音项目,专有名词和术语的发音一致性一直是最耗时的环节之一。ElevenLabs把这个环节从“逐词发现”变成了“批量审核”,大幅压缩了后期编辑的时间成本。Tépper甚至专门称赞了ElevenLabs选择了第一个重要的回文数作为品牌名的一部分——这当然是一句玩笑,但也透露出他对这个平台的真实好感。

发行策略:直接销售优先,Spotify只是补充

Tépper明确指出了一个行业现实:作者通过直接销售获得的版税最高,尤其是互动有声书和电子书版本。因此,这本书的主要发行渠道是Remembering.info上的直接电商销售,这是TecnoTur的MyBookPortal和Prolific Website服务的一部分。

互动有声书采用M4B格式,支持章节和段落之间的导航。ePUB版本同步发行。由于部分购买者不知道用什么应用来阅读或收听这些格式,团队在Remembering.info/m4b和Remembering.info/epub添加了子页面,根据用户偏好的平台给出建议。这两个子页面还被加入了页脚菜单和自动生成的收据中——购买者通过邮件支付后即时收到。

Spotify上也能听到这本有声书,但作者获得的版税要低得多。这个对比揭示了一个正在被AI语音技术改变的出版经济学:当制作成本大幅下降后,发行渠道的版税差异反而成为作者收入的最大变量。

11个国家的印刷版发行:一个尚未宣布的扩展

Remembering.info网站上还列出了印刷版目前可用的11个国家:阿根廷、澳大利亚、智利、哥伦比亚、厄瓜多尔、墨西哥、波多黎各、西班牙、乌拉圭、英国和美国。每个国家的链接显示以当地货币计价的印刷版。

其中拉丁美洲国家的可用性,得益于TecnoTur最新(尚未正式宣布)的扩展发行网络。这个细节值得注意:AI语音克隆解决的是制作端的问题,但发行端仍然需要传统的渠道建设和商务拓展。技术降低了进入门槛,但并没有消除地面工作。

所以呢?对行业意味着什么

第一,有声书制作的经济学正在被重写。一本63,325字的书,传统方式下需要专业配音演员数周的工作时间,加上录音棚、导演、编辑的全程参与。克隆声音方案将核心成本从“人力时间”转移到了“技术平台+人工审听”。对于独立作者和中小型出版商,这意味着以前在经济上不可行的项目现在变得可行。

第二,“作者本人的声音”成为一个可规模化的资产。Anna的案例证明,作者不需要亲自花几十小时在录音棚里,也能让有声书听起来像她本人在朗读。这对于那些声音是品牌核心组成部分的作者——教练、治疗师、思想领袖——尤其有价值。克隆声音保留了个人品牌的音频标识,同时释放了作者的时间。

第三,ElevenLabs的“主动式配音词汇表”代表了一个方向。AI语音平台正在从“生成音频”向“理解内容并主动解决发音问题”演进。这个功能看似小,但它解决的是长篇内容制作中最琐碎、最耗时的痛点之一。当平台开始预判用户的编辑需求,工作流就从“生成-发现问题-修复”变成了“生成-审核-确认”。

第四,发行渠道的碎片化仍然是瓶颈。Tépper团队不得不为M4B和ePUB分别建立指导页面,还要把这些链接嵌入收据邮件。这说明即使制作端已经高度自动化,消费端的格式兼容性和用户教育仍然是摩擦点。AI语音降低了制作门槛,但并没有简化发行的复杂性。

第五,直接销售与平台分发的张力在加剧。Tépper明确建议作者优先直接销售,因为版税更高。Spotify虽然提供了触达,但版税低得多。当AI语音克隆让制作成本趋近于零时,作者对发行渠道的选择将更加受版税结构驱动。这可能会推动更多作者建立自己的直接销售门户,而不是依赖平台分发。

Anna Pittman的项目是一个标志性案例,但不是终点。它展示了一条可行的路径:用高质量原始录音作为克隆基础,用ElevenLabs Pro进行生成和发音管理,用人工审听保证质量,用直接销售最大化版税,用多国发行扩展触达。每一个环节都有工具可用,但每一个环节也都需要人的判断。技术没有取代人,它重新分配了人在哪里投入时间。

其
行业动态有声书声音克隆ElevenLabsAI语音出版发行