给 TA 一把声音:从 96 个音色里挑,或者克隆一把

Foreverse 里声音出现在三个地方:听书、角色聊天朗读、伴侣的语音条和通话。这篇先讲目录(接阿里百炼 Key 解锁 49 个中文音色,含上海话、粤语方言组;xAI 26 个、OpenAI 13 个、硅基流动 CosyVoice 8 个),再讲行内试听的计费规矩(真调用、有缓存),最后一步步走完声音克隆:录一段或传一段音频,命名保存,一键绑给伴侣。克隆本身免费,只允许克隆你本人的声音。

暖纸色手绘墨线插画:一支老式麦克风立在桌上,声波化作一条墨色缎带绕进旁边的手机屏幕,屏幕里一排小小的音色卡片亮着微光

先回答一个我们被问过很多次的问题:「为什么你们的音色一会儿多一会儿少?」答案不神秘, 音色目录跟着通道走。语音合成的音色是各家服务商的资产,你接谁的 Key,就看到谁的货架。 接了阿里百炼,货架上是 49 个中文音色;接 xAI 是 26 个;OpenAI 13 个;硅基流动的 CosyVoice 8 个。 什么 Key 都不配、走官方渠道,用的是内置的语音模型目录,能用,但选择面小。 搞清这一层,挑声音这件事就从玄学变成了逛货架。

货架上的东西在三个地方消费:整本书的听书、 角色聊天里的朗读、伴侣的语音条和电话。三处各有自己的音色选择器,长得一样,记忆各自独立: 听书用磁性男声、伴侣用你克隆的声音,互不打架。

货架怎么逛:分组、徽标、搜索

以最大的阿里百炼货架为例。49 个音色分三组陈列:标准组在前,方言组居中,角色组殿后。 方言组是中文货架独有的乐趣,上海话的阿珍、粤语的阿清,给方言背景的角色配上会有奇效; 角色组则是些有预设气质的声线。每行是名字加性别徽标加一句气质描述,比如「芊悦 · 阳光积极亲切自然的小姐姐」, 描述来自服务商官方目录,我们逐条照抄,没有自己发挥。

列表顶部有搜索框,中文名、英文 id、描述、性别都能命中;还有一枚「换模型」, 点开是叠上来的模型选择器,选完回落原地,目录当场热切换,不用退出去重进。 觉得 49 个挑花眼,先搜性别再听描述顺眼的两三个,比从头听到尾快得多。

试听的账怎么算

每行右侧的试听键是真家伙:点一下就是一次真实的 TTS 合成调用,不弹确认框。 我们敢这么做是因为把账压得足够小——样句不超过 40 个字,一次只花合成一句话的钱; 合成结果缓存在本机,同一个音色同一句样句,第二次点直接播放,零调用零费用。 实测数据:首次试听约两秒出声,复点一秒内出声,请求记录里查不到第二次请求。 试听失败会把原因写在行里,Key 无效、限频、网络异常各有各的说法,不会只给一个「重试」让你猜。

克隆:录一段,或者传一段

目录再大也有一种声音不在里面。克隆入口在设置的「AI 模型与服务」里,叫「我的音色」; 伴侣的音色选择器底部也有一行「+克隆一个声音」直达。

流程五步,前两步是规矩:先过合规同意,确认克隆的是你本人的声音、知道可以随时删除; 再选通道,xAI Grok 或硅基流动 CosyVoice,按你配了哪家的 Key 显示。 xAI 通道有个前提,你的团队要开通过 Custom Voices,没开通会明确报错,报错了换硅基流动就行。 然后是采样:现场录一段,引导词的第一段就是同意声明,照着读完,一举两得; 或者传一段现成的音频文件,CosyVoice 通道需要你把音频的逐字内容一起填进去。 最后命名保存。克隆这一步不收费,走你自己的 Key。

保存成功那一刻会弹一个「绑给伴侣」,点一下头像就绑上了,连语音模型都自动切到克隆归属的通道, 不用再去设置里找。之后这把声音在三处选择器的「我的音色」分组置顶常驻;伴侣侧不管当前挂着哪家模型, 它都显示在那,选中挂在别家通道的克隆音色时会自动切换语音模型并提示一句。

删除也交代清楚:列表行里可以试听、重命名、删除,删除会级联到服务商侧一起删, 正在用这把声音的伴侣自动回到默认音色。不会有一把删不干净的声音留在别人的服务器上。

三个场景,三种挑法

听书页(阅读中点一下页面中央唤出底部控制栏,点「听」)底部有四个入口:引擎、音色、缓存、原文。 引擎先选:Android 系统 TTS 本地合成、离线可用、完全免费,通勤听个爽文足够; 在线语音模型音质好得多,按次计费,配定时和分段缓存用最划算。 两条路线的音色列表都在「音色」入口里,克隆音色也在。

角色聊天的朗读在「+」面板里,读最后一条回复;⋮ 菜单里有自动朗读开关,每条新回复自动播。 这里的音色按模型持久化,给不同的卡配不同声线,切回来还是原来那把。 旁白多的卡记得开同区的「只朗读台词」,跳过大段动作描写,省钱也省耳朵。

伴侣的声音在资料页「TA 的声音」里选,语音条合成结果有缓存,同一条不会重复计费。 有一个贴心也诚实的细节:给伴侣换语音模型时,如果旧音色不属于新模型的音色空间, 会被自动清空回默认音色,而不是留一个必然合成失败的脏值等你踩。

这套东西的边界

如实交代几条。音色目录的数字是 2026 年 7 月各家官方列表的数,服务商上新或下架,货架会跟着变。 只允许克隆你本人的声音,这条没有商量余地,想给 TA 配某个特定人的嗓音,此路不通。 系统 TTS 免费但音色固定;在线音色好听但每次合成都是真实调用,长篇听书记得用分段缓存, 听过的段落不会二次计费。每一笔合成,和文本调用一样,都在设置的 API 请求记录里逐条可查。

常见问题

声音克隆要花钱吗?安全吗?

克隆这一步免费,走你自己的 Key;之后用克隆音色合成语音,按对应服务商的 TTS 牌价计费。安全边界有三条:只允许克隆你本人的声音,录音引导词的第一段就是同意声明;音色可随时删除,删除会级联到服务商侧一起删;正在用这把声音的伴侣会自动回到默认音色,不会留一把没主的克隆声。

为什么我看到的音色只有几个,别人有几十个?

音色目录跟着你接的通道走。接了阿里百炼 Key 能看到 49 个中文音色(含方言组和角色组),xAI 有 26 个,OpenAI 13 个,硅基流动 CosyVoice 8 个;不配 Key 走官方渠道,用的是内置的语音模型目录,选择面小一些。音色选择器顶部有「换模型」,切一个通道,目录当场就换。

试听音色收费吗?

收,但收得很克制。点行内试听是一次真实的 TTS 合成,样句不超过 40 个字,所以单次费用很小;同一个音色同一句样句的结果会缓存在本机,第二次点直接播放、零调用。我们实测首次试听约两秒出声,复点一秒内出声且不产生任何请求。

克隆的声音能用在听书上吗?

能。克隆完成后,这把声音会出现在听书、角色聊天朗读、伴侣「TA 的声音」三处选择器的「我的音色」分组里,置顶显示。听书页还有个免费方案:引擎选 Android 系统 TTS,本地合成、离线可用、零费用,只是音色固定不可克隆。

有想法或问题?来 Discord 聊聊 →

AI 声音克隆怎么玩:录一段自己的声音,让 TA 拿它说话(附 96 个音色怎么挑) · Foreverse · 新梦