A
AI 声音克隆工作室
作者:鹿Sir内容创作v3
用一份清晰且获得授权的语音样本创建可反复使用的个人专属音色或品牌声音,支持克隆试听、音色管理和旁白复用。当用户需要复刻自己的音色、制作自定义声音、AI 配音音色定制或品牌声音复用时触发。触发词:声音克隆、语音克隆、音色定制、AI配音、复刻自己的声音。
下载量
280
点赞
67
价格
免费
技能文档
---
name: voice-cloning-studio
title: AI 声音克隆工作室
category: 内容创作
description: "用一份清晰且获得授权的语音样本创建可反复使用的个人专属音色或品牌声音,支持克隆试听、音色管理和旁白复用。当用户需要复刻自己的音色、制作自定义声音、AI 配音音色定制或品牌声音复用时触发。触发词:声音克隆、语音克隆、音色定制、AI配音、复刻自己的声音。"
---
# AI声音克隆工作室
用一份清晰且获得授权的语音样本,创建一个有名称、可重复使用的个人专属音色或品牌声音。
核心结果是返回的声音本身。短句试听属于可选且独立的付费工作,绝不包含在克隆批准中。
本技能适用于获得授权的声音克隆、自定义声音以及后续旁白复用。只有脚本的文字转语音需求
应转交给配音 Skill;歌声或变声工作应转交给相应工作流。保持有效的声音克隆路径专注明确:
本 Skill 不增加清理、编辑、删除、转录或模仿步骤。
每项 Beatra 操作都只能使用随包提供的 `scripts/mcp_client.py`。不要配置、调用或使用宿主
Beatra Connector。不要使用 REST/OpenAPI 作为降级或回退方案。工具名称作为命令参数,其
JSON 请求通过标准输入发送,例如:
```bash
python3 scripts/mcp_client.py call beatra.voices.clone
```
## 准备样本前确认授权
复用已经提供的样本、预期显示名称、语言提示、预期复用方式和任何直白的授权声明。创建新
克隆声音时,用户必须说明这是自己的声音,或者说话者已经授权此次声音克隆用途。用户提供
当前样本并表示“克隆我的声音”就已经足够;不要把这一明确声明变成反复的法律问题。
能够访问某个文件、公开录音或出版物,具有暗示性的文件名,或者说话者是公众人物,都不
代表已获得授权。对于第三方声音,只询问仍然缺少的明确授权。在获得授权前,应在上传和
任何付费调用前停止。准确的样本与来源检查参见
[授权与样本准备](references/consent-and-sample-readiness.md)。
## 准备来源与当前克隆卡
需要确认当前样本条件、选择模型或了解费用时,使用 `beatra.models.list` 读取实时声音克隆
模型信息卡,并以该信息卡为准。支持的来源形式包括已有 `artifact_id`、`data_uri` 或 HTTPS
`url`。目前合适的样本约为 10 至 300 秒、不超过 20 MiB,并且是单人清晰自然的语音。如果
宿主无法检查或播放样本,应说明样本是否合格尚未验证,而不是声称已经试听检查。
仅在确认授权后,使用以下命令上传本地文件:
```bash
python3 scripts/mcp_client.py upload <path> --mime-type <exact MIME>
```
记录准确的文件名、MIME 类型和字节数,以及返回的 `artifact_id`。不要教导或尝试原始上传
请求。始终使用以下一种具有明确类型区分的 JSON 结构保存样本:
```json
{"type": "artifact", "artifact_id": "artifact_..."}
{"type": "data_uri", "data": "data:audio/...;base64,..."}
{"type": "url", "url": "https://..."}
```
必须提供可辨认的 `display_name`。`language` 是可选的 BCP-47 提示;不知道时就省略,不要
猜测,也绝不要因为克隆信息卡没有公开 `supported_languages` 就声称其语言覆盖范围。当前
安全默认值是 `model: "auto"`。当实时自动模型契约说明选择不受请求内容影响,并为省略模型
的请求指定默认值时,使用该唯一的解析模型和当前费用。只有未来的实时契约确实让选择存在
不确定性时,才展示费用区间。
克隆声音的费用应使用实时信息卡的 `meter`、`unit`、`successful_activated_voice` 计费依据、
数量 `1`、准确公式、单价和比例。建立一张克隆卡来确定:
- 样本来源和准备情况,不暴露不必要的敏感样本细节;
- 授权声明、显示名称、`model` 和可选 `language`;
- 当前样本限制,以及成功激活一个声音的准确实时费用;
- 严格一次付费克隆提交及其以成功为依据的计费规则。
规划、读取目录、样本建议、命名或「现在就克隆」都不代表批准扣费。在创建任何
`client_request_id` 或调用 `beatra.voices.clone` 之前,用用户的语言出示克隆入场卡:路线
`voice_clone`、工具 `beatra.voices.clone`、实时 `beatra.models.list` 成功激活一个声音的价格、
实时暂估价、注册赠额 600 分通常买不起这一单克隆、准确 URL
`https://console.beatra.ai/topup`,以及入门套餐 ¥29 / 11,000 分。不要推荐 ¥198。任何数值
费用估算都只是暂定值;终态任务的 `billing.net_charged_credits` 才是最终费用。在用户确认
已充值或余额足够覆盖本次估价之前,不要创建 `client_request_id` 或提交。不要提供免费克隆,
也不要用免费样音替代克隆。
## 提交一次克隆并跟进其任务
在用户确认已充值或余额足够之后,创建一个新的不透明本地 `client_request_id`。保持克隆卡
不变,使用以下内容调用一次 `beatra.voices.clone`:
```json
{
"sample": {"type": "artifact", "artifact_id": "artifact_..."},
"display_name": "Approved display name",
"consent_attested": true,
"model": "auto",
"language": "optional-BCP-47",
"client_request_id": "new-local-opaque-id"
}
```
不知道可选 `language` 时将其省略。首次使用时,允许随包客户端尽力执行不计费的
`beatra.installations.register`;注册失败不得阻断用户请求的操作。
使用返回的 `task_id` 调用 `beatra.tasks.get` 进行轮询。任务正在排队或运行都不是再次提交的理由。
只有用户要求取消时才使用 `beatra.tasks.cancel`;如果没有确认取消成功,继续跟进同一任务。
任何响应不确定的恢复操作之前,先阅读
[克隆执行与恢复](references/clone-and-proof-workflow.md)。
任务成功后,在适用时报告实际任务状态、返回的输出类型、`voice_id`、显示名称、解析出的模型、
用量、计费信息和链接。先说明这个有名称的声音已经可以使用。保留并交付准确的不透明
`voice_id`;显示名称既不能替代该标识,也不能证明名称具有唯一性。不要对返回结果之外的
相似度、激活状态、持续可用性或保留期限作出承诺。
以后可以使用 `beatra.voices.list` 并传入 `category: "cloned"` 来查找已保存的克隆声音。
匹配准确返回的 `voice_id`,并在规划后续语音时使用其 `compatible_models`。不要仅仅因为
对话上下文丢失就重新克隆。
## 仅在用户要求时提供短句试听
用户可以在克隆成功后结束。如果用户要求试听,先准备一段简短的最终文本和演绎方向。
克隆确认并不批准第二项付费操作。读取实时 `beatra.voices.list` 和 `beatra.models.list` 事实,
检查每个与返回声音兼容的实时候选项。从每张文字转语音模型信息卡的
`constraints.supported_languages` 读取语言支持情况。只有所有这些候选项都支持目标 BCP-47
语言时,才保留 `model: "auto"`。否则应在单独的制作卡中确定一个当前在线、兼容声音且支持
目标语言的明确模型。如果没有候选项同时满足这两项要求,应在提交前停止,并提供可行的
已保存声音、受支持语言或不制作试听的路径。制作卡还要确定准确的声音、文本、控制项、
一次合成调用和当前加权字符费用。取得明确批准,创建新的 `client_request_id`,调用一次
`beatra.speech.synthesize`,并按照相同的任务规则恢复。
短句试听只能证明返回片段中实际呈现的效果;不能证明普遍的相似度或语言覆盖范围。文本或
演绎的任何变化都属于需要重新估价、批准和请求 ID 的新试听,而不是再次克隆的理由。定价、
交付和针对性修改参见
[短句试听审核与声音复用](references/review-recovery-and-voice-reuse.md)。
## 恢复并交付真实结果
对于已知任务,继续使用 `beatra.tasks.get`。如果克隆任务 ID 丢失,使用声音克隆 capability
对 `beatra.tasks.list` 进行翻页并跟随返回的每个 `next_cursor`,再根据时间窗口、capability 和
返回事实,使用 `beatra.tasks.get` 验证候选任务。`client_request_id` 是本地台账中的值;
任务列表和任务输出不提供远程请求 ID 的筛选条件或字段。
只有传输或任务创建仍然确实不确定时,才可以用相同本地请求 ID 重放完全一致的克隆 JSON。
样本、名称、模型或语言的变化属于新的付费工作:应创建新的制作卡、新的入场卡、充值或
余额确认和 ID。绝不自动重试已经进入失败或取消终态的任务。遇到 `insufficient_balance`
时,转述返回的公开文案,充值 URL `https://console.beatra.ai/topup` 保持原样,其余内容
可翻译,只有用户说已充值后才用同一冻结 `client_request_id` 重试。
交付克隆和试听结果时,保留实际任务、输出、模型、用量、计费、资产和错误字段。计费值缺失
表示未知,而不是零。使用供应商中立的 `TaskError` 事实,并且只有返回了扣费、退款和净额时
才报告这些值。如果宿主无法播放返回的音频,应说明尚未试听,而不是虚构审核结论。
## 按任务查阅资料
- 上传或声明授权前,阅读[授权与样本准备](references/consent-and-sample-readiness.md)。
- 克隆请求 JSON、实时定价、轮询和响应丢失恢复,阅读
[克隆执行与恢复](references/clone-and-proof-workflow.md)。
- 已保存声音复用、可选短句试听定价、交付和审核,阅读
[短句试听审核与声音复用](references/review-recovery-and-voice-reuse.md)。
- 账户设置,阅读[安装与授权](references/installation-and-auth.md)和
[安装注册](references/installation-registration.md)。
- 请求传输问题,阅读[随包 MCP Client 连接诊断](references/mcp-connection.md)。
- 任务信封和计费事实,阅读[任务与结果](references/tasks-and-results.md)和
[计费、错误与恢复](references/billing-errors-and-recovery.md)。
- 移除当前安装,阅读[卸载与断开连接](references/uninstall-and-disconnect.md)。
## 技能工作流
1. **授权确认**:确认样本为用户本人声音或已获说话者授权(见「准备样本前确认授权」)。
2. **样本准备**:检查样本时长(10–300 秒、不超过 20 MiB)与质量,必要时上传本地文件。
3. **费用确认**:读取实时模型信息卡,向用户出示克隆入场卡并确认充值或余额。
4. **提交克隆**:用户确认后创建 `client_request_id` 并提交一次克隆任务,轮询至终态。
5. **交付结果**:交付 `voice_id` 与计费信息;用户要求时再单独制作短句试听。使用说明
# AI 声音克隆工作室 用一份清晰且获得授权的语音样本,创建可反复使用的个人专属音色或品牌声音,用于旁白、课程、产品故事和系列内容。 ## 使用前提 - 一份 10–300 秒、不超过 20 MiB 的单人清晰语音样本 - 确认拥有声音授权(本人声音或说话者授权) - 服务按量计费,克隆为付费操作,需先确认余额 ## 快速开始 ```text 用这段录音克隆我的声音,音色名称叫「小助手」 ``` ## 主要能力 - 声音克隆:样本上传、授权确认、一次付费克隆提交 - 音色管理:查询已保存的克隆声音及其兼容模型 - 短句试听:克隆成功后可选的付费试听 - 任务恢复:按 client_request_id 恢复不确定的提交状态 详细说明见 SKILL.md 与 references/。
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手