目 录CONTENT

文章目录

用豆包从 0 到 1 创建数字人:从注册账号到生成第一条视频

传家宝VPS
2026-08-30 / 0 评论 / 0 点赞 / 1 阅读 / 0 字
RackNerd Mobile Leaderboard Banner

先从云端 API 生成数字人说起

这篇文章想分享一件我刚刚跑通的事。把几家云端服务的 API 接进豆包以后,给它一条短视频链接、一份自己的音色和一个训练好的数字人形象,豆包就能继续生成文案、音频和数字人视频,最后把成片保存到指定文件夹。

今天我会从豆包的角度,把这套做法完整写下来。智凌 API 用来提取文案,MiniMax 负责克隆声音和生成音频,蝉镜负责让数字人开口。豆包负责调用这些接口、整理中间文件,并检查每一步有没有真的完成。

四个平台在整套流程里的分工如下。

平台

在这套流程里负责什么

智凌 API

把短视频分享链接变成文字

MiniMax

把文字变成自己的克隆声音

蝉镜

让数字人按照这段声音开口

豆包

调用前三个平台,并把文案、音频和视频接起来

这套流程最容易卡在平台之间的衔接。文案、音频和数字人视频分散在三家服务里,任何一个接口的凭证或参数填错,完整任务都会停在中途。为了方便定位问题,先注册三个平台、拿到各自凭证,再准备数字人和音色。随后分别测试链接转文案、文字转声音和音频驱动数字人,三项都通过以后,再让豆包生成完整成片。

实际操作按下面这条顺序走。

平台准备 → 凭证准备 → 素材准备 → 三项单测 → 完整成片 → 人工验收

我这次最终跑出了一条 10.24 秒、1080×1920 的竖屏数字人视频。整条任务都由豆包执行,真实 API Key 没有出现在提示词、文章、Skill 文件和结果目录里。后文用到的耗时、文件大小和报错,也都来自这次实测。

file-20260829103846573.webp

一、先看懂整条数字人流水线

1. 三个平台分别负责什么

把数字人想成一个真人主播,会更容易理解这三套服务的分工。

智凌负责“找稿子”。你把公开短视频的分享链接交给它,它返回标题、字幕或口播文字。这里拿到的只是原始材料,不等于可以直接发布的新文案。

MiniMax 负责“说话”。你先创建一个克隆音色,再把确认后的口播稿提交给 TTS 接口,它会生成 MP3 音频。

蝉镜负责“出镜”。你先创建并训练自己的数字人形象,再把 MP3 上传给它,平台会让数字人的嘴型、表情和动作跟随音频,最后返回 MP4。

豆包负责把三家平台接起来。它读取链接、调用 Skill、保存中间文件,碰到异步任务就继续等待,任务完成后再下载成片。每一步是否成功,按提示词里的验收条件判断。

2. 开始前需要准备什么

正式操作前,先把这些材料准备齐。

  1. 一个可公开访问的短视频分享链接;

  2. 一段用于克隆声音的干净录音;

  3. 一段用于训练数字人的真人视频;

  4. 智凌 API Key;

  5. MiniMax API Key 和 Voice ID;

  6. 蝉镜 App ID、Secret Key 和数字人 ID;

  7. 一个专门保存本次产物的文件夹;

  8. 豆包客户端和一个独立的“豆包数字人”项目。

录音和训练视频尽量一次准备好。录音要减少背景音乐、回声和他人说话;训练视频要保持正脸、光线稳定、画面连续。素材质量不好,后面再好的模型也只能放大问题。

3. 平台网址速查

实际用到的网站都在下面。先分别注册并登录,再回来继续操作。

平台

官方入口

本教程中的用途

豆包

https://www.doubao.com/

创建 Skill、执行测试并串联完整流程

智凌 API

https://api.17zhiling.com/user/api-list

开通短视频文案提取、创建 API Key

MiniMax 开放平台

https://platform.minimaxi.com/

克隆音色、获取 Voice ID 和 API Key

蝉镜开放平台

https://www.chanjing.cc/other/openapi-home.html

创建数字人、获取 API 凭证并生成视频

需要核对接口参数时,可直接查看 MiniMax 音色快速复刻MiniMax 同步语音合成蝉镜获取 AccessToken蝉镜合成数字人视频。平台页面后续可能改版;如果链接打开后要求登录,登录后按照本文给出的菜单名称查找即可。

4. 安全和授权边界

API Key 相当于第三方平台的付费通行证。不要把它贴进普通对话或共享项目,也不要写进 Skill 的 SKILL.md、脚本、文章或 Git 仓库。

本教程只记录配置项名称,不记录真实值。

ZHILING_API_KEY
MINIMAX_API_KEY
MINIMAX_VOICE_ID
CHANJING_APP_ID
CHANJING_SECRET_KEY
CHANJING_PERSON_ID

本教程的主流程从三个平台分别取得凭证,再把真实值填入豆包项目的安全配置。

保存后只让豆包检查配置是否存在、格式是否合理,不要让它打印完整内容。普通对话里只写变量名,真实值只出现在安全配置区域。

三项测试会调用真实接口,数字人生成通常还会产生少量费用。第一次保持“按需确认”,看到调用外部 API、上传音频或开始视频合成时,先确认范围再继续。

二、准备智凌,先拿到短视频文案

1. 注册并进入控制台

打开智凌 API 用户控制台,按照页面提供的方式注册并登录。进入控制台后,先找到“产品列表”,确认账号下已经出现短视频解析、文案提取或语音转文字相关产品。

界面名称以后可能调整,判断方法很简单。这个接口要能接收短视频分享链接,并返回可读的文字结果。

file-20260829103846575.webp

2. 找到文案提取接口

点进文案提取产品,先看接口说明,不要马上复制示例代码。文档里先找四件事。

  • 请求地址是什么;

  • 请求方法是 GET 还是 POST;

  • 分享链接放在哪个参数中;

  • 任务是同步返回还是提交后继续轮询。

短视频文案提取经常走异步流程。第一次请求只返回任务编号,几秒后还要查询任务状态。豆包 Skill 会负责轮询,你不用手动刷新。接口显示“提交成功”时,文案通常还没有生成。

file-20260829103846580.webp

3. 获取并安全保存 API Key

回到控制台,打开“密钥管理”。如果账号还没有密钥,点击创建;如果已经有可用密钥,不要重复创建。

复制以后立刻放进安全配置,并记录变量名为 ZHILING_API_KEY。文章、截图和豆包回复里都不应该出现完整值。部分平台只在创建时展示一次完整密钥,关闭弹窗前先确认已经安全保存。

file-20260829103846576.webp

4. 记下接口规则,暂时不要调用

准备一条公开的短视频分享链接,第一次不要选十几分钟的长视频。此时只确认产品已经开通、接口可以接收分享链接,并记下任务查询方式。

真正的接口测试放在第六章。等豆包里的 Skill、凭证和输出目录全部准备好,再执行一次最小测试。这样遇到错误时,能够判断问题来自平台接口还是豆包配置。

三、准备 MiniMax,克隆并调用自己的声音

1. 注册时先确认站点和账号

进入 MiniMax 开放平台,按页面方式注册。国内账号尽量使用国内开放平台,不要把不同站点创建的 Key、音色和账户余额混在一起。

登录后先检查控制台里是否能看到“语音”“声音克隆”“我的音色”和“API 密钥”。声音克隆需要完成个人或企业实名认证。如果某个入口没有显示,先检查认证状态、账号权限和产品是否已开通。

2. 准备录音并创建克隆音色

进入“声音克隆”,上传或直接录制一段干净的人声。按照 MiniMax 音色快速复刻文档 当前的接口要求,克隆音频应为 MP3、M4A 或 WAV,时长保持在 10 秒至 5 分钟之间,文件不要超过 20MB。录音时再注意下面这些事。

  • 只留一个人说话。

  • 不放背景音乐。

  • 避免明显喷麦、回声和电流声。

  • 使用正常语速和自然情绪。

  • 内容尽量连续,少用碎片拼接。

提交前给音色起一个一眼能认出的名字,例如“我的日常口播”。平台完成处理后,先在网页里试听,确认没有明显机械音、吞字或音量突变。

file-20260829103846582.webp

3. 找到并记录 Voice ID

打开“我的音色”,找到刚才创建并试听通过的音色。音色名称方便人确认,API 调用认的是 Voice ID。

把 Voice ID 保存到 MINIMAX_VOICE_ID,不要直接写入 Skill 正文。后续如果有多个音色,豆包应按名称或你明确指定的顺序选择,不能每次随机取一个。

file-20260829103846584.webp

4. 创建并保存 API Key

进入“API 密钥”,点击创建新密钥,填写一个能识别用途的名称,例如“doubao-digital-human”。创建后复制到安全配置中的 MINIMAX_API_KEY

Key 和 Voice ID 的作用不同。Key 负责鉴权,Voice ID 负责指定声音。出现 401、无权限或找不到音色时,先检查账号和站点,再确认这两个字段是否属于同一个 MiniMax 账户。

file-20260829103846587.webp

5. 试听音色,暂时不要调用 API

先在 MiniMax 网页里试听刚刚创建的音色,确认没有明显机械音、吞字和音量突变。API 单项测试统一放到第六章,届时只生成三到五秒的短句。

四、准备蝉镜,创建自己的数字人形象

1. 注册并进入 API 接入页面

打开蝉镜 API 接入页并登录,进入“API 接入”或开放平台页面。豆包要从这个入口调用蝉镜,普通网页成片编辑器接不到这次任务。

先检查账户是否已开通 API、是否还有可用额度,再确认能看到 App ID、Secret Key、数字人列表和任务查询等入口。平台套餐、计费和可用模型会变化,实际费用以生成前的页面提示为准。

file-20260829103846588 1.webp

2. 创建 API 凭证并确认鉴权方式

在 API 接入页面找到密钥区域。这里会用到两项凭证。

配置名

用途

CHANJING_APP_ID

应用或账号标识

CHANJING_SECRET_KEY

用于签名或鉴权的 API Key

两项必须来自同一个应用。复制后放入安全配置,不要截图完整密钥,也不要让豆包在报错时把请求头全部打印出来。

按照蝉镜获取 AccessToken 文档,业务接口不会直接使用这两项凭证。Skill 需要先用 App ID 和 Secret Key 请求 AccessToken,再把 Token 放进后续接口的请求头。AccessToken 默认有效一天,重新获取以后,旧 Token 会立即失效。因此不要把 AccessToken 当作长期配置保存,也不要让多个任务同时反复刷新。

file-20260829103846590.webp

3. 创建自己的数字人

进入“数字人”或“我的数字人”,点击创建。平台提供“视频生数字人”和“文生数字人”等方式;想让成片使用自己的真人形象,就选择“视频生数字人”,上传自己有权使用的真人素材。

file-20260829103846596.webp

训练视频尽量满足下面这些条件。

  1. 竖屏成片就用竖屏素材,主体不要太小;

  2. 人脸完整、无遮挡,视线尽量看向镜头;

  3. 光线和背景保持稳定;

  4. 不要频繁切镜头、转身或突然离开画面;

  5. 嘴部要清晰可见,避免手、口罩或杯子遮挡;

  6. 只上传自己拥有授权的人像和声音。

提交后等待平台训练完成。状态还是处理中时,不要继续调用视频接口。

4. 找到数字人 ID

训练完成后打开数字人详情,确认预览图、名称和造型都正确,再记录它的数字人 ID,并保存为 CHANJING_PERSON_ID

这里也要分清名称和 ID。名称方便人确认,API 通常依赖 ID。为了避免泄露或误用,本教程截图和结果只展示名称,不展示完整 ID。

file-20260829103846592.webp

5. 记下音频驱动要求,稍后统一测试

蝉镜的云端接口不能直接读取电脑上的本地路径。第六章开始测试时,Skill 要先把 MiniMax 生成的 MP3 上传到蝉镜文件管理,等待文件可用,再把返回的文件 ID 交给数字人视频接口。

按照蝉镜合成数字人视频文档,如果希望视频带字幕,上传音频可以使用 8000Hz 或 16000Hz 的单声道文件。本教程统一使用 16000Hz、单声道 MP3。测试时先选基础模型,画面使用 1080×1920、1080p,音频只做三到五秒。数字人视频是异步任务,提交成功以后还要继续查询任务状态并下载结果。

五、在豆包中建立数字人项目

1. 新建独立项目和结果目录

打开豆包,在左侧新建一个“豆包数字人”项目,再为第一次练习准备单独的输出文件夹。原始录音、训练视频、测试文件和正式成片不要混在桌面或下载目录根部。

建议给每个中间结果编号。

01-zhiling-copy.txt
02-minimax-voice.mp3
03-chanjing-test.mp4
04-final-script.txt
05-final-voice.mp3
06-final-digital-human.mp4

顺序编号方便排错。看一眼最后生成的文件名,就知道任务停在哪一步。

2. 让豆包准备三个独立 Skill

这里不用提前下载压缩包,也不用自己编写复杂代码。让豆包先读取三个平台的接口说明,再把三个 API 分别做成只管一件事的 Skill。接口地址和参数以平台文档为准,遇到没有写清的字段就停下来,不让豆包凭经验猜。

Skill

输入

输出

需要读取的配置

智凌文案提取

公开视频分享链接

TXT 文案

ZHILING_API_KEY

MiniMax 文字转语音

文字、模型、语速

MP3 音频

MINIMAX_API_KEYMINIMAX_VOICE_ID

蝉镜数字人

MP3 音频、画面规格

MP4 视频

CHANJING_APP_IDCHANJING_SECRET_KEYCHANJING_PERSON_ID

三个 Skill 用同一套规则。凭证只从安全配置读取,不写进 Skill。输入和输出路径要明确,异步任务只轮询同一个任务编号。接口返回成功以后还要检查文件,失败时保留错误并停在当前步骤。

复制下面的提示词,豆包会按照这套思路在当前项目中创建三个 Skill。

请在当前“豆包数字人”项目中创建三个彼此独立的本地 Skill:

1. 智凌文案提取:接收公开视频分享链接,调用智凌接口,输出纯文本 TXT。
2. MiniMax 文字转语音:接收文字、模型和语速,调用指定克隆音色,输出 MP3。
3. 蝉镜数字人:接收本地 MP3 和视频规格,用指定数字人生成并下载 MP4。

共同要求:
- 先读取三个平台当前的接口文档,再编写调用逻辑;接口地址、请求参数或签名规则不明确时停止并说明,不得猜测。
- 凭证只能从安全配置读取,变量名分别为 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID。
- 不得把任何凭证或完整 ID 写入 Skill、脚本、日志和回复。
- 每个 Skill 只负责一种能力,并写清输入参数、输出路径、接口失败信息和验收方法。
- 异步任务必须保存任务编号并轮询同一个任务,禁止重复提交。
- MiniMax 输出 MP3 时允许指定采样率和声道,本教程默认使用 16000Hz、单声道。
- 蝉镜 Skill 先用 App ID 和 Secret Key 获取 AccessToken。Token 过期或返回 10400 时只刷新一次,刷新后继续原任务,不把 Token 长期写入配置。
- 蝉镜 Skill 接收本地 MP3 时,先上传文件并等待文件状态可用,再提交数字人视频任务。使用蝉镜主站创建的数字人时设置 source=1。
- 输出文件已存在时不要直接覆盖,先说明情况;API 调用失败时停止,不要自动改用其他平台。

创建完成后只做静态检查,不调用任何付费 API。最后用表格报告三个 Skill 的名称、输入、输出、所需配置和检查结果。

3. 把三个平台的 API 凭证提供给豆包

完成前面三个平台的注册和配置后,你手里应该已经有六项信息。智凌提供 API Key,MiniMax 提供 API Key 和 Voice ID,蝉镜提供 App ID、Secret Key 和数字人 ID。它们都要从你自己的平台账号中复制,不能使用文章示例或别人的凭证。

平台

需要提供给豆包的配置

智凌 API

ZHILING_API_KEY

MiniMax

MINIMAX_API_KEYMINIMAX_VOICE_ID

蝉镜

CHANJING_APP_IDCHANJING_SECRET_KEYCHANJING_PERSON_ID

先确认当前豆包项目只有自己可以访问,然后打开三个 Skill 的配置区域,把六项真实值分别填入对应字段。真实凭证只在安全配置区域填写,不要粘贴到下面的提示词、普通对话、文章或截图中。

六项配置填完以后,再复制下面的检查提示词。

请只检查当前“豆包数字人”项目中的安全配置,本轮不要调用任何外部或付费 API。

依次检查 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID 是否存在且非空。

不得读取、展示、复述或截断展示任何真实值。不要修改配置,也不要自动创建或替换凭证。发现缺项或格式明显异常时,只报告变量名和问题。

完成后用表格报告六项配置是否就绪,以及是否满足后续单项测试条件。

配置完成后,关闭仍然显示完整密钥的页面,不要把填写过程截图发到公开平台。后面的单项测试只引用变量名,不再重复粘贴真实值。

file-20260829103846596 1.webp

4. 先让豆包检查环境

正式调用前,让豆包完成一次不计费的预检。下面这段可以直接复制使用。

请对当前“豆包数字人”项目执行一次只读预检,本轮禁止调用任何外部或付费 API。

依次检查:
1. 三个 Skill 是否存在并可以加载;
2. 六项安全配置是否存在,但不要读取或展示真实值;
3. 所需运行依赖是否可用;
4. output 目录是否存在且可写;
5. output/01-zhiling-copy.txt、output/02-minimax-voice.mp3 和 output/03-chanjing-test.mp4 是否已有同名文件,避免误覆盖。

请用表格输出“检查项、结果、待处理问题”。如果有任意一项不通过,明确指出问题并停止;全部通过时只回复“可以开始三项单测”。

只有三项 Skill、配置和输出目录都显示正常,才进入下一步。

六、逐项测试三个能力

第一次不要把链接、改写、TTS、数字人一次全交出去。完整任务出了错,你很难判断是链接无效、音色失效、密钥错误,还是蝉镜仍在排队。一次只测一个输入和一个输出,排查起来最快。

测试一,链接能不能变成干净文案

输入是一条公开分享链接,输出是 output/01-zhiling-copy.txt。复制下面的提示词,只替换分享链接。

请执行一次“智凌文案提取”单项测试。

输入:
- 公开视频分享链接:【把分享链接粘贴到这里】
- 输出文件:output/01-zhiling-copy.txt

执行要求:
1. 使用安全配置中的 ZHILING_API_KEY 调用智凌文案提取接口。
2. 只保留视频中的原始口播或字幕正文,不改写、不总结,也不要保存整段接口 JSON。
3. 如果接口返回任务编号,请持续查询同一个任务,直到成功或明确失败。
4. 如果遇到临时网络错误,间隔数秒后最多自动重试一次。再次失败时停止,不要继续创建任务。
5. 不得在回复、日志或输出文件中显示 API Key。

完成后检查输出文件存在且非空,只报告:执行结果、正文字符数、耗时和文件路径。

验收时检查文件非空、内容可读,也没有把接口返回的 JSON 当成正文。我第一次和第二次独立测试都遇到 Connection reset by peer。排除本机代理影响后,我手动发起了第三次测试,5.4 秒后成功拿到 363 个字符,文件大小 955 字节。这里的第三次是人工排查后的新测试,不属于提示词允许的一次自动重试。

如果出现临时网络重置,先确认服务可达,再只处理智凌这一项,不要跟着重跑 MiniMax 和蝉镜。

测试二,文案能不能变成可用声音

输入是一句固定短文案,输出是 output/02-minimax-voice.mp3。下面这段可以直接复制。

请执行一次“MiniMax 文字转语音”单项测试。

输入:
- 测试文案:你好,这是我的第一条数字人语音测试。
- 输出文件:output/02-minimax-voice.mp3

执行要求:
1. 从安全配置读取 MINIMAX_API_KEY 和 MINIMAX_VOICE_ID,使用指定的克隆音色。
2. 模型使用 speech-2.8-turbo,语速设为 1.0,输出 16000Hz、单声道 MP3。
3. 原样朗读测试文案,不扩写、不添加开场白,只调用一次语音接口。
4. 不得在回复、日志或输出文件中显示 API Key 和完整 Voice ID。

完成后确认 MP3 可以播放、时长大于 2 秒且没有明显截断,只报告:执行结果、音频时长、文件大小、耗时和文件路径。

验收时亲自播放,确认音色正确、声音完整、没有读错关键字。本次实测音频 4.05 秒、67,956 字节,约 1.4 秒生成完成。

短句通过以后再测试长文案。因为长音频更贵,也更容易暴露断句、英文缩写和多音字问题。

测试三,音频能不能驱动数字人

输入是第二项已经听过的 MP3,输出是 output/03-chanjing-test.mp4。下面的提示词适用于在蝉镜主站创建的个人数字人。

请执行一次“蝉镜音频驱动数字人”单项测试。

输入:
- 驱动音频:output/02-minimax-voice.mp3
- 输出文件:output/03-chanjing-test.mp4

执行要求:
1. 从安全配置读取 CHANJING_APP_ID、CHANJING_SECRET_KEY 和 CHANJING_PERSON_ID。
2. 先用 App ID 和 Secret Key 获取 AccessToken,不展示或长期保存 Token。返回 10400 时只刷新一次。
3. 把本地 MP3 上传到蝉镜文件管理,等待文件状态可用,再使用返回的文件 ID 创建视频。
4. 使用 CHANJING_PERSON_ID 指定的数字人。该数字人来自蝉镜主站,因此 source 设为 1。
5. 选择基础模型,生成 1080×1920、1080p 的竖屏视频,保留默认字幕处理。
6. 任务提交后持续查询同一个任务编号,完成后立即下载 MP4。等待期间不要重复提交任务。
7. 不得在回复、日志或输出文件中显示 App ID、Secret Key、AccessToken 和完整数字人 ID。

完成后确认视频可以打开,画面为 1080×1920,同时包含视频流和音频流,视频时长与输入音频基本一致。只报告:执行结果、视频时长、文件大小、耗时和文件路径。

文件扩展名只能说明它叫 MP4,验收时还要逐项检查下面这些内容。

  • 能不能正常打开;

  • 画面是不是 1080×1920;

  • 有没有声音;

  • 时长是否接近输入音频;

  • 人脸、嘴部和字幕是否正常。

我这次生成的测试片长 4.04 秒,文件大小 3,055,955 字节,前后等了约 42.6 秒。豆包等到任务完成后才下载文件,没有把“提交成功”当成最终结果。

我这次跑出的数据放在下面。

项目

结果

耗时

输出

智凌文案提取

成功

5.4 秒

955 B / 363 字符

MiniMax 语音

成功

1.4 秒

4.05 秒 / 67,956 B

蝉镜数字人

成功

42.6 秒

4.04 秒 / 3,055,955 B

file-20260829103846597.webp

三个结果文件都能打开,并且分别通过验收,素材准备才算完成。

七、用豆包生成第一条完整数字人视频

1. 把智凌结果整理成正式口播稿

三项测试通过以后,先把 output/01-zhiling-copy.txt 整理成自己的正式口播。智凌提取到的是原始材料,豆包可以帮你压缩和改写,最终版本仍然要由人确认。

第一条完整成片控制在十秒左右,口播保留 45 至 65 个汉字即可。复制下面的提示词,先让豆包给出候选稿,不调用语音和数字人接口。

请读取 output/01-zhiling-copy.txt,把它整理成一段适合约 10 秒数字人口播的候选稿。

改写要求:
1. 只使用原文中能够确认的信息,不补写未经核实的数据、经历和效果。
2. 保留一个主要信息,控制在 45 至 65 个汉字,使用自然口语和完整句子。
3. 不连续照搬原文中的长句,重新组织表达,删除账号名、引流话术和无关开场。
4. 本轮只在回复中给出一版候选稿,不保存文件,也不调用智凌、MiniMax 或蝉镜 API。

最后报告候选稿字数,并等待我确认。

读一遍候选稿,确认事实、语气和长度都合适以后,再复制下面这句。

确认使用上一版候选稿。请原样保存为 output/04-final-script.txt,不再改写,不调用任何外部 API。保存后只报告字符数和文件路径。

为了单独验证接口衔接,我这次使用了一段 58 字的自写测试稿,同样保存为 output/04-final-script.txt

我现在会用 AI 工具整理文案、生成声音,再驱动数字人完成一条完整视频,整个流程简单又高效,就算第一次操作也能很快上手。

output/04-final-script.txt 一旦确认,后续重试只处理失败的音频或视频步骤,不再顺手改稿。

2. 把完整任务一次写清

确认三个单项测试都通过后,复制下面的提示词即可开始。它会使用安全配置中的音色和数字人,不用再填写真实 Key 或 ID。执行后会产生实际 API 调用和少量费用。

请使用当前项目中已经通过单项测试的 MiniMax 和蝉镜 Skill,生成一条约 10 秒的正式数字人成片。

固定参数:
- 输出目录:output
- 口播文案:读取 output/04-final-script.txt 中已经人工确认的完整内容
- MiniMax 模型:speech-2.8-turbo
- 语速:1.0
- 音频规格:16000Hz、单声道 MP3
- 音色:使用 MINIMAX_VOICE_ID 指定且已通过单测的克隆音色
- 数字人:使用 CHANJING_PERSON_ID 指定且已通过单测的数字人
- 视频规格:基础模型、竖屏 1080×1920、1080p

执行顺序:
1. 先确认 output/04-final-script.txt 存在且非空,不修改文件内容。
2. 检查 output/05-final-voice.mp3 和 output/06-final-digital-human.mp4 是否已存在;任一文件存在时停止并报告,不要覆盖。
3. 调用 MiniMax 一次,生成 output/05-final-voice.mp3;生成后确认文件可播放且内容完整。
4. 只有音频验收通过后,才调用蝉镜一次,生成 output/06-final-digital-human.mp4。
5. 蝉镜 Skill 先上传 MP3,再使用有效 AccessToken 提交视频任务。保存任务编号并持续查询同一个任务,禁止因等待而重复提交。

安全与失败处理:
- 凭证只从安全配置读取,不修改配置,不显示 API Key、Voice ID、App ID 或数字人 ID。
- 任一步失败时立即停止,保留已经成功的文件,并说明失败步骤和原始错误摘要。
- 只允许对发生临时网络错误的失败步骤自动重试一次;不得重跑已成功步骤。

最终验收:
- 确认三个正式文件都存在;
- 报告口播字符数、音频时长、视频时长、文件大小和总耗时;
- 确认视频为 1080×1920,并同时包含 H.264 视频流和 AAC 音频流;
- 最后只输出结果表和三个文件路径,不再生成其他版本。

3. 为什么一定要写“失败时只重试失败环节”

一条流水线里,文案几乎不花钱,语音费用较低,数字人视频通常更慢、消耗也更明显。

如果只在最后下载文件时失败,却把前面的步骤全部重跑一遍,就会多出重复音频、重复视频和额外费用。提示词要让豆包先找到失败步骤,只重跑这一段。

4. 打开结果文件夹验收

本次豆包最终生成六个按顺序编号的文件,测试产物和正式产物都保留在同一个独立文件夹中。

file-20260829103846600.webp

最终验收结果放在下面。

项目

实测结果

正式口播

58 字(含标点)

正式音频

10.27 秒,167,604 B

正式视频

10.24 秒,8,250,407 B

画面

H.264,1080×1920

声音

AAC 音频流

总耗时

64.7 秒

打开视频以后,还要人工看一遍人物是否正确、嘴型是否同步、字幕是否完整、开头和结尾有没有被截断。

八、常见问题与排查顺序

1. 智凌返回连接重置或超时

先检查公开链接能否在浏览器打开,再检查智凌服务是否可达。服务可达、凭证也存在时,只做一次带间隔的重试。不要因为智凌失败就重新生成声音和视频。

2. MiniMax 提示 401、无权限或找不到音色

先看 API Key 是否来自当前站点,再确认 Voice ID 属于同一个账号。接着检查音色是否仍然可用,账户有没有调用权限。不要把完整 Key 放进报错截图。

3. 声音生成了,但不是自己的音色

说明豆包选到了系统音色或另一个克隆音色。回到“我的音色”确认名称,在安全配置中指定正确 Voice ID,再只重跑 MiniMax 这一项。

4. 蝉镜一直显示处理中

数字人视频是异步任务,短片也可能需要几十秒。让豆包继续查询同一个任务,不要反复提交新任务。超过平台正常等待时间后,再检查任务状态和额度。

5. 蝉镜返回 10400 或 AccessToken 验证失败

先确认 App ID 和 Secret Key 来自同一个应用。让蝉镜 Skill 重新获取一次 AccessToken,再继续查询或提交当前步骤。刷新 Token 后不要继续使用旧值,也不要让多个任务同时重复获取 Token。

6. MP4 能打开,但没有声音

文件存在不代表成片完整。让豆包检查媒体流,至少应该同时看到视频流和音频流。本次实测是 H.264 + AAC。只有视频流时,回到上传音频或合成参数这一步排查。

7. 字幕位置过高、遮脸或被裁切

这类问题出在模板和画面布局上,API Key 不用动。先确认分辨率和方向,再调整字幕安全区、字号和数字人位置。

8. 豆包反复分析,却迟迟不执行

把任务拆短,并使用确定句式。MiniMax 这一步迟迟没有执行时,直接复制下面这段。

请停止继续规划,当前只执行 MiniMax 语音生成这一步。

输入文案读取 output/04-final-script.txt,使用已经通过单测的克隆音色、speech-2.8-turbo 和 1.0 语速,输出到 output/05-final-voice.mp3。不要改写文案,不调用蝉镜,也不要创建其他文件。

如果输出文件已存在,停止并报告;如果调用失败,保留错误摘要并停止,不要自动更换模型、音色或平台。命令开始运行后再报告进度,完成后只报告文件路径、时长和大小。

豆包写出计划以后,任务还没完成。文件落盘、能打开并通过验收,这一步才算结束。

九、小白最适合的升级路线

第一条视频跑通后,也不要马上批量生成。按下面五级升级,哪里出问题都容易定位。

  1. 固定短句,反复测试同一个音色;

  2. 固定音频,比较不同数字人或基础、高质模型;

  3. 加入文案改写,但每次先由人确认最终稿;

  4. 把链接提取、改写、TTS、数字人串成单条稳定任务;

  5. 单条任务稳定后,再做批量选题、批量口播和定时执行。

每升一级都保留三个习惯。

  • 中间文件按顺序编号;

  • 失败时只重试失败环节;

  • 豆包报告完成后,人再打开最终文件验收。

第一条十秒短片跑通以后,先把这六个编号文件留好。下一次换文案或人物时,哪一步出错就回到对应文件继续,不用整条任务从头再来。

广告 广告
博主关闭了所有页面的评论