先从云端 API 生成数字人说起
这篇文章想分享一件我刚刚跑通的事。把几家云端服务的 API 接进豆包以后,给它一条短视频链接、一份自己的音色和一个训练好的数字人形象,豆包就能继续生成文案、音频和数字人视频,最后把成片保存到指定文件夹。
今天我会从豆包的角度,把这套做法完整写下来。智凌 API 用来提取文案,MiniMax 负责克隆声音和生成音频,蝉镜负责让数字人开口。豆包负责调用这些接口、整理中间文件,并检查每一步有没有真的完成。
四个平台在整套流程里的分工如下。
这套流程最容易卡在平台之间的衔接。文案、音频和数字人视频分散在三家服务里,任何一个接口的凭证或参数填错,完整任务都会停在中途。为了方便定位问题,先注册三个平台、拿到各自凭证,再准备数字人和音色。随后分别测试链接转文案、文字转声音和音频驱动数字人,三项都通过以后,再让豆包生成完整成片。
实际操作按下面这条顺序走。
平台准备 → 凭证准备 → 素材准备 → 三项单测 → 完整成片 → 人工验收
我这次最终跑出了一条 10.24 秒、1080×1920 的竖屏数字人视频。整条任务都由豆包执行,真实 API Key 没有出现在提示词、文章、Skill 文件和结果目录里。后文用到的耗时、文件大小和报错,也都来自这次实测。

一、先看懂整条数字人流水线
1. 三个平台分别负责什么
把数字人想成一个真人主播,会更容易理解这三套服务的分工。
智凌负责“找稿子”。你把公开短视频的分享链接交给它,它返回标题、字幕或口播文字。这里拿到的只是原始材料,不等于可以直接发布的新文案。
MiniMax 负责“说话”。你先创建一个克隆音色,再把确认后的口播稿提交给 TTS 接口,它会生成 MP3 音频。
蝉镜负责“出镜”。你先创建并训练自己的数字人形象,再把 MP3 上传给它,平台会让数字人的嘴型、表情和动作跟随音频,最后返回 MP4。
豆包负责把三家平台接起来。它读取链接、调用 Skill、保存中间文件,碰到异步任务就继续等待,任务完成后再下载成片。每一步是否成功,按提示词里的验收条件判断。
2. 开始前需要准备什么
正式操作前,先把这些材料准备齐。
一个可公开访问的短视频分享链接;
一段用于克隆声音的干净录音;
一段用于训练数字人的真人视频;
智凌 API Key;
MiniMax API Key 和 Voice ID;
蝉镜 App ID、Secret Key 和数字人 ID;
一个专门保存本次产物的文件夹;
豆包客户端和一个独立的“豆包数字人”项目。
录音和训练视频尽量一次准备好。录音要减少背景音乐、回声和他人说话;训练视频要保持正脸、光线稳定、画面连续。素材质量不好,后面再好的模型也只能放大问题。
3. 平台网址速查
实际用到的网站都在下面。先分别注册并登录,再回来继续操作。
需要核对接口参数时,可直接查看 MiniMax 音色快速复刻、MiniMax 同步语音合成、蝉镜获取 AccessToken 和 蝉镜合成数字人视频。平台页面后续可能改版;如果链接打开后要求登录,登录后按照本文给出的菜单名称查找即可。
4. 安全和授权边界
API Key 相当于第三方平台的付费通行证。不要把它贴进普通对话或共享项目,也不要写进 Skill 的 SKILL.md、脚本、文章或 Git 仓库。
本教程只记录配置项名称,不记录真实值。
ZHILING_API_KEY
MINIMAX_API_KEY
MINIMAX_VOICE_ID
CHANJING_APP_ID
CHANJING_SECRET_KEY
CHANJING_PERSON_ID
本教程的主流程从三个平台分别取得凭证,再把真实值填入豆包项目的安全配置。
保存后只让豆包检查配置是否存在、格式是否合理,不要让它打印完整内容。普通对话里只写变量名,真实值只出现在安全配置区域。
三项测试会调用真实接口,数字人生成通常还会产生少量费用。第一次保持“按需确认”,看到调用外部 API、上传音频或开始视频合成时,先确认范围再继续。
二、准备智凌,先拿到短视频文案
1. 注册并进入控制台
打开智凌 API 用户控制台,按照页面提供的方式注册并登录。进入控制台后,先找到“产品列表”,确认账号下已经出现短视频解析、文案提取或语音转文字相关产品。
界面名称以后可能调整,判断方法很简单。这个接口要能接收短视频分享链接,并返回可读的文字结果。

2. 找到文案提取接口
点进文案提取产品,先看接口说明,不要马上复制示例代码。文档里先找四件事。
请求地址是什么;
请求方法是 GET 还是 POST;
分享链接放在哪个参数中;
任务是同步返回还是提交后继续轮询。
短视频文案提取经常走异步流程。第一次请求只返回任务编号,几秒后还要查询任务状态。豆包 Skill 会负责轮询,你不用手动刷新。接口显示“提交成功”时,文案通常还没有生成。

3. 获取并安全保存 API Key
回到控制台,打开“密钥管理”。如果账号还没有密钥,点击创建;如果已经有可用密钥,不要重复创建。
复制以后立刻放进安全配置,并记录变量名为 ZHILING_API_KEY。文章、截图和豆包回复里都不应该出现完整值。部分平台只在创建时展示一次完整密钥,关闭弹窗前先确认已经安全保存。

4. 记下接口规则,暂时不要调用
准备一条公开的短视频分享链接,第一次不要选十几分钟的长视频。此时只确认产品已经开通、接口可以接收分享链接,并记下任务查询方式。
真正的接口测试放在第六章。等豆包里的 Skill、凭证和输出目录全部准备好,再执行一次最小测试。这样遇到错误时,能够判断问题来自平台接口还是豆包配置。
三、准备 MiniMax,克隆并调用自己的声音
1. 注册时先确认站点和账号
进入 MiniMax 开放平台,按页面方式注册。国内账号尽量使用国内开放平台,不要把不同站点创建的 Key、音色和账户余额混在一起。
登录后先检查控制台里是否能看到“语音”“声音克隆”“我的音色”和“API 密钥”。声音克隆需要完成个人或企业实名认证。如果某个入口没有显示,先检查认证状态、账号权限和产品是否已开通。
2. 准备录音并创建克隆音色
进入“声音克隆”,上传或直接录制一段干净的人声。按照 MiniMax 音色快速复刻文档 当前的接口要求,克隆音频应为 MP3、M4A 或 WAV,时长保持在 10 秒至 5 分钟之间,文件不要超过 20MB。录音时再注意下面这些事。
只留一个人说话。
不放背景音乐。
避免明显喷麦、回声和电流声。
使用正常语速和自然情绪。
内容尽量连续,少用碎片拼接。
提交前给音色起一个一眼能认出的名字,例如“我的日常口播”。平台完成处理后,先在网页里试听,确认没有明显机械音、吞字或音量突变。

3. 找到并记录 Voice ID
打开“我的音色”,找到刚才创建并试听通过的音色。音色名称方便人确认,API 调用认的是 Voice ID。
把 Voice ID 保存到 MINIMAX_VOICE_ID,不要直接写入 Skill 正文。后续如果有多个音色,豆包应按名称或你明确指定的顺序选择,不能每次随机取一个。

4. 创建并保存 API Key
进入“API 密钥”,点击创建新密钥,填写一个能识别用途的名称,例如“doubao-digital-human”。创建后复制到安全配置中的 MINIMAX_API_KEY。
Key 和 Voice ID 的作用不同。Key 负责鉴权,Voice ID 负责指定声音。出现 401、无权限或找不到音色时,先检查账号和站点,再确认这两个字段是否属于同一个 MiniMax 账户。

5. 试听音色,暂时不要调用 API
先在 MiniMax 网页里试听刚刚创建的音色,确认没有明显机械音、吞字和音量突变。API 单项测试统一放到第六章,届时只生成三到五秒的短句。
四、准备蝉镜,创建自己的数字人形象
1. 注册并进入 API 接入页面
打开蝉镜 API 接入页并登录,进入“API 接入”或开放平台页面。豆包要从这个入口调用蝉镜,普通网页成片编辑器接不到这次任务。
先检查账户是否已开通 API、是否还有可用额度,再确认能看到 App ID、Secret Key、数字人列表和任务查询等入口。平台套餐、计费和可用模型会变化,实际费用以生成前的页面提示为准。

2. 创建 API 凭证并确认鉴权方式
在 API 接入页面找到密钥区域。这里会用到两项凭证。
两项必须来自同一个应用。复制后放入安全配置,不要截图完整密钥,也不要让豆包在报错时把请求头全部打印出来。
按照蝉镜获取 AccessToken 文档,业务接口不会直接使用这两项凭证。Skill 需要先用 App ID 和 Secret Key 请求 AccessToken,再把 Token 放进后续接口的请求头。AccessToken 默认有效一天,重新获取以后,旧 Token 会立即失效。因此不要把 AccessToken 当作长期配置保存,也不要让多个任务同时反复刷新。

3. 创建自己的数字人
进入“数字人”或“我的数字人”,点击创建。平台提供“视频生数字人”和“文生数字人”等方式;想让成片使用自己的真人形象,就选择“视频生数字人”,上传自己有权使用的真人素材。

训练视频尽量满足下面这些条件。
竖屏成片就用竖屏素材,主体不要太小;
人脸完整、无遮挡,视线尽量看向镜头;
光线和背景保持稳定;
不要频繁切镜头、转身或突然离开画面;
嘴部要清晰可见,避免手、口罩或杯子遮挡;
只上传自己拥有授权的人像和声音。
提交后等待平台训练完成。状态还是处理中时,不要继续调用视频接口。
4. 找到数字人 ID
训练完成后打开数字人详情,确认预览图、名称和造型都正确,再记录它的数字人 ID,并保存为 CHANJING_PERSON_ID。
这里也要分清名称和 ID。名称方便人确认,API 通常依赖 ID。为了避免泄露或误用,本教程截图和结果只展示名称,不展示完整 ID。

5. 记下音频驱动要求,稍后统一测试
蝉镜的云端接口不能直接读取电脑上的本地路径。第六章开始测试时,Skill 要先把 MiniMax 生成的 MP3 上传到蝉镜文件管理,等待文件可用,再把返回的文件 ID 交给数字人视频接口。
按照蝉镜合成数字人视频文档,如果希望视频带字幕,上传音频可以使用 8000Hz 或 16000Hz 的单声道文件。本教程统一使用 16000Hz、单声道 MP3。测试时先选基础模型,画面使用 1080×1920、1080p,音频只做三到五秒。数字人视频是异步任务,提交成功以后还要继续查询任务状态并下载结果。
五、在豆包中建立数字人项目
1. 新建独立项目和结果目录
打开豆包,在左侧新建一个“豆包数字人”项目,再为第一次练习准备单独的输出文件夹。原始录音、训练视频、测试文件和正式成片不要混在桌面或下载目录根部。
建议给每个中间结果编号。
01-zhiling-copy.txt
02-minimax-voice.mp3
03-chanjing-test.mp4
04-final-script.txt
05-final-voice.mp3
06-final-digital-human.mp4
顺序编号方便排错。看一眼最后生成的文件名,就知道任务停在哪一步。
2. 让豆包准备三个独立 Skill
这里不用提前下载压缩包,也不用自己编写复杂代码。让豆包先读取三个平台的接口说明,再把三个 API 分别做成只管一件事的 Skill。接口地址和参数以平台文档为准,遇到没有写清的字段就停下来,不让豆包凭经验猜。
三个 Skill 用同一套规则。凭证只从安全配置读取,不写进 Skill。输入和输出路径要明确,异步任务只轮询同一个任务编号。接口返回成功以后还要检查文件,失败时保留错误并停在当前步骤。
复制下面的提示词,豆包会按照这套思路在当前项目中创建三个 Skill。
请在当前“豆包数字人”项目中创建三个彼此独立的本地 Skill:
1. 智凌文案提取:接收公开视频分享链接,调用智凌接口,输出纯文本 TXT。
2. MiniMax 文字转语音:接收文字、模型和语速,调用指定克隆音色,输出 MP3。
3. 蝉镜数字人:接收本地 MP3 和视频规格,用指定数字人生成并下载 MP4。
共同要求:
- 先读取三个平台当前的接口文档,再编写调用逻辑;接口地址、请求参数或签名规则不明确时停止并说明,不得猜测。
- 凭证只能从安全配置读取,变量名分别为 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID。
- 不得把任何凭证或完整 ID 写入 Skill、脚本、日志和回复。
- 每个 Skill 只负责一种能力,并写清输入参数、输出路径、接口失败信息和验收方法。
- 异步任务必须保存任务编号并轮询同一个任务,禁止重复提交。
- MiniMax 输出 MP3 时允许指定采样率和声道,本教程默认使用 16000Hz、单声道。
- 蝉镜 Skill 先用 App ID 和 Secret Key 获取 AccessToken。Token 过期或返回 10400 时只刷新一次,刷新后继续原任务,不把 Token 长期写入配置。
- 蝉镜 Skill 接收本地 MP3 时,先上传文件并等待文件状态可用,再提交数字人视频任务。使用蝉镜主站创建的数字人时设置 source=1。
- 输出文件已存在时不要直接覆盖,先说明情况;API 调用失败时停止,不要自动改用其他平台。
创建完成后只做静态检查,不调用任何付费 API。最后用表格报告三个 Skill 的名称、输入、输出、所需配置和检查结果。
3. 把三个平台的 API 凭证提供给豆包
完成前面三个平台的注册和配置后,你手里应该已经有六项信息。智凌提供 API Key,MiniMax 提供 API Key 和 Voice ID,蝉镜提供 App ID、Secret Key 和数字人 ID。它们都要从你自己的平台账号中复制,不能使用文章示例或别人的凭证。
先确认当前豆包项目只有自己可以访问,然后打开三个 Skill 的配置区域,把六项真实值分别填入对应字段。真实凭证只在安全配置区域填写,不要粘贴到下面的提示词、普通对话、文章或截图中。
六项配置填完以后,再复制下面的检查提示词。
请只检查当前“豆包数字人”项目中的安全配置,本轮不要调用任何外部或付费 API。
依次检查 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID 是否存在且非空。
不得读取、展示、复述或截断展示任何真实值。不要修改配置,也不要自动创建或替换凭证。发现缺项或格式明显异常时,只报告变量名和问题。
完成后用表格报告六项配置是否就绪,以及是否满足后续单项测试条件。
配置完成后,关闭仍然显示完整密钥的页面,不要把填写过程截图发到公开平台。后面的单项测试只引用变量名,不再重复粘贴真实值。

4. 先让豆包检查环境
正式调用前,让豆包完成一次不计费的预检。下面这段可以直接复制使用。
请对当前“豆包数字人”项目执行一次只读预检,本轮禁止调用任何外部或付费 API。
依次检查:
1. 三个 Skill 是否存在并可以加载;
2. 六项安全配置是否存在,但不要读取或展示真实值;
3. 所需运行依赖是否可用;
4. output 目录是否存在且可写;
5. output/01-zhiling-copy.txt、output/02-minimax-voice.mp3 和 output/03-chanjing-test.mp4 是否已有同名文件,避免误覆盖。
请用表格输出“检查项、结果、待处理问题”。如果有任意一项不通过,明确指出问题并停止;全部通过时只回复“可以开始三项单测”。
只有三项 Skill、配置和输出目录都显示正常,才进入下一步。
六、逐项测试三个能力
第一次不要把链接、改写、TTS、数字人一次全交出去。完整任务出了错,你很难判断是链接无效、音色失效、密钥错误,还是蝉镜仍在排队。一次只测一个输入和一个输出,排查起来最快。
测试一,链接能不能变成干净文案
输入是一条公开分享链接,输出是 output/01-zhiling-copy.txt。复制下面的提示词,只替换分享链接。
请执行一次“智凌文案提取”单项测试。
输入:
- 公开视频分享链接:【把分享链接粘贴到这里】
- 输出文件:output/01-zhiling-copy.txt
执行要求:
1. 使用安全配置中的 ZHILING_API_KEY 调用智凌文案提取接口。
2. 只保留视频中的原始口播或字幕正文,不改写、不总结,也不要保存整段接口 JSON。
3. 如果接口返回任务编号,请持续查询同一个任务,直到成功或明确失败。
4. 如果遇到临时网络错误,间隔数秒后最多自动重试一次。再次失败时停止,不要继续创建任务。
5. 不得在回复、日志或输出文件中显示 API Key。
完成后检查输出文件存在且非空,只报告:执行结果、正文字符数、耗时和文件路径。
验收时检查文件非空、内容可读,也没有把接口返回的 JSON 当成正文。我第一次和第二次独立测试都遇到 Connection reset by peer。排除本机代理影响后,我手动发起了第三次测试,5.4 秒后成功拿到 363 个字符,文件大小 955 字节。这里的第三次是人工排查后的新测试,不属于提示词允许的一次自动重试。
如果出现临时网络重置,先确认服务可达,再只处理智凌这一项,不要跟着重跑 MiniMax 和蝉镜。
测试二,文案能不能变成可用声音
输入是一句固定短文案,输出是 output/02-minimax-voice.mp3。下面这段可以直接复制。
请执行一次“MiniMax 文字转语音”单项测试。
输入:
- 测试文案:你好,这是我的第一条数字人语音测试。
- 输出文件:output/02-minimax-voice.mp3
执行要求:
1. 从安全配置读取 MINIMAX_API_KEY 和 MINIMAX_VOICE_ID,使用指定的克隆音色。
2. 模型使用 speech-2.8-turbo,语速设为 1.0,输出 16000Hz、单声道 MP3。
3. 原样朗读测试文案,不扩写、不添加开场白,只调用一次语音接口。
4. 不得在回复、日志或输出文件中显示 API Key 和完整 Voice ID。
完成后确认 MP3 可以播放、时长大于 2 秒且没有明显截断,只报告:执行结果、音频时长、文件大小、耗时和文件路径。
验收时亲自播放,确认音色正确、声音完整、没有读错关键字。本次实测音频 4.05 秒、67,956 字节,约 1.4 秒生成完成。
短句通过以后再测试长文案。因为长音频更贵,也更容易暴露断句、英文缩写和多音字问题。
测试三,音频能不能驱动数字人
输入是第二项已经听过的 MP3,输出是 output/03-chanjing-test.mp4。下面的提示词适用于在蝉镜主站创建的个人数字人。
请执行一次“蝉镜音频驱动数字人”单项测试。
输入:
- 驱动音频:output/02-minimax-voice.mp3
- 输出文件:output/03-chanjing-test.mp4
执行要求:
1. 从安全配置读取 CHANJING_APP_ID、CHANJING_SECRET_KEY 和 CHANJING_PERSON_ID。
2. 先用 App ID 和 Secret Key 获取 AccessToken,不展示或长期保存 Token。返回 10400 时只刷新一次。
3. 把本地 MP3 上传到蝉镜文件管理,等待文件状态可用,再使用返回的文件 ID 创建视频。
4. 使用 CHANJING_PERSON_ID 指定的数字人。该数字人来自蝉镜主站,因此 source 设为 1。
5. 选择基础模型,生成 1080×1920、1080p 的竖屏视频,保留默认字幕处理。
6. 任务提交后持续查询同一个任务编号,完成后立即下载 MP4。等待期间不要重复提交任务。
7. 不得在回复、日志或输出文件中显示 App ID、Secret Key、AccessToken 和完整数字人 ID。
完成后确认视频可以打开,画面为 1080×1920,同时包含视频流和音频流,视频时长与输入音频基本一致。只报告:执行结果、视频时长、文件大小、耗时和文件路径。
文件扩展名只能说明它叫 MP4,验收时还要逐项检查下面这些内容。
能不能正常打开;
画面是不是 1080×1920;
有没有声音;
时长是否接近输入音频;
人脸、嘴部和字幕是否正常。
我这次生成的测试片长 4.04 秒,文件大小 3,055,955 字节,前后等了约 42.6 秒。豆包等到任务完成后才下载文件,没有把“提交成功”当成最终结果。
我这次跑出的数据放在下面。

三个结果文件都能打开,并且分别通过验收,素材准备才算完成。
七、用豆包生成第一条完整数字人视频
1. 把智凌结果整理成正式口播稿
三项测试通过以后,先把 output/01-zhiling-copy.txt 整理成自己的正式口播。智凌提取到的是原始材料,豆包可以帮你压缩和改写,最终版本仍然要由人确认。
第一条完整成片控制在十秒左右,口播保留 45 至 65 个汉字即可。复制下面的提示词,先让豆包给出候选稿,不调用语音和数字人接口。
请读取 output/01-zhiling-copy.txt,把它整理成一段适合约 10 秒数字人口播的候选稿。
改写要求:
1. 只使用原文中能够确认的信息,不补写未经核实的数据、经历和效果。
2. 保留一个主要信息,控制在 45 至 65 个汉字,使用自然口语和完整句子。
3. 不连续照搬原文中的长句,重新组织表达,删除账号名、引流话术和无关开场。
4. 本轮只在回复中给出一版候选稿,不保存文件,也不调用智凌、MiniMax 或蝉镜 API。
最后报告候选稿字数,并等待我确认。
读一遍候选稿,确认事实、语气和长度都合适以后,再复制下面这句。
确认使用上一版候选稿。请原样保存为 output/04-final-script.txt,不再改写,不调用任何外部 API。保存后只报告字符数和文件路径。
为了单独验证接口衔接,我这次使用了一段 58 字的自写测试稿,同样保存为 output/04-final-script.txt。
我现在会用 AI 工具整理文案、生成声音,再驱动数字人完成一条完整视频,整个流程简单又高效,就算第一次操作也能很快上手。
output/04-final-script.txt 一旦确认,后续重试只处理失败的音频或视频步骤,不再顺手改稿。
2. 把完整任务一次写清
确认三个单项测试都通过后,复制下面的提示词即可开始。它会使用安全配置中的音色和数字人,不用再填写真实 Key 或 ID。执行后会产生实际 API 调用和少量费用。
请使用当前项目中已经通过单项测试的 MiniMax 和蝉镜 Skill,生成一条约 10 秒的正式数字人成片。
固定参数:
- 输出目录:output
- 口播文案:读取 output/04-final-script.txt 中已经人工确认的完整内容
- MiniMax 模型:speech-2.8-turbo
- 语速:1.0
- 音频规格:16000Hz、单声道 MP3
- 音色:使用 MINIMAX_VOICE_ID 指定且已通过单测的克隆音色
- 数字人:使用 CHANJING_PERSON_ID 指定且已通过单测的数字人
- 视频规格:基础模型、竖屏 1080×1920、1080p
执行顺序:
1. 先确认 output/04-final-script.txt 存在且非空,不修改文件内容。
2. 检查 output/05-final-voice.mp3 和 output/06-final-digital-human.mp4 是否已存在;任一文件存在时停止并报告,不要覆盖。
3. 调用 MiniMax 一次,生成 output/05-final-voice.mp3;生成后确认文件可播放且内容完整。
4. 只有音频验收通过后,才调用蝉镜一次,生成 output/06-final-digital-human.mp4。
5. 蝉镜 Skill 先上传 MP3,再使用有效 AccessToken 提交视频任务。保存任务编号并持续查询同一个任务,禁止因等待而重复提交。
安全与失败处理:
- 凭证只从安全配置读取,不修改配置,不显示 API Key、Voice ID、App ID 或数字人 ID。
- 任一步失败时立即停止,保留已经成功的文件,并说明失败步骤和原始错误摘要。
- 只允许对发生临时网络错误的失败步骤自动重试一次;不得重跑已成功步骤。
最终验收:
- 确认三个正式文件都存在;
- 报告口播字符数、音频时长、视频时长、文件大小和总耗时;
- 确认视频为 1080×1920,并同时包含 H.264 视频流和 AAC 音频流;
- 最后只输出结果表和三个文件路径,不再生成其他版本。
3. 为什么一定要写“失败时只重试失败环节”
一条流水线里,文案几乎不花钱,语音费用较低,数字人视频通常更慢、消耗也更明显。
如果只在最后下载文件时失败,却把前面的步骤全部重跑一遍,就会多出重复音频、重复视频和额外费用。提示词要让豆包先找到失败步骤,只重跑这一段。
4. 打开结果文件夹验收
本次豆包最终生成六个按顺序编号的文件,测试产物和正式产物都保留在同一个独立文件夹中。

最终验收结果放在下面。
打开视频以后,还要人工看一遍人物是否正确、嘴型是否同步、字幕是否完整、开头和结尾有没有被截断。
八、常见问题与排查顺序
1. 智凌返回连接重置或超时
先检查公开链接能否在浏览器打开,再检查智凌服务是否可达。服务可达、凭证也存在时,只做一次带间隔的重试。不要因为智凌失败就重新生成声音和视频。
2. MiniMax 提示 401、无权限或找不到音色
先看 API Key 是否来自当前站点,再确认 Voice ID 属于同一个账号。接着检查音色是否仍然可用,账户有没有调用权限。不要把完整 Key 放进报错截图。
3. 声音生成了,但不是自己的音色
说明豆包选到了系统音色或另一个克隆音色。回到“我的音色”确认名称,在安全配置中指定正确 Voice ID,再只重跑 MiniMax 这一项。
4. 蝉镜一直显示处理中
数字人视频是异步任务,短片也可能需要几十秒。让豆包继续查询同一个任务,不要反复提交新任务。超过平台正常等待时间后,再检查任务状态和额度。
5. 蝉镜返回 10400 或 AccessToken 验证失败
先确认 App ID 和 Secret Key 来自同一个应用。让蝉镜 Skill 重新获取一次 AccessToken,再继续查询或提交当前步骤。刷新 Token 后不要继续使用旧值,也不要让多个任务同时重复获取 Token。
6. MP4 能打开,但没有声音
文件存在不代表成片完整。让豆包检查媒体流,至少应该同时看到视频流和音频流。本次实测是 H.264 + AAC。只有视频流时,回到上传音频或合成参数这一步排查。
7. 字幕位置过高、遮脸或被裁切
这类问题出在模板和画面布局上,API Key 不用动。先确认分辨率和方向,再调整字幕安全区、字号和数字人位置。
8. 豆包反复分析,却迟迟不执行
把任务拆短,并使用确定句式。MiniMax 这一步迟迟没有执行时,直接复制下面这段。
请停止继续规划,当前只执行 MiniMax 语音生成这一步。
输入文案读取 output/04-final-script.txt,使用已经通过单测的克隆音色、speech-2.8-turbo 和 1.0 语速,输出到 output/05-final-voice.mp3。不要改写文案,不调用蝉镜,也不要创建其他文件。
如果输出文件已存在,停止并报告;如果调用失败,保留错误摘要并停止,不要自动更换模型、音色或平台。命令开始运行后再报告进度,完成后只报告文件路径、时长和大小。
豆包写出计划以后,任务还没完成。文件落盘、能打开并通过验收,这一步才算结束。
九、小白最适合的升级路线
第一条视频跑通后,也不要马上批量生成。按下面五级升级,哪里出问题都容易定位。
固定短句,反复测试同一个音色;
固定音频,比较不同数字人或基础、高质模型;
加入文案改写,但每次先由人确认最终稿;
把链接提取、改写、TTS、数字人串成单条稳定任务;
单条任务稳定后,再做批量选题、批量口播和定时执行。
每升一级都保留三个习惯。
中间文件按顺序编号;
失败时只重试失败环节;
豆包报告完成后,人再打开最终文件验收。
第一条十秒短片跑通以后,先把这六个编号文件留好。下一次换文案或人物时,哪一步出错就回到对应文件继续,不用整条任务从头再来。
