AI口播视频一键成片
介绍如何用1至6个视频和最多15张图片制作单款电商口播视频,配置AI文案、声音、字幕、封面与背景音乐并生成可预览成片。
这个功能是做什么的
AI口播视频一键成片 用来快速制作单款商品视频。你可以添加 1 至 6 个视频,也可以再添加最多 15 张图片,选择文案、声音、字幕、封面和背景音乐后,生成 1 条可以直接查看的成片。
它适合手机随拍、厂家视频、档口素材、直播间口播素材和单款试剪。你不需要先整理 Excel,也不需要准备批量记录表,选择本款素材和输出目录就能开始。
页面支持两种模式:
AI口播混剪:使用 AI 生成或手动填写的口播文案,添加配音、字幕、封面和背景音乐后生成视频。仅混剪+配背景音乐:不生成口播和字幕,只对画面进行混剪、去重并添加背景音乐。
如果你要按商品文件夹和表格一次处理很多款,请使用 AI批量智能混剪。
本页是单款试剪工具,视频在当前电脑本地处理,不提供云端剪辑开关。这样零散试剪不需要等待云端节点;如果电脑配置较低或需要一次处理多款,请使用 AI批量智能混剪 并保持默认的云端剪辑。
页面会自动检查当前电脑是否可以进行本地剪辑:
- 显示“已就绪”时,可以直接添加素材并生成成片。
- 显示“需要安装”时,点击“自动下载安装”,软件会自动完成下载和安装。
- 如果网络较慢,或已经从云店AI取得安装包,可以点击“使用已下载的安装包”,选择该文件后自动安装。
- 最低配置建议:4 核处理器、8GB 内存;剪辑时尽量关闭大型软件。
适合哪些使用场景
这个功能适合:
- 先为一个商品做口播视频样片,再决定是否批量生产。
- 把厂家或档口提供的多个短视频合成一条商品视频。
- 用商品图片穿插补充画面,丰富单一视频素材。
- 给已有视频增加口播、字幕、封面和背景音乐。
- 不需要口播,只想做视频混剪、画面差异处理和配乐。
- 测试不同文案方向、音色、画面比例和去重强度。
本页一次只生成 1 条视频,不会把同一条任务复制成多条。需要一款多方向或多款批量生成时,请使用批量剪辑页面。
使用前要准备什么
1. 至少一个视频
视频是必选素材。你可以一次添加 1 至 6 个视频。
只添加一个视频也可以剪辑。系统仍可进行切片、顺序调整、镜像、颜色微调、缩放微调、字幕、封面和配乐等处理。
添加多个视频时,系统会把它们作为本次成片的共同素材,不需要你先手动拼接。
2. 可选的商品图片
图片不是必选。需要补充商品细节、模特图、封面图或穿插画面时,可以添加最多 15 张图片。
添加图片后,可以选择:
随机穿插:图片参与画面混剪。仅封面:第一张图片放在开头,其余画面以视频为主。不参与:保留已选图片,但本次成片不使用。
3. 输出目录
输出目录用于保存本次成片以及相关音频、字幕和结果记录。
建议每次测试使用单独目录,避免和原始素材混在一起。软件不会删除你的原视频和原图片。
4. 口播文案
选择 AI口播混剪 时,必须有口播文案才能生成视频。
你可以:
- 点击
生成口播文案,让系统根据素材和款式关键词生成。 - 直接在口播文案框里填写或粘贴自己的文案。
- AI 生成后继续手动修改,再用修改后的文案成片。
5. 支持的文件格式
- 视频:
mp4、mov、m4v、avi、mkv、webm、flv。 - 图片:
jpg、jpeg、png、webp、bmp、jfif。 - 本地背景音乐:
mp3、wav、m4a、aac、flac、ogg。
文件后缀符合要求,不代表文件内容一定完整。打不开、已损坏、被其它软件占用或只有后缀但没有真实媒体内容的文件,仍可能无法使用。建议在生成前先确认素材能在当前电脑正常播放或打开。
页面怎么使用
第一步:添加素材并选择保存位置
点击 添加视频 选择本次要使用的视频。需要图片时,再点击 添加图片。
素材会显示在已选素材区。你可以点击预览,也可以移除选错的文件。素材数量达到上限后,需要先移除不需要的文件,才能继续添加。
然后选择输出目录。
如果以后经常使用同一套剪辑规则,可以使用设置模板:
保存模板:覆盖当前选中的设置模板。另存为模板:把当前规则保存成新的设置模板。
设置模板只保存剪辑规则,不会保存本次视频、图片、输出目录或上一次生成的成片。
已经保存的模板可以到 设置中心 -> 设置模板管理 统一查看和删除;“默认模板”不能删除,只能恢复系统默认值。
第二步:选择成片方案
剪辑模式
AI口播混剪 适合需要商品讲解、带货口播、字幕和封面的成片。
仅混剪+配背景音乐 适合已有画面质量较好,只需要混剪、去重和配乐的素材。切换到这个模式后,口播文案、配音和字幕设置会自动隐藏,因为这些内容不会参与本次任务。
口播文案模板
口播模式下可以选择文案模板。模板决定文案的表达风格和可选方向,例如商品介绍、种草、试穿或场景导购。
如果当前商品类目或文案风格不确定,建议先选默认模板生成一条,确认内容符合商品事实后再成片。
画面比例
页面提供:
3:4 主图视频:适合淘宝主图视频等商品展示场景。9:16 竖版视频:适合抖音等竖屏短视频场景。1:1 方版视频:适合需要方形画面的展示场景。
多视频处理
只添加一个视频时,页面固定使用第一个视频。添加多个视频时,可以选择:
只用第1个视频:只剪第一个,默认使用这个选项。多视频合并:让本款的多个视频共同参加混剪。
这与稳定老脚本的处理方式一致,并不是添加多个视频后强制全部合并。
第三步:生成文案并选择配音
这一步只在 AI口播混剪 模式显示。
款式关键词
款式关键词 是可选项,可以填写款式名、商品编码或主要卖点,帮助系统理解商品。它不会直接被当作完整口播正文。
口播方向
可以选择随机一个方向,也可以指定一个方向。单款页每次只生成一个方向。
点击 生成口播文案 后,系统会生成新的文案并自动填入口播文案框。已有文案不会阻止重新生成。生成后请核对商品材质、版型、功能和卖点是否真实,再决定是否使用。
生成口播文案时,系统优先使用第 1 张商品图片作为参考;没有图片时,会从第 1 个视频中取一个画面作为参考。参考画面、款式关键词和当前文案要求会发送到在线文案生成服务。请不要在素材或关键词中放入账号密码、验证码、订单隐私或无授权的个人资料。
字数上限
字数越多,配音和成片通常越长。页面允许设置口播文案字数上限,适合控制视频节奏。
配音和音色
页面会在登录后同步管理员设置的女声和男声,新任务默认选择推荐的“小何 2.0”。如果该声音尚未配置完成,页面会明确显示“暂不可用”并阻止启动,不会偷偷换成其它声音。选择可用音色后,可以按该音色的建议范围调整语速。
旧设置中的常用音色会自动迁移;无法识别的旧音色会要求重新选择。所选音色不可用时,本条任务会明确失败,不会自动换成其它声音。若声音风格必须严格一致,建议先用一条短视频检查成片。
还可以调整:
语速:控制说话快慢。人声音量:控制口播声音大小。口播延迟:控制口播和字幕在视频开始后多久出现。结束缓冲:控制口播结束后画面继续保留多久。
不同音色适合的语速可能不同。新手建议先使用音色的建议值,生成小样后再微调。
第四步:微调画面与声音
切片段数和去重强度
切片段数越多,画面顺序和节奏变化通常越明显,但处理时间也可能增加。
去重强度提供 轻、中、强 和 自定义:
轻:尽量保留原视频节奏,只做较少变化。中:兼顾画面自然度和差异,适合大多数商品视频。强:增加镜像、颜色和缩放变化,适合需要更明显画面差异的场景。自定义:当你手动修改打乱、镜像、颜色或缩放等细项时使用。
去重处理只能帮助画面产生差异,不代表平台一定判定为原创,也不能保证流量或审核结果。
图片展示时长
图片参与混剪时,可以设置每张图片在画面中停留多久。图片过多或停留过长,可能让视频节奏变慢,建议先用默认值试跑。
背景音乐
开启 BGM 后,可以使用系统音乐分类,也可以在更多设置中改用本地音乐文件或本地音乐文件夹。
本地背景音乐有两种方式:
- 选择一个指定音频文件。
- 选择一个文件夹,由系统从里面取可用音频。
如果指定的文件不存在、格式不支持,或文件夹里没有可读音频,任务可能继续完成,但成片不带背景音乐。对音乐有硬性要求时,请先确认音频能正常播放,再生成小样。
口播模式下建议开启 人声避让。口播出现时,系统会压低背景音乐,减少音乐盖住人声的情况。
封面和字幕
口播模式可以分别开启或关闭封面、字幕。
展开更多设置后,可以调整:
- 最小切片时长。
- 颜色波动和缩放波动。
- 封面时长。
- 字幕单行字数、字号和底距。
- BGM 音量。
- 本地 BGM 文件或文件夹。
- 封面字体和字幕字体。
- 智能打乱、镜像、倒放和慢放。
低频设置不确定时建议保持默认。先用默认规则生成一条,再针对成片效果调整。
怎么开始生成
页面底部会根据当前模式显示:
生成口播视频生成配乐混剪视频
点击生成按钮时,页面会先检查:
- 已添加至少一个视频。
- 已选择输出目录。
- 口播模式下已经有口播文案。
如果有缺项,页面会一次告诉你还缺什么、标出对应位置并定位第一项,任务不会进入任务中心。全部填写后,任务才会进入任务中心。长视频、多个素材、字幕、封面和较强去重都会增加处理时间,请不要因为几秒没有成片就重复点击。
结果在哪里看
任务成功后,右侧 成片预览 会优先显示本次生成的视频。你可以点击画面播放,也可以点击 打开成片 在电脑中打开结果。
你还可以在 任务中心 查看:
- 当前处理到哪一步。
- 任务是否成功。
- 失败原因和处理建议。
- 本次输出位置。
- 之前运行过的任务。
如果任务显示成功但页面没有立即更新,可以先刷新任务状态,再检查输出目录和任务中心里的结果路径。
常见问题
1. 为什么点击生成后没有开始
先检查:
- 是否至少添加了一个视频。
- 是否选择了输出目录。
- 口播模式下,口播文案是否为空。
图片不能代替必选视频。只添加图片时,不能开始成片。
页面会保留已经填写的其它设置,并定位第一个缺项;补齐后再次点击即可。
2. 点击生成口播文案后没有内容
常见原因包括:
- 在线生成服务额度不足或服务暂时不可用。
- 本地服务没有连接。
- 素材或款式关键词不足,暂时无法生成合适内容。
- 网络临时异常。
可以稍后重试,也可以先手动填写文案继续剪辑。持续失败时,请把任务时间和提示信息提供给客服,不要发送账号密码或私密凭证。
3. 文案生成了,但生成视频失败
检查:
- 视频文件是否仍然存在、是否能正常播放。
- 输出目录是否存在并且可以写入。
- 当前选择的配音音色是否可用。
- 本机视频处理环境是否正常。
- 本地字体或背景音乐文件是否被移动、占用或损坏。
优先打开任务中心查看失败步骤。云店Agent也可以根据任务记录帮你解释。
4. 视频有画面但没有口播声音
确认当前模式是 AI口播混剪,口播文案不为空,并检查配音音色和人声音量。
如果任务中心提示所选音色暂时不可用,可以重新选择页面中当前可用的音色或稍后再试;系统不会自动改用其它声音。
5. 背景音乐没有出现
确认 BGM 已开启。
使用系统音乐时,请确认已选择音乐分类。使用本地音乐时,请确认音频文件或文件夹仍然存在,并且里面包含可读取的音频。音乐不可用时,任务可能仍会完成,但成片不会带背景音乐。
6. 背景音乐盖住了人声
可以:
- 降低 BGM 音量。
- 开启人声避让。
- 提高人声音量。
- 换一首更轻的背景音乐。
7. 为什么图片没有出现在视频里
检查 图片参与混剪:
- 选择
随机穿插,图片会参与画面混剪。 - 选择
仅封面,只会把第一张图片用于开头画面。 - 选择
不参与,本次视频不会使用图片。
8. 为什么选择仅配乐后,口播设置消失了
这是正常的。仅混剪+配背景音乐 不生成口播、配音和口播字幕,所以页面会隐藏无效设置,避免误操作。
9. 成片处理很慢是不是卡住了
视频剪辑需要读取素材、切片、转码、合成音频、字幕和封面,通常比表格任务耗时更长。
处理时间会受到视频时长、分辨率、素材数量、字幕、封面、倒放、慢放和电脑性能影响。先在任务中心确认仍有运行播报,再判断是否失败。
10. 原素材会不会被删除
不会。本功能读取你选择的视频、图片、音乐和字体,成片写入输出目录,不会删除原始文件。
云店Agent可以怎么帮你
你可以这样问云店Agent:
我只想把一个商品视频混剪并配背景音乐,应该选哪个模式?帮我看看这次口播视频为什么失败了。为什么生成按钮现在不能点?我想做淘宝主图视频,画面比例应该怎么选?背景音乐盖住口播了,应该调哪些设置?云店Agent会优先参考本说明和当前任务记录。涉及生成文案、生成视频或写入输出目录时,会按当前账号权限和确认规则执行。
推荐的第一次使用流程
- 添加一个能正常播放的视频。
- 选择一个新的输出目录。
- 选择
AI口播混剪或仅混剪+配背景音乐。 - 口播模式先生成或填写一段较短文案。
- 先使用默认声音、默认去重和默认 BGM。
- 点击生成按钮。
- 在任务中心查看过程,在右侧预览成片。
- 确认小样效果后,再增加视频、图片或调整更多设置。
