数字人系统:从形象和音频到口播视频
上传数字人形象与驱动音频,设置表演和护栏,生成并质检口播视频。
这篇教程适合谁
第一次使用该智能体,希望从准备素材到生成、验收和下载完整走通一次的新用户。
- 操作入口:登录后打开“智能体工具箱”,找到“数字人系统”并进入工作台。
- 预计用时:约 14-28 分钟,不包含分析、排队和生成时间。
- 完成结果:上传数字人形象与驱动音频,设置表演和护栏,生成并质检口播视频。
新手先记住:先按页面从上到下填写,不要跳过带星号的必填项。第一次使用建议保持默认参数,只修改教程明确要求的内容。
你将学会什么
- 选择全驱或对口型模式。
- 准备形象图和干净驱动音频。
- 设置场景、表演与身份保护并提交。
开始前需要准备什么
- 使用本人或已获授权的正面清晰人物图。
- 准备页面支持的音频格式,保持单人、无明显噪声;大小以上传区为准。
- 准备准确口播文案并确认人物声音授权。
操作前自检
- 页面标题与本教程对应,上传区和操作按钮均已正常显示。
- 账号已登录且余额足够,模型下拉框中至少有一个可用选项。
- 所有素材来源清楚,真人、品牌、商品和声音已经取得相应用途授权。
上面任意一项还没有准备好时,先处理完再提交任务。这样最容易避免上传到一半、余额不足或生成后才发现素材用错。
先认识当前界面
下面按页面真实区域说明每一块是做什么的。找不到某个区域时,先确认当前智能体名称,再从页面顶部向下查看;手机端部分区域会改为纵向排列。
智能体列表与移动端选择器:切换工具
电脑端从左侧智能体列表切换;手机端使用页面顶部“选择智能体”下拉框。切换前先确认当前输入是否需要保留。
标题栏操作区:查看教程和整理界面
“教程”打开当前智能体的独立说明;“专注模式”扩大工作区;“清理”可以只清输入、只清当前输出或全部清空,但不会取消后台任务。
模式与制作预设:决定驱动方式
全驱适合需要头部和身体表达的口播,对口型更适合保留原照片姿态;预设会同步场景、气质和动作幅度。
形象与音频:提供身份和口型依据
形象图决定人物外观,驱动音频决定说话内容和时长;两项都应能正常预览或试听。
表演导演与护栏:限制动作和身份漂移
场景、语气、动作幅度和身份稳定、口型优先等护栏应与素材质量匹配。
消耗与结果区:提交并验收口播视频
预计消耗随模型和音频时长变化;结果完成后完整播放,重点检查开头、长句、转头和结尾。
字段填写字典:每一项应该怎么填
这一节可以直接按字段名搜索。必填项没有完成时通常无法提交;选填项不是越多越好,只填写真实、能帮助系统做判断的内容。
数字人模式(必填)
这个字段的作用:全驱会生成头部和身体表演;对口型更强调保持原图姿态。根据素材和用途选择,不要只看名称。
合格填写示例:课程讲解选择全驱;证件式稳定播报选择对口型。
不要这样填:只有一张姿态很好的半身照,却选择大幅动作并要求人物频繁转身。
人物形象(必填)
这个字段的作用:使用正面、清晰、无遮挡的已授权人物图,脸部和嘴部区域不能过小。
合格填写示例:本人授权的正面半身照,光线均匀,嘴部无遮挡。
不要这样填:使用多人合照、侧脸、强滤镜或嘴部被手和麦克风遮挡的图片。
驱动音频(必填)
这个字段的作用:音频决定口播内容、语速和成片时长。使用单人、干净、无混响的声音,并完整试听。
合格填写示例:20 秒普通话 WAV,单人匀速朗读,无背景音乐。
不要这样填:上传多人对话、音乐盖住人声或开头结尾被截断的音频。
预设、表演幅度、模型与护栏(必填)
这个字段的作用:预设同步场景和气质;动作幅度越大越容易漂移。身份稳定和口型优先通常应保留。
合格填写示例:课程知识;亲和自然;轻微点头;口型优先;稳画面。
不要这样填:同时要求固定机位、完全静止和大幅走动手势,造成导演要求冲突。
先看懂任务状态
- 等待执行:任务还没有提交,继续检查素材、字段、模型和预计消耗。
- 提交中:浏览器正在上传素材和创建任务,不要关闭页面或重复点击。
- 排队中:服务器已经收到任务,等待模型或后台工作进程处理。
- 生成中:任务正在执行,可以留在当前页,也可以稍后到“生成记录”查看。
- 成功:结果文件已经生成;仍需完整预览和验收,成功状态不等于内容一定合格。
- 失败:先展开完整错误并记录任务编号;确认退款或扣费状态后再按原因重试。
编号操作步骤:从入口到完成
第 1 步:选择模式与预设
本步目的:把系统默认方案调整到本次真实交付目标,避免生成后才发现比例、范围或方向不对。
具体操作:在数字人口播导演台选择当前生成模式和“品牌讲解、带货口播、课程知识、新闻播报”等预设。
操作标准:每改一个选项都观察关联字段、就绪度和预计消耗是否变化;第一次优先使用推荐值。
最常见错误:一次改动多个高级参数,结果异常时无法判断是哪一个选项造成。
完成标志:所选选项保持高亮或显示在下拉框中,切换后预计消耗和可用参数没有异常提示。
如果界面不一致:如果教程中的选项没有出现,以页面当前选项为准;常见原因是所选模型不支持该参数,或管理员尚未启用。
第 2 步:上传形象
本步目的:让系统拿到本次任务的真实依据,并把每份素材放进正确职责位置。
具体操作:上传人物图片,检查预览;需要复用时可填写“数字人名称”并按页面提示保存。
操作标准:选择文件后必须看到文件名、缩略图、数量或读取完成提示;有预览时打开确认内容正确。
最常见错误:只看文件选择窗口已关闭就认为上传成功,或把人物、商品、服装和目标图放反。
完成标志:上传区出现正确的文件名、数量或缩略图,页面没有格式、大小或数量错误提示。
如果界面不一致:先确认文件格式、大小和数量符合上传区提示;仍失败时换一个可正常打开的文件重新上传。
第 3 步:上传音频
本步目的:让系统拿到本次任务的真实依据,并把每份素材放进正确职责位置。
具体操作:上传驱动音频,试听确认内容、时长和音质。
操作标准:选择文件后必须看到文件名、缩略图、数量或读取完成提示;有预览时打开确认内容正确。
最常见错误:只看文件选择窗口已关闭就认为上传成功,或把人物、商品、服装和目标图放反。
完成标志:上传区出现正确的文件名、数量或缩略图,页面没有格式、大小或数量错误提示。
如果界面不一致:先确认文件格式、大小和数量符合上传区提示;仍失败时换一个可正常打开的文件重新上传。
第 4 步:设置表演
本步目的:把系统默认方案调整到本次真实交付目标,避免生成后才发现比例、范围或方向不对。
具体操作:选择场景、表达气质、动作幅度和页面当前模型参数。
操作标准:每改一个选项都观察关联字段、就绪度和预计消耗是否变化;第一次优先使用推荐值。
最常见错误:一次改动多个高级参数,结果异常时无法判断是哪一个选项造成。
完成标志:所选选项保持高亮或显示在下拉框中,切换后预计消耗和可用参数没有异常提示。
如果界面不一致:如果教程中的选项没有出现,以页面当前选项为准;常见原因是所选模型不支持该参数,或管理员尚未启用。
第 5 步:补充导演要求
本步目的:把素材中看不出来、但会影响结果的真实信息和限制明确告诉系统。
具体操作:在提示词中写口播主题、禁用词和必须保留的服装背景。
操作标准:一条信息表达一件事;名称、数字、范围和禁止项可核对,不确定内容留空或标记待确认。
最常见错误:堆叠“高级、震撼、好看”等形容词,却遗漏对象、用途、事实和不能改变的内容。
完成标志:输入框中保留了刚才填写的内容;必填项不再为空,文字中的名称、数字和限制与真实需求一致。
如果界面不一致:先确认进入了正确的智能体,再按页面从上到下检查遗漏字段;界面名称小幅变化时,以相同含义的当前字段为准。
第 6 步:确认护栏和授权
本步目的:在继续消耗积分或交付之前,主动发现事实、素材职责、连续性和合规问题。
具体操作:保留“身份稳定”“口型优先”等需要项,并勾选素材授权确认。
操作标准:逐项对照输入素材和真实信息;发现一项错误就先修正该项,再进入下一阶段。
最常见错误:只看摘要或缩略图,看到状态成功就跳过正文、时间线和完整播放检查。
完成标志:页面已经保留本步骤的设置,没有红色错误提示,可以继续下一步。
如果界面不一致:先确认进入了正确的智能体,再按页面从上到下检查遗漏字段;界面名称小幅变化时,以相同含义的当前字段为准。
第 7 步:生成
本步目的:把已经核对完成的设置创建为后台任务,并保留可追踪的任务记录。
具体操作:核对当前消耗后点击“生成数字人视频”,在结果区或生成记录等待。
操作标准:提交前看完预计消耗;点击一次后等待状态变为提交中、排队中或生成中,并记下任务时间。
最常见错误:按钮暂时没有结果就连续点击,造成重复任务、重复排队或重复消耗。
完成标志:按钮进入提交中、排队或生成中状态,并出现任务记录;此时不要再次连续点击。
如果界面不一致:从页面顶部向下检查必填项、模型、素材和余额。按钮显示处理中时先等待,不要刷新后重复提交。
提交前 30 秒检查清单
提交按钮可以点击,不代表内容一定正确。按下面顺序全部确认一遍,能避免大多数重复消耗。
- 页面标题仍是当前智能体,没有误切换到相邻工具。
- “数字人模式”已经按上面的标准完成,页面没有对应缺失提示。
- “人物形象”已经按上面的标准完成,页面没有对应缺失提示。
- “驱动音频”已经按上面的标准完成,页面没有对应缺失提示。
- “预设、表演幅度、模型与护栏”已经按上面的标准完成,页面没有对应缺失提示。
- 上传区的文件名、缩略图、数量和素材职责都正确,没有放反或混入旧素材。
- 模型下拉框不是“暂无可用模型”,当前模型支持所选任务和参考素材数量。
- 比例、时长、清晰度、数量、候选数和预计消耗符合本次预算。
- 真人、声音、品牌、商品、剧本、链接和其他素材均已取得本次用途授权。
- 点击提交后只等待状态变化,不连续点击,也不立即关闭正在上传素材的页面。
提交后的正确做法:看到“提交中”“排队中”或“生成中”以后就先等待。需要离开当前页面时,到“生成记录”或当前工作台的任务区继续查看,不要因为暂时没有结果而连续提交同一任务。
可以照着填写的完整示例
第一次练习可以直接照下面的结构填写,再把主体、素材和真实信息替换成自己的内容。
模式:全驱数字人
预设:课程知识
形象:本人授权的半身正面照
音频:本人录制的 20 秒普通话 WAV
导演要求:固定机位,亲和自然,轻微点头,保持深蓝衬衫和浅灰背景,不增加字幕和 Logo
模型以页面当前显示为准。
提交前再检查一遍:示例中的人物、商品、价格、地点、时长和模型都只是示范,必须换成你的真实内容和页面当前可用选项。
如何判断结果是否成功
- 形象和音频预览都能正常打开。
- 口型与音频基本同步,人物身份、服装和背景稳定。
- 结果自动出现在当前结果区和生成记录,可预览下载。
只有上面的验收项都满足,才建议下载或交付。若只有一项不合格,先针对那一项修改提示词、素材或参数,不要一次改动所有内容。
结果不理想时,应该修改哪一项
- 名称、价格、地址、规格、情节或卖点不准确:回到事实、原稿或真实信息字段修正;不要只在生成提示词末尾补一句“准确一点”。
- 人物、商品、服装、道具或场景身份漂移:更换更清晰的主参考图,减少互相冲突的参考,并强化必须保持项。
- 动作、口型、镜头或时间段不对:检查源视频职责、生效时间、时长和导演稿;不要用静态图片承担动作依据。
- 构图、风格或表达方向不对:只调整画幅、风格、结构或提示词中的一个变量,保留上一版作为对照。
- 清晰度低但内容正确:先保持内容设置不变,再提高模型质量或输出清晰度,避免内容和质量同时变化。
- 只有部分候选失败:保留成功结果,查看失败项原因,只重试失败候选,不重新提交整批任务。
- 结果已成功但不符合授权或合规要求:不要下载、发布或交付;删除问题素材,修正真实信息后新建任务。
完成后的保存与交付
- 先在结果区完整预览,不要只看缩略图就交付。
- 按“如何判断结果是否成功”逐项检查;不合格时只修改一个关键变量后重试。
- 下载合格结果,同时记录所用素材、关键参数和任务时间,方便复现。
问题速查:按现象定位
直接在本页顶部搜索报错文字、按钮名称或问题现象。下面每项都按“可能原因 → 立即处理”说明。
按钮是灰色或点击没有反应
可能原因:通常是必填项、素材、模型或授权确认尚未完成。
立即处理:从页面顶部向下检查红色提示、空白字段、上传数量、模型下拉框和授权复选框。
上传后没有缩略图或文件名
可能原因:文件可能未被页面接受,或格式、大小、数量超过当前限制。
立即处理:先删除该文件,确认本机能打开,再按上传区提示换成支持格式或更小文件重新上传。
模型下拉框显示暂无可用模型
可能原因:管理员尚未给当前智能体启用兼容模型,或所选模式需要另一种模型能力。
立即处理:切回页面支持的模式复查;仍为空时把智能体名称和截图交给管理员配置模型。
一直显示排队中或生成中
可能原因:任务已经提交,正在等待上游模型或后台队列处理。
立即处理:记录任务时间,到生成记录继续查看;不要刷新后连续重复提交。只有明确失败后才重试。
提示余额不足或预计消耗过高
可能原因:当前模型、时长、清晰度、数量或候选数超过可用余额。
立即处理:减少数量、时长或清晰度,改用页面当前较低消耗的兼容模型,或充值后再提交。
任务失败但不知道原因
可能原因:失败可能来自素材、参数组合、模型服务、网络或后台处理。
立即处理:展开完整错误,记录任务编号和时间;先只调整一个最可能因素重试,仍失败时把这些信息交给管理员。
显示成功但当前页面看不到结果
可能原因:结果可能在下方结果区、生成记录或另一个候选标签中,页面也可能尚未刷新状态。
立即处理:先滚动到结果区,再查看生成记录;不要直接重新生成。必要时正常刷新一次并按任务时间查找。
结果能预览但不能下载
可能原因:任务可能仍未完成,资源地址已失效,或浏览器拦截了下载。
立即处理:确认状态为成功并重新打开预览;允许当前站点下载。仍失败时记录任务编号让管理员检查文件。
口型不同步
可能原因:这是当前智能体的常见结果或操作问题。
立即处理:换用更干净、语速稳定的音频,并启用“口型优先”。
人物闪烁
可能原因:这是当前智能体的常见结果或操作问题。
立即处理:使用清晰正面图,降低动作幅度并启用“稳画面”。
无法提交
可能原因:这是当前智能体的常见结果或操作问题。
立即处理:检查形象、音频、模型和授权勾选是否齐全。
任务失败时按这个顺序排查
- 先记下任务时间、任务编号和页面显示的完整错误提示。
- 检查所有必填项、素材格式与大小、模型能力、参数组合和账号余额。
- 如果是排队中或生成中,继续等待;只有明确显示失败后才重新提交。
- 重试时只改一个最可能的问题,例如更换素材、减少数量或改用页面允许的参数。
- 仍然失败时,把任务编号、错误提示和操作时间提供给管理员,不要发送密码、私钥或支付信息。
常见问题与解决办法
口型不同步
换用更干净、语速稳定的音频,并启用“口型优先”。
人物闪烁
使用清晰正面图,降低动作幅度并启用“稳画面”。
无法提交
检查形象、音频、模型和授权勾选是否齐全。
素材版权、人物授权与隐私提醒
只处理你拥有版权或已获许可的视频、图片和声音。涉及真人脸部、声音或动作时先取得明确授权;不要把未成年人、客户资料、账号信息或私人场景用于公开生成。
积分与等待:提交前查看页面当前显示的预计消耗;模型、规格和数量变化都会影响消耗。任务提交后留在当前结果区等待,或到“生成记录”查看状态,不要因暂时没有结果而连续重复提交。
