本站教程图文与视频学习中心

数字人系统:从形象和音频到口播视频

上传数字人形象与驱动音频,设置表演和护栏,生成并质检口播视频。

数字人系统推荐入门
可搜索本篇全部步骤和问题

这篇教程适合谁

第一次使用该智能体,希望从准备素材到生成、验收和下载完整走通一次的新用户。

  • 操作入口:登录后打开“智能体工具箱”,找到“数字人系统”并进入工作台。
  • 预计用时:约 14-28 分钟,不包含分析、排队和生成时间。
  • 完成结果:上传数字人形象与驱动音频,设置表演和护栏,生成并质检口播视频。

新手先记住:先按页面从上到下填写,不要跳过带星号的必填项。第一次使用建议保持默认参数,只修改教程明确要求的内容。

你将学会什么

  • 选择全驱或对口型模式。
  • 准备形象图和干净驱动音频。
  • 设置场景、表演与身份保护并提交。

开始前需要准备什么

  • 使用本人或已获授权的正面清晰人物图。
  • 准备页面支持的音频格式,保持单人、无明显噪声;大小以上传区为准。
  • 准备准确口播文案并确认人物声音授权。

操作前自检

  • 页面标题与本教程对应,上传区和操作按钮均已正常显示。
  • 账号已登录且余额足够,模型下拉框中至少有一个可用选项。
  • 所有素材来源清楚,真人、品牌、商品和声音已经取得相应用途授权。

上面任意一项还没有准备好时,先处理完再提交任务。这样最容易避免上传到一半、余额不足或生成后才发现素材用错。

先认识当前界面

下面按页面真实区域说明每一块是做什么的。找不到某个区域时,先确认当前智能体名称,再从页面顶部向下查看;手机端部分区域会改为纵向排列。

智能体列表与移动端选择器:切换工具

电脑端从左侧智能体列表切换;手机端使用页面顶部“选择智能体”下拉框。切换前先确认当前输入是否需要保留。

标题栏操作区:查看教程和整理界面

“教程”打开当前智能体的独立说明;“专注模式”扩大工作区;“清理”可以只清输入、只清当前输出或全部清空,但不会取消后台任务。

模式与制作预设:决定驱动方式

全驱适合需要头部和身体表达的口播,对口型更适合保留原照片姿态;预设会同步场景、气质和动作幅度。

形象与音频:提供身份和口型依据

形象图决定人物外观,驱动音频决定说话内容和时长;两项都应能正常预览或试听。

表演导演与护栏:限制动作和身份漂移

场景、语气、动作幅度和身份稳定、口型优先等护栏应与素材质量匹配。

消耗与结果区:提交并验收口播视频

预计消耗随模型和音频时长变化;结果完成后完整播放,重点检查开头、长句、转头和结尾。

字段填写字典:每一项应该怎么填

这一节可以直接按字段名搜索。必填项没有完成时通常无法提交;选填项不是越多越好,只填写真实、能帮助系统做判断的内容。

数字人模式(必填)

这个字段的作用:全驱会生成头部和身体表演;对口型更强调保持原图姿态。根据素材和用途选择,不要只看名称。
合格填写示例:课程讲解选择全驱;证件式稳定播报选择对口型。
不要这样填:只有一张姿态很好的半身照,却选择大幅动作并要求人物频繁转身。

人物形象(必填)

这个字段的作用:使用正面、清晰、无遮挡的已授权人物图,脸部和嘴部区域不能过小。
合格填写示例:本人授权的正面半身照,光线均匀,嘴部无遮挡。
不要这样填:使用多人合照、侧脸、强滤镜或嘴部被手和麦克风遮挡的图片。

驱动音频(必填)

这个字段的作用:音频决定口播内容、语速和成片时长。使用单人、干净、无混响的声音,并完整试听。
合格填写示例:20 秒普通话 WAV,单人匀速朗读,无背景音乐。
不要这样填:上传多人对话、音乐盖住人声或开头结尾被截断的音频。

预设、表演幅度、模型与护栏(必填)

这个字段的作用:预设同步场景和气质;动作幅度越大越容易漂移。身份稳定和口型优先通常应保留。
合格填写示例:课程知识;亲和自然;轻微点头;口型优先;稳画面。
不要这样填:同时要求固定机位、完全静止和大幅走动手势,造成导演要求冲突。

先看懂任务状态

  • 等待执行:任务还没有提交,继续检查素材、字段、模型和预计消耗。
  • 提交中:浏览器正在上传素材和创建任务,不要关闭页面或重复点击。
  • 排队中:服务器已经收到任务,等待模型或后台工作进程处理。
  • 生成中:任务正在执行,可以留在当前页,也可以稍后到“生成记录”查看。
  • 成功:结果文件已经生成;仍需完整预览和验收,成功状态不等于内容一定合格。
  • 失败:先展开完整错误并记录任务编号;确认退款或扣费状态后再按原因重试。

编号操作步骤:从入口到完成

第 1 步:选择模式与预设

本步目的:把系统默认方案调整到本次真实交付目标,避免生成后才发现比例、范围或方向不对。

具体操作:在数字人口播导演台选择当前生成模式和“品牌讲解、带货口播、课程知识、新闻播报”等预设。

操作标准:每改一个选项都观察关联字段、就绪度和预计消耗是否变化;第一次优先使用推荐值。

最常见错误:一次改动多个高级参数,结果异常时无法判断是哪一个选项造成。

完成标志:所选选项保持高亮或显示在下拉框中,切换后预计消耗和可用参数没有异常提示。

如果界面不一致:如果教程中的选项没有出现,以页面当前选项为准;常见原因是所选模型不支持该参数,或管理员尚未启用。

第 2 步:上传形象

本步目的:让系统拿到本次任务的真实依据,并把每份素材放进正确职责位置。

具体操作:上传人物图片,检查预览;需要复用时可填写“数字人名称”并按页面提示保存。

操作标准:选择文件后必须看到文件名、缩略图、数量或读取完成提示;有预览时打开确认内容正确。

最常见错误:只看文件选择窗口已关闭就认为上传成功,或把人物、商品、服装和目标图放反。

完成标志:上传区出现正确的文件名、数量或缩略图,页面没有格式、大小或数量错误提示。

如果界面不一致:先确认文件格式、大小和数量符合上传区提示;仍失败时换一个可正常打开的文件重新上传。

第 3 步:上传音频

本步目的:让系统拿到本次任务的真实依据,并把每份素材放进正确职责位置。

具体操作:上传驱动音频,试听确认内容、时长和音质。

操作标准:选择文件后必须看到文件名、缩略图、数量或读取完成提示;有预览时打开确认内容正确。

最常见错误:只看文件选择窗口已关闭就认为上传成功,或把人物、商品、服装和目标图放反。

完成标志:上传区出现正确的文件名、数量或缩略图,页面没有格式、大小或数量错误提示。

如果界面不一致:先确认文件格式、大小和数量符合上传区提示;仍失败时换一个可正常打开的文件重新上传。

第 4 步:设置表演

本步目的:把系统默认方案调整到本次真实交付目标,避免生成后才发现比例、范围或方向不对。

具体操作:选择场景、表达气质、动作幅度和页面当前模型参数。

操作标准:每改一个选项都观察关联字段、就绪度和预计消耗是否变化;第一次优先使用推荐值。

最常见错误:一次改动多个高级参数,结果异常时无法判断是哪一个选项造成。

完成标志:所选选项保持高亮或显示在下拉框中,切换后预计消耗和可用参数没有异常提示。

如果界面不一致:如果教程中的选项没有出现,以页面当前选项为准;常见原因是所选模型不支持该参数,或管理员尚未启用。

第 5 步:补充导演要求

本步目的:把素材中看不出来、但会影响结果的真实信息和限制明确告诉系统。

具体操作:在提示词中写口播主题、禁用词和必须保留的服装背景。

操作标准:一条信息表达一件事;名称、数字、范围和禁止项可核对,不确定内容留空或标记待确认。

最常见错误:堆叠“高级、震撼、好看”等形容词,却遗漏对象、用途、事实和不能改变的内容。

完成标志:输入框中保留了刚才填写的内容;必填项不再为空,文字中的名称、数字和限制与真实需求一致。

如果界面不一致:先确认进入了正确的智能体,再按页面从上到下检查遗漏字段;界面名称小幅变化时,以相同含义的当前字段为准。

第 6 步:确认护栏和授权

本步目的:在继续消耗积分或交付之前,主动发现事实、素材职责、连续性和合规问题。

具体操作:保留“身份稳定”“口型优先”等需要项,并勾选素材授权确认。

操作标准:逐项对照输入素材和真实信息;发现一项错误就先修正该项,再进入下一阶段。

最常见错误:只看摘要或缩略图,看到状态成功就跳过正文、时间线和完整播放检查。

完成标志:页面已经保留本步骤的设置,没有红色错误提示,可以继续下一步。

如果界面不一致:先确认进入了正确的智能体,再按页面从上到下检查遗漏字段;界面名称小幅变化时,以相同含义的当前字段为准。

第 7 步:生成

本步目的:把已经核对完成的设置创建为后台任务,并保留可追踪的任务记录。

具体操作:核对当前消耗后点击“生成数字人视频”,在结果区或生成记录等待。

操作标准:提交前看完预计消耗;点击一次后等待状态变为提交中、排队中或生成中,并记下任务时间。

最常见错误:按钮暂时没有结果就连续点击,造成重复任务、重复排队或重复消耗。

完成标志:按钮进入提交中、排队或生成中状态,并出现任务记录;此时不要再次连续点击。

如果界面不一致:从页面顶部向下检查必填项、模型、素材和余额。按钮显示处理中时先等待,不要刷新后重复提交。

提交前 30 秒检查清单

提交按钮可以点击,不代表内容一定正确。按下面顺序全部确认一遍,能避免大多数重复消耗。

  1. 页面标题仍是当前智能体,没有误切换到相邻工具。
  2. “数字人模式”已经按上面的标准完成,页面没有对应缺失提示。
  3. “人物形象”已经按上面的标准完成,页面没有对应缺失提示。
  4. “驱动音频”已经按上面的标准完成,页面没有对应缺失提示。
  5. “预设、表演幅度、模型与护栏”已经按上面的标准完成,页面没有对应缺失提示。
  6. 上传区的文件名、缩略图、数量和素材职责都正确,没有放反或混入旧素材。
  7. 模型下拉框不是“暂无可用模型”,当前模型支持所选任务和参考素材数量。
  8. 比例、时长、清晰度、数量、候选数和预计消耗符合本次预算。
  9. 真人、声音、品牌、商品、剧本、链接和其他素材均已取得本次用途授权。
  10. 点击提交后只等待状态变化,不连续点击,也不立即关闭正在上传素材的页面。

提交后的正确做法:看到“提交中”“排队中”或“生成中”以后就先等待。需要离开当前页面时,到“生成记录”或当前工作台的任务区继续查看,不要因为暂时没有结果而连续提交同一任务。

可以照着填写的完整示例

第一次练习可以直接照下面的结构填写,再把主体、素材和真实信息替换成自己的内容。

模式:全驱数字人
预设:课程知识
形象:本人授权的半身正面照
音频:本人录制的 20 秒普通话 WAV
导演要求:固定机位,亲和自然,轻微点头,保持深蓝衬衫和浅灰背景,不增加字幕和 Logo
模型以页面当前显示为准。

提交前再检查一遍:示例中的人物、商品、价格、地点、时长和模型都只是示范,必须换成你的真实内容和页面当前可用选项。

如何判断结果是否成功

  • 形象和音频预览都能正常打开。
  • 口型与音频基本同步,人物身份、服装和背景稳定。
  • 结果自动出现在当前结果区和生成记录,可预览下载。

只有上面的验收项都满足,才建议下载或交付。若只有一项不合格,先针对那一项修改提示词、素材或参数,不要一次改动所有内容。

结果不理想时,应该修改哪一项

  • 名称、价格、地址、规格、情节或卖点不准确:回到事实、原稿或真实信息字段修正;不要只在生成提示词末尾补一句“准确一点”。
  • 人物、商品、服装、道具或场景身份漂移:更换更清晰的主参考图,减少互相冲突的参考,并强化必须保持项。
  • 动作、口型、镜头或时间段不对:检查源视频职责、生效时间、时长和导演稿;不要用静态图片承担动作依据。
  • 构图、风格或表达方向不对:只调整画幅、风格、结构或提示词中的一个变量,保留上一版作为对照。
  • 清晰度低但内容正确:先保持内容设置不变,再提高模型质量或输出清晰度,避免内容和质量同时变化。
  • 只有部分候选失败:保留成功结果,查看失败项原因,只重试失败候选,不重新提交整批任务。
  • 结果已成功但不符合授权或合规要求:不要下载、发布或交付;删除问题素材,修正真实信息后新建任务。

完成后的保存与交付

  1. 先在结果区完整预览,不要只看缩略图就交付。
  2. 按“如何判断结果是否成功”逐项检查;不合格时只修改一个关键变量后重试。
  3. 下载合格结果,同时记录所用素材、关键参数和任务时间,方便复现。

问题速查:按现象定位

直接在本页顶部搜索报错文字、按钮名称或问题现象。下面每项都按“可能原因 → 立即处理”说明。

按钮是灰色或点击没有反应

可能原因:通常是必填项、素材、模型或授权确认尚未完成。
立即处理:从页面顶部向下检查红色提示、空白字段、上传数量、模型下拉框和授权复选框。

上传后没有缩略图或文件名

可能原因:文件可能未被页面接受,或格式、大小、数量超过当前限制。
立即处理:先删除该文件,确认本机能打开,再按上传区提示换成支持格式或更小文件重新上传。

模型下拉框显示暂无可用模型

可能原因:管理员尚未给当前智能体启用兼容模型,或所选模式需要另一种模型能力。
立即处理:切回页面支持的模式复查;仍为空时把智能体名称和截图交给管理员配置模型。

一直显示排队中或生成中

可能原因:任务已经提交,正在等待上游模型或后台队列处理。
立即处理:记录任务时间,到生成记录继续查看;不要刷新后连续重复提交。只有明确失败后才重试。

提示余额不足或预计消耗过高

可能原因:当前模型、时长、清晰度、数量或候选数超过可用余额。
立即处理:减少数量、时长或清晰度,改用页面当前较低消耗的兼容模型,或充值后再提交。

任务失败但不知道原因

可能原因:失败可能来自素材、参数组合、模型服务、网络或后台处理。
立即处理:展开完整错误,记录任务编号和时间;先只调整一个最可能因素重试,仍失败时把这些信息交给管理员。

显示成功但当前页面看不到结果

可能原因:结果可能在下方结果区、生成记录或另一个候选标签中,页面也可能尚未刷新状态。
立即处理:先滚动到结果区,再查看生成记录;不要直接重新生成。必要时正常刷新一次并按任务时间查找。

结果能预览但不能下载

可能原因:任务可能仍未完成,资源地址已失效,或浏览器拦截了下载。
立即处理:确认状态为成功并重新打开预览;允许当前站点下载。仍失败时记录任务编号让管理员检查文件。

口型不同步

可能原因:这是当前智能体的常见结果或操作问题。
立即处理:换用更干净、语速稳定的音频,并启用“口型优先”。

人物闪烁

可能原因:这是当前智能体的常见结果或操作问题。
立即处理:使用清晰正面图,降低动作幅度并启用“稳画面”。

无法提交

可能原因:这是当前智能体的常见结果或操作问题。
立即处理:检查形象、音频、模型和授权勾选是否齐全。

任务失败时按这个顺序排查

  1. 先记下任务时间、任务编号和页面显示的完整错误提示。
  2. 检查所有必填项、素材格式与大小、模型能力、参数组合和账号余额。
  3. 如果是排队中或生成中,继续等待;只有明确显示失败后才重新提交。
  4. 重试时只改一个最可能的问题,例如更换素材、减少数量或改用页面允许的参数。
  5. 仍然失败时,把任务编号、错误提示和操作时间提供给管理员,不要发送密码、私钥或支付信息。

常见问题与解决办法

口型不同步

换用更干净、语速稳定的音频,并启用“口型优先”。

人物闪烁

使用清晰正面图,降低动作幅度并启用“稳画面”。

无法提交

检查形象、音频、模型和授权勾选是否齐全。

素材版权、人物授权与隐私提醒

只处理你拥有版权或已获许可的视频、图片和声音。涉及真人脸部、声音或动作时先取得明确授权;不要把未成年人、客户资料、账号信息或私人场景用于公开生成。

积分与等待:提交前查看页面当前显示的预计消耗;模型、规格和数量变化都会影响消耗。任务提交后留在当前结果区等待,或到“生成记录”查看状态,不要因暂时没有结果而连续重复提交。