声音带动完整口播表现
OmniHuman 1.5 不只让照片中的嘴部运动,还将表情、头部与肩部动作同语音节奏协调起来。创作重点是人物如何讲述内容,适合需要固定讲解者的口播视频;准备音频时,应先确定停顿、重音与表达基调。
在选型前明确容量、输入输出与调用方式。
以上为本平台的素材要求与调用方式,音频时长建议不代表模型原生上限。
了解 omnihuman-1.5 能为你的工作带来什么。
OmniHuman 1.5 不只让照片中的嘴部运动,还将表情、头部与肩部动作同语音节奏协调起来。创作重点是人物如何讲述内容,适合需要固定讲解者的口播视频;准备音频时,应先确定停顿、重音与表达基调。
除了照片和声音,还可用 prompt 描述温柔、平静、自然等情绪,并提出轻微头部动作或稳定表现等要求。它用于引导人物表演风格,适合分别制作课程讲解、品牌播报和温情内容,而不是替代音频中的台词。
以清晰正脸照作为形象基础,无需预先准备多角度建模素材。多人照片可搭配主体遮罩指定驱动对象;生成后获得视频地址,继续下载、剪辑或加入产品页面,使人物口播能够接入已有内容制作流程。
从具体任务出发,找到模型发挥作用的位置。
将产品更新整理成配音,搭配固定讲解者的形象照,生成介绍新功能的口播片段。再与操作录屏、字幕和重点标注组合,交付用于帮助中心或新用户引导的视频,让人物承担讲述,录屏负责展示实际操作。
把课程开场、知识点概述或培训提醒录成语音,配上讲师照片,生成分章节的数字人讲解。沿用同一形象可保持课程视觉连续性;涉及公式、图表或步骤时,后期加入课件画面,不必让人物承担所有信息展示。
为活动通知、商品介绍或常见问题准备不同音频,使用同一品牌人物形象分别生成视频。交付物可继续加上商品镜头、字幕和片尾;沿用照片能减少重复拍摄,但每条内容仍应检查表情、口型和音频是否贴合。
结合任务复杂度、输入材料与预期结果选择。
如果已有可使用的人物照片和成稿配音,目标是让人物面对观众讲述内容,OmniHuman 1.5 的单图音频工作流很直接。它更适合围绕声音组织表演,而非从文字构建复杂剧情。选择 1.5 应以口播需求和样片效果为依据,不必把版本数字理解为所有任务的全面提升。
人物讲解、课程主持和品牌播报可优先考虑 OmniHuman 1.5;若重点是大幅动作、角色走位、场景变化或精确复刻一段动作,应考虑支持相应控制的动画或视频模型。口播任务内部则可先用短片段试验照片、声音与提示词,再制作完整内容。
从一次小规模任务到正式接入。
明确目标、必要输入与输出要求,使用真实业务样例作为起点。
打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。
保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。
在正式使用前,了解输出质量与能力范围。
解答使用 omnihuman-1.5 时的常见疑问。
这一工作流需要人物图片和驱动音频,不能只用文字替代两项素材。可先把脚本录制或制作成 mp3/wav,再提交音频地址。prompt 用于调整表情、情绪与风格,不承担直接朗读台词的作用。
建议使用清晰正脸、光线良好且无遮挡的人像,人物在画面中的占比应适中。照片需要有可公网访问的 URL。正式制作前,可先用一段短音频测试该照片的口型、表情与头肩动作效果,再沿用素材。
可以通过 mask_url 提交主体遮罩 URL 数组,指定多人照片中需要驱动的人物;即使只有一个遮罩地址,也应以数组形式提交。应先明确目标并准备对应遮罩。这个功能用于主体选择,不应理解为一次请求即可让多个角色分别说话或完成多人对话。
声音本身提供语速、停顿和表达节奏,prompt 可补充温柔、平静、自然或轻微头部动作等要求。建议让配音和提示词保持一致,避免声音激昂而文字要求平静;最终表演仍需通过生成视频检查。
向 POST /dreamina/videos 提交 image_url、audio_url,并指定 omnihuman-1.5。短任务可同步取得结果;较长任务可用 callback_url,或设置 async:true 后查询 /dreamina/tasks,完成后读取 video_url 并保存。
模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。