输入台词,生成语音
在“生成语音”中填写台词并选择声音。按口头表达习惯写文稿,生成后先听一遍,检查读音和停顿,再制作视频。
用 Pixlr AI 把人像照片和台词变成口型同步的说话视频。可以输入文稿生成语音,也可以上传录音,制作开场介绍、讲解片段或角色台词。
先选好声音来源,再描述画面表现。实际语音决定人物说什么,以及说话的节奏。
在“生成语音”中填写台词并选择声音。按口头表达习惯写文稿,生成后先听一遍,检查读音和停顿,再制作视频。
已经录好满意的声音时,选择“上传音频”。清楚的单人录音适合用来制作重点明确的口播片段。
照片决定人物外观,以及说话时的画面构图。
优先选择正面或轻微侧脸的人像。如果要表现说话过程,尽量避免手或其他物体遮住嘴部。
头肩构图便于看清表情。背景、服装与讲述内容应相符,不要依赖后续动画替你重新设计整个场景。
把台词与画面要求分开,再选择可用的 720p 或 1080p 输出。
在动作描述中写出可见表现,例如平静的表情、专注的姿态或轻微点头。动作应符合语音的语气和内容。
听台词的同时观察嘴部、眼神和头部运动。确认表情适合这段话,开头和结尾也方便后续剪辑。
当内容需要一个可见的讲述者时,再安排数字人出镜。
让人物介绍主题、说明更新或欢迎观众。把主要信息放在台词前面,让人尽快知道这段口播要讲什么。
让插画角色讲一个知识点或一段故事台词。较长课程可拆成多个口播小节,选好结果后再与辅助画面一起剪辑。
看表演主要由语音驱动,还是由动作描述驱动。
数字人口播围绕人像和语音生成。如果核心任务是配合台词说话、呈现口型与表达,优先用数字人工具。
商品展示、环境变化或角色动作,可用图生视频描述运动。有参考表演、希望沿用其动作时,则使用动作控制。
了解台词、录音、人像和画面要求分别起什么作用。
上传人像,选择“生成语音”,选好声音并输入台词。工具会先生成口播音频。补充人物表情或动作要求,选择分辨率后即可生成说话视频。
可以。上传录音,就能用这段音频作为口播表现。如果想用自己的音色朗读新台词,先在独立的声音克隆工具中生成语音,再上传完成的音轨。
不是。台词是人物要说出的内容;动作描述说明说话时的表情或运动。使用上传音频时,录音提供台词,动作描述仍用于指导画面表现。
可以尝试五官清楚、眼睛和嘴部容易辨认的插画人像。构图应适合口播,并检查该风格下的实际效果。过于抽象的面部或被遮住的嘴部,会让说话表现更难辨认。
可以上传目标语言的录音,或用合适的声音朗读对应语言的台词。先检查姓名和发音,再生成视频。人物跟随提供的语音表演,上传音频不会自动完成翻译。
可以。工作区提供 720p 和 1080p 输出,按展示用途选择。尽量使用清晰人像,让视频中的面部细节更容易看清。
可以。用一张人像搭配简短台词或录音,免费尝试 Pixlr AI 数字人口播。先查看声音与面部表现,再制作较长内容。
选择一张人像,添加想让它讲述的内容。
生成口播视频