一张照片就能当出镜人
把你自己的一张形象照变成一段简短的讲解、通知或欢迎语,不用架设摄像机。
AI 照片说话
上传一张照片和你想让它说的音频。照片里的脸会动起来,说出你的话,时长与音频一致。使用默认模型时,真人、宠物和卡通角色都可以。
把一张照片变成跟随你的音频说话的视频。适用于真人、动物、卡通和风格化角色,视频时长与音频轨一致。
按成片秒数计费,不足一秒按一秒计。视频时长与你的音频一致,所以添加音频后,下方价格会显示确切总额。
说话视频会在一个可以随时回来的会话中打开,可以直接下载,也可以带进另一个工具继续用。
使用方法
添加一张图片,画面里要有一张清晰的脸:人像、宠物或插画角色都可以。脸部要光线充足、没有被遮挡。
添加照片要说的音频,时长 1 到 60 秒:你自己的声音、提前录好的一段话,或 AI 生成的语音。然后选择一个模型。
说话视频的时长与你的音频一致,会在属于你的会话中打开,可以直接下载,也可以带进下一步编辑。
适用场景
把你自己的一张形象照变成一段简短的讲解、通知或欢迎语,不用架设摄像机。
给吉祥物、插画角色或 AI 生成的人像配上声音,用在故事、课程或社交媒体帖子里。
让你家狗狗或猫咪的照片替你说一段话。两个可灵数字人模型(包括默认模型)都支持动物。
用几种语言、或面向几类受众,把同一段话各录一遍,每个版本都用同一张照片。
开始之前
照片本身没有时长,所以视频采用音频的时长:1 到 60 秒之间,精确到秒。这也是你付费的依据,所以请先剪掉音频开头和结尾的静音。
效果最好的是:只有一张脸,朝向镜头,光线充足,没有被手、头发或墨镜挡住。一张图里有好几张脸时,结果难以预料,所以请先裁剪,只留下要说话的那个人或角色。
可灵数字人 v2 标准版是默认模型:它能处理真人、宠物、卡通和风格化角色,价格最低。可灵数字人 v2 专业版细节更清晰、口型更分明,每秒价格也更高。Sync 3 照片说话适用于只有一张清晰正脸的照片或插画。
照片说话按成片的秒数计费,短短几句话,就只花几句话该花的钱。每个套餐都包含积分,可以用在 YouArt 的任何其他工具上。
适合爱好者和探索者
适合专业人士
适合高级用户和团队
适合团队和工作室
常见问题
不止一张照片
这个页面一次只跑一个步骤。打开工作流编辑器,可以在同一个工作流里写好脚本并配上语音,从你生成的人像开始做,或者把一批照片变成说话视频。