AI 照片说话

AI 照片说话:让照片跟着你的音频对口型

上传一张照片和你想让它说的音频。照片里的脸会动起来,说出你的话,时长与音频一致。使用默认模型时,真人、宠物和卡通角色都可以。

照片

JPEG、PNG 或 WebP,画面中有一张清晰的脸

音频

MP3、WAV 或 M4A,时长 1 到 60 秒,不超过 30 MB

把一张照片变成跟随你的音频说话的视频。适用于真人、动物、卡通和风格化角色,视频时长与音频轨一致。

按成片秒数计费,不足一秒按一秒计。视频时长与你的音频一致,所以添加音频后,下方价格会显示确切总额。

12 积分/秒

说话视频会在一个可以随时回来的会话中打开,可以直接下载,也可以带进另一个工具继续用。

使用方法

三步让照片说话

  1. 第 1 步

    上传照片

    添加一张图片,画面里要有一张清晰的脸:人像、宠物或插画角色都可以。脸部要光线充足、没有被遮挡。

  2. 第 2 步

    添加你的音频

    添加照片要说的音频,时长 1 到 60 秒:你自己的声音、提前录好的一段话,或 AI 生成的语音。然后选择一个模型。

  3. 第 3 步

    生成并下载

    说话视频的时长与你的音频一致,会在属于你的会话中打开,可以直接下载,也可以带进下一步编辑。

适用场景

大家用 AI 照片说话做什么

一张照片就能当出镜人

把你自己的一张形象照变成一段简短的讲解、通知或欢迎语,不用架设摄像机。

插画角色和 AI 角色

给吉祥物、插画角色或 AI 生成的人像配上声音,用在故事、课程或社交媒体帖子里。

宠物和动物

让你家狗狗或猫咪的照片替你说一段话。两个可灵数字人模型(包括默认模型)都支持动物。

一张照片,多个版本

用几种语言、或面向几类受众,把同一段话各录一遍,每个版本都用同一张照片。

开始之前

怎样做出效果好的照片说话视频

时长与音频一致

照片本身没有时长,所以视频采用音频的时长:1 到 60 秒之间,精确到秒。这也是你付费的依据,所以请先剪掉音频开头和结尾的静音。

选对照片

效果最好的是:只有一张脸,朝向镜头,光线充足,没有被手、头发或墨镜挡住。一张图里有好几张脸时,结果难以预料,所以请先裁剪,只留下要说话的那个人或角色。

三个模型可选

可灵数字人 v2 标准版是默认模型:它能处理真人、宠物、卡通和风格化角色,价格最低。可灵数字人 v2 专业版细节更清晰、口型更分明,每秒价格也更高。Sync 3 照片说话适用于只有一张清晰正脸的照片或插画。

按秒付费,不是按月订阅

照片说话按成片的秒数计费,短短几句话,就只花几句话该花的钱。每个套餐都包含积分,可以用在 YouArt 的任何其他工具上。

基础版

适合爱好者和探索者

$9.99/月
升级
  • 1000 额度
  • 每月最多 ~200 张图片
  • 每月最多约 332 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2.5、GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

专业版

最受欢迎

适合专业人士

$29.99/月
升级
  • 3300 额度
  • 每月最多 ~1000 张图片
  • 每月最多约 1100 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2.5、GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

旗舰版

最超值

适合高级用户和团队

$149.99/月
升级
  • 18000 额度
  • 每月最多 ~6000 张图片
  • 每月最多约 6000 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2.5、GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

团队版

适合团队和工作室

$329.99/月
升级
  • 36300 额度
  • 每月最多 ~12000 张图片
  • 每月最多约 12100 秒视频
  • 真人合规模式
  • 与团队共享画布、工作流和素材
  • 每个团队最多 10 名成员
  • 最多 5 个团队
  • 基于角色的管理
  • 团队额度管理与消费上限
  • 成员用量追踪

常见问题

AI 照片说话常见问题

它是用一张静态图片做出的视频。你给它一张照片和一条音频轨,AI 会让照片里的脸动起来,说出音频里的内容,嘴部动作跟着声音走。结果是一段简短的说话视频,时长与你的音频一致。

不止一张照片

需要的不只是一段照片说话视频?

这个页面一次只跑一个步骤。打开工作流编辑器,可以在同一个工作流里写好脚本并配上语音,从你生成的人像开始做,或者把一批照片变成说话视频。