面向视频的 AI 深度估计

AI 视频深度图生成器:把任意片段转成深度通道

上传一段视频,得到逐帧的深度图:越亮离镜头越近,越暗越远。运动、运镜、构图和时间轴全部保留,颜色和纹理则被剥离。这正是它的用处——把真实素材的空间结构交给视频模型、合成软件或三维工具,而不把原片的外观一起带过去。

输出方式

灰度是下游工具唯一读得懂的格式,彩色映射用于肉眼查看。

每秒视频 8 积分

单个文件最大 100 MB

40 积分

深度视频会在一个可以随时回来的会话中打开,方便下载或接入其他工具。

使用方式

三步生成深度图

  1. 第 1 步

    上传你的视频

    拖入 MP4、MOV 或 WebM,单个文件最大 100 MB。分辨率与帧率跟随原片,上传过程中不会被缩放或重采样。

  2. 第 2 步

    逐帧估算深度

    模型会读取整段片子而不是孤立的单帧,算出每个像素离镜头多远。因为参考了相邻帧,静止的墙面会保持同一个深度值,不会逐帧漂移。

  3. 第 3 步

    生成并下载

    深度视频会在一个可以随时回来的会话中打开,你可以下载它、处理下一段素材,或把结果带进工作流编辑器,作为视频模型的控制输入。

处理前后对比

同一个镜头,用距离重新写一遍

  • 几十个人处在几十个不同的距离上,彼此都被清晰分开。整个灰阶范围都用上了——从画面下缘接近纯白的人影,一直到灭点处的纯黑。
  • 少数几个主体,但彼此距离差别极大,而且细节结构完整保留:绿植的叶片被逐片分开,门后的房间也正确地读作比门框所在的墙更远。

适用场景

当模型或合成师需要的是结构,而不是像素

深度引导的视频生成

把深度通道作为控制输入交给视频模型,它会沿用你素材的布局、运镜和节奏,同时生成完全不同的外观。深度只传递几何结构,不会把原片的人脸、颜色和纹理一起带过去。

合成与调色

深度通道可以驱动景深、大气雾、体积雾和重新布光,适用于 After Effects、Nuke、Fusion 和达芬奇。它相当于你本来要手动逐帧抠出来的遮罩,而且会随镜头运动自动更新。

三维、空间视频与视差

用深度图对平面做位移,平面素材就有了真实视差——2.5D 运镜、空间视频转换、摇摆立体。这些效果都需要深度这一个通道,而普通摄像机并不会记录它。

分离前景与远景

深度是连续值而不是硬边抠像,因此可以在任意位置设阈值:单独取出前景主体、只替换背景,或者只对中景调色,完全不依赖颜色来做键控。

原理说明

为视频而做,所以才稳得住

它会参考每一帧前后的帧

把图像深度模型逐帧套在视频上,深度就会「沸腾」:每帧各猜各的,猜测之间略有出入,于是平面开始蠕动、边缘出现噪点。视频深度模型会把相邻帧放在一起读,静止的表面因此保持同一个数值,这条通道拿到剪辑里才真正可用。

相对深度,不是米

输出的是相对深度:它告诉你同一个镜头里什么更近、什么更远,而不是任何东西的真实距离,而且每段片子的尺度都会重新拟合。ControlNet、位移贴图和景深要的正是这个。它不适合用来测量,单摄像头模型也给不出真实尺寸。

灰度用来干活,彩色用来看

灰度是通用交换格式:所有消费深度图的工具读的都是亮度,所以默认就是灰度。turbo、inferno、magma 和 viridis 这四种彩色映射把同样的数值铺到色相上,肉眼判读深度层次会容易得多,但送进下游之前必须先转回灰度。

按秒计费,不用按月订阅

所有套餐都包含积分,可以用在这个页面或 YouArt 的任何其他功能上;新注册账号还会获得免费试用积分。

基础版

适合爱好者和探索者

$9.99/月
升级
  • 1000 额度
  • 每月最多 ~200 张图片
  • 每月超过 ~1000 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

专业版

最受欢迎

适合专业人士

$29.99/月
升级
  • 3300 额度
  • 每月最多 ~1000 张图片
  • 每月超过 ~3300 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

旗舰版

适合高级用户和团队

$149.99/月
升级
  • 18000 额度
  • 每月最多 ~6000 张图片
  • 每月超过 ~18000 秒视频
  • 智能创意 Agent
  • 视频编辑器
  • 最新图像模型,包括 GPT Image 2 和 Nano Banana Pro
  • 最新视频模型,包括 Seedance 2
  • 真人合规模式
  • 使用 ElevenLabs 生成语音
  • 无水印
  • 50+ AI 特效库

团队版

适合团队和工作室

$329.99/月
升级
  • 36300 额度
  • 每月最多 ~12000 张图片
  • 每月超过 ~36300 秒视频
  • 真人合规模式
  • 与团队共享画布、工作流和素材
  • 每个团队最多 10 名成员
  • 最多 5 个团队
  • 基于角色的管理
  • 团队额度管理与消费上限
  • 成员用量追踪

常见问题

视频深度图常见问题

什么是视频深度图?
它是一段与原片等长的视频,用亮度表示距离:像素越亮,说明那个点离镜头越近。它保留原片的运动、运镜、构图和时间轴,舍弃颜色与纹理——所以它的价值在于作为别的东西的输入,而不是拿来观看。
为什么不直接对每一帧跑图像深度模型?
可以,但结果通常会闪。每帧都是独立估算的,于是一面从未移动的墙在每一帧里都得到略有差异的深度值,看起来像在蠕动、沸腾。这个模型会读取每一帧前后的帧,静止的几何结构因此稳得住。时序稳定正是视频专用深度模型存在的全部理由。
这是绝对深度吗?可以用来测距离吗?
不行。它输出的是相对深度——只在同一个镜头内部排出远近次序,尺度按片段重新拟合,而不是以米为单位。深度引导生成、位移、雾效和景深要的恰好就是这个。如果你需要真实测量值,就得用深度传感器或标定过的多摄像机阵列,任何单视频模型都无法替代。
输出可以用来控制 AI 视频模型吗?
可以,这也是生成深度图最常见的理由。深度通道把你素材的几何结构、运镜和节奏交给视频模型,同时把外观完全留白,因此你可以彻底改变一个镜头的风格,却保住它的场面调度。这种用法请选择灰度输出——控制输入读的就是灰度。
该选哪种颜色输出?
除非只是拿来看,否则一律选灰度。所有下游环节——控制输入、合成软件的深度通道、置换修改器——读的都是亮度,所以 turbo 或 viridis 的文件必须先转回灰度才能用。彩色映射的优势在于肉眼判读深度确实清楚得多,适合审片和演示。
多少钱?可以先免费试试吗?
按片长计费,每秒 8 积分:十秒的视频 80 积分,一分钟 480 积分。新注册账号会获得免费试用积分,可以先跑一段短片看看效果再决定。
深度视频会保留原来的声音吗?
不会。输出是无声的——深度图属于画面数据,原片上的音轨会被丢弃。如果成片需要原声,请在视频编辑器里把它和深度通道重新放到一起。
支持上传哪些视频格式?
MP4、MOV 和 WebM,单个文件最大 100 MB。分辨率与帧率跟随原片,不会被强制成某个预设,所以输出与输入是逐帧对齐的。

更多工具

同一个文件还能做什么

每一个都只做一件事,直接处理你手上已有的文件——不用写提示词,也不用学编辑器。

查看全部 9 款 AI 工具

不止一条通道

想直接用上深度,而不只是下载它?

这个页面只跑一个固定步骤。打开工作流编辑器,可以把深度通道直接接到视频模型的控制输入上、让一批片段跑同一张图,或者把它接在放大之后。