Grok 视频 v1.5
视频模型
概览
xAI Grok 视频 v1.5 图生视频。将 1 张起始图动画化为带原生音频、真实运动的短视频,支持 480p/720p 输出。
Grok 视频 v1.5
规格
- 类别
- 视频模型
- 输入
- 文本, 图像
- 输出
- 视频
- 价格
4-90
必须输入 1 张图像作为首帧。该预览模型不支持文生视频。
能力
- 动画化
- 图生视频
- 起始帧
- 视频
- XAI
- Grok
常见问题
让产品照片、角色渲染图或参考图像不再静止。YouArt 上的 Grok Video v1.5 可将一张起始图像转化为 480p 或 720p 短视频,呈现原生音频和逼真的动态效果。这款由 xAI 开发的预览版模型专为图生视频工作流设计:当开场画面已经确定时,可以在进入下一个制作环节前,先看看画面动起来、配上声音后的效果。目前价格较标准定价优惠 25%。
概览:Grok Video v1.5 能做什么
Grok Video v1.5 是 YouArt 上由 xAI 开发的图生视频模型。这款预览版模型面向已有明确起始图像的创作者,可将图像转化为短视频,呈现原生音频和逼真的动态效果。该模型要求输入且仅输入一张首帧图像;此预览版不支持文生视频。提供文本提示词来描述动作、镜头表现和声音,上传首帧图像,即可生成一段 6 秒视频,分辨率为 480p 或 720p。
| 功能 | 可以帮你实现什么 |
|---|---|
| 原生音频生成 | 将起始图像转化为视频,并在同一次生成中配上同步声音。 |
| 逼真的动态效果 | 该模型可根据静态起始图像,生成自然、物理表现合理的运动。 |
| 仅支持图生视频 | 要求输入且仅输入一张首帧图像;专为开场构图已经确定的工作流设计。 |
| 480p 和 720p 输出 | 根据工作流的画质需求,选择标准或更高分辨率生成视频。 |
| 现行价格优惠 25% | 优惠期间,使用该模型所需的积分更少。 |
最适合的使用场景
产品图像动态化
使用 Grok Video v1.5,将产品照片转化为带原生音频的短视频。上传产品图像作为首帧,描述镜头运动、环境,以及能让产品更具真实感的声音,即可生成一段 6 秒视频。这样,营销团队就能在筹备更大规模的拍摄之前,为产品页面或社交广告制作初步的视听创意样片。
角色与肖像动态化
对于插画师、游戏设计师和角色美术师而言,Grok Video v1.5 是将角色渲染图或肖像转化为短视频的实用工具。上传角色图像作为首帧,描述预期动作和环境声,即可生成让角色生动起来的初稿,用于提案、作品集或概念评审。
概念美术与场景可视化
对于概念美术师和视觉开发团队而言,Grok Video v1.5 可将静态环境渲染图或概念插画转化为有声动态短片。上传概念图作为首帧,描述镜头运动和场景中的环境声,即可生成初稿,传达场景的氛围与空间感。
如何在 YouArt 上使用 Grok Video v1.5
可直接在 YouArt 的模型界面中使用 Grok Video v1.5。由于该模型需要首帧图像,请先选好要赋予动态效果的图像,再编写提示词,描述动作、镜头表现,以及与动态画面相配的音频。
- 打开模型。前往 YouArt 的 Grok Video v1.5 页面;如果工作区提示登录,请先登录。
- 上传首帧图像。选择要赋予动态效果的图像。这是必需输入;没有图像,模型将无法生成视频。
- 编写提示词。描述动作、镜头运动,以及应与动态画面相配的音频。
- 设置分辨率。根据工作流的画质需求,选择 480p 或 720p。
- 生成并检查。生成初稿,评估动态效果和音频,再优化提示词或图像,进行下一轮迭代。
输入与输出
Grok Video v1.5 要求输入且仅输入一张首帧图像,并使用文本提示词描述动作、镜头表现和音频。此预览版模型不支持文生视频。输出为一段带原生音频的 6 秒视频,分辨率为 480p 或 720p。
| 规格 | YouArt 模型页面当前信息 |
|---|---|
| 输入方式 | 一张首帧图像(必需,且仅限一张);用于指导动作和音频的文本提示词 |
| 生成模式 | 仅支持图生视频(此预览版不支持文生视频) |
| 主要输出 | 带原生音频的视频 |
| 宽高比 | Auto(由输入图像决定) |
| 时长 | 6 秒 |
| 分辨率选项 | 480p, 720p |
| 积分显示 | 36 积分(优惠 25%);生成前请查看实时界面 |
提示词与使用示例
最有效的 Grok Video v1.5 提示词,会描述起始图像应呈现的动作以及相配的音频。由于图像已经确定了开场构图,提示词应重点描述运动、镜头表现和声音。
示例 1:带音频的产品图像动态化
输入:一张产品照片:玻璃香水瓶置于深色天鹅绒表面。
提示词:镜头缓缓环绕香水瓶,一束窄光扫过玻璃瓶身,映亮各个切面。光线移动时,响起轻柔清澈的铃音,随后接上一段极简的氛围音。
适用原因:图像确定了产品和开场构图。提示词则指导镜头运动、光线变化和声音效果,让动态画面呈现出完整产品亮相短片的质感。
示例 2:角色肖像动态化
输入:一幅角色插画:身穿盔甲的战士站在森林中。
提示词:风穿过树林,角色轻轻调整身体重心。树叶在角色周围缓缓飘落。森林的环境声——风声、树叶沙沙声、远处的鸟鸣——充满整个场景。
适用原因:图像确定了角色和环境。提示词指导细微动作和环境声的生成,在不改变原始构图的前提下,让插画生动起来。
示例 3:概念美术场景可视化
输入:一幅环境概念图:暮色中的未来城市。
提示词:镜头保持稳定,建筑中的灯光开始亮起,车辆沿着下方街道行驶。克制的氛围配乐与远处的城市声响充满整个场景。
适用原因:概念图确定了环境和视觉风格。提示词添加灯光亮起、车辆行驶等动态元素,并通过音频传达场景氛围。
使用技巧与限制
- 打开模型前先准备好图像。该模型要求输入且仅输入一张首帧图像;提前备好图像,可以避免工作流中断。
- 同时描述动态效果和音频。模型会在同一步骤中生成两者,因此,兼顾画面动作与声音的提示词能带来更协调的结果。
- 使用自动宽高比。模型会根据输入图像确定宽高比,因此上传前无需将图像裁剪或调整为特定画布尺寸。
- 最终输出使用 720p。先用 480p 快速迭代,待概念确定且输出需要达到更高画质标准时,再切换至 720p。
- 限制:必须输入图像。此预览版模型不支持文生视频。如果需要仅通过文本生成视频,可以考虑 Kling v3.0、Seedance 2.0 或 Sora 2。
- 限制:时长固定为 6 秒。如果需要更长的视频,请规划生成多个片段,再通过后期制作将它们拼接起来。
模型对比与相关模型
YouArt 模型页面展示了 Grok Video v1.5 以及其他视频生成选项。可参考下表,根据输入要求、音频需求和生成模式,选择适合当前项目的模型。
| 相关模型 | 适合改选此模型的情况 |
|---|---|
希望使用 YouArt 原生模型,且需要原生音频、文生视频支持和 1080p 输出。 | |
需要文生视频支持、首尾帧控制、原生音频,以及最高 4K 输出。 | |
需要文生视频支持、4–15 秒时长、原生音频和 1080p 输出。 | |
希望选用 MiniMax 的图生视频替代方案,支持 Fast 和 Pro 模式,分辨率为 768p 或 1080p。 | |
需要在 1 至 16 秒之间灵活选择时长,并可选用音频和运动控制。 |
该模型最适合的图生视频工作流是:开场画面已经确定,而且从初稿阶段就需要原生音频。如果想更全面地了解可用选项,可返回 YouArt 的视频模型页面,对比各模型展示的输入、设置和示例表现,再决定是否投入积分进行正式制作。
在工作流中的应用
Grok Video v1.5 适用于视觉制作工作流中的动态化环节:将已经完成的图像——产品照片、角色渲染图或概念插画——转化为视听短片。使用 AI 视频工作流构建器,可统筹源图像、动态输出与后续环节之间的衔接。
对于产品和电商团队,该模型的图生视频模式与原生音频功能,使其成为 AI 电商产品视频工作流的实用起点,这类工作流以产品照片作为视觉概念的起点。对于以社交媒体为主的营销活动,该模型的原生音频生成功能也十分契合 AI UGC 广告视频工作流:开场图像已经确定,目标是让画面动起来,并配上声音。
创作你的下一个视频
Grok Video v1.5 为产品营销人员、角色美术师和概念设计师提供了直接的图像动态化方式,可将起始图像转化为带原生音频、动态效果逼真的短视频,目前较现行价格优惠 25%。准备一张首帧图像和提示词,选择分辨率,即可把静态参考图转化为供团队评估的动态初稿。