OpenRouter · 2026/9/29

如果你已经手头有一段视频应当起始的画面,那么选择图生视频模型的关键,就落在「第一帧之后需要发生什么」这件事上。生成的片段可能需要以另一张精确的画面收尾、时长超过几秒、附带 AI 生成的音频,或者必须控制在每秒价格之内。
我们服务中的视频模型会以不同方式应对这些需求。本文将覆盖四条模型线:Veo 3.1、Seedance、Kling 以及 Grok Imagine Video。它们并非图生视频的全部目录,完整的列表可在 视频模型合集 中查看。
你可以通过同一个 视频生成 API 调用它们。「提交—轮询—下载」的整个生命周期对所有模型都是一致的。但各模型所接受的时长、分辨率、帧角色、音频选项和价格各不相同。本文将对比这些设置,并演示如何使用 TypeScript SDK 提交一份图生视频任务。
摘要
- Veo 3.1、Fast 与 Lite 可生成 4、6 或 8 秒的片段,支持首帧与尾帧控制,并自带音频生成能力。Veo 3.1 与 Fast 最高支持 4K,Lite 止步于 1080p。
- Seedance 2.5 可生成分辨率为 480p 或 720p、时长 4 至 30 秒的片段,接受首帧与尾帧,并可使用最多 50 个图像、视频与音频参考素材。Seedance 2.0 系列覆盖 4 至 15 秒。
- Kling v3.0 Standard 与 Pro 可生成分辨率为 720p、时长 3 至 15 秒的片段,支持首帧与尾帧控制。音频为可选项,且会影响价格。
- Grok Imagine Video 1.5 可基于一张首帧生成 1 至 15 秒、480p、720p 或 1080p 的片段,自带音频生成。
- 本文涉及的所有模型均使用
POST /api/v1/videos接口。GET /api/v1/videos/models会返回各模型支持的设置与价格 SKU。
图像在视频请求中的作用方式
图像既可以定义成品视频中的某一帧,也可以充当参考素材。我们使用两个不同的请求字段来处理这两种情形。
文生视频、图生视频与参考生视频
在文生视频(text-to-video)模式下,模型仅根据你的提示词构建场景。除提示词所描述的内容外,你无法控制起始帧。
在图生视频(image-to-video)模式下,图像将作为首帧、尾帧或同时充当两者。若一段产品视频必须以一张精确的产品画面开场,那么应使用此模式。
在参考生视频(reference-to-video)模式下,模型接收源素材,但不会将其锁定到某一固定帧位置。例如,你可以提供同一个角色的多张图像,让模型在合成新镜头时维持其形象的一致性。
若图像必须出现在片段中的某个特定时间点,请使用图生视频;若它仅需对结果起到引导作用,请使用参考生视频。
frame_images 与 input_references 字段
我们将这两种模式分别通过 POST /api/v1/videos 上的两个字段开放。
| 字段 | 作用 |
|---|---|
frame_images |
将图像用作精确的首帧、尾帧或两者兼具 |
input_references |
向模型提供图像、视频或音频素材以供遵循,但不会将其固定到某一帧 |
每个 frame_images 条目都带有 frame_type 属性,取值为 first_frame 或 last_frame。并非所有模型都同时支持这两种角色。视频模型目录中的 supported_frame_images 数组会告诉你某个模型接受哪些角色。
若在同一次请求中同时发送两个字段,则以 frame_images 为准,我们会将此次任务视作图生视频。
图生视频模型对比
下表涵盖 Veo、Seedance、Kling 与 Grok Imagine Video 几条产品线。我们同样提供其他图生视频模型,完整的现行目录请参见视频模型合集。
分辨率、时长、帧角色与音频设置来源于 GET /api/v1/videos/models,价格则取自各模型页面。我们在 2026 年 9 月 11 日核对了两者。视频定价因分辨率、音频与输入类型而异,请将这些数字仅视作横向比较,并在估算生产成本前查阅模型页面。
输出设置
| 模型 | 分辨率 | 时长 | 生成音频 | 帧控制 |
|---|---|---|---|---|
| google/veo-3.1 | 720p、1080p、4K | 4、6、8 秒 | 可选 | 首帧与尾帧 |
| google/veo-3.1-fast | 720p、1080p、4K | 4、6、8 秒 | 可选 | 首帧与尾帧 |
| google/veo-3.1-lite | 720p、1080p | 4、6、8 秒 | 可选 | 首帧与尾帧 |
| bytedance/seedance-2.5 | 480p、720p | 4 至 30 秒 | 可选 | 首帧与尾帧 |
| bytedance/seedance-2.0 | 480p、720p、1080p、4K | 4 至 15 秒 | 可选 | 首帧与尾帧 |
| bytedance/seedance-2.0-fast | 480p、720p | 4 至 15 秒 | 可选 | 首帧与尾帧 |
| bytedance/seedance-2.0-mini | 480p、720p | 4 至 15 秒 | 可选 | 首帧与尾帧 |
| kwaivgi/kling-v3.0-pro | 720p | 3 至 15 秒 | 可选 | 首帧与尾帧 |
| kwaivgi/kling-v3.0-std | 720p | 3 至 15 秒 | 可选 | 首帧与尾帧 |
| kwaivgi/kling-video-o1 | 720p | 5 或 10 秒 | 可选 | 首帧与尾帧 |
| x-ai/grok-imagine-video-1.5 | 480p、720p、1080p | 1 至 15 秒 | 是 | 仅首帧 |
| x-ai/grok-imagine-video | 480p、720p | 1 至 15 秒 | 未列出 | 仅首帧 |
参考输入与价格
| 模型 | 参考输入 | 价格 |
|---|---|---|
| google/veo-3.1 | 未列出 | $0.20/秒 至 $0.60/秒 |
| google/veo-3.1-fast | 未列出 | $0.08/秒 至 $0.30/秒 |
| google/veo-3.1-lite | 未列出 | $0.03/秒 至 $0.08/秒 |
| bytedance/seedance-2.5 | 最多 50 个图像、视频与音频素材 | 480p 起价 $0.1028/秒 |
| bytedance/seedance-2.0 | 图像、视频与音频 | 480p 起价 $0.06726/秒 |
| bytedance/seedance-2.0-fast | 图像、视频与音频 | 480p 起价 $0.04035/秒 |
| bytedance/seedance-2.0-mini | 图像、视频与音频 | 480p 起价 $0.03363/秒 |
| kwaivgi/kling-v3.0-pro | 未列出 | 不含音频 $0.112/秒,含音频 $0.168/秒 |
| kwaivgi/kling-v3.0-std | 未列出 | 不含音频 $0.084/秒,含音频 $0.126/秒 |
| kwaivgi/kling-video-o1 | 未列出 | $0.112/秒 |
| x-ai/grok-imagine-video-1.5 | 未列出 | $0.08/秒 至 $0.25/秒,另加每张输入图像 $0.01 |
| x-ai/grok-imagine-video | 最多 7 张图像 | $0.05/秒 至 $0.07/秒,另加每张输入图像 $0.002 |
关于如何阅读上述表格,有三点说明。
- 「可选音频」意味着模型对外开放了
generate_audio请求参数。Grok Imagine Video 系列并未开放该参数。Grok Imagine Video 1.5 的说明称模型会生成音效、环境音与对白,因此表中标记为「是」。较早版本的 Grok Imagine Video 说明中未涉及音频,故标记为「未列出」。 - 「参考输入」一项反映的是该模型在 OpenRouter 页面上描述所声明的内容。「未列出」表示其描述未提及参考图像、视频或音频,但这并不意味着我们经过测试后发现参考输入会被拒收。参考生视频 Cookbook 中介绍了如何在依赖某项能力前确认其是否受支持。
- Seedance 的价格按 video token 计费,而非按秒计费。Seedance 2.0 的模型页面说明,token 数量等于「高 × 宽 × 时长 × 24,再除以 1,024」。表中给出的每秒价格,是各模型页面针对 480p 输出展示的起始费率。Seedance 2.5 列出每百万 video token 收费 $10.70;Seedance 2.0 在 480p 与 720p 列出 $7.00,1080p 与 4K 分别另有费率;Fast 列出 $4.20;Mini 列出 $3.50。使用视频输入的请求会适用更低的每 token 费率。
由于多数模型按秒计费,因此时长本身也是一项成本决策。按 Seedance 2.5 的起始费率 $0.1028/秒计算,一段 4 秒片段的起步价约为 $0.41,一段 30 秒片段的起步价约为 $3.08。在 720p 分辨率或不同输入配置下,实际费用会更高。
如何选择
首先用时长与帧控制缩小候选范围。一旦明确了片段所需的时长,以及是否需要固定的首帧、尾帧或二者兼具,再在剩余模型中就音频、分辨率与成本进行横向比较。