
| 开发方 | Zhipu AI |
| 来源地 | 中国 |
| 发布日期 | CogVideoX 1.5 · Nov 2024 |
| 原生音频 | 可添加配音 |
| 最高分辨率 | 1360×768 |
| 最长片段时长 | 6–10秒 |
| 开源情况 | 开源权重 · 开源权重(2B:Apache 2.0) |
| 获取方式 | Open weights · Z.ai API |
| 起价 | Free (open) · API |
CogVideoX 适合追求快捷灵活的文生/图生视频创作,尤其在需要易用、开放模型时表现出色。
背景. 由 Zhipu AI 与清华大学 THUDM 推出,CogVideoX(1.5,2024 年 11 月)是最早期且被大量分叉的开源视频模型之一,可在消费级硬件上运行,并以其 ICLR 论文设计获得认可。
打开 Vivideo,创建一个新视频。
选择 CogVideoX 作为你的模型 — 或让 Video Agent 为你自动挑选。
描述你的镜头(或上传图片),并设置时长与画幅比例。
用 CogVideoX 生成后,再精修、添加配音或数字人,并一键导出到任意平台。
每个模型都是 Vivideo 中 30+ 模型之一 — 逐镜头切换,只为拿到你想要的画面质感。








来自 Zhipu AI 的 CogVideoX 是广泛使用的开源视频模型,支持文生视频与图生视频。其开放性让它成为社区实验与创作的热门之选。
CogVideoX 适合希望拥有灵活、易用引擎的创作者,用于日常短片与基于文本和图像输入的快速迭代。
在 Vivideo 上,CogVideoX 是单一订阅内的 30+ 模型之一——日常灵活活用;当镜头需要更高打磨度时,在同一项目中再切换到 Veo 或 Sora。
CogVideoX 成为最受分支的开源视频模型之一:2B 变体采用 Apache 2.0 并允许商业使用,能在约 4–5 GB VRAM 上运行,且围绕它的 Diffusers、ComfyUI 与 LoRA 生态非常丰富。CogVideoX 的文本到视频与图像到视频都适合快速日常剪辑,因此成为一代研究者和爱好者的默认起点。
要现实地看待它的年纪:开源发布追溯到 2024 年末,分辨率最高为 1360×768,片段持续 6–10 秒、无原生音频且提示词仅支持英语。与更新引擎相比,它在画质上落后 —— 当前更强的开源选项包括 WAN 和 Hunyuan,而 Veo 3.1 或 Sora 2 在打磨度上更胜一筹。它仍然是原型制作、B-roll 与研究的良好选择。
在 Vivideo 上,CogVideoX AI 视频可免费试用 —— 含每日免费生成次数,无需本地 GPU 设置。用它做快速草稿与布局,然后把要保留的片段用更高阶模型重新渲染;由于输出无声,可在同一项目中添加 AI 配音与音乐,或将片段并入最长 10 分钟的剪辑中。
你可以在 Vivideo 上免费试用 CogVideoX,无需信用卡。更高用量与高级模型由付费计划覆盖。
CogVideoX 是一款易上手的开源模型,兼顾文生视频与图生视频,适合作为日常通用方案。
支持——在 Vivideo 上你可以用 CogVideoX 同时完成文生视频与图生视频,并可按镜头切换到其他模型。
可以。Vivideo 支持按镜头切换模型,你可在同一项目中混用 CogVideoX 与其他引擎。
2B 版本的开源权重采用 Apache 2.0 许可 — 自托管时含商业使用在内均可免费。在 Vivideo 上也可以免费试用,含每日免费生成次数且无需任何设置。
开源发布的最高分辨率为 1360×768。如需 1080p 或 4K 交付,请改用更新的模型,例如 Veo 3.1 或 LTX-2。