
| Desenvolvedor | Zhipu AI |
| Origem | China |
| Lançamento | CogVideoX 1.5 · Nov 2024 |
| Áudio nativo | Adicionar narração |
| Resolução máxima | 1360×768 |
| Duração máxima do clipe | 6–10s |
| Disponibilidade | Pesos abertos · Pesos abertos (2B: Apache 2.0) |
| Disponível via | Open weights · Z.ai API |
| Preço a partir de | Free (open) · API |
CogVideoX é ideal para geração rápida e flexível de texto e imagem para vídeo, quando um modelo aberto e acessível faz mais sentido.
Contexto. Da Zhipu AI e do THUDM de Tsinghua, o CogVideoX (1.5, novembro de 2024) é um dos primeiros modelos de vídeo abertos mais bifurcados, executável em hardware de consumidor, com design aceito no ICLR.
Abra o Vivideo e inicie um novo vídeo.
Selecione CogVideoX como seu modelo — ou deixe o Agente de Vídeo escolher por você.
Descreva a sua tomada (ou envie uma imagem) e defina duração e proporção.
Gere com CogVideoX, depois refine, adicione voz ou avatar e exporte para qualquer plataforma.
Cada modelo é um dos 30+ do Vivideo — alterne por tomada para chegar exatamente ao visual que você quer.





Movimento, realismo e áudio nativo de última geração.



CogVideoX, da Zhipu AI, é um modelo de vídeo open-source amplamente usado que suporta texto- e imagem-para-vídeo. Sua abertura o tornou um favorito da comunidade para experimentação.
O CogVideoX atende criadores que querem um engine flexível e acessível para clipes do dia a dia e iterações rápidas a partir de entradas de texto e imagem.
No Vivideo, o CogVideoX é um dos 30+ modelos em uma única assinatura — use-o como opção versátil do cotidiano e, no mesmo projeto, suba para Veo ou Sora quando uma tomada pedir acabamento extra.
CogVideoX conquistou seu lugar como um dos modelos de vídeo abertos mais forkados: a variante de 2B é Apache 2.0 e livre para uso comercial, roda com apenas ~4–5 GB de VRAM e o ecossistema Diffusers, ComfyUI e LoRA ao redor dele é profundo. CogVideoX texto para vídeo e imagem para vídeo funcionam bem para clipes rápidos do dia a dia, o que o tornou ponto de partida padrão para uma geração de curiosos e pesquisadores.
Seja realista sobre sua idade: os lançamentos abertos datam do final de 2024, a resolução máxima é 1360×768, clipes têm 6–10 segundos, não há áudio nativo e prompts são apenas em inglês. Contra motores mais novos ele fica atrás em fidelidade — WAN e Hunyuan são as melhores opções abertas atualmente, e Veo 3.1 ou Sora 2 superam na lapidação. Ainda é ótima escolha para prototipagem, B‑roll e pesquisa.
No Vivideo, um vídeo de IA CogVideoX é gratuito para testar — gerações diárias sem necessidade de GPU local. Use-o para rascunhos rápidos e layouts, depois re-renderize os selecionados num modelo mais pesado; como a saída é silenciosa, adicione narração por Voz de IA e música no mesmo projeto antes de exportar, ou una os clipes numa edição de até 10 minutos.
Você pode experimentar o CogVideoX grátis no Vivideo para começar — sem cartão. Uso intensivo e modelos premium ficam dentro de um plano pago.
O CogVideoX é um modelo aberto acessível que lida bem com texto-para-vídeo e imagem-para-vídeo, tornando-se uma opção versátil para o dia a dia.
Sim — no Vivideo você pode usar o CogVideoX tanto para texto-para-vídeo quanto para imagem-para-vídeo, e alternar para outros modelos por tomada.
Sim — o Vivideo permite trocar de modelo por tomada, então você pode misturar CogVideoX com outros engines em um mesmo projeto.
Os pesos abertos de 2B são Apache 2.0 — gratuitos inclusive para uso comercial se você hospedar localmente. No Vivideo você também pode testá‑lo de graça, com gerações diárias sem configuração.
As versões abertas chegam até 1360×768. Para entrega em 1080p ou 4K, gere a tomada com um modelo mais recente como Veo 3.1 ou LTX-2.