
Veo 3.1 Fast
เร็วและประหยัด เหมาะกับการลองแก้หลายรอบอย่างฉับไว
| ผู้พัฒนา | Zhipu AI |
| แหล่งกำเนิด | จีน |
| เปิดตัว | CogVideoX 1.5 · Nov 2024 |
| เสียงในตัว | ใส่เสียงพากย์เพิ่มเติม |
| ความละเอียดสูงสุด | 1360×768 |
| ความยาวคลิปสูงสุด | 6–10 วินาที |
| สถานะการเปิดเผย | โอเพ่นเวท · น้ำหนักเปิด (2B: Apache 2.0) |
| เข้าถึงผ่าน | Open weights · Z.ai API |
| ราคาเริ่มต้น | Free (open) · API |
CogVideoX เหมาะที่สุดสำหรับงานข้อความและภาพเป็นวิดีโอที่ต้องการความคล่องตัว รวดเร็ว และใช้โมเดลเปิดที่เข้าถึงง่าย
ที่มา. จาก Zhipu AI และ THUDM ของมหาวิทยาลัยชิงหวา CogVideoX (1.5, พฤศจิกายน 2024) เป็นหนึ่งในโมเดลวิดีโอแบบเปิดยุคแรกที่ถูกฟอร์กมากที่สุด รันได้บนฮาร์ดแวร์ผู้บริโภคด้วยดีไซน์ที่ผ่านการรับใน ICLR
เปิด Vivideo แล้วเริ่มโปรเจกต์วิดีโอใหม่
เลือก CogVideoX เป็นโมเดล — หรือให้ Video Agent เลือกให้อัตโนมัติ
อธิบายช็อตของคุณ (หรืออัปโหลดรูปภาพ) แล้วตั้งค่าระยะเวลาและอัตราส่วนภาพ
สร้างวิดีโอด้วย CogVideoX จากนั้นปรับแต่ง ใส่เสียงพากย์หรืออวตาร แล้วเอ็กซ์พอร์ตสำหรับทุกแพลตฟอร์ม
แต่ละโมเดลเป็นหนึ่งในกว่า 30 โมเดลบน Vivideo — สลับตามช็อตเพื่อให้ได้ลุคที่ใช่เป๊ะ

เร็วและประหยัด เหมาะกับการลองแก้หลายรอบอย่างฉับไว


โมเดลสร้างสรรค์ของ OpenAI ความยาวได้ถึง 12 วินาทีพร้อมเสียง

Sora 2 คุณภาพสูงขึ้นที่ความละเอียด 1080p

การเคลื่อนไหวล้ำสมัย เหมือนจริง พร้อมเสียงต้นฉบับ

Negative prompt + หลายช็อต ความยาวได้ถึง 15 วินาที

Kling รุ่นใหม่ล่าสุด ยาวได้ถึง 15 วินาทีพร้อมเสียงต้นฉบับ

CogVideoX จาก Zhipu AI เป็นโมเดลวิดีโอโอเพ่นซอร์สที่ได้รับความนิยม รองรับทั้งข้อความ-และภาพ-เป็นวิดีโอ ความเปิดกว้างทำให้เป็นที่โปรดปรานของชุมชนสำหรับการทดลอง
CogVideoX เหมาะกับครีเอเตอร์ที่ต้องการเอนจินยืดหยุ่น เข้าถึงง่าย สำหรับคลิปประจำวันและการเวียนงานรวดเร็วจากทั้งอินพุตข้อความและภาพ
บน Vivideo CogVideoX เป็นหนึ่งในกว่า 30 โมเดลภายใต้สมาชิกเดียว — ใช้เป็นตัวเลือกประจำวัน แล้วขยับไป Veo หรือ Sora เมื่อช็อตต้องการความเนี้ยบยิ่งขึ้น ทั้งหมดในโปรเจ็กต์เดียว
CogVideoX ได้รับสถานะเป็นหนึ่งในโมเดลวิดีโอแบบเปิดที่ถูก fork มากที่สุด: เวอร์ชัน 2B ใช้ไลเซนส์ Apache 2.0 และใช้งานเชิงพาณิชย์ได้ฟรี รันบน VRAM เพียง ~4–5 GB ได้ และระบบนิเวศ Diffusers, ComfyUI และ LoRA รอบๆ มันก็ลึก CogVideoX text to video และ image to video ทำงานได้ดีสำหรับคลิปไวๆ ในชีวิตประจำวัน ทำให้มันเป็นจุดเริ่มต้นของนักทดลองและนักวิจัยหลายรุ่น
ต้องมองความเก่าเป็นจริง: การปล่อยแบบเปิดมาจากปลาย 2024 ความละเอียดสูงสุดที่ 1360×768 คลิปยาว 6–10 วินาที ไม่มีเสียงในตัว และพรอมต์ใช้งานเป็นภาษาอังกฤษเท่านั้น เทียบกับเอนจินใหม่ๆ คุณภาพแสดงออกตามหลัง — วันนี้ WAN และ Hunyuan เป็นตัวเลือกแบบเปิดที่แข็งแกร่งกว่า และ Veo 3.1 หรือ Sora 2 ชนะในเรื่องความปราณีต แต่มันยังเป็นตัวเลือกที่ดีสำหรับการสร้างต้นแบบ B-roll และงานวิจัย
บน Vivideo คุณสามารถลอง CogVideoX AI video ได้ฟรี — มีการสร้างฟรีรายวัน ไม่ต้องตั้งค่า GPU ท้องถิ่น ใช้มันสำหรับร่างด่วนและการจัดเลย์เอาต์ แล้วเรนเดอร์ช็อตที่ต้องเก็บไว้ด้วยโมเดลที่ทรงพลังกว่าอีกครั้ง เพราะผลลัพธ์เป็นคลิปไม่มีเสียง ให้เพิ่มพากย์ AI และดนตรีในโปรเจ็กต์เดียวกันก่อนส่งออก หรือรวมช็อตเข้ากับการตัดต่อยาวสูงสุด 10 นาที
คุณลองใช้ CogVideoX บน Vivideo ได้ฟรีตั้งต้น — ไม่ต้องใช้บัตรเครดิต การใช้งานหนักและโมเดลพรีเมียมครอบคลุมในแพ็กเกจแบบชำระเงิน
CogVideoX เป็นโมเดลเปิดที่เข้าถึงง่าย รองรับทั้งข้อความ-เป็นวิดีโอและภาพ-เป็นวิดีโอได้ดี เหมาะเป็นตัวเลือกประจำวันอเนกประสงค์
รองรับ — บน Vivideo คุณใช้ CogVideoX ได้ทั้งข้อความ-เป็นวิดีโอและภาพ-เป็นวิดีโอ และสลับโมเดลรายช็อตได้
ได้ — Vivideo ให้สลับโมเดลรายช็อต คุณจึงผสม CogVideoX กับเอนจินอื่นในโปรเจ็กต์เดียวกันได้
น้ำหนักเปิดขนาด 2B อยู่ภายใต้ Apache 2.0 — ใช้งานได้ฟรีรวมถึงเชิงพาณิชย์หากคุณโฮสต์เอง บน Vivideo คุณก็สามารถลองใช้งานฟรีได้เช่นกัน มีการสร้างฟรีรายวันและไม่ต้องตั้งค่าอะไร
การปล่อยแบบเปิดสูงสุดที่ 1360×768 หากต้องการส่งมอบ 1080p หรือ 4K ให้สร้างช็อตด้วยโมเดลใหม่กว่าเช่น Veo 3.1 หรือ LTX-2 แทน