Làm video với AI kết hợp hai hệ thuật ngữ — video truyền thống (tỷ lệ khung hình, độ phân giải, codec) và AI tạo sinh (diffusion, prompt, thang CFG, image-to-video). Bộ thuật ngữ video AI này định nghĩa mọi khái niệm bạn sẽ gặp để biệt ngữ không còn làm chậm bạn nữa.
Bắt đầu với nền tảng — tỷ lệ khung hình, độ phân giải, tốc độ khung hình — rồi chuyển sang các thuật ngữ riêng của AI quyết định đầu ra của bạn: text-to-video, image-to-video, diffusion, đồng bộ khẩu hình, avatar và hơn thế. Mỗi định nghĩa được viết cho người sáng tạo, không phải nhà nghiên cứu.
Tìm kiếm thuật ngữ hoặc duyệt theo danh mục. Mỗi mục đều dùng tiếng Anh giản dị, không cần toán, và liên kết đến nơi khái niệm thực sự quan trọng khi bạn làm video.

Video AI nằm ở giao điểm của hai lĩnh vực, mỗi bên có thuật ngữ riêng: sản xuất video truyền thống (tỷ lệ khung hình, độ phân giải, tốc độ khung hình, codec, bitrate) và AI tạo sinh (diffusion, prompt, thang CFG, text-to-video, image-to-video, latent space). Bảng thuật ngữ này định nghĩa mọi khái niệm bạn sẽ gặp, bằng tiếng Anh đơn giản, để vốn từ không còn là rào cản giữa bạn và một video hoàn chỉnh.
Một số thuật ngữ tác động trực tiếp đến đầu ra. Biết khác biệt giữa text-to-video và image-to-video sẽ thay đổi cách bạn bắt đầu dự án; hiểu tỷ lệ khung hình và độ phân giải quyết định nơi có thể đăng video; nắm diffusion và denoising giúp bạn hiểu vì sao các mô hình hành xử như vậy. Mỗi định nghĩa ở đây đều viết cho người sáng tạo làm video, không phải nhà nghiên cứu đọc bài báo.
Hãy dùng như một bàn tra cứu: tìm thuật ngữ ngay khi bạn gặp, hoặc duyệt theo danh mục — cơ bản về video, khái niệm AI, và điểm riêng của AI-video. Mỗi mục đều liên kết khái niệm về nơi nó quan trọng trong thực tế, và bạn có thể nhảy thẳng vào studio để xem nó vận hành trên 30+ mô hình.
Một từ điển tiếng Anh đơn giản cho mọi thuật ngữ trong video AI — từ nền tảng video như tỷ lệ khung hình và codec đến khái niệm AI như diffusion, prompt và text-to-video. Hãy tìm kiếm hoặc duyệt theo danh mục để gỡ rối biệt ngữ.
Text-to-video tạo clip từ prompt văn bản; image-to-video biến ảnh tĩnh thành chuyển động. Cả hai đều được định nghĩa tại đây, và Vivideo làm được cả hai trên 30+ mô hình.
Diffusion là quy trình hầu hết các mô hình video dùng để tạo cảnh quay — bắt đầu từ nhiễu và dần tinh chỉnh thành hình ảnh rõ nét theo prompt của bạn. Định nghĩa đầy đủ, với ngữ cảnh dễ hiểu, có trong bảng thuật ngữ.
Không — bạn vẫn có thể làm video hay mà không cần lý thuyết. Nhưng biết vài thuật ngữ then chốt (tỷ lệ khung hình, text-to-video vs image-to-video, prompt) sẽ giúp bạn đạt kết quả tốt hơn nhanh hơn — đó là mục đích của bảng thuật ngữ này.
Thang CFG kiểm soát mức độ mô hình bám theo prompt của bạn so với tự ứng biến. Cao thì bám sát chữ hơn; thấp thì sáng tạo hơn. Đây là một trong nhiều thuật ngữ được giải thích ở đây bằng ngôn ngữ thân thiện với người sáng tạo.
Mỗi định nghĩa đều liên kết tới nơi khái niệm đó quan trọng trong quy trình thực tế, và bạn có thể thử trực tiếp trên Vivideo — một studio, 30+ mô hình, miễn phí để bắt đầu.