Chuẩn bị trước khi bắt đầu
Điều làm mình mất thời gian nhất hồi mới làm không phải là công cụ, mà là vừa làm vừa nghĩ. Nên bây giờ trước khi mở bất cứ công cụ AI nào, mình viết ra ba dòng: video này nói về cái gì, dành cho ai, và kết thúc bằng câu gì. Ba dòng đó quyết định toàn bộ phần sau.
Chặng 1 · Ý tưởng và kịch bản
Mình chia video thành 5–7 cảnh, mỗi cảnh một câu thoại ngắn. Cách này giúp bước sau dễ hơn rất nhiều, vì mỗi cảnh sẽ tương ứng với đúng một hình ảnh cần tạo. Đừng viết đoạn văn dài rồi mới cắt, làm ngược lại sẽ nhanh hơn.
Thời gian mình dành cho chặng này khoảng 8 phút. Nếu quá 15 phút mà vẫn chưa xong kịch bản, thường là do chủ đề còn quá rộng.
Mỗi cảnh gồm: một câu thoại tối đa 15 từ và mô tả hình ảnh.
Giọng văn thân thiện, nói với người mới bắt đầu.
Chặng 2 · Tạo hình ảnh
Với mỗi cảnh, mình tạo hình ảnh theo mô tả đã có ở chặng 1. Điều quan trọng nhất ở đây là giữ nhân vật và bối cảnh nhất quán: cùng một câu mô tả nhân vật được lặp lại nguyên văn trong mọi prompt, chỉ đổi phần hành động và góc nhìn.



Ba cảnh liên tiếp dùng cùng một mô tả nhân vật, chỉ đổi hành động.
Chặng 3 · Cho hình ảnh chuyển động
Mỗi hình ảnh được đưa qua công cụ image-to-video với một chuyển động duy nhất. Một chuyển động cho một cảnh là đủ, thêm nữa thường làm video rối và nhân vật bị biến dạng.
Chuyển động chậm và đơn giản luôn trông tự nhiên hơn chuyển động phức tạp.
Chặng 4 · Voice và dựng
Voice làm sau cùng, vì lúc này bạn đã biết chính xác mỗi cảnh dài bao lâu. Với tiếng Việt, mình giảm tốc độ đọc xuống một chút và thêm dấu phẩy ở những chỗ muốn ngắt — chỉ hai chỉnh đó thôi đã nghe tự nhiên hơn nhiều.
Ghép trên CapCut theo thứ tự cảnh, thêm nhạc nền ở mức âm lượng thấp, chèn phụ đề. Xuất bản.
Tóm lại
Lần đầu bạn sẽ mất lâu hơn 45 phút, điều đó bình thường. Từ video thứ ba trở đi, phần lớn thời gian chỉ còn ở chặng 2.
Nhập email để mình gửi file prompt bạn có thể dùng ngay.