Scene Studio: từ kịch bản và bộ ảnh thành video, đồng bộ tới từng câu
Dán kịch bản, thả ảnh cho từng cảnh, chọn giọng đọc AI hoặc giọng clone của chính bạn. App tạo giọng đọc, tự căn thời điểm đổi ảnh khớp lời, cho bạn nghe thử và chỉnh tay, rồi xuất MP4 kèm timeline Premiere.
Đăng nhập nhận 20 credit dùng thửXem gói credit
Tặng 20 credit TTS khi tạo tài khoảnChỉ trừ credit phần thật sự tạo giọngDữ liệu dự án ở lại máy bạn
Bốn bước ra video
Bạn lo kịch bản và hình ảnh, phần căn chỉnh tỉ mỉ để máy làm.
Chuẩn bị kịch bản & ảnh
Mỗi cảnh một đoạn lời đọc và một ảnh. Nhập từ bảng tính hoặc file JSON. Cảnh chỉ có tiêu đề ngắn tự thành cảnh câm, hiện ảnh theo số giây bạn đặt.
Chọn giọng đọc
Chọn giọng hệ thống hoặc clone giọng của bạn từ 3–10 giây ghi âm. Voice profile lưu theo tài khoản, dùng lại cho mọi dự án.
Tạo giọng, tự căn thời điểm
App báo trước số credit, tạo giọng đọc theo từng câu trọn vẹn, rồi nhận dạng lại audio để đặt ranh giới đổi ảnh đúng lời.
Nghe thử, chỉnh tay, xuất
Xem trước ngay trong app. Kéo ranh giới, thêm khoảng nghỉ, thay ảnh, hoàn tác thoải mái. Xuất MP4 hoặc timeline Premiere để dựng tiếp.
Làm video kể chuyện nhanh hơn, không mất kiểm soát
Tự động phần tốn thời gian, giữ lại cho bạn quyền chỉnh từng chi tiết.
Giọng đọc AI, kể cả giọng của bạn
Nhiều engine TTS quản lý tập trung, không cần tự cấu hình API. Clone giọng riêng từ đoạn ghi âm mẫu, giọng thuộc về tài khoản bạn.
Đồng bộ tới từng câu chữ
Nhận dạng giọng nói lấy thời điểm từng từ, đặt điểm đổi ảnh đúng ranh giới câu. Câu đọc lệch nhiều được cảnh báo để bạn tạo lại.
Xem trước & chỉnh tay
Phát audio và đổi ảnh theo playhead ngay trong app. Kéo ranh giới, thêm khoảng nghỉ sau câu, thay ảnh từng cảnh, có hoàn tác/làm lại.
Sửa một câu, không tốn cả bài
Tạo lại riêng câu đọc chưa ưng, các câu khác dùng cache. Chỉ trừ credit phần tạo mới, phần lỗi hoàn tự động.
Xuất MP4 + timeline Premiere
MP4 tới 4K, audio hoàn chỉnh, XML mở trong Adobe Premiere kèm marker gợi ý hiệu ứng âm thanh. Xuất audio lẻ theo cảnh khớp tên ảnh.
Cảnh câm, tiêu đề
Cảnh chỉ có tiêu đề viết hoa ngắn không tạo giọng, hiện ảnh theo số giây bạn đặt. Tiện cho title card, chuyển đoạn.
Biết trước sẽ tốn bao nhiêu
Trước mỗi lần tạo giọng, app ước tính số ký tự và credit sẽ trừ, hết credit thì báo ngay kèm gói nạp, không chạy dở.
Câu trọn vẹn, giọng tự nhiên
Các dòng liền nhau chưa hết câu được gom lại để tạo giọng theo câu trọn vẹn, giọng đọc không bị ngắt giữa chừng.
Một tài khoản, dùng chung với Auto Flow
Đăng nhập bằng email như extension. Gói Pro cộng credit Scene Studio mỗi tháng; nạp thêm theo gói khi cần, thanh toán PayOS.
Trả theo lượng giọng đọc thật sự tạo ra
1 credit = 1.000 ký tự, tương đương khoảng 1 phút audio tiếng Việt. Video 10 phút lời đọc tốn khoảng 10 credit.
Cần gì để bắt đầu
Máy Windows
Bản Windows 10/11. Không cần GPU: tạo giọng chạy trên server, phần dựng video chạy cục bộ trên máy văn phòng bình thường.
Kịch bản và ảnh cho từng cảnh
Ảnh PNG/JPG cho mỗi cảnh, lời đọc theo cảnh trong bảng tính hoặc JSON. Tạo ảnh hàng loạt bằng Auto Flow rồi đưa thẳng vào đây.
Tài khoản Automation Labs
Đăng nhập bằng email, nhận 20 credit dùng thử. Cần mạng khi tạo giọng; căn chỉnh và xuất video làm offline được.
Câu hỏi thường gặp về Scene Studio
Scene Studio chạy trên hệ nào? Cần máy mạnh không?
Hiện có bản Windows. Phần tạo giọng đọc chạy trên server nên máy bạn không cần GPU; phần căn thời điểm và dựng video chạy cục bộ, máy văn phòng bình thường là đủ. Cần kết nối mạng khi tạo giọng đọc.
Credit tính thế nào? Sửa một câu có tốn lại cả bài không?
1 credit = 1.000 ký tự văn bản chuyển thành giọng nói, khoảng 1 phút audio. Trước khi chạy app báo trước số credit sẽ trừ. Câu nào đọc chưa ưng thì tạo lại riêng câu đó, các câu còn lại dùng cache, chỉ trừ phần tạo mới. Nhóm lỗi được hoàn credit tự động.
Clone giọng cần gì?
Một đoạn ghi âm mẫu 3–10 giây, rõ tiếng, ít tạp âm. App tự chuyển định dạng và tạo voice profile thuộc tài khoản của bạn; người khác không thấy và không dùng được giọng đó. Ngoài giọng clone còn có sẵn các giọng hệ thống dùng chung.
Đổi ảnh có khớp lời đọc thật không hay canh theo thời gian?
Khớp theo lời đọc thật: sau khi tạo giọng, app nhận dạng lại audio để lấy thời điểm từng từ, rồi đặt ranh giới đổi ảnh đúng giữa câu cuối của cảnh trước và câu đầu của cảnh sau. Bạn vẫn kéo chỉnh tay được từng ranh giới.
Xuất ra được gì? Có dùng tiếp trong Premiere không?
MP4 (kể cả 4K), file audio hoàn chỉnh, và timeline XML mở thẳng trong Adobe Premiere với đúng thứ tự ảnh, thời điểm đổi và marker gợi ý chèn hiệu ứng âm thanh. Có thể xuất riêng audio theo từng cảnh, khớp tên ảnh.
Dùng chung tài khoản với Extension Auto Flow được không?
Được, cùng một email. Gói Pro của extension cộng credit Scene Studio mỗi tháng vào tài khoản đó; cần thêm thì nạp gói credit. Tối đa 3 thiết bị đăng nhập cho cả hai sản phẩm.
Thử với 20 credit miễn phí
Tạo tài khoản bằng email, nhận credit dùng thử, dựng video đầu tiên với giọng đọc của chính bạn.