Long-form TTS · Giới hạn đã kiểm chứng

TTS văn bản dài chất lượng cao từ các thư viện giọng hàng đầu.

Chọn nguồn giọng được lập danh mục từ ElevenLabs, Fish Audio, MiniMax và Vbee ở mức Chất lượng cao, hoặc Microsoft Edge cho khối lượng tiết kiệm. Mỗi tác vụ nhận tối đa 1.000.000 ký tự—và một lần chạy single-speaker 153K ký tự đã tạo 2 giờ 25 phút audio trong 2 phút 38 giây, nhanh hơn thời lượng phát 55,2 lần.

1 triệuký tự mỗi tác vụGiới hạn văn bản đầu vào
5 giờtimeline SRTThời lượng phụ đề tối đa
≈1.700phút TTS từ 125.000₫Ước tính ở mức tiết kiệm
55,2×tốc độ real-time đã đoJob một giọng 153K ký tự
Giao diện OpenSpeaker High quality TTS với nguồn giọng ElevenLabs, điều chỉnh tốc độ, phát âm và thẻ biểu cảm AI
Giao diện sản phẩm thật: OpenSpeaker tập trung nhãn nguồn giọng ElevenLabs, Fish Audio, MiniMax và Vbee trong một luồng High quality TTS. Core TTS tổng hợp qua bridge riêng của OpenSpeaker; nhãn nguồn không đảm bảo gọi model hoặc API của nhà cung cấp được nêu.

Quy trình văn bản dài

Một tác vụ cho bản thảo dài hoặc tệp phụ đề

OpenSpeaker được thiết kế cho đầu vào dài hơn nhiều so với giới hạn một request của từng nhà cung cấp. Ứng dụng chia văn bản thành đoạn phù hợp, đưa vào hàng đợi xử lý và giữ toàn bộ công việc trong một tác vụ.

Benchmark production có ngày đo cho thấy một job một giọng dùng nguồn giọng ElevenLabs đã biến 153.072 ký tự thành 2 giờ 25 phút 46 giây audio trong 158,396 giây xử lý active—RTF 0,0181, tương đương 55,2× real-time.

  • Dán văn bản hoặc nhập tệp văn bản
  • Dùng SRT khi cần khớp thời gian
  • Chọn nguồn giọng và mức chất lượng
  • Theo dõi toàn bộ trong một tác vụ

Kiểm soát và nhất quán

Giữ cách đọc tên riêng, tốc độ và đầu ra nhất quán

Văn bản dài cần nhiều hơn một ô nhập lớn. OpenSpeaker có điều chỉnh tốc độ, lọc ngôn ngữ/giọng, từ điển phát âm và tùy chọn xuất bản chép lời. Quy tắc phát âm dùng lại giúp tên thương hiệu hoặc thuật ngữ được đọc thống nhất qua nhiều chương.

Chất lượng vẫn phụ thuộc engine và giọng đã chọn. Dùng nguồn cao cấp khi cần biểu cảm; dùng mức Microsoft Edge tiết kiệm khi ưu tiên khối lượng và ngân sách.

Giới hạn đã biết

Long-form không có nghĩa là vô hạn

Giới hạn đã xác minh là 1.000.000 ký tự mỗi tác vụ TTS. SRT hợp lệ có timeline tối đa 5 giờ. Các đoạn con vẫn được điều chỉnh theo nhà cung cấp, vì vậy thời gian xử lý thay đổi theo độ dài, hàng đợi, engine và tùy chọn.

Với dự án thật, hãy thử một đoạn đại diện trước. Kiểm tra phát âm, nhịp đọc và giọng rồi mới dùng credit cho toàn bộ bản thảo.

Phạm vi kiểm chứng

Giới hạn và hành vi sản phẩm được đối chiếu ngày 11/07/2026; benchmark RTF production được đo ngày 02/08/2026. Nguồn giọng và thời gian xử lý có thể thay đổi.

Câu hỏi thường gặp

Thông tin cần biết trước khi tạo

Một tác vụ OpenSpeaker xử lý được bao nhiêu văn bản?

Mỗi tác vụ TTS nhận tối đa 1.000.000 ký tự và tự chia đầu vào dài để xử lý theo hàng đợi.

Có thể chuyển phụ đề SRT thành giọng nói không?

Có. OpenSpeaker nhận SRT hợp lệ với tổng timeline tối đa 5 giờ.

Có phải tự chia sách theo giới hạn của nhà cung cấp không?

Không cần tự chia theo request. OpenSpeaker tạo các đoạn xử lý nhỏ hơn ở phía sau tác vụ.

Có thể dùng những nguồn giọng nào?

Không gian TTS đang kết nối ElevenLabs, MiniMax, Vbee, Fish Audio và Microsoft Edge. Tùy ngôn ngữ mà danh sách giọng có thể khác.

125.000₫ có luôn tạo đúng 1.700 phút không?

Không. Đây là ước tính của mức tiết kiệm đang hiển thị trên sản phẩm. Credit thực tế phụ thuộc engine, văn bản và tùy chọn.