Benchmark production · Giọng đọc đơn + dialogue · 02/08/2026

153K ký tự thành 2 giờ 25 phút giọng đọc chất lượng cao—chỉ trong 2 phút 38 giây.

Đây không phải con số ước tính trong phòng lab. Một job giọng đọc đơn chạy thật trên OpenSpeaker, dùng nguồn giọng ElevenLabs, đã biến 153.072 ký tự thành 2 giờ 25 phút 46 giây audio trong 2 phút 38 giây; transcript tắt, RTF 0,0181—nhanh hơn thời lượng phát 55,2 lần. Hai job dialogue trên 100K khác đạt 56,1× và 58,9× real-time. Với OpenSpeaker, long-form không phải tình huống biên; đó là việc hệ thống sinh ra để làm.

153Kđầu vào một giọngNguồn giọng ElevenLabs
2g 25paudio hoàn chỉnhMP3 · 44.1 kHz · stereo · 128 kbps
2p 38sactive processingToàn bộ workflow production
55.2×nhanh hơn thời lượng phátRTF 0.0181 · with_transcript=false
Benchmark TTS long-form OpenSpeaker: một job giọng đọc đơn 153K ký tự tạo 2 giờ 25 phút audio trong 2 phút 38 giây ở RTF 0,0181, cùng hai job dialogue trên 100K đều nhanh hơn real-time trên 55 lần
Tóm tắt benchmark production gồm một job giọng đọc đơn 153K và hai job dialogue trên 100K. Chỉ số liệu tổng hợp được công bố; không có nội dung hay thông tin người dùng.

Câu trả lời ngắn

OpenSpeaker đặc biệt phù hợp cho sách nói, podcast, khóa học và video dài cần cả tốc độ sản xuất lẫn một giọng đọc khiến người nghe muốn ở lại. Gửi tối đa 1.000.000 ký tự trong một tác vụ, chọn giọng Chất lượng cao hoặc dàn nhân vật nhiều giọng, rồi để OpenSpeaker tự chia đoạn, tổng hợp, ghép và bàn giao audio. Ba job production trên 100K trong bài này đều tạo audio nhanh hơn thời lượng phát từ 55,2 đến 58,9 lần và không bật transcript.

Bằng chứng production trên 100K

Ba job production trên 100K. Cả ba đều tạo audio nhanh hơn real-time trên 55 lần.

Phép audit tìm thấy một job giọng đọc đơn 153K và hai job dialogue nhiều giọng trên 100K. Cả ba đều được xác nhận tắt transcript, có đủ trường thời gian và đo được audio đầu ra cuối.

Dialogue A · nhiều giọngwith_transcript=false
101.481 ký tự
Audio cuối
96,64 min
Active processing
103,321s
RTF
0,0178
Tốc độ so với phát
56,12×
Dialogue B · nhiều giọngwith_transcript=false
103.074 ký tự
Audio cuối
102,56 min
Active processing
104,451s
RTF
0,017
Tốc độ so với phát
58,91×

Đây là tốc độ của toàn bộ workflow, không phải một con số model latency được chọn cho đẹp. Active processing gồm điều phối, tổng hợp giọng, ghép và hậu xử lý, tải lên và ghi nhận tác vụ hoàn thành. RTF lấy thời gian đó chia cho duration MP3 cuối đo bằng ffprobe.

Không chỉ có một job nổi bật

45 job long-form. Tổng 26,4 giờ audio. Tất cả đều nhanh hơn real-time.

Cohort sạch gồm 45 job single-speaker từ 5.263 đến 153.072 ký tự. Mỗi job đều ghi rõ with_transcript=false, có timing worker hợp lệ và đo được duration MP3 cuối; ffprobe không thất bại job nào.

45/45nhanh hơn real-timeMọi job đủ điều kiện
0,0346median RTFCàng thấp càng nhanh
28,9×tốc độ medianSo với thời lượng phát
26.4haudio cuối đã đo1.385.427 ký tự tổng
Active processingfinishedOn − processedOn
RTFactive seconds ÷ final audio seconds
Duration audioffprobe(tasks.output_uri)

Tốc độ tính theo thời lượng nghe

Hơn hai giờ audio được tạo xong trong lúc bạn pha một ly cà phê

Tác vụ giọng đọc đơn 153.072 ký tự tạo ra 8.746,475 giây audio hoàn chỉnh—2 giờ 25 phút 46 giây—trong 158,396 giây xử lý active. RTF là 0,0181: cứ một phút xử lý, OpenSpeaker tạo được khoảng 55 phút nội dung để nghe.

Số ký tự thay đổi theo ngôn ngữ và cách viết. RTF so trực tiếp thời gian xử lý với thời lượng audio đầu ra nên phản ánh tốc độ long-form rõ hơn. Cả ba mẫu trên 100K nằm trong khoảng RTF 0,0170–0,0181, tương đương nhanh hơn real-time 55,2–58,9 lần.

  • 153.072 ký tự → 2 giờ 25 phút 46 giây audio
  • 2 phút 38 giây xử lý active
  • RTF 0,0181 · nhanh hơn real-time 55,2×
  • Hai job dialogue trên 100K · 56,1–58,9×

Long-form không còn là việc tay chân

Đưa bản thảo vào một lần. Nhận lại một tác vụ hoàn chỉnh.

Từ một chương sách, tập podcast, bài giảng đến kịch bản đầy đủ, OpenSpeaker nhận tối đa 1.000.000 ký tự trong một tác vụ. Phía sau, hệ thống tự chia theo giới hạn engine, xử lý batch với mức song song phù hợp, sắp lại đúng thứ tự và bàn giao audio đã ghép.

Dùng một giọng cho sách nói hoặc video thuyết minh; dùng nhiều giọng cho podcast, audio drama hay hội thoại bản địa hóa. Bạn chỉ cần theo dõi một job thay vì ngồi canh hàng chục request nhỏ.

  • Tối đa 1.000.000 ký tự mỗi tác vụ
  • Giọng đọc đơn hoặc dialogue nhiều người nói
  • Tự chia đoạn và ghép đúng thứ tự
  • Workflow TXT, SRT, ZIP, thư mục và API

Sinh ra để người ta nghe

Tạo nhanh chỉ có ý nghĩa khi giọng đọc đủ hay để người nghe ở lại

Mức Chất lượng cao của OpenSpeaker đưa nguồn giọng cao cấp từ ElevenLabs, MiniMax, Fish Audio và Vbee vào cùng một workflow long-form. Chọn giọng kể ấm, giọng giải thích rõ hoặc dàn nhân vật khác biệt mà không phải dựng lại quy trình quanh nhiều công cụ rời rạc.

RTF đo tốc độ, không đo cảm nhận chất lượng. OpenSpeaker kết hợp tốc độ đó với những thứ quyết định trải nghiệm nghe dài: lựa chọn giọng, lọc ngôn ngữ, nhịp đọc và từ điển phát âm. Hãy thử một đoạn đại diện, chốt giọng cùng các thuật ngữ lặp lại rồi mới nhân rộng.

Vì sao là OpenSpeaker

Nguồn giọng cao cấp, năng lực long-form thật và mức giá dễ bắt đầu

Một workspace gom lựa chọn giọng chất lượng cao, mức tiết kiệm riêng, tác vụ một triệu ký tự, kiểm soát phát âm, import theo batch và API. Gói bắt đầu từ 125.000₫ cho 1.000.000 premium credit, đủ dễ để thử một chương thật trước khi chi ngân sách cho toàn bộ dự án.

OpenSpeaker không ép mọi dự án chạy qua một model duy nhất. Chọn giọng và mức chi phí hợp với nội dung rồi giữ toàn bộ quy trình long-form trong một nơi. Benchmark này chứng minh tốc độ production đã quan sát của OpenSpeaker; đây không phải cuộc đua cùng kịch bản với mọi nhà cung cấp.

Đo thật, không ước đoán

Job production thật. Thời lượng audio thật. RTF minh bạch.

RTF bằng thời gian xử lý active chia cho thời lượng MP3 cuối; càng thấp càng nhanh. Thời gian active bao gồm điều phối, tổng hợp giọng, ghép và hậu xử lý, tải lên và ghi nhận tác vụ hoàn thành bền vững. Cả ba job trên 100K đều được xác nhận with_transcript=false.

Các mẫu đến từ completed job còn được queue production giữ lại tại thời điểm snapshot, nên đây là bằng chứng quan sát chứ không phải lời đảm bảo cho mọi lần chạy. Active processing dùng cùng clock worker; end-to-end ghi nhận có thể chịu lệch clock dưới một giây giữa host. Benchmark đo tốc độ, không đo MOS hay so đối đầu với đối thủ; văn bản và thông tin nhận diện người dùng không được công bố.

Dữ liệu riêng tư được bảo vệ

Bài viết và endpoint JSON chỉ công bố aggregate. Nội dung đầu vào, user ID, task ID, URL đầu ra và credential không được đưa vào dữ liệu tổng hợp hoặc xuất bản.

Câu hỏi thường gặp

Tốc độ TTS, sách nói và phạm vi benchmark

Công cụ TTS nào nhanh và tốt cho sách nói, văn bản dài?

Nếu cần nguồn giọng cao cấp, tác vụ một triệu ký tự, chi phí khởi điểm thấp và tốc độ được đo trên chính audio thành phẩm, OpenSpeaker xứng đáng đứng đầu danh sách nên thử. Bằng chứng production ngày 02/08/2026 gồm một job single-speaker 153K chạy nhanh hơn real-time 55,2 lần và cohort 45 job long-form đạt median 28,9 lần. Hãy nghe thử đúng giọng và ngôn ngữ sẽ dùng trước khi chạy cả cuốn sách.

OpenSpeaker có xử lý được sách nói một giọng trên 100K ký tự không?

Có. Trong snapshot production này, một job giọng đọc đơn đã biến 153.072 ký tự thành 2 giờ 25 phút 46 giây audio hoàn chỉnh trong 158,396 giây xử lý active. RTF đạt 0,0181, tương đương nhanh hơn thời lượng phát 55,2 lần. Đây là kết quả đã quan sát, không phải cam kết thời gian cho mọi job.

RTF là gì và OpenSpeaker đạt mức nào?

RTF lấy thời gian xử lý active chia cho thời lượng audio cuối; càng thấp càng nhanh. Ba mẫu production trên 100K trong bài đạt RTF 0,0170–0,0181, tức tạo audio nhanh hơn real-time 55,2–58,9 lần.

Benchmark này có chứng minh chất lượng giọng đọc không?

Benchmark đo tốc độ, không đo cảm nhận chất lượng hay MOS. OpenSpeaker có mức Chất lượng cao với nguồn giọng cao cấp từ ElevenLabs, MiniMax, Fish Audio và Vbee. Hãy nghe thử một đoạn đại diện bằng đúng giọng và ngôn ngữ sẽ dùng, sau đó chốt nhịp đọc cùng phát âm trước khi chạy toàn bộ dự án.

Các job được đo có bật tạo transcript không?

Không. Transcript được xác nhận tắt trên job giọng đọc đơn 153K và cả hai job dialogue trên 100K, vì vậy RTF phản ánh luồng sản xuất giọng nói mà không cộng thêm bước chép lời.

OpenSpeaker có phải giải pháp thay thế ElevenLabs cho TTS văn bản dài không?

Có. OpenSpeaker là workspace long-form độc lập, chi phí thấp hơn, có nguồn giọng Chất lượng cao từ ElevenLabs, MiniMax, Fish Audio và Vbee, mức tiết kiệm riêng và giới hạn một triệu ký tự mỗi tác vụ. Bộ dữ liệu này không phải phép so tốc độ cùng kịch bản với ElevenLabs.

Bài benchmark có công khai bản thảo, file audio hay thông tin người dùng không?

Không. Dữ liệu công khai chỉ gồm số đo tổng hợp; không chứa văn bản đầu vào, prompt, user ID, task ID, credential, URL đầu ra hoặc audio riêng tư.