ĐANG HOẠT ĐỘNG · ĐÃ ĐỐI CHIẾU HỆ THỐNG

Chuyển giọng nói thành văn bản

Chép lời tệp âm thanh bằng ElevenLabs Scribe v2, sau đó xuất văn bản, phụ đề SRT hoặc dữ liệu mốc thời gian có cấu trúc.

Thông số vận hành đã kiểm chứng

Đầu vào, giới hạn và điều khiển thực tế

Giới hạn tải lên
200 MB cho mỗi tệp audio
Định dạng
AAC, AIFF, OGG, MP3, Opus, WAV, WebM, FLAC và M4A
Đầu ra
SRT theo đoạn cùng JSON có mốc thời gian đoạn và từng từ
Nhận diện
Tùy chọn gắn thẻ sự kiện âm thanh; xử lý nhiều tệp và tải ZIP

Khả năng chính

Công cụ này làm được gì?

Scribe v2
Xuất phụ đề SRT
Dữ liệu mốc thời gian
Tải tệp audio lên

Dịch vụ được kết nối

Nguồn giọng, dịch vụ hoặc mô hình liên quan

ElevenLabsDịch vụ được kết nối

Quy trình sản phẩm

Từ đầu vào đến thành phẩm trong ba bước

01

Tải các bản thu

Thêm một hoặc nhiều tệp thuộc chín định dạng được hỗ trợ.

02

Chọn mức chi tiết

Bật gắn thẻ sự kiện âm thanh khi các âm thanh ngoài lời nói có ý nghĩa.

03

Xuất văn bản có thời gian

Tải SRT hoặc JSON có cấu trúc theo từng tệp hay cả lô ZIP.

Tình huống sử dụng

Phù hợp cho

  • Tạo phụ đề
  • Chép lời podcast
  • Phân tích phỏng vấn
  • Dữ liệu thời gian từng từ

API cho lập trình viên

Tích hợp quy trình này

Tác vụ tạo nội dung chạy bất đồng bộ: nhận task_id, sau đó polling hoặc dùng webhook.

POST/v1/task/speech-to-text
Xem hướng dẫn API công khai
Thông tin đã đối chiếu

Trang này chỉ mô tả khả năng đang hiển thị trong ứng dụng và có luồng xử lý tương ứng trong hệ thống tại lần xác minh gần nhất.