VI ▾
API văn bản không kiểm duyệt cho đường ống TTShttps://api.ttsapihub.com/v1

Danh sách kiểm tra API Elevenlabs: Hướng dẫn đường ống TTS sản xuất

Danh sách kiểm tra này ánh xạ các bước tích hợp quan trọng cho API ElevenLabs, đảm bảo đường ống chuyển văn bản thành giọng nói của bạn xử lý truyền phát, giới hạn ngữ cảnh và giới hạn tốc độ mà không bị lỗi trong môi trường sản xuất. Chúng tôi cũng chỉ ra nơi API văn bản không kiểm duyệt có thể thay thế các LLM tiêu chuẩn để loại bỏ kiểm duyệt sáng tạo trong việc tạo hội thoại của bạn.

Cập nhật

Các điểm chính

  • Cấu trúc tích hợp ElevenLabs của bạn để xử lý các đoạn âm thanh truyền phát nhằm mang lại trải nghiệm người dùng độ trễ thấp.
  • Sử dụng gọi hàm trong lớp tạo văn bản của bạn để xuất JSON có cấu trúc nhằm chọn giọng nói và metadata nhất quán.
  • Giám sát chặt chẽ giới hạn tốc độ yêu cầu của bạn để tránh lỗi 429 trong các tác vụ kể chuyện khối lượng lớn.
  • Giữ cửa sổ ngữ cảnh của bạn trong giới hạn an toàn để tránh cắt ngắn token trong các kịch bản âm thanh dài.

Tại sao chất lượng văn bản quyết định chất lượng TTS

Đầu ra của bất kỳ đường ống TTS nào chỉ tốt bằng văn bản đầu vào. Nếu LLM của bạn tạo ra cách diễn đạt lủng củng, dấu câu không nhất quán hoặc các ngắt không mong muốn, API ElevenLabs sẽ đọc to những lỗi đó chính xác như khi viết. Đây là lý do tại sao bước tạo văn bản thường là phần quan trọng nhất trong kiến trúc của bạn.

Các mô hình tiêu chuẩn thường áp dụng bộ lọc an toàn doanh nghiệp, làm cắt câu hoặc thay đổi giọng điệu giữa cuộc hội thoại để tránh các chủ đề gây tranh cãi. Đối với văn học sáng tạo, trò chơi điện tử hoặc quy trình xử lý nội dung người lớn, những gián đoạn này làm mất đi sự nhập vai. Một LLM không kiểm duyệt đảm bảo kịch bản của bạn được gửi đến công cụ TTS chính xác như bạn mong muốn, giữ nguyên sắc thái và dòng chảy.

  • Kiểm tra giọng nhân vật nhất quán trên các văn bản dài.
  • Đảm bảo dấu câu phù hợp với nhịp điệu nói mong muốn.
  • Xác minh rằng các bộ lọc an toàn không viết lại các đoạn hội thoại quan trọng.

Nếu đường ống văn bản của bạn sử dụng mô hình tiêu chuẩn, bạn có thể thấy sự thay đổi đột ngột về giọng điệu khi một chủ đề vượt qua ngưỡng ẩn. Chuyển sang mô hình được tinh chỉnh cho tự do sáng tạo sẽ loại bỏ biến số này.

Kịch bản không kiểm duyệt cho tự do sáng tạo

Khi xây dựng ứng dụng cho kể chuyện, sách nói hoặc văn học tương tác, bạn cần một công cụ văn bản không từ chối nội dung dựa trên các hướng dẫn tùy tiện. API của chúng tôi cung cấp một LLM không kiểm duyệt được tối ưu hóa cho việc sử dụng người lớn hợp pháp, nghiên cứu bảo mật và văn học sáng tạo.

Mô hình, được xác định là uncensored, chạy trên các máy chủ GPU của chúng tôi và không sử dụng prompt của bạn để huấn luyện. Nó hỗ trợ truyền phát qua SSE, cho phép bạn bắt đầu tạo các đoạn văn bản âm thanh gần như ngay lập tức.

Chúng tôi tính $0.25 cho mỗi 1M token đầu vào và $1.00 cho mỗi 1M token đầu ra. Không có phí hàng tháng và tín dụng trả trước không bao giờ hết hạn. Mô hình trả theo mức sử dụng này tích hợp liền mạch với bất kỳ khách hàng tương thích OpenAI nào, bao gồm cả các đầu vào văn bản tiêu chuẩn của ElevenLabs.

  • Hỗ trợ gọi công cụ/hàm cho đầu ra có cấu trúc.
  • Cửa sổ ngữ cảnh 100,000 token cho các câu chuyện dài.
  • Không từ chối nội dung cho các chủ đề người lớn tiêu chuẩn hoặc gây tranh cãi.

Truyền phát văn bản sang API Elevenlabs

Độ trễ thấp là rất quan trọng đối với các ứng dụng TTS thời gian thực. Trong khi ElevenLabs hỗ trợ truyền phát âm thanh, lớp tạo văn bản cũng phải truyền phát để giảm thiểu thời gian đến byte đầu tiên. Sử dụng endpoint tương thích OpenAI tiêu chuẩn POST /v1/chat/completions với stream: true.

Nhận các đoạn văn bản theo thời gian thực và chuyển chúng trực tiếp vào endpoint truyền phát âm thanh ElevenLabs. Điều này tạo ra một đường ống liên tục nơi âm thanh phát trước khi toàn bộ kịch bản được tạo ra.

API của chúng tôi hỗ trợ SSE (Server-Sent Events), giúp dễ dàng chuyển văn bản trực tiếp vào công cụ âm thanh của bạn. Đảm bảo khách hàng của bạn xử lý các câu chưa hoàn thành một cách mượt mà để tránh lỗi âm thanh.

  • Bật truyền phát trong máy khách LLM của bạn.
  • Đệm các đoạn âm thanh khi chúng đến.
  • Xử lý các gián đoạn mạng bằng cách thử lại chỉ các đoạn bị thiếu.

Xử lý cửa sổ ngữ cảnh cho các câu chuyện dài

API tts bạn dùng để tạo văn bản phải xử lý được cửa sổ ngữ cảnh dài nếu bạn đang tạo sách nói hoặc bài viết dài. Mô hình của chúng tôi hỗ trợ 100.000 token, tương đương khoảng 40-50 trang văn bản.

Nếu câu chuyện của bạn vượt quá giới hạn này, bạn phải triển khai chiến lược phân đoạn. Chia văn bản thành các đoạn logic, xử lý từng đoạn qua API và nối kết quả lại. Hãy cẩn thận không làm mất tính liên tục của câu chuyện giữa các đoạn.

Giám sát chặt chẽ việc sử dụng token của bạn. Token đầu vào rẻ hơn token đầu ra, nhưng các prompt dài vẫn có thể tích lũy. Hãy tính toán trước số lượng token trước khi gửi các văn bản lớn để tránh chi phí không mong muốn.

  • Chia văn bản theo chương hoặc cảnh.
  • Gửi prompt hệ thống để duy trì tính nhất quán về giọng nói.
  • Lưu trữ các đoạn đã hoàn thành để tránh xử lý lại.

Gọi công cụ cho hội thoại có cấu trúc

Đối với các ứng dụng phức tạp, bạn cần hơn là văn bản thuần túy. Sử dụng gọi hàm để tạo JSON có cấu trúc bao gồm ID giọng nói, thẻ cảm xúc và siêu dữ liệu. Điều này đảm bảo các cuộc gọi API ElevenLabs của bạn nhất quán và có thể dự đoán được.

Xác định lược đồ bao gồm các trường cho voice_id, stability và similarity_boost. LLM xuất ra JSON này, mà phía máy chủ của bạn sẽ phân tích cú pháp và gửi đến ElevenLabs. Điều này giảm cấu hình thủ công và ngăn ngừa lỗi.

API của chúng tôi hỗ trợ gọi hàm nguyên bản. Xác định các công cụ của bạn trong tham số tools và để mô hình quyết định khi nào sử dụng chúng. Điều này rất lý tưởng cho các nhân vật động hoặc các cuộc hội thoại đa người nói.

  • Xác định lược đồ JSON cho các tham số giọng nói.
  • Phân tích cú pháp đầu ra LLM trước khi gọi API TTS.
  • Xử lý lỗi một cách mượt mà nếu LLM bỏ sót một trường.

Quyền riêng tư: Không huấn luyện trên kịch bản của bạn

Đối với các nhà sáng tạo nội dung chuyên nghiệp, quyền riêng tư là ưu tiên hàng đầu. API của chúng tôi đảm bảo rằng các prompt của bạn không được sử dụng để huấn luyện. Khi bạn đăng ký, bạn chỉ cung cấp email và mật khẩu, và dữ liệu của bạn được giữ an toàn.

Khác với một số gói miễn phí, chúng tôi không sử dụng văn bản của bạn để cải thiện mô hình của chúng tôi. Điều này rất quan trọng đối với các câu chuyện độc quyền, kịch bản kinh doanh hoặc dữ liệu cá nhân. Tác phẩm sáng tạo của bạn vẫn thuộc về bạn.

Chúng tôi cũng áp dụng một giới hạn nội dung cứng: không có nội dung tình dục liên quan đến trẻ vị thành niên. Đây là hạn chế duy nhất được áp dụng cho nội dung hợp pháp của bạn. Mọi thứ khác đều phù hợp cho quy trình xử lý của bạn.

  • Không huấn luyện trên các prompt của bạn.
  • Yêu cầu đăng ký tối thiểu.
  • Ranh giới nội dung rõ ràng.

Giới hạn tốc độ các yêu cầu Tts Api của bạn

Giới hạn tốc độ không chỉ là sự lịch sự; chúng là yêu cầu bắt buộc cho môi trường sản xuất ổn định. API của chúng tôi cho phép 300 yêu cầu mỗi phút trên mỗi khóa. Nếu bạn vượt quá giới hạn này, bạn sẽ nhận được lỗi 429.

Triển khai cơ chế chờ tăng dần trong khách hàng của bạn để xử lý các lần thử lại một cách hiệu quả. Không làm quá tải API bằng các yêu cầu đồng thời nếu bạn có thể tránh điều đó. Sử dụng hàng đợi để quản lý các công việc khối lượng lớn.

Giám sát bảng điều khiển sử dụng của bạn để theo dõi mức tiêu thụ. Nếu bạn cần giới hạn cao hơn, hãy cân nhắc việc tạo lại khóa API của bạn, điều này sẽ thu hồi khóa cũ và bắt đầu bộ đếm giới hạn tốc độ mới. Điều này có thể hữu ích cho lưu lượng truy cập tăng đột biến.

  • Đặt giới hạn tối đa là 300 yêu cầu mỗi phút.
  • Bạn hãy sử dụng cơ chế backoff theo cấp số nhân cho các lần thử lại.
  • Bạn hãy tạo lại các khóa để đặt lại các giới hạn nếu cần thiết.

Tối ưu hóa chi phí cho TTS khối lượng lớn

Kiểm soát chi phí là rất quan trọng để mở rộng quy mô. API của chúng tôi tính $0.25 cho mỗi 1M token đầu vào và $1.00 cho mỗi 1M token đầu ra. Điều này cạnh tranh đối với các mô hình không kiểm duyệt, nhưng chi phí có thể tăng nhanh.

Tối ưu hóa prompt của bạn bằng cách loại bỏ khoảng trắng và ngữ cảnh không cần thiết. Sử dụng gọi hàm để giảm số lượt gọi. Tính toán trước số token để duy trì trong ngân sách.

Chúng tôi cung cấp tín dụng trả trước với phần thưởng. Thêm $50 để nhận phần thưởng 5%, hoặc $100 để nhận phần thưởng 10%. Điều này giảm đáng kể chi phí hiệu dụng trên mỗi token của bạn.

  • Bạn hãy theo dõi việc sử dụng token hàng ngày.
  • Bạn hãy sử dụng tín dụng trả trước để nhận chiết khấu.
  • Bạn hãy tối ưu hóa độ dài của prompt.

Hỏi đáp

Cửa sổ ngữ cảnh của mô hình không kiểm duyệt là bao nhiêu?

Mô hình hỗ trợ cửa sổ ngữ cảnh 100,000 token, bao gồm cả token prompt và token hoàn thành. Điều này cho phép các câu chuyện dài lên đến khoảng 50 trang văn bản.

Bạn có sử dụng prompt của tôi để huấn luyện không?

Không. Prompt của bạn không được sử dụng để huấn luyện. Chúng tôi chỉ yêu cầu email và mật khẩu để đăng ký, và dữ liệu của bạn vẫn được giữ bí mật.

Nội dung nào bị chặn?

Chúng tôi áp dụng giới hạn cứng đối với nội dung khiêu dâm liên quan đến trẻ vị thành niên. Tất cả các chủ đề hợp pháp khác dành cho người trưởng thành, hư cấu hoặc gây tranh cãi đều được cho phép mà không bị từ chối.

Làm thế nào để tôi bắt đầu với gói dùng thử?

Bạn hãy đăng ký bằng email và mật khẩu để nhận $0.50 tín dụng dùng thử, có hiệu lực trong 7 ngày. Không cần thẻ tín dụng để bắt đầu.

Khóa của bạn chỉ cách một biểu mẫu

Bạn hãy tạo tài khoản, sao chép khóa, thay đổi base URL. Đó là toàn bộ quy trình thiết lập.

Lấy khóa API