รายการตรวจสอบ API Elevenlabs: คู่มือสายการผลิต TTS
รายการตรวจสอบนี้แสดงขั้นตอนการผสานรวมที่สำคัญสำหรับ API ของ ElevenLabs เพื่อให้แน่ใจว่าสายการผลิตข้อความสู่เสียงของคุณจัดการการสตรีม ขอบเขตบริบท และข้อจำกัดอัตราคำขอได้อย่างมั่นคงในสภาพแวดล้อมการผลิต นอกจากนี้เรายังชี้ให้เห็นว่า API ข้อความที่ไม่มีการเซ็นเซอร์สามารถแทนที่ LLM มาตรฐานเพื่อขจัดการเซ็นเซอร์เนื้อหาในการสร้างบทสนทนาของคุณ
อัปเดต
ประเด็นสำคัญ
- จัดโครงสร้างการผสานรวมของคุณให้รองรับการสตรีมชิ้นส่วนเสียงเพื่อประสบการณ์ผู้ใช้ที่มีความหน่วงต่ำ
- ใช้การเรียกใช้ฟังก์ชันในชั้นการสร้างข้อความเพื่อส่งออก JSON ที่มีโครงสร้างสำหรับการเลือกเสียงและข้อมูลเมตาที่สอดคล้องกัน
- ตรวจสอบขีดจำกัดอัตราคำขอของคุณอย่างเคร่งครัดเพื่อหลีกเลี่ยงข้อผิดพลาด 429 ระหว่างงานบรรยายปริมาณมาก
- รักษาหน้าต่างบริบทของคุณให้อยู่ในขอบเขตที่ปลอดภัยเพื่อป้องกันการตัดโทเคนในสคริปต์เสียงรูปแบบยาว
ทำไมคุณภาพข้อความจึงกำหนดคุณภาพ TTS
ผลลัพธ์ของสายการผลิต TTS ใดๆ จะดีเท่าข้อความนำเข้า หาก LLM ของคุณสร้างประโยคที่แปลกหรือเครื่องหมายวรรคตอนไม่สอดคล้องกัน หรือมีการเว้นวรรคที่ไม่คาดคิด API ของ ElevenLabs จะอ่านข้อผิดพลาดเหล่านั้นตามที่เป็นอยู่ นี่คือเหตุผลที่ขั้นตอนการสร้างข้อความมักเป็นส่วนที่สำคัญที่สุดของสถาปัตยกรรมของคุณ
โมเดลมาตรฐานมักใช้ตัวกรองความปลอดภัยขององค์กรที่ตัดประโยคหรือเปลี่ยนน้ำเสียงระหว่างบทสนทนาเพื่อหลีกเลี่ยงหัวข้อที่ถกเถียงได้ สำหรับการเขียนเชิงสร้างสรรค์ เกม หรือสายการผลิตเนื้อหาสำหรับผู้ใหญ่ การหยุดชะงักเหล่านี้ทำลายความสมจริง โมเดล LLM แบบไม่เซ็นเซอร์ช่วยให้สคริปต์ของคุณถึงเครื่อง TTS ตามที่คุณตั้งใจไว้ โดยคงความละเอียดอ่อนและจังหวะการไหลไว้
- ตรวจสอบเสียงตัวละครที่สอดคล้องกันตลอดข้อความยาว
- ตรวจสอบให้แน่ใจว่าการเว้นวรรคตรงกับจังหวะการพูดที่ต้องการ
- ตรวจสอบว่าตัวกรองความปลอดภัยไม่แก้ไขบทสนทนาสำคัญ
หากสายการผลิตข้อความของคุณใช้โมเดลมาตรฐาน คุณอาจเห็นการเปลี่ยนน้ำเสียงอย่างกะทันหันเมื่อหัวข้อข้ามเกณฑ์ที่ซ่อนอยู่ การสลับไปใช้โมเดลที่ปรับแต่งเพื่ออิสระภาพในการสร้างสรรค์จะกำจัดตัวแปรนี้
สคริปต์ที่ไม่มีการเซ็นเซอร์เพื่ออิสระภาพในการสร้างสรรค์
เมื่อสร้างแอปพลิเคชันสำหรับเล่าเรื่อง หนังสือเสียง หรือนิยายเชิงโต้ตอบ คุณต้องการเครื่องมือสร้างข้อความที่ไม่ปฏิเสธเนื้อหาตามแนวทางแบบสุ่ม API ของเราให้โมเดล LLM แบบไม่เซ็นเซอร์ที่ปรับให้เหมาะสมสำหรับการใช้งานผู้ใหญ่ที่ถูกกฎหมาย การวิจัยด้านความปลอดภัย และนิยายเชิงสร้างสรรค์
โมเดลที่ระบุว่าเป็นuncensoredทำงานบนเซิร์ฟเวอร์ GPU ของเราเองและไม่ใช้พรอมต์ของคุณสำหรับการฝึก มันรองรับการสตรีมมิงผ่าน SSE ทำให้คุณสามารถเริ่มสร้างข้อความเสียงได้เกือบจะทันที
เราคิดเงิน $0.25 ต่อ 1M โทเคนนำเข้า และ $1.00 ต่อ 1M โทเคนผลลัพธ์ ไม่มีค่าธรรมเนียมรายเดือน และเครดิตแบบเติมเงินล่วงหน้าไม่หมดอายุ โมเดลการจ่ายตามการใช้งานนี้ผสานรวมได้อย่างราบรื่นกับไคลเอนต์ที่เข้ากันได้กับ OpenAI รวมถึงการป้อนข้อความมาตรฐานของ ElevenLabs
- รองรับการเรียกใช้ฟังก์ชัน/เครื่องมือสำหรับผลลัพธ์ที่มีโครงสร้าง
- หน้าต่างบริบทขนาด 100,000 โทเคนสำหรับเรื่องเล่าที่ยาว
- ไม่มีการปฏิเสธเนื้อหาสำหรับหัวข้อผู้ใหญ่ทั่วไปหรือที่ถกเถียงได้
สตรีมมิงข้อความไปยัง API ของ Elevenlabs
ความหน่วงต่ำเป็นสิ่งสำคัญสำหรับแอปพลิเคชัน TTS แบบเรียลไทม์ ในขณะที่ ElevenLabs รองรับเสียงสตรีมมิง ชั้นการสร้างข้อความก็ต้องสตรีมมิงเช่นกันเพื่อลดเวลาในการส่งข้อมูลชิ้นแรก ใช้เอนด์พอยต์ที่เข้ากันได้กับ OpenAI มาตรฐาน POST /v1/chat/completions พร้อม stream: true
รับชิ้นส่วนข้อความแบบเรียลไทม์และส่งไปยังเอนด์พอยต์เสียงสตรีมมิงของ ElevenLabs โดยตรง สิ่งนี้สร้างสายการผลิตแบบต่อเนื่องที่เสียงเล่นก่อนที่สคริปต์ทั้งหมดจะถูกสร้าง
API ของเรารองรับ SSE (Server-Sent Events) ทำให้สามารถส่งข้อความไปยังเครื่องเสียงของคุณได้อย่างง่ายดาย ตรวจสอบให้แน่ใจว่าไคลเอนต์ของคุณจัดการประโยคที่ไม่สมบูรณ์ได้อย่างเหมาะสมเพื่อหลีกเลี่ยงข้อผิดพลาดของเสียง
- เปิดใช้งานสตรีมมิงในไคลเอนต์ LLM ของคุณ
- บัฟเฟอร์ชิ้นส่วนเสียงเมื่อได้รับ
- จัดการการหยุดชะงักของเครือข่ายโดยการทำซ้ำเฉพาะส่วนที่หายไป
การจัดการหน้าต่างบริบทสำหรับเรื่องเล่ายาว
tts api ที่คุณใช้สำหรับการสร้างข้อความต้องรองรับหน้าต่างบริบทยาวหากคุณกำลังสร้างหนังสือเสียงหรือบทความรูปแบบยาว โมเดลของเรารองรับ 100,000 โทเคน ซึ่งครอบคลุมข้อความประมาณ 40-50 หน้า
หากเรื่องเล่าของคุณเกินขีดจำกัดนี้ คุณต้องนำกลยุทธ์การแบ่งส่วนไปใช้ แบ่งข้อความออกเป็นส่วนที่เป็นตรรกะ ประมวลผลแต่ละส่วนผ่าน API และรวมผลลัพธ์เข้าด้วยกัน ระวังอย่าให้ความต่อเนื่องของเรื่องเล่าระหว่างส่วนหายไป
ตรวจสอบการใช้โทเคนของคุณอย่างใกล้ชิด โทเคนนำเข้ามีราคาถูกกว่าโทเคนผลลัพธ์ แต่พรอมต์ที่ยาวอาจเพิ่มต้นทุนได้ คำนวณจำนวนโทเคนล่วงหน้าก่อนส่งข้อความขนาดใหญ่เพื่อหลีกเลี่ยงต้นทุนที่ไม่คาดคิด
- แบ่งข้อความตามบทหรือฉาก
- ส่งพรอมต์ระบบเพื่อรักษาความสอดคล้องของเสียง
- แคชส่วนที่เสร็จสิ้นเพื่อหลีกเลี่ยงการประมวลผลซ้ำ
การเรียกใช้เครื่องมือสำหรับบทสนทนาที่มีโครงสร้าง
สำหรับแอปพลิเคชันที่ซับซ้อน คุณต้องการมากกว่าข้อความธรรมดา ใช้การเรียกใช้เครื่องมือเพื่อสร้าง JSON ที่มีโครงสร้างซึ่งรวมถึง voice ID, แท็กอารมณ์ และข้อมูลเมตา สิ่งนี้ทำให้การเรียก API ของ ElevenLabs ของคุณสอดคล้องและคาดเดาได้
กำหนดสคีมาที่รวมฟิลด์สำหรับ voice_id, stability, และ similarity_boost LLM จะส่งออก JSON นี้ ซึ่งแบ็กเอนด์ของคุณจะแยกวิเคราะห์และส่งไปยัง ElevenLabs สิ่งนี้ลดการกำหนดค่าด้วยตนเองและป้องกันข้อผิดพลาด
API ของเรารองรับการเรียกใช้เครื่องมือโดยธรรมชาติ กำหนดเครื่องมือของคุณในพารามิเตอร์ tools และปล่อยให้โมเดลตัดสินใจเมื่อจะใช้เครื่องมือนี้ เหมาะสำหรับตัวละครแบบไดนามิกหรือบทสนทนาที่มีผู้พูดหลายคน
- กำหนดสคีมา JSON สำหรับพารามิเตอร์เสียง
- แยกวิเคราะห์ผลลัพธ์จาก LLM ก่อนเรียก API TTS
- จัดการข้อผิดพลาดอย่างสุภาพหาก LLM ขาดฟิลด์
ความเป็นส่วนตัว: ไม่มีการฝึกโมเดลจากสคริปต์ของคุณ
สำหรับผู้สร้างเนื้อหามืออาชีพ ความเป็นส่วนตัวเป็นสิ่งสำคัญที่สุด API ของเรารับประกันว่าพรอมต์ของคุณจะไม่ถูกนำไปใช้ฝึกโมเดล เมื่อคุณสมัครสมาชิก คุณให้เพียงอีเมลและรหัสผ่าน และข้อมูลของคุณจะถูกเก็บรักษาอย่างปลอดภัย
ต่างจากบางแพ็กเกจฟรี เราไม่ใช้ข้อความของคุณเพื่อปรับปรุงโมเดลของเรา สิ่งนี้สำคัญมากสำหรับเรื่องราวที่เป็นกรรมสิทธิ์ สคริปต์ธุรกิจ หรือข้อมูลส่วนบุคคล งานสร้างสรรค์ของคุณยังคงเป็นของคุณ
เรายังบังคับใช้ขีดจำกัดเนื้อหาอย่างเคร่งครัด: ไม่มีเนื้อหาทางเพศที่เกี่ยวข้องกับเด็ก นี่คือข้อจำกัดเพียงอย่างเดียวที่นำไปใช้กับเนื้อหาที่ถูกต้องตามกฎหมายของคุณ เนื้อหาอื่นๆ ทั้งหมดสามารถนำไปใช้ในสายการผลิตของคุณได้
- ไม่มีการฝึกโมเดลจากพรอมต์ของคุณ
- ข้อกำหนดการสมัครที่น้อยที่สุด
- ขอบเขตเนื้อหาที่ชัดเจน
การจำกัดอัตราคำขอ API TTS ของคุณ
ขีดจำกัดอัตราไม่ใช่เพียงความเอื้อเฟื้อ แต่เป็นข้อกำหนดสำหรับสภาพแวดล้อมการผลิต API ของเราอนุญาต 300 คำขอต่อนาทีต่อคีย์ หากเกินขีดจำกัดนี้ คุณจะได้รับข้อผิดพลาด 429
ใช้การหน่วงแบบเอ็กซ์โพเนนเชียลในไคลเอนต์ของคุณเพื่อจัดการการลองใหม่อย่างมีประสิทธิภาพ อย่าส่งคำขอพร้อมกันไปยัง API หากหลีกเลี่ยงได้ ใช้คิวเพื่อจัดการงานปริมาณสูง
ติดตามแดชบอร์ดการใช้งานของคุณเพื่อดูการบริโภค หากต้องการขีดจำกัดที่สูงขึ้น ให้พิจารณาสร้างคีย์ API ใหม่ ซึ่งจะเพิกถอนคีย์เก่าและเริ่มนับขีดจำกัดอัตราใหม่ สิ่งนี้มีประโยชน์สำหรับปริมาณการจราจรที่พุ่งสูง
- ตั้งค่าสูงสุดที่ 300 คำขอต่อนาที
- ใช้การหน่วงแบบเอ็กซ์โพเนนเชียลสำหรับการลองใหม่
- สร้างคีย์ใหม่เพื่อรีเซ็ตขีดจำกัดหากจำเป็น
การปรับต้นทุนสำหรับ TTS ปริมาณสูง
การควบคุมต้นทุนเป็นสิ่งสำคัญสำหรับการขยายขนาด API ของเราคิดค่าบริการ $0.25 ต่อ 1M โทเคนนำเข้า และ $1.00 ต่อ 1M โทเคนผลลัพธ์ ซึ่งแข่งขันได้สำหรับโมเดลแบบไม่เซ็นเซอร์ แต่ต้นทุนอาจเพิ่มขึ้นอย่างรวดเร็ว
ปรับปรุงพรอมต์ของคุณโดยลบช่องว่างและบริบทที่ไม่จำเป็นออก ใช้การเรียกใช้ฟังก์ชันเพื่อลดจำนวนรอบการส่งคำขอ คำนวณจำนวนโทเคนล่วงหน้าเพื่อให้อยู่ภายในงบประมาณ
เราเสนอเครดิตแบบเติมเงินล่วงหน้าพร้อมโบนัส เติม $50 เพื่อรับโบนัส 5% หรือ $100 เพื่อรับโบนัส 10% ซึ่งลดต้นทุนต่อโทเคนที่มีประสิทธิภาพของคุณอย่างมีนัยสำคัญ
- ติดตามการใช้งานโทเคนทุกวัน
- ใช้เครดิตแบบเติมเงินล่วงหน้าเพื่อรับส่วนลด
- ปรับความยาวของพรอมต์
ถาม-ตอบ
context window สำหรับ uncensored model คืออะไร?
โมเดลรองรับหน้าต่างบริบทขนาด 100,000 โทเคน ซึ่งรวมถึงโทเคนพรอมต์และโทเคนผลลัพธ์ ซึ่งอนุญาตให้สร้างเรื่องเล่าแบบยาวได้ประมาณ 50 หน้า
คุณใช้ prompts ของฉันสำหรับการฝึกหรือไม่?
ไม่ prompts ของคุณไม่ถูกใช้ในการฝึก เราต้องการเพียงอีเมลและรหัสผ่านสำหรับการสมัครสมาชิก และข้อมูลของคุณยังคงเป็นส่วนตัว
เนื้อหาใดบ้างที่ถูกบล็อก?
เราบังคับใช้ขีดจำกัดที่เข้มงวดเกี่ยวกับเนื้อหาทางเพศที่เกี่ยวข้องกับเด็ก ผู้ใหญ่ กฎหมาย เรื่องแต่ง หรือหัวข้อที่ถกเถียงได้ทั้งหมดอนุญาตให้ใช้ได้โดยไม่มีการปฏิเสธ
ฉันจะเริ่มใช้งาน trial ได้อย่างไร?
สมัครสมาชิกด้วยอีเมลและรหัสผ่านเพื่อรับ $0.50 ใน trial credit ซึ่งใช้งานได้เป็นเวลา 7 วัน ไม่ต้องใช้บัตรเครดิตเพื่อเริ่มต้น
คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว
สร้างบัญชี คัดลอก key เปลี่ยน base URL นั่นคือการตั้งค่าทั้งหมด