สังเคราะห์เสียงพูด
สำหรับการบรรยาย ให้ส่งข้อความ โมเดล และเสียงที่ใช้ได้กับโมเดลที่เลือก จัดการการตอบกลับเป็นสตรีมเสียงไบนารี ไม่ใช่สตริง JSON
กำหนดนามสกุลไฟล์และ Content-Type จากรูปแบบการตอบกลับจริงก่อนบันทึกหรือเล่น
คำขอแปลงข้อความเป็นเสียงพูด
bash
curl --request POST https://cicora.ai/api/v1/audio/speech \
--header "Authorization: Bearer $CICORA_API_KEY" \
--header 'Content-Type: application/json' \
--output narration.mp3 \
--data '{
"model": "mistralai/voxtral-mini-tts-2603",
"voice": "en_paul_neutral",
"input": "Your delivery is scheduled for tomorrow.",
"response_format": "mp3"
}'การถอดเสียงและอินพุต
- ส่งไฟล์เสียงไปยัง /audio/transcriptions ในรูปแบบที่ระบุไว้ในเอกสาร
- จำกัดระยะเวลาและขนาดไฟล์ในฝั่งของคุณก่อนเริ่มอัปโหลด
- เก็บภาษา เวลา และส่วนต่าง ๆ ไว้เฉพาะเมื่อการดำเนินการที่เลือกส่งคืนข้อมูลเหล่านี้
คุณภาพและความพร้อมใช้งาน
เสียง รูปแบบ ภาษา และความเป็นแบบซิงโครนัสขึ้นอยู่กับโมเดล แสดงแก่ผู้ใช้เฉพาะตัวควบคุมที่แค็ตตาล็อกยืนยันแล้ว
สำหรับไฟล์ที่ยาวกว่า ให้สร้างงานเบื้องหลังในผลิตภัณฑ์ของคุณ เพื่อไม่ให้การหมดเวลาของเครือข่ายเป็นตัวกำหนดเวิร์กโฟลว์ของผู้ใช้