Tổng hợp giọng nói
Để thuyết minh, gửi văn bản, mô hình và giọng nói khả dụng cho mô hình đã chọn. Xử lý phản hồi dưới dạng luồng âm thanh nhị phân, không phải chuỗi JSON.
Gán phần mở rộng tệp và Content-Type theo định dạng phản hồi thực tế trước khi lưu hoặc phát.
Yêu cầu chuyển văn bản thành giọng nói
bash
curl --request POST https://cicora.ai/api/v1/audio/speech \
--header "Authorization: Bearer $CICORA_API_KEY" \
--header 'Content-Type: application/json' \
--output narration.mp3 \
--data '{
"model": "mistralai/voxtral-mini-tts-2603",
"voice": "en_paul_neutral",
"input": "Your delivery is scheduled for tomorrow.",
"response_format": "mp3"
}'Phiên âm và đầu vào
- Gửi tệp âm thanh đến /audio/transcriptions theo định dạng được mô tả trong tài liệu.
- Giới hạn thời lượng và kích thước tệp ở phía bạn trước khi bắt đầu tải lên.
- Chỉ giữ ngôn ngữ, dấu thời gian và phân đoạn nếu thao tác đã chọn trả về chúng.
Chất lượng và tính khả dụng
Giọng nói, định dạng, ngôn ngữ và tính đồng bộ phụ thuộc vào mô hình. Chỉ hiển thị cho người dùng các điều khiển được danh mục xác nhận.
Với tệp dài hơn, hãy tạo công việc nền trong sản phẩm để thời gian chờ mạng không quyết định quy trình của người dùng.