Синтез речи
Для озвучки передайте текст, model и голос, доступный выбранной модели. Обрабатывайте ответ как бинарный аудиопоток, а не JSON-строку.
Назначьте расширение файла и Content-Type по фактическому формату ответа перед сохранением или воспроизведением.
Text-to-speech request
bash
curl --request POST https://cicora.ai/api/v1/audio/speech \
--header "Authorization: Bearer $CICORA_API_KEY" \
--header 'Content-Type: application/json' \
--output narration.mp3 \
--data '{
"model": "mistralai/voxtral-mini-tts-2603",
"voice": "en_paul_neutral",
"input": "Your delivery is scheduled for tomorrow.",
"response_format": "mp3"
}'Транскрипция и вход
- Отправляйте аудиофайл по маршруту /audio/transcriptions в документированном для него формате.
- Ограничивайте длину и размер файла на своей стороне до начала загрузки.
- Сохраняйте язык, временные метки и сегменты только если их вернула выбранная операция.
Качество и доступность
Голос, формат, языки и синхронность зависят от модели. Показывайте пользователю только элементы управления, подтверждённые каталогом.
Для длинных файлов создавайте фоновые задачи в своём продукте, чтобы сетевой тайм-аут не определял пользовательский сценарий.