音声を合成
ナレーションでは、text、model、および選択したモデルで利用できるvoiceを送信します。応答はJSON文字列ではなくバイナリ音声ストリームとして処理してください。
保存または再生の前に、実際の応答形式に基づいてファイル拡張子とContent-Typeを指定します。
テキスト読み上げリクエスト
bash
curl --request POST https://cicora.ai/api/v1/audio/speech \
--header "Authorization: Bearer $CICORA_API_KEY" \
--header 'Content-Type: application/json' \
--output narration.mp3 \
--data '{
"model": "mistralai/voxtral-mini-tts-2603",
"voice": "en_paul_neutral",
"input": "Your delivery is scheduled for tomorrow.",
"response_format": "mp3"
}'文字起こしと入力
- 文書化された形式で音声ファイルを /audio/transcriptions に送信します。
- アップロード開始前に、ファイルの長さとサイズを自社側で制限します。
- 選択した操作から返される場合に限り、言語、タイムスタンプ、セグメントを保持します。
品質と提供状況
音声、形式、言語、同期・非同期の別はモデルによって異なります。カタログで確認されたコントロールだけをユーザーに表示します。
長いファイルの場合は、製品内でバックグラウンド処理を作成し、ネットワークタイムアウトによってユーザーのワークフローが左右されないようにします。