cicora.ai
Specyfikacja APIMowa

Dźwięk

Używaj oddzielnych operacji do syntezy mowy, transkrypcji i wejścia audio modelu.

Materiały dotyczące integracji: wybierz parametry i dostępne funkcje w ustawieniach API konta oraz w katalogu modeli dla swojego środowiska.

Syntezuj mowę

W przypadku narracji wyślij tekst, model i głos dostępny dla wybranego modelu. Obsłuż odpowiedź jako binarny strumień audio, a nie ciąg JSON.

Przed zapisaniem lub odtworzeniem przypisz rozszerzenie pliku i Content-Type zgodnie z rzeczywistym formatem odpowiedzi.

Żądanie zamiany tekstu na mowę
bash
curl --request POST https://cicora.ai/api/v1/audio/speech \
  --header "Authorization: Bearer $CICORA_API_KEY" \
  --header 'Content-Type: application/json' \
  --output narration.mp3 \
  --data '{
    "model": "mistralai/voxtral-mini-tts-2603",
    "voice": "en_paul_neutral",
    "input": "Your delivery is scheduled for tomorrow.",
    "response_format": "mp3"
  }'

Transkrypcja i dane wejściowe

  • Wyślij plik audio do /audio/transcriptions w udokumentowanym formacie.
  • Ogranicz czas trwania i rozmiar pliku po swojej stronie jeszcze przed rozpoczęciem przesyłania.
  • Zachowuj język, znaczniki czasu i segmenty tylko wtedy, gdy zwraca je wybrana operacja.

Jakość i dostępność

Głos, format, języki i synchroniczność zależą od modelu. Pokazuj użytkownikowi tylko elementy sterujące potwierdzone przez katalog.

W przypadku dłuższych plików twórz w produkcie zadanie działające w tle, aby przekroczenie limitu czasu sieci nie wyznaczało przebiegu pracy użytkownika.