텍스트 음성 변환

조합형 텍스트 음성 변환(Compose TTS)

SDK

수동 HTTP 호출보다 안전하고 빠른 통합을 위해 SDK를 사용하세요.

SDK 가이드

여러 음성 구간과 쉼을 하나의 오디오 파일로 생성합니다. segments 배열에 ttspause 객체를 재생할 순서대로 넣으세요. 각 tts 세그먼트는 POST /v1/text-to-speech와 동일한 보이스, 모델, 감정, 출력 설정을 지원하며 세그먼트마다 다른 보이스와 모델을 사용할 수 있습니다.

제한

  • 전체 세그먼트는 최대 50개이며 tts 세그먼트가 최소 1개 필요합니다.
  • 모든 tts 세그먼트의 텍스트 합은 최대 2,000자입니다.
  • 쉼은 개별 최대 10초, 전체 합계 최대 60초입니다.
  • 모든 tts 세그먼트의 audio_format은 같아야 합니다.

크레딧은 tts 텍스트 길이의 합만큼 차감되며 쉼에는 차감되지 않습니다. 세그먼트는 병렬로 합성된 뒤 입력 순서대로 반환됩니다. 하나라도 합성에 실패하면 전체 요청이 실패하며 크레딧은 차감되지 않습니다.

응답 성공하면 JSON이 아닌 합성된 오디오 바이너리 데이터를 직접 반환합니다. 응답의 Content-Type은 세그먼트에서 요청한 audio_format에 따라 audio/wav 또는 audio/mpeg입니다.

POST/v1/text-to-speech/compose

인증

X-API-KEYstringheader필수

인증을 위한 API 키입니다. Typecast API 콘솔에서 API 키를 발급받을 수 있습니다.

본문

application/json

음성과 쉼 세그먼트를 순서대로 합성하여 하나의 오디오 파일로 반환하는 요청입니다.

segmentsobject[]required

출력 순서대로 나열한 음성과 쉼 세그먼트입니다. 최소 1개, 최대 50개이며 tts 세그먼트가 적어도 하나 필요합니다.

응답

200요청한 `audio_format`에 맞는 바이너리 합성 오디오 데이터audio/wav · audio/mpeg
⌘I