CLI는 타입캐스트 Timestamp TTS를 호출해 생성된 오디오와 함께 정렬 데이터를 저장할 수 있습니다. 쇼츠 자막, 소셜 영상 캡션 타이밍, 가라오케 스타일 하이라이트, 립싱크 메타데이터가 필요할 때 사용합니다.
자막 생성
# 오디오와 SRT 자막 저장
cast "Hello, world. This is a test." \
--out hello.wav \
--timestamp-out hello.srt
# 오디오와 WebVTT 자막 저장
cast "Hello, world. This is a test." \
--out hello.wav \
--timestamp-out hello.vtt \
--timestamp-format vtt
--timestamp-format을 생략하면 CLI는 --timestamp-out 확장자에서 srt 또는 vtt를 추론하고, 그렇지 않으면 json으로 저장합니다.
원본 타임스탬프 JSON 저장
cast "Hello, world. This is a test." \
--out hello.wav \
--timestamp-out hello.timestamps.json
JSON은 다른 도구가 자막을 만들거나, 텍스트 애니메이션을 렌더링하거나, 시각 요소를 직접 정렬해야 할 때 유용합니다.
Granularity 선택
cast "Hello, world." \
--out hello.wav \
--timestamp-out hello.srt \
--timestamp-granularity both
일본어(jpn)나 중국어(zho)처럼 단어 사이 공백이 없는 언어는 문자 단위 타임스탬프가 자막 타이밍에 더 적합합니다:
cast "こんにちは。世界。" \
--language jpn \
--out hello.wav \
--timestamp-out hello.srt
에이전트용 자막 워크플로우
script.txt에서 내레이션 오디오와 자막을 만들어줘.
CLI를 사용해줘.
오디오는 ./video/voiceover.wav에 저장해줘.
자막은 ./video/voiceover.srt에 저장해줘.
자막 파일은 오디오 파일 옆에 둬.
출력 선택
| 출력 | 사용 시점 |
|---|---|
.srt | 영상 편집기, Shorts/Reels/TikTok 자막 import |
.vtt | 웹 비디오 플레이어와 브라우저 기반 preview |
.json | 커스텀 렌더링, 가라오케 하이라이트, 립싱크, 후속 자동화 |
무음 길이 조절
Cast v1.0.10 이상에서 --remove-silence-ms로 설정합니다. 기본값은 미설정이며 0이 아닙니다.
cast "Hello. Thank you for listening." --voice-id tc_672c5f5ce59fac2a48faeaee --remove-silence-ms 300
remove_silence_ms는 제거할 시간이 아니라 남길 무음 길이를 지정합니다. 0부터 1000ms까지의 정수를 사용하세요. 0은 검출된 무음을 제거하며, 생략하거나 null을 지정하면 지정 길이에 따른 무음 제거를 적용하지 않습니다.
일반·스트리밍·타임스탬프 TTS는 output.remove_silence_ms, Compose는 각 tts 세그먼트의 segments[].output.remove_silence_ms로 전달합니다. 반환 타임스탬프는 처리 후 오디오를 기준으로 하며, 명시적인 pause 세그먼트는 유지됩니다.
스트리밍의 기본 앞부분 무음 트림은 별개입니다. 특히 0처럼 작은 값에서는 재생 가능한 청크 수신에 간격이 생길 수 있으므로 충분한 재생 버퍼를 확보하고 실제 콘텐츠로 확인하세요.