CLI

타임스탬프와 자막

CLI로 타임스탬프 정렬 데이터, SRT 자막, WebVTT 자막을 생성합니다.

CLI는 타입캐스트 Timestamp TTS를 호출해 생성된 오디오와 함께 정렬 데이터를 저장할 수 있습니다. 쇼츠 자막, 소셜 영상 캡션 타이밍, 가라오케 스타일 하이라이트, 립싱크 메타데이터가 필요할 때 사용합니다.

자막 생성

# 오디오와 SRT 자막 저장
cast "Hello, world. This is a test." \
  --out hello.wav \
  --timestamp-out hello.srt

# 오디오와 WebVTT 자막 저장
cast "Hello, world. This is a test." \
  --out hello.wav \
  --timestamp-out hello.vtt \
  --timestamp-format vtt

--timestamp-format을 생략하면 CLI는 --timestamp-out 확장자에서 srt 또는 vtt를 추론하고, 그렇지 않으면 json으로 저장합니다.

원본 타임스탬프 JSON 저장

cast "Hello, world. This is a test." \
  --out hello.wav \
  --timestamp-out hello.timestamps.json

JSON은 다른 도구가 자막을 만들거나, 텍스트 애니메이션을 렌더링하거나, 시각 요소를 직접 정렬해야 할 때 유용합니다.

Granularity 선택

cast "Hello, world." \
  --out hello.wav \
  --timestamp-out hello.srt \
  --timestamp-granularity both

일본어(jpn)나 중국어(zho)처럼 단어 사이 공백이 없는 언어는 문자 단위 타임스탬프가 자막 타이밍에 더 적합합니다:

cast "こんにちは。世界。" \
  --language jpn \
  --out hello.wav \
  --timestamp-out hello.srt

에이전트용 자막 워크플로우

script.txt에서 내레이션 오디오와 자막을 만들어줘.
CLI를 사용해줘.
오디오는 ./video/voiceover.wav에 저장해줘.
자막은 ./video/voiceover.srt에 저장해줘.
자막 파일은 오디오 파일 옆에 둬.

출력 선택

출력사용 시점
.srt영상 편집기, Shorts/Reels/TikTok 자막 import
.vtt웹 비디오 플레이어와 브라우저 기반 preview
.json커스텀 렌더링, 가라오케 하이라이트, 립싱크, 후속 자동화

무음 길이 조절

Cast v1.0.10 이상에서 --remove-silence-ms로 설정합니다. 기본값은 미설정이며 0이 아닙니다.

cast "Hello. Thank you for listening." --voice-id tc_672c5f5ce59fac2a48faeaee --remove-silence-ms 300

remove_silence_ms는 제거할 시간이 아니라 남길 무음 길이를 지정합니다. 0부터 1000ms까지의 정수를 사용하세요. 0은 검출된 무음을 제거하며, 생략하거나 null을 지정하면 지정 길이에 따른 무음 제거를 적용하지 않습니다.

일반·스트리밍·타임스탬프 TTS는 output.remove_silence_ms, Compose는 각 tts 세그먼트의 segments[].output.remove_silence_ms로 전달합니다. 반환 타임스탬프는 처리 후 오디오를 기준으로 하며, 명시적인 pause 세그먼트는 유지됩니다.

스트리밍의 기본 앞부분 무음 트림은 별개입니다. 특히 0처럼 작은 값에서는 재생 가능한 청크 수신에 간격이 생길 수 있으므로 충분한 재생 버퍼를 확보하고 실제 콘텐츠로 확인하세요.

⌘I