✂️ TTS 무음 자동 삭제, 캡컷 없이 API로 한 번에 — 타입캐스트 무음 구간 제거

작성자
Heeju Choi
게시일
2026년 10월 2일
최종 업데이트
2026년 10월 2일
Typecast  |  이번 아티클, 차분한 '시연' 목소리로 읽어드려요

 

숏폼은 속도감 있는 전개가 반입니다. 주어진 짧은 시간 안에 시청자를 사로잡고, 전달하고 싶은 내용까지 모두 넣어야 하니까요. 한 박자만 늘어져도 손가락은 다음 영상으로 넘어갑니다.

그렇다고 말 속도만 올려서는 해결되지 않아요. 말투만 급해지고 길이는 생각보다 줄지 않거든요. 정작 줄여야 하는 건 문장 앞뒤와 문장 사이, 숨을 고르는 자리에 남은 불필요한 무음입니다.

타입캐스트 API로 숏폼 영상을 만드는 분들에게 이 요청이 많았습니다. 생성 단계에서 무음을 줄일 방법이 없다 보니, 만들어진 음성을 CapCut 같은 편집 프로그램에 올려 무음 일괄 제거를 돌리는 분들이 많았어요. 그리고 드디어 타입캐스트 API에도 숏폼 제작을 위한 무음 구간 제거 기능이 업데이트됐습니다.

무음 구간 제거를 사용하면 이제 편집 프로그램을 거치지 않고, 음성을 만들 때 무음까지 정리해 받을 수 있습니다. 오늘은 값이 정확히 어떻게 동작하는지, 같은 대본이 실제로 얼마나 짧아지는지, 그리고 자막 싱크까지 한 번에 맞추는 방법까지 정리했습니다.

이런 분들에게 추천드립니다

✅ 속도감 있는 나레이션으로 숏폼 제작을 자동화하고 싶은 콘텐츠팀·제작자

✅ 타입캐스트 API로 만든 나레이션을 CapCut·Vrew에서 무음 제거하고 속도를 올리던 숏폼 제작자

✅ 타임스탬프 TTS로 자막을 만드는데, 무음을 자를 때마다 자막 시간을 다시 맞추던 팀

무음 구간 제거 문서 보기 →


무음 구간 제거는 무엇인가요?

무음 구간 제거는 TTS 음성 안에 존재하는 모든 무음 구간을 지정한 길이까지 줄여주는 출력 옵션입니다.

요청의 output 안에 remove_silence_ms 한 줄을 넣으면 됩니다.

"output": {
  "audio_format": "wav",
  "remove_silence_ms": 100
}

입력하는 값은 TTS 음성 안에 남길 무음 길이입니다. 100을 넣으면 100ms보다 긴 무음이 100ms로 줄어들고, 그보다 짧은 구간은 그대로 남습니다. 값이 작을수록 더 짧은 무음까지 줄어드는 셈이죠.

remove_silence_ms 값 음성에 생기는 일
생략 또는 null 무음 제거를 적용하지 않습니다.
0 검출된 무음을 모두 없앱니다. 가장 짧게 줄이는 설정이에요
100 100ms보다 긴 무음을 최대 100ms로 줄입니다. 100ms 이하의 무음은 그대로 유지합니다.
1000 1초보다 긴 무음을 최대 1초로 줄입니다. 넣을 수 있는 최댓값이에요.

타입캐스트 API는 일반 TTS 외에도 스트리밍 TTS, 타임스탬프 TTS, 조합형 TTS를 제공하는데요. 네 가지 모두 무음 제거를 지원합니다. 앞의 세 가지는 output.remove_silence_ms에 넣고, 여러 구간을 한 파일로 만드는 Compose TTS만 각 tts 세그먼트의 segments[].output.remove_silence_ms에 넣습니다.


똑같은 대본으로 직접 비교해봤어요.

무음 제거로 얼마나 속도감이 달라지는지 직접 확인해볼게요.

똑같은 쇼츠 대본 한 편을 ssfm-v30으로 생성하면서 무음제거 & 속도 설정을 제외한 다른 조건들은 동일하게 맞췄습니다.

버전 1원본
17.65초
 
기준

상세 설정 · 옵션 없음

버전 2무음만 제거
14.60초
 
−3.05초

상세 설정 · remove_silence_ms: 50

버전 3무음 제거 + 1.15배속
12.48초
 
−5.17초 (−29%)

상세 설정 · remove_silence_ms: 50 · audio_tempo: 1.15

 

타입캐스트 마케팅팀 자체 측정, 2026년 10월, ssfm-v30 · 한국어 쇼츠 대본(96자)

원본에서 remove_silence_ms를 0으로 두면 문장 앞뒤와 문장 사이의 공백이 사라집니다. 말투는 그대로인데 호흡만 빨라져서 같은 대본이 1.22초 짧아졌어요.여기에 더 빠른 템포가 필요하면 속도까지 얹으면 됩니다. 말 속도까지 1.15배로 올린 3번은 원본보다 3.61초(20% 감소) 짧아졌습니다.

💡 영상 유형별 무음 제거 값 고르기

영상 유형별로 어울리는 속도감이 다릅니다. 타입캐스트가 권장하는 아래 값을 기반으로, 콘텐츠에 맞게 무음 구간 길이를 조절해보세요. 공식 문서가 권장하는 무음값 범위는 0~200 사이이며, 콘텐츠 제작자들의 실제 데이터를 보면 무음값은 100(27%), 0(19%), 120(16%) 순으로, 속도는 1.1~1.2 사이 값으로 가장 많이 사용되었습니다.

영상 유형 무음 권장 값
빠른 템포의 쇼츠·릴스 0
정보 전달형 숏폼 100
차분한 설명 나레이션 200

사용 데이터: 타입캐스트 API 내부 데이터, 2026년 9월 기준


캡컷 없이도, 무음 제거부터 자막 싱크까지 한 번에

타임스탬프 TTS로 자막을 만드신다면 이 부분이 가장 반가우실 거예요.

무음 구간 제거를 적용하면 반환되는 타임스탬프가 무음을 줄인 뒤의 음성을 기준으로 정렬됩니다. 즉 줄어든 음성만큼 자막 시간을 다시 계산하지 않고 그대로 쓸 수 있는 거죠.CapCut 같은 별도의 편집 프로그램을 거치던 작업 단계가 API 요청 한 번으로 단순해집니다.

BEFORE
음성 생성 → 편집 프로그램에서 무음 자르기 → 잘라낸 만큼 자막 시간 보정 → 영상 편집 4단계

AFTER
옵션 넣어 음성 생성 → 영상 편집 2단계

Cast CLI를 쓰신다면 --timestamp-out으로 SRT·WebVTT 파일까지 바로 저장할 수 있습니다. 무음이 줄어든 음성과 시간이 맞는 자막 파일이 한 번에 나오는 거죠.

 


자주 묻는 질문

Q. 어떤 무음이 제거되나요? +

한 번의 요청으로 만든 음성 안의 무음이 모두 대상입니다. 음성 맨 앞과 맨 뒤, 문장과 문장 사이, 문장 안에서 잠깐 끊기는 자리까지 위치를 가리지 않아요. 원하는 무음길이를 설정하면, 해당 길이보다 긴 무음 구간만 해당 길이만큼 줄어들고, 짧은 무음 구간은 그대로 남습니다.

Q. TTS로 만든 음성의 무음 구간을 자동으로 없앨 수 있나요? +

타입캐스트 API의 무음 구간 제거 옵션을 사용하면 생성 단계에서 무음을 줄일 수 있습니다. 요청의 output.remove_silence_ms에 남길 무음 길이를 0부터 1000ms 사이 정수로 넣으면, 그보다 긴 무음이 해당 길이로 줄어든 음성이 반환됩니다. 편집 프로그램에서 파형을 보며 자르는 과정이 필요 없어요.

Q. remove_silence_ms에 0을 넣으면 무음 제거가 꺼지나요? +

아닙니다. 0은 검출된 무음을 없애는 값으로, 가장 짧게 줄이는 설정입니다. 무음 제거를 적용하지 않으려면 값을 생략하거나 null로 두세요. 기존 연동에 옵션을 추가하지 않았다면 결과는 지금까지와 같습니다.

Q. 말 속도를 올리는 것과 무음을 줄이는 건 뭐가 다른가요? +

audio_tempo는 말하는 속도 자체를 바꾸고, 무음 구간 제거는 말과 말 사이의 빈 구간만 줄입니다. 속도를 크게 올리면 발음과 억양까지 함께 빨라져서 말투가 급하게 들릴 수 있어요. 무음 제거는 말투를 그대로 둔 채 불필요한 쉼만 덜어내기 때문에 그런 변화가 없습니다. 물론 두 가지를 함께 쓰는 것도 가능합니다.

Q. 무음을 제거하면 자막 타임스탬프도 다시 맞춰야 하나요? +

아닙니다. 타임스탬프 TTS가 돌려주는 단어·문자 단위 시간은 무음을 제거한 뒤의 음성을 기준으로 정렬됩니다. 줄어든 무음 길이만큼 자막 시간을 따로 보정하지 않아도 됩니다.

Q. 스트리밍 TTS에서도 무음 구간을 줄일 수 있나요? +

가능합니다. 스트리밍 TTS도 일반 TTS와 같은 output.remove_silence_ms를 사용하고, 값의 범위와 의미도 동일합니다. 0부터 1000ms 사이 정수로 남길 무음 길이를 지정하면 됩니다.

Q. 무음 제거 옵션을 쓰면 크레딧이 더 차감되나요? +

아니요. 무음 제거 옵션 사용에 따른 추가 요금은 없고, 크레딧은 기존과 동일하게 글자 수 기준으로 차감됩니다. 무료 플랜을 포함한 모든 API 플랜에서 사용할 수 있습니다.

Q. 타입캐스트 API는 뭐가 좋은가요? +

타입캐스트는 320만 명의 크리에이터와 누적 3,000개 기업고객이 선택한 음성·영상 생성 AI 서비스입니다. 핵심 강점은 세 가지예요. ① 자연스러움 — 전문 성우 녹음과 텍스트 맥락을 읽는 스마트 이모션이 결합돼 자연스러운 감정 표현을 냅니다. ② 다양성 — API 기준 600개 이상의 AI 목소리와 37개 언어를 같은 API로 호출해 글로벌 서비스로 그대로 확장됩니다. ③ 안정성 — 수만 명이 동시 접속하는 라이브 환경에서도 레이턴시 없이 동작하는 게 검증됐습니다.

무음구간 편집으로 속도감 있는 숏폼을 만들어보세요

음성 생성부터 무음 제거, 자막 타임스탬프까지 타입캐스트 API가 한 번에 지원합니다.
한국인이 좋아하는 속도감 있는 숏폼, 간편하게 만들어보세요.

무음 구간 제거 문서 보기 → API 무료로 시작하기 →

Heeju Choi
B2B 마케터
음성 AI 제품을 기업에 알리는 일을 합니다. API부터 대화형 음성 에이전트까지, 직접 제품을 써보면서 알게된 것들을 쉽게 전하려고 해요.

관련 아티클

🎬숏폼 영상, 이제 AI 에이전트에게 통째로 맡기세요 — 쇼츠 자동화 스킬 무료 공개

요즘 유행하는 신비한 건축 스타일 쇼츠, 자동으로 만들어보세요. 타입캐스트 쇼츠 스킬을 AI 에이전트에 붙여 넣으면 대본부터 나레이션·자막·편집까지 처리해 완성 영상을 돌려줍니다. 스킬 무료 다운로드방법부터 실제 제작방식까지 알려드릴게요.

🎙AICC에 맞는 목소리, 라이브 방송에선 왜 어색할까요? : 서비스별 AI 목소리 고르는 법

서비스마다 어울리는 AI 목소리가 다릅니다. 그 이유와 AICC 상담·라이브커머스·에듀튜터까지 목소리로 직접 비교해봤어요. 타입캐스트의 보이스 추천 API로 서비스에 딱 맞는 목소리를 쉽게 찾는 법까지 소개해드립니다.

🎙 프리미엄 보이스 클로닝, 이제 API에서도 씁니다. 라이트 플랜부터

타입캐스트 API의 프리미엄 보이스 클로닝이 출시되었습니다. 5초 샘플로 즉시 만드는 퀵 클로닝과 5분 이상 녹음으로 억양·말투까지 재현하는 프리미엄 클로닝의 차이부터 프리미엄 클로닝의 네 단계 사용법을 확인하세요

직접 써보는 게 가장 빠릅니다

몰입감 있는 콘텐츠부터 대화형 AI까지
누적 320만명이 만족한 AI 목소리를 직접 사용해보세요.