샘플레이트: 음성 인식 모델은 16kHz로 듣는다
샘플레이트는 1초에 소리를 몇 번 기록하느냐예요. 기록할 수 있는 가장 높은 주파수는 샘플레이트의 절반이라서, 16kHz로 녹음하면 8kHz까지의 소리가 담겨요. 음악용 44.1kHz는 사람이 들을 수 있는 한계인 20kHz 근처까지 담기 위한 값이고요.
그런데 말소리를 알아듣는 데 필요한 정보는 대부분 그보다 훨씬 낮은 대역에 있어요. 오래전부터 쓰인 유선 전화가 대략 300Hz~3.4kHz만 전달하는데도 대화가 되는 이유예요. 16kHz 녹음은 이 전화 대역의 두 배 이상을 담으니 발음을 구분하는 데는 충분한 여유가 있어요.
더 결정적인 이유도 있어요. 요즘 무료 STT 프로그램이 많이 쓰는 Whisper 계열 모델은 입력을 16kHz 모노로 변환한 뒤에 처리해요. 48kHz로 녹음해도 모델에 들어가기 직전에 16kHz로 낮춰지니, 그 위의 정보는 인식 결과에 쓰이지 않고 버려져요.
채널: 스테레오는 인식에 도움이 안 된다
스테레오는 왼쪽·오른쪽 소리를 따로 기록해 공간감을 만드는 방식이에요. 음악 감상에는 의미가 있지만, 음성 인식 모델은 두 채널을 하나로 합쳐서 듣기 때문에 공간 정보가 결과에 반영되지 않아요. 게다가 노트북 내장 마이크나 헤드셋 마이크는 대부분 원래 모노 마이크라서, 스테레오로 저장하면 같은 소리가 두 번 기록될 뿐이에요.
용량: 같은 1시간이 5배 넘게 차이 난다
압축하지 않은 WAV 파일의 크기는 샘플레이트 × 샘플당 바이트 × 채널 수 × 시간으로 바로
계산할 수 있어요. 16비트(2바이트) 기준으로 비교하면 이래요.
| 형식 | 초당 크기 | 1시간 녹음 |
|---|---|---|
| 16kHz · 모노 | 약 32KB | 약 115MB |
| 44.1kHz · 스테레오 | 약 176KB | 약 635MB |
| 48kHz · 스테레오 | 약 192KB | 약 691MB |
회의나 강의를 매일 녹음한다면 이 차이가 금방 쌓여요. 인식 결과는 같은데 디스크는 5~6배 더 쓰는 셈이에요.
WAV와 MP3: 다시 저장할수록 손해
MP3·M4A 같은 형식은 사람이 잘 못 듣는 소리를 덜어내서 용량을 크게 줄여요. 비트레이트를 너무 낮추지만 않으면 음성 인식에도 대체로 문제가 없어요. 주의할 점은 손실 압축은 저장할 때마다 조금씩 정보가 사라진다는 거예요. 편집하고 다시 MP3로 저장하기를 반복하면 자음처럼 짧고 높은 소리부터 뭉개져요.
권장 — 원본은 WAV(무압축)로 보관하고, 공유나 보관 용량이 문제될 때만 한 번 압축해서 따로 저장하세요. 텍스트 변환은 항상 원본으로 하는 게 좋아요.
진짜 신경 써야 할 것은 입력 레벨
형식보다 결과를 훨씬 크게 바꾸는 건 녹음 크기예요. 너무 작으면 말소리가 배경 소음에 묻히고, 너무 크면 파형 윗부분이 잘려나가는 클리핑이 생겨요. 작게 녹음된 건 나중에 키울 수라도 있지만, 잘려나간 소리는 어떤 프로그램으로도 되살릴 수 없어요.
- 녹음 프로그램의 레벨 미터가 말할 때 절반에서 3분의 2 정도까지 올라오면 적당해요.
- 웃음이나 박수처럼 갑자기 커지는 순간에도 미터가 끝까지 닿지 않도록 약간 여유를 두세요.
- 윈도우 마이크 속성의 마이크 증폭(부스트)은 소음까지 같이 키워요. 입력이 작다면 부스트보다 마이크를 입에 가까이 두는 쪽이 효과가 커요.
정리
- 텍스트 변환이 목적이면 16kHz · 모노 · 16비트 WAV로 충분하다.
- 더 높은 샘플레이트와 스테레오는 인식 결과를 바꾸지 못하고 용량만 5배 이상 늘린다.
- 손실 압축은 한 번만. 원본 WAV를 남겨두고 변환은 원본으로.
- 형식보다 입력 레벨과 마이크 거리가 결과를 훨씬 크게 좌우한다.
설정 없이 바로 16kHz 모노로 녹음
MemoO는 음성 인식에 맞춘 형식으로 녹음하고, PC 안에서 바로 한국어 텍스트로 바꿔줘요.