//녹음 설정

음성 인식용 녹음 설정,
16kHz 모노면 충분한 이유

녹음 프로그램 설정에서 44.1kHz, 48kHz, 스테레오 같은 옵션을 보면 높을수록 좋아 보여요. 하지만 나중에 텍스트로 바꾸는 게 목적이라면 이 값들은 결과를 거의 바꾸지 못하고 파일 크기만 키워요. MemoO를 만들면서 녹음 형식을 16kHz 모노로 정한 이유를 정리했어요.

샘플레이트: 음성 인식 모델은 16kHz로 듣는다

샘플레이트는 1초에 소리를 몇 번 기록하느냐예요. 기록할 수 있는 가장 높은 주파수는 샘플레이트의 절반이라서, 16kHz로 녹음하면 8kHz까지의 소리가 담겨요. 음악용 44.1kHz는 사람이 들을 수 있는 한계인 20kHz 근처까지 담기 위한 값이고요.

그런데 말소리를 알아듣는 데 필요한 정보는 대부분 그보다 훨씬 낮은 대역에 있어요. 오래전부터 쓰인 유선 전화가 대략 300Hz~3.4kHz만 전달하는데도 대화가 되는 이유예요. 16kHz 녹음은 이 전화 대역의 두 배 이상을 담으니 발음을 구분하는 데는 충분한 여유가 있어요.

더 결정적인 이유도 있어요. 요즘 무료 STT 프로그램이 많이 쓰는 Whisper 계열 모델은 입력을 16kHz 모노로 변환한 뒤에 처리해요. 48kHz로 녹음해도 모델에 들어가기 직전에 16kHz로 낮춰지니, 그 위의 정보는 인식 결과에 쓰이지 않고 버려져요.

채널: 스테레오는 인식에 도움이 안 된다

스테레오는 왼쪽·오른쪽 소리를 따로 기록해 공간감을 만드는 방식이에요. 음악 감상에는 의미가 있지만, 음성 인식 모델은 두 채널을 하나로 합쳐서 듣기 때문에 공간 정보가 결과에 반영되지 않아요. 게다가 노트북 내장 마이크나 헤드셋 마이크는 대부분 원래 모노 마이크라서, 스테레오로 저장하면 같은 소리가 두 번 기록될 뿐이에요.

용량: 같은 1시간이 5배 넘게 차이 난다

압축하지 않은 WAV 파일의 크기는 샘플레이트 × 샘플당 바이트 × 채널 수 × 시간으로 바로 계산할 수 있어요. 16비트(2바이트) 기준으로 비교하면 이래요.

형식 초당 크기 1시간 녹음
16kHz · 모노약 32KB약 115MB
44.1kHz · 스테레오약 176KB약 635MB
48kHz · 스테레오약 192KB약 691MB

회의나 강의를 매일 녹음한다면 이 차이가 금방 쌓여요. 인식 결과는 같은데 디스크는 5~6배 더 쓰는 셈이에요.

WAV와 MP3: 다시 저장할수록 손해

MP3·M4A 같은 형식은 사람이 잘 못 듣는 소리를 덜어내서 용량을 크게 줄여요. 비트레이트를 너무 낮추지만 않으면 음성 인식에도 대체로 문제가 없어요. 주의할 점은 손실 압축은 저장할 때마다 조금씩 정보가 사라진다는 거예요. 편집하고 다시 MP3로 저장하기를 반복하면 자음처럼 짧고 높은 소리부터 뭉개져요.

권장 — 원본은 WAV(무압축)로 보관하고, 공유나 보관 용량이 문제될 때만 한 번 압축해서 따로 저장하세요. 텍스트 변환은 항상 원본으로 하는 게 좋아요.

진짜 신경 써야 할 것은 입력 레벨

형식보다 결과를 훨씬 크게 바꾸는 건 녹음 크기예요. 너무 작으면 말소리가 배경 소음에 묻히고, 너무 크면 파형 윗부분이 잘려나가는 클리핑이 생겨요. 작게 녹음된 건 나중에 키울 수라도 있지만, 잘려나간 소리는 어떤 프로그램으로도 되살릴 수 없어요.

정리

설정 없이 바로 16kHz 모노로 녹음

MemoO는 음성 인식에 맞춘 형식으로 녹음하고, PC 안에서 바로 한국어 텍스트로 바꿔줘요.

MemoO 보러 가기