//음성 텍스트 변환

음성 텍스트 변환 프로그램,
무엇을 기준으로 고를까

"무료"와 "정확도" 말고도 실제로 만족도를 가르는 기준이 몇 가지 더 있어요. 오프라인 STT 프로그램을 직접 만들면서 알게 된, 고를 때 꼭 따져봐야 할 것들을 정리했어요.

1. 음성이 내 PC 밖으로 나가는가

가장 먼저 갈리는 지점이에요. 웹 기반 변환 서비스는 녹음 파일을 서버에 업로드해서 처리해요. 빠르고 설치가 필요 없다는 장점이 있지만, 업로드되는 순간 그 파일은 내 손을 떠나요.

반대로 오프라인 프로그램은 음성 인식 모델을 PC에 설치해두고 로컬에서 처리해요. 인터넷이 끊겨도, 외부망이 막힌 사내 PC에서도 동작하고, 파일이 외부로 나가지 않아요. 대신 설치 용량이 크고(모델 포함 수백 MB 이상) 변환 속도가 PC 성능에 좌우돼요.

온라인 서비스 오프라인 프로그램
음성 데이터서버로 업로드PC 안에서만 처리
인터넷필수불필요
설치 용량없음수백 MB ~ 수 GB
속도대체로 빠름PC 성능에 좌우
분량 제한무료 구간 제한이 흔함대체로 없음

회의·상담·의료 상담처럼 제3자의 음성이 담긴 녹음이라면 업로드 여부를 특히 신중하게 따져보는 게 좋아요. 내 파일이지만 그 안의 목소리는 내 것만이 아니니까요.

2. 모델 크기 — 정확도와 속도는 맞바꾸는 관계

요즘 무료 STT 프로그램 상당수는 OpenAI가 공개한 Whisper 계열 모델을 씁니다. 이 모델은 크기별로 여러 버전이 있고, 크기가 클수록 정확하지만 느리고 메모리를 더 씁니다.

모델 대략적인 크기 특징
small약 500MB일반 사무용 PC에 무난. 일상 대화·회의는 대체로 충분
medium약 1.5GB고유명사·전문용어에서 유리. 대신 변환 시간이 길어짐
large약 3GB 이상가장 정확하지만 개인 PC에서는 부담이 큼

체감상 회의록처럼 맥락이 분명한 내용은 small로도 충분한 경우가 많아요. 반대로 사람 이름, 제품명, 업계 용어가 자주 나오는 녹음이라면 medium 쪽이 확실히 덜 틀려요. 처음에는 작은 모델로 써보고 아쉬울 때 키우는 순서를 권해요.

3. GPU 가속을 지원하는가

NVIDIA 그래픽카드가 있다면 변환 속도가 크게 달라져요. CPU만 쓸 때와 비교해 수 배까지 빨라지는데, 프로그램이 이를 자동으로 감지해서 쓰는지는 제품마다 달라요. 별도 설정이 필요한 경우도 있고, CUDA 런타임이 없으면 조용히 CPU로 되돌아가는 경우도 있어요. 30분, 1시간짜리 녹음을 자주 다룬다면 이 항목이 생각보다 중요해요.

4. 변환 후 "찾아 쓰기"가 편한가

의외로 많이 간과되는 부분이에요. 변환은 끝이 아니라 시작이고, 실제로는 그 텍스트를 다시 뒤지게 되거든요. 아래 기능이 있는지 확인해보세요.

5. 정확도를 가장 크게 좌우하는 건 사실 녹음 환경

모델을 키우는 것보다 효과가 큰 게 녹음 자체의 품질이에요. 같은 모델이라도 입력이 깨끗하면 결과가 확연히 달라져요.

정리

순서대로 따져보면 선택이 쉬워져요. ① 음성이 외부로 나가도 괜찮은 내용인가 → ② 내 PC 사양으로 감당되는 모델인가 → ③ 변환한 뒤 다시 찾아 쓸 수 있는 구조인가. 그리고 어떤 프로그램을 고르든, 마이크를 입 가까이 두는 것만으로 체감 정확도가 가장 많이 올라간다는 점은 같아요.

오프라인으로 처리하는 쪽을 찾는다면

MemoO는 녹음부터 한국어 텍스트 변환까지 PC 안에서 끝내는 무료 프로그램이에요.

MemoO 보러 가기