받아쓰기 정확도 테스트 방법: 한국어 교정량을 공정하게 비교하기
정확도 숫자 하나만으로 받아쓰기 앱을 고르면 실제 업무에서 틀릴 가능성이 큽니다. 한국어는 띄어쓰기 변형 때문에 단어 오류율만으로 불리하게 보일 수 있어 문자 오류, 의미 오류, 교정 시간까지 함께 봐야 합니다.
최종 확인일: 2026-07-31. Voicetypr가 발행한 테스트 방법론입니다. 이 글은 특정 제품의 점수를 발표하지 않으며 Voicetypr가 우승했다는 근거로 사용하지 않습니다. 예시는 사용자가 직접 재현하도록 설계했습니다.
빠른 결론
동일한 원본 음성 10~20개, 사람이 확인한 기준 전사, 고정된 정규화 규칙을 준비하세요. WER 또는 한국어 CER를 계산하되 사람 이름·숫자·부정어 같은 치명적 오류와 최종 교정 시간도 따로 기록해야 합니다. 실시간 받아쓰기는 붙여넣기 성공률과 지연까지 분리해 평가하세요.
사용자별 판단
개인 구매자
수정 횟수와 시간 중심
복잡한 연구 지표보다 실제 메일·프롬프트 10개를 고치는 부담이 구매 판단에 직접 연결됩니다.
다국어 팀
언어별 별도 샘플
영어 결과를 한국어에 일반화하지 말고 각 언어의 띄어쓰기·고유명사·코드 전환을 반영해야 합니다.
연구·조달 담당자
버전과 원본을 고정한 반복 실험
모델, 앱, 장치, 마이크, 설정, 날짜를 기록해야 결과를 재현할 수 있습니다.
선택 기준
대표성 있는 샘플
짧고 깨끗한 문장만 쓰지 말고 긴 문단, 숫자, 고유명사, 영문 약어, 평소 소음을 포함하세요.
정규화 규칙
문장부호, 숫자 표기, 띄어쓰기, 필러 단어를 오류로 셀지 시작 전에 고정하세요.
업무 결과 지표
WER·CER 외에 의미를 바꾸는 오류, 수정 키 입력, 교정 시간, 붙여넣기 실패, 대기 시간을 기록하세요.
| 지표 | 보는 것 | 주의점 |
|---|---|---|
| WER | 단어 교체·삭제·삽입 비율 | 한국어 띄어쓰기 차이에 민감 |
| CER | 문자 단위 교체·삭제·삽입 | 의미가 큰 숫자 오류를 작게 보일 수 있음 |
| 교정 시간 | 사용 가능한 최종문까지 걸린 시간 | 편집 숙련도와 인터페이스 영향 |
| 치명적 오류 | 이름·금액·부정어·명령 오류 | 수동 분류 기준 필요 |
1단계: 실제 업무를 대표하는 음성을 만드세요
메일, 회의 메모, AI 프롬프트, 기술 설명 등 자신이 자주 말할 내용을 30초에서 2분 길이로 녹음합니다. 같은 파일을 모든 제품에 넣을 수 있어야 입력 조건이 같아집니다.
조용한 환경과 평소 작업 소음, 빠른 말과 느린 말, 한국어와 영문 고유명사가 섞인 문장을 균형 있게 넣습니다. 모델에 유리하도록 문장을 바꾸지 마세요.
2단계: 기준 전사와 정규화 규칙을 먼저 고정하세요
사람이 녹음을 듣고 의도한 말을 정확히 적은 기준 전사를 만듭니다. “3시”와 “세 시”, 쉼표 유무, 허용할 띄어쓰기를 어떻게 처리할지 문서화합니다.
OpenAI의 large-v3 발표도 한국어에서 띄어쓰기 불일치 때문에 CER를 함께 사용했다고 설명합니다. 따라서 한국어 평가는 WER 하나만 보지 않는 편이 타당합니다.
3단계: 점수와 교정 경험을 분리해 기록하세요
각 결과에서 교체, 삭제, 삽입을 세고 WER 또는 CER를 계산합니다. 그런 다음 실제 앱에서 사용할 수 있는 문장으로 고치는 데 걸린 시간과 오류 유형을 기록합니다.
실시간 입력 도구라면 녹음 시작 실패, 커서 위치 삽입 실패, 앱 전환, 대기 시간도 따로 측정하세요. 낮은 WER가 불안정한 입력 흐름을 상쇄하지는 못합니다.
- 모델·앱 버전과 날짜
- 장치·마이크·언어 설정
- 원본 파일 해시 또는 보관 위치
- 오류 규칙과 교정 시간
한계와 확인할 점
- 작은 개인 샘플은 전체 언어 또는 모든 화자의 성능을 대표하지 않습니다.
- WER·CER는 의미 중요도와 사용자 경험을 완전히 표현하지 못합니다.
- 클라우드 모델은 공급자 업데이트로 같은 테스트 결과가 달라질 수 있습니다.
평가 방법
- Hugging Face 공식 ASR 문서의 WER 평가 흐름과 OpenAI Whisper의 한국어 CER 설명을 참고했습니다.
- 제품 비교와 연구 재현성을 위해 입력, 기준 전사, 정규화, 모델 버전을 고정하도록 구성했습니다.
- Voicetypr나 경쟁 제품의 미측정 점수를 제시하지 않았습니다.
출처
구매 전 가격, 시스템 요구 사항, 개인정보 처리 조건을 각 제공업체에서 다시 확인하세요.
자주 묻는 질문
WER가 낮으면 가장 좋은 받아쓰기 앱인가요?
아닙니다. 실제 교정 시간, 치명적 오류, 지연, 붙여넣기 안정성, 개인정보와 비용도 함께 봐야 합니다.
한국어는 WER와 CER 중 무엇을 써야 하나요?
둘 다 볼 수 있지만 띄어쓰기 변형이 큰 한국어에서는 CER를 함께 보고 의미 오류를 별도 분류하는 편이 좋습니다.
몇 개 샘플이면 충분한가요?
개인 구매 판단에는 대표 작업 10~20개가 출발점입니다. 일반화된 성능 주장을 하려면 훨씬 큰 화자·환경 표본과 통계 설계가 필요합니다.