키워드 빈도 분석
어떤 단어와 구절이 얼마나 자주 나오는지 세고, 전체에서 차지하는 비율을 백분율로 보여 줍니다.
텍스트는 이 기기를 벗어나지 않습니다. 처리는 브라우저 안에서 이루어집니다. 텍스트는 TextTidyTools로 전송되지 않습니다. 개인정보처리방침
단어 분포
| # | 용어 | 횟수 | 밀도 | 비중 |
|---|
이 도구는 무엇을 하나
글에서 어떤 단어와 구절이 몇 번 나오는지 세고, 전체 단어 수 대비 비율을 백분율로 보여 줍니다. 한 단어뿐 아니라 두 단어, 세 단어 구절도 셀 수 있습니다.
쓸모는 두 가지입니다. 첫째, 자기 글에서 무의식적으로 반복하는 표현을 발견하는 것. 둘째, 다루려던 주제어가 실제로 글에 충분히 나오는지 확인하는 것.
이 수치는 검색 순위를 말하지 않습니다. 아래 "밀도에 대한 오해"에 왜 그런지 적어 두었습니다.
사용법
- 분석할 글을 붙여넣습니다.
- 표에 용어가 빈도순으로 나옵니다.
- 구절을 보려면 구절 길이를 2단어나 3단어로 바꿉니다.
- 영어 글이라면 흔한 불용어 제외를 켜 두세요. 켜지 않으면 the와 and가 상위를 차지합니다.
- 표 복사나 CSV 다운로드로 결과를 가져갑니다.
한국어 분석에서 알아 둘 것
이 도구는 띄어쓰기로 단어를 나눕니다. 한국어에 쓸 때 그 결과가 어떤 의미인지 알아 두세요.
- 조사가 붙은 채로 셉니다. "학교에", "학교를", "학교가"가 각각 다른 용어로 집계됩니다. 형태소 분석을 하지 않기 때문입니다. 그래서 실제로는 같은 주제어인데 빈도가 흩어져 보입니다.
- 해결 방법. 관심 있는 주제어가 있다면 찾아 바꾸기로 조사를 미리 정리하거나, 표에서 같은 어간을 가진 항목들의 횟수를 직접 더하세요.
- 불용어 목록이 없습니다. 영어 기능어 목록만 있어서, 한국어 글에서는 "것", "수", "있다" 같은 말이 상위에 올라옵니다. 최소 단어 길이를 2로 올리면 한 글자 조사와 의존명사가 어느 정도 걸러집니다.
- 2단어 구절이 오히려 유용합니다. 한국어에서는 "인공 지능", "머신 러닝"처럼 띄어 쓰는 복합어가 많아, 2단어 구절 분석이 주제어를 더 잘 잡아냅니다.
어떻게 계산하는가
밀도는 어떤 용어가 나온 횟수를 같은 길이의 용어가 들어갈 수 있는 자리 수로 나눈 값입니다.
- 한 단어짜리 용어는 분모가 전체 단어 수입니다.
- 두 단어짜리 구절은 분모가 겹치는 두 단어 창의 개수, 곧 전체 단어 수보다 하나 적습니다.
길이에 맞는 분모를 쓰기 때문에 구절의 백분율과 단어의 백분율을 나란히 비교할 수 있습니다.
단어는 소문자로 바꾸고 앞뒤 문장부호를 떼어낸 뒤에 셉니다. 그래서 Writing,과 writing이 같은 용어가 됩니다. 어간 추출은 하지 않으므로 write, writes, writing은 따로 셉니다. 한국어에서 조사가 붙은 형태가 따로 세어지는 것과 같은 이유입니다.
밀도에 대한 오해
"키워드 밀도를 2~3퍼센트로 맞추면 검색 순위가 오른다"는 말이 오래 돌아다녔습니다. 이는 검색 엔진이 단순 빈도를 세던 시절의 이야기입니다.
지금 이 수치가 실제로 알려 주는 것은 이렇습니다.
- 주제어가 아예 없는 경우. 다루려던 주제어가 표에 나오지 않는다면, 글이 그 주제를 실제로 다루지 않고 있을 가능성이 큽니다. 이건 유용한 신호입니다.
- 부자연스러운 반복. 한 단어의 밀도가 5퍼센트를 넘는다면 소리 내어 읽어 보세요. 대개 어색합니다.
- 무의식적 반복. "그리고", "또한", "때문에" 같은 말이 상위에 있다면 문장 구조가 단조롭다는 뜻입니다.
목표 수치를 정해 놓고 거기에 맞추는 방식은 권하지 않습니다. 글이 어색해지고, 검색 엔진은 그것을 알아봅니다. 이 표는 글을 진단하는 도구이지 채점 기준이 아닙니다.
이럴 때 씁니다
- 반복 표현 찾기. 자기도 모르게 되풀이하는 말을 발견합니다.
- 주제 일관성 점검. 다루려던 주제어가 실제로 나오는지 봅니다.
- 경쟁 글 분석. 잘 쓰인 글이 어떤 용어를 쓰는지 참고합니다.
- 용어 통일. 같은 개념을 여러 말로 부르고 있는지 확인합니다.
- 번역 검수. 원문의 핵심어가 번역에서도 일관되게 쓰였는지 봅니다.
개인정보와 보안
분석은 브라우저 안에서 이루어집니다. 글은 서버로 가지 않고 탭을 닫으면 사라집니다. 아직 발행하지 않은 원고도 안심하고 넣어도 됩니다.
옵션 설정만 브라우저에 저장됩니다. 자세한 내용은 개인정보처리방침(영문)에 있습니다.
자주 묻는 질문
한국어에서 "학교에"와 "학교를"이 따로 세어집니다
맞습니다. 형태소 분석을 하지 않고 띄어쓰기로만 나누기 때문입니다. 주제어의 실제 빈도를 알고 싶다면 표에서 같은 어간의 항목들을 직접 더하거나, 찾아 바꾸기로 조사를 미리 정리한 뒤 분석하세요.
한국어 불용어 필터는 없나요?
없습니다. 불용어 목록은 영어 기능어만 담고 있습니다. 한국어 글에서는 최소 단어 길이를 2로 올리면 한 글자짜리 의존명사와 조사가 어느 정도 걸러집니다. 완벽하지는 않습니다.
키워드 밀도는 몇 퍼센트가 좋은가요?
정답이 없습니다. 특정 수치를 목표로 삼는 방식은 오래된 오해이고, 지금은 도움이 되지 않습니다. 이 표는 반복이 지나친 곳과 주제어가 빠진 곳을 찾는 진단 도구로 쓰세요. 5퍼센트를 넘는 단어가 있다면 그 문장들을 소리 내어 읽어 보는 정도가 실질적인 활용입니다.
2단어 구절이 무엇을 알려 주나요?
한국어에서는 특히 유용합니다. "인공 지능", "기후 변화"처럼 띄어 쓰는 복합어가 주제어인 경우가 많아, 한 단어씩 볼 때보다 실제 주제를 잘 잡아냅니다.
결과를 스프레드시트로 가져갈 수 있나요?
CSV 다운로드를 누르면 용어, 횟수, 밀도가 담긴 파일이 저장됩니다. 엑셀이나 구글 시트에서 바로 열립니다. 표 복사는 같은 내용을 텍스트로 클립보드에 담습니다.
함께 쓰면 좋은 도구
키워드 빈도 분석와(과) 함께 쓰기 좋은 도구입니다.