계산 방식

이 사이트의 모든 계산 규칙입니다. 숫자가 어긋날 때 직접 맞춰 볼 수 있도록 적어 두었습니다.

On this page

도구마다 세는 방식이 다르기 때문에, 워드와 CMS와 텍스트 도구가 같은 문단을 두고 서로 다른 숫자를 말할 수 있습니다. 이 페이지는 TextTidyTools가 정확히 무엇을 어떻게 세는지 적어 둔 문서입니다. 숫자가 어긋날 때 그 차이가 어디서 왔는지 맞춰 볼 수 있습니다.

무엇을 한 단어로 세는가

공백 — 스페이스, 탭, 줄바꿈 — 이 이어진 구간을 기준으로 텍스트를 나눕니다. 그렇게 나온 조각에 어떤 문자 체계로든 글자나 숫자가 하나라도 들어 있으면 한 단어로 셉니다. 따라서,

  • don't, e-mail, 3.5, café는 각각 한 단어입니다.
  • 혼자 떨어진 &는 글자도 숫자도 없으므로 단어가 아닙니다.
  • New York은 두 단어입니다. 고유명사를 찾아보는 사전 조회는 하지 않습니다.
  • https://example.com/page 같은 주소는 공백이 없으므로 한 단어입니다.

한국어는 어절 단위로 셉니다. 띄어쓰기로 나누기 때문에 "학교에 갔다"는 두 단어이고, 조사가 붙은 "학교에"는 한 단어입니다. 형태소로 쪼개지 않으므로 국어학에서 말하는 단어 수와는 다를 수 있습니다. 띄어쓰기를 하지 않는 일본어와 중국어에서는 단어 수가 낮게 나오며 의미가 없습니다. 그 경우 글자 수를 쓰세요.

무엇을 한 글자로 세는가

글자 수는 UTF-16 코드 단위의 개수입니다. 거의 모든 플랫폼의 글자 제한이 이 기준으로 측정됩니다. 보통의 글자, 숫자, 문장부호로 이루어진 글에서는 눈에 보이는 것과 일치합니다.

한글은 완성형 한 글자가 1로 셉니다. "한"은 한 글자입니다. 다만 자모를 따로 입력한 조합형(ㅎ + ㅏ + ㄴ)은 세 글자로 셉니다. 기본 다국어 평면 바깥의 문자 — 대부분의 이모지, 일부 희귀 문자 — 는 하나에 2를 차지합니다. 👍 하나가 글자 수를 2 늘리고, 여러 기호가 결합된 가족 이모지는 훨씬 더 늘립니다. 눈에 보이는 기호를 하나로 세어야 하는 도구(예: 텍스트 뒤집기)는 대신 자소 분할을 쓰므로 이모지가 반으로 쪼개지지 않습니다.

공백 제외 글자 수

모든 공백 문자를 지우고 셉니다. 일반 스페이스, 탭, 줄바꿈, 그리고 줄바꿈 없는 공백(U+00A0) 같은 유니코드 공백까지 포함합니다. 문장부호는 남깁니다.

자기소개서나 지원서의 "공백 제외" 한도가 이 값과 맞는 경우가 많지만, 기관마다 규칙이 다를 수 있습니다. 한도가 걸린 일이라면 마지막에는 제출 시스템에서 확인하세요.

바이트 용량

텍스트를 UTF-8로 인코딩한 뒤의 바이트 수입니다. ASCII 글자는 1바이트, 대부분의 악센트가 붙은 라틴 문자와 그리스 문자는 2바이트, 한글과 한자는 3바이트, 대부분의 이모지는 4바이트입니다. 데이터베이스 컬럼 길이나 일부 API의 페이로드 제한에서 중요한 값입니다.

문장은 어떻게 구분하는가

., !, ?, 뒤에 오는 공백이 아닌 첫 글자가 새로 시작하는 무언가 — 대문자, 숫자, 여는 따옴표나 괄호 — 이고, 부호 앞의 말이 알려진 약어가 아닐 때 문장이 끝난 것으로 봅니다.

약어 목록에는 흔한 경칭(Mr., Dr., Prof.), 법인 약칭(Inc., Ltd.), 월과 요일 약어, 이름의 이니셜(J.), e.g.와 i.e. 같은 라틴 약어가 들어 있습니다. 소수점도 보호하므로 3.5 million은 한 문장 안에 남습니다.

이 규칙은 영어를 기준으로 다듬은 어림짐작입니다. 한국어 문장은 대개 마침표로 끝나므로 대체로 맞지만, 영어식 약어 목록은 한국어에 도움이 되지 않습니다. 드문 약어, 문장 중간의 말줄임표, 물음표로 끝나는 인용 대사는 개수를 한둘 어긋나게 할 수 있습니다. 빈 줄은 언제나 문장을 닫습니다.

문단은 어떻게 세는가

문단은 앞뒤가 빈 줄로 나뉜 텍스트 덩어리입니다. 엔터를 한 번 누르거나 PDF에서 내보낼 때 생기는 연속된 한 줄 줄바꿈은 같은 문단 안에 남습니다. 글 맨 앞과 맨 뒤의 빈 줄은 무시하고, 공백만 있는 문단은 세지 않습니다.

줄은 줄바꿈과 줄바꿈 사이의 텍스트입니다. 윈도 줄바꿈(\r\n)과 옛 맥 줄바꿈(\r)은 세기 전에 \n으로 통일합니다. 그래서 메모장에서 내보낸 파일과 맥 편집기에서 내보낸 파일이 같은 숫자를 냅니다. 빈 텍스트는 0줄, 줄바꿈이 하나도 없는 텍스트는 1줄입니다.

읽는 시간

읽는 시간은 단어 수를 분당 단어 수로 나눈 값이며, 분과 초로 보여 줍니다. 기본값은 분당 238단어로, 화면에서 영어 산문을 눈으로 읽을 때의 평균에 관한 연구 값을 반영합니다. 읽는 속도는 사람마다, 그리고 글의 난도에 따라 크게 다르므로 이 값은 계획을 세우기 위한 참고치이지 독자를 측정한 값이 아닙니다.

한국어에는 이 기본값을 그대로 쓰지 마세요. 238이라는 수치는 영어 단어 기준입니다. 한국어는 어절당 담기는 정보량이 달라 같은 분량이라도 체감 속도가 다릅니다. 한국어 원고라면 속도를 직접 지정해 두고, 실제로 읽어 본 시간과 맞춰 보정하는 편이 낫습니다.

계산기는 이미지, 표, 코드 블록, 각주에 드는 시간을 더하지 않고, 전문 용어가 많다고 느려지지도 않습니다. 내용이 빽빽하다면 나온 값보다 넉넉하게 잡으세요.

말하는 시간

말하는 시간은 같은 산술에 더 느린 속도를 씁니다. 말은 읽기보다 느리기 때문입니다. 기본 제공 속도는 또박또박 느리게 100, 대화하듯 130, 보통 발표 속도 150, 빠른 전달 180입니다. 쉼, 웃음, 질문, 슬라이드 전환은 포함되지 않습니다. 실제 발표라면 나온 값에 10~20퍼센트를 더해 잡으세요.

한국어 발표도 위의 읽는 시간과 같은 주의가 필요합니다. 영어 단어 기준 속도이므로, 한국어 대본은 한 번 소리 내어 읽어 보고 속도를 맞추는 편이 정확합니다.

키워드 밀도

밀도는 어떤 용어가 나온 횟수를 같은 길이의 용어가 들어갈 수 있는 자리 수로 나눈 값이며, 백분율로 보여 줍니다. 한 단어짜리 용어에서는 분모가 전체 단어 수이고, 두 단어짜리 구절에서는 겹치는 두 단어 창의 개수, 곧 전체 단어 수보다 하나 적은 값입니다. 길이에 맞는 분모를 쓰기 때문에 구절의 백분율과 단어의 백분율을 나란히 비교할 수 있습니다.

단어는 소문자로 바꾸고 앞뒤의 문장부호를 떼어낸 뒤에 셉니다. 그래서 Writing,writing은 같은 용어입니다. 어간 추출은 하지 않으므로 write, writes, writing은 각각 따로 셉니다. 선택 가능한 불용어 필터는 표준 영어 기능어 목록을 쓰며, 도구 페이지에 전체 목록을 공개해 두었습니다. 한국어 불용어 목록은 아직 없습니다.

유니코드 관련 한계

대소문자 변환은 브라우저 자체의 유니코드 케이스 매핑을 씁니다. 대부분의 언어를 올바르게 처리하지만, 텍스트의 언어를 모르는 상태에서는 터키어의 점 없는 i처럼 문맥에 따라 달라지는 경우를 해결할 수 없습니다. 정렬은 브라우저의 로캘 인식 콜레이터에 숫자 정렬을 켜서 쓰므로, item2item10보다 앞에 옵니다. 한국어 정렬은 이 콜레이터를 통해 가나다순으로 처리됩니다.

눈에 보이는 글자를 하나의 단위로 다뤄야 하는 도구는 브라우저가 제공하면 Intl.Segmenter를 쓰고, 없으면 코드 포인트 분할로 물러납니다. 이 대체 방식은 서로게이트 쌍은 온전히 유지하지만, 기본 이모지와 그 수식 기호를 갈라놓을 수 있습니다.

반올림

평균값은 소수점 한두 자리까지 보여 줍니다. 시간은 초 단위로 반올림하고, 짧은 "몇 분 분량" 표시는 분 단위로 반올림하되 최소 1분입니다. 키워드 도구의 백분율은 소수점 두 자리까지 보여 줍니다.