가이드

Word Frequency Map으로 텍스트 단어 빈도 분석하기

텍스트를 입력한 뒤 불용어, 최소 길이, 표시 항목 수를 확인하면 남겨진 단어를 빈도순으로 볼 수 있습니다. 입력을 비워 두면 단어 항목 없이 총계가 0인 결과가 나옵니다.

도구 단어 빈도 분석기

반복 단어를 살펴보는 기본 원리

텍스트에서 어떤 단어가 자주 나타나는지 확인하려면 단어 빈도 분석을 사용할 수 있습니다. 이 기능은 입력한 내용에서 조건을 통과한 단어 토큰을 세고, 많이 나온 순서로 결과를 보여 줍니다. 문서 초안의 어휘를 살피거나, 반복 표현을 찾거나, 짧은 영문 메모의 단어 구성을 비교할 때 활용할 수 있습니다. 불용어 필터, 최소 단어 길이, 표시 항목 수를 목적에 맞게 살펴보면 결과의 범위를 조절할 수 있습니다. 다만 화면에 보이는 수치는 원문을 그대로 세었다는 뜻이 아니라, 정규화와 필터링을 거친 뒤 남은 토큰을 바탕으로 한 값입니다. 따라서 분석 전에 입력 언어와 필요한 문자 형식을 확인하는 것이 좋습니다.

설정부터 결과 확인까지

  1. 분석할 텍스트를 입력합니다. 입력을 생략하거나 빈 문자열로 두는 것도 가능하지만, 이 경우 작업은 성공하고 단어 항목 없이 총계가 0인 결과가 나옵니다.
  2. 불용어 필터의 상태를 확인합니다. 기본 상태에서는 필터가 켜져 있습니다. 필터가 켜져 있으면 먼저 최소 길이 조건을 적용하고, 그다음 기본 불용어 목록에 들어 있는 항목을 제외합니다. 특정 단어가 보이지 않을 때는 이 순서를 염두에 둡니다.
  3. 최소 단어 길이를 정합니다. 값을 주지 않으면 기본값 3이 사용됩니다. 입력값은 정수로 변환되며, 처리된 값은 1보다 작아지지 않습니다. 짧은 항목까지 살피고 싶다면 조건을 낮추되, 결과가 어떤 토큰을 포함하는지 함께 확인합니다.
  4. 표시할 단어 수를 정합니다. 값을 생략하면 기본값 30이 적용됩니다. 입력값은 정수로 변환된 뒤 5 이상 100 이하의 범위로 조정됩니다. 목록을 넓게 보려는 경우에도 이 범위를 벗어난 값을 그대로 기대하지 않습니다.
  5. 분석을 실행합니다. 입력 텍스트는 소문자로 바뀝니다. ASCII 영문자, 공백, 아포스트로피가 아닌 문자는 공백으로 바뀌고, 남은 내용은 공백을 기준으로 나뉩니다. 이 정규화 결과를 바탕으로 토큰을 세므로 숫자, 일반 문장 부호, 비ASCII 문자는 원래 모양으로 유지된다고 가정하지 않습니다.
  6. 결과 목록과 전체 통계를 함께 확인합니다. 목록은 남겨진 토큰의 횟수가 많은 순서로 정렬되며, 표시 한도만큼의 항목이 제시됩니다. 필터를 바꾸어 다시 분석할 때는 설정과 결과를 한 쌍으로 기록하면 비교가 쉬워집니다.

수치가 뜻하는 범위

결과의 각 단어 항목에는 해당 토큰의 횟수와 비율이 제공됩니다. 비율은 남겨진 토큰 전체에서 그 항목이 차지하는 몫을 기준으로 하며, 소수 둘째 자리까지 반올림됩니다. 상대 막대 값은 소수 첫째 자리까지 반올림되어 항목 사이의 크기를 비교하는 데 쓰입니다. 함께 제시되는 남겨진 토큰 총수는 필터를 통과한 항목의 개수이고, 서로 다른 단어 수는 중복을 하나로 묶었을 때의 어휘 수입니다. 원문 단어 수와 두 통계의 값이 다를 수 있는 이유는 정규화, 불용어 제외, 최소 길이 조건에 있습니다. 표시 한도가 어휘 수보다 작다면 서로 다른 단어가 모두 목록에 나타나지 않습니다. 목록에 없는 항목이 있다는 사실만으로 집계가 잘못되었다고 판단하지 말고, 표시 한도와 필터 상태를 먼저 살펴보세요. 한국어 문장처럼 ASCII가 아닌 문자가 중심인 입력은 해당 문자가 공백으로 바뀌므로, 한국어 단어별 빈도표를 얻는 용도로 해석해서는 안 됩니다. 입력을 바꾼 결과를 비교할 때는 같은 정규화 대상과 같은 설정을 유지해야 수치의 차이를 같은 기준에서 읽을 수 있습니다.

사용 예시

짧은 영문 메모에서 반복 표현의 순서와 남겨진 어휘 규모를 확인하려는 상황입니다.

영문 텍스트 ‘apple apple pear’를 입력하고 기본 필터와 표시 한도를 유지한 뒤 분석을 실행합니다. 결과에서 반복 횟수가 높은 항목이 먼저 놓이는지 확인하고, 항목별 통계와 전체 통계가 함께 나타나는지 살펴봅니다.

결과에는 빈도순으로 정렬된 단어 항목과 항목별 횟수, 비율, 상대 막대 값이 표시되며, 남겨진 토큰 총수와 서로 다른 단어 수도 함께 제시됩니다. 남겨진 3개 토큰 중 가장 많이 나타나는 단어는 apple로 2회입니다.

제한 사항

  • 결과는 원문에 있는 단어 전체가 아니라 정규화와 불용어, 최소 길이 조건을 통과한 토큰을 집계한 값이며, 표시 한도에 따라 목록의 항목 수가 줄어들 수 있습니다.

자주 발생하는 오류

  • 한국어 문장을 넣고 한국어 단어가 그대로 집계될 것으로 예상하면 결과가 달라질 수 있습니다. 비ASCII 문자는 공백으로 바뀌므로, ASCII 영문자 중심의 입력인지 먼저 확인하고 남은 토큰을 기준으로 결과를 읽으세요.

자주 묻는 질문

텍스트를 입력하지 않아도 되나요?

입력을 생략하거나 빈 문자열로 두면 작업은 성공하며, 단어 항목 없이 총계가 0으로 표시됩니다.

한국어 텍스트의 단어 빈도를 그대로 확인할 수 있나요?

ASCII가 아닌 문자는 공백으로 바뀐 뒤 분리되므로 한국어 단어가 원래 형태로 남는다고 볼 수 없습니다. 한국어 단어별 집계가 목적이라면 결과가 어떤 문자 기준으로 만들어졌는지 먼저 확인해야 합니다.

화면에 표시할 단어 수를 바꿀 수 있나요?

표시 항목 수는 조정할 수 있습니다. 값을 생략하면 30이 적용되고, 입력값은 정수로 변환된 뒤 5 이상 100 이하로 처리됩니다.

도구

단어 빈도 분석기