텍스트에서 단어 빈도 분석하는 방법
영어 알파벳 중심의 텍스트를 입력하면 단어별 빈도와 비율, 상대 막대 값을 빈도순으로 확인할 수 있습니다. 불용어 제외 여부와 상위 결과 개수도 입력 조건에 맞게 조정할 수 있습니다.
무엇을 확인할 수 있나요
이 도구는 입력한 텍스트에서 조건에 맞는 단어를 세고, 자주 등장한 순서로 목록을 보여 주는 분석 도구입니다. 단어별 등장 횟수뿐 아니라 전체 추출 토큰에서 차지하는 비율과 가장 많이 나온 단어를 기준으로 한 상대 막대 값도 함께 살펴볼 수 있습니다. 영어 문서의 반복 표현을 찾거나 여러 문서에서 어휘 사용 양상을 비교할 때 활용하기 좋습니다.
분석 대상은 텍스트의 언어와 표기 방식을 먼저 확인해야 합니다. 도구는 입력 내용을 소문자로 바꾼 뒤 ASCII 영어 알파벳 a부터 z까지와 아포스트로피로 이루어진 토큰을 추출합니다. 따라서 영어 단어를 중심으로 작성된 자료에서 결과를 읽는 방식이 적합합니다. 한국어 문장 자체의 단어 수를 세는 용도라면 추출 규칙 때문에 기대한 결과와 달라질 수 있습니다. 결과를 문서의 의미나 품질에 대한 평가로 받아들이기보다, 집계 조건에 따른 단어 분포로 해석하세요.
입력부터 결과 확인까지
- 분석할 영어 텍스트를 입력란에 붙여 넣습니다. 텍스트를 입력하지 않으면 빈 문자열이 사용되므로, 실제 자료를 분석하려면 대상 내용을 입력해야 합니다.
- 불용어 제외 설정을 확인합니다. 이 기능은 기본적으로 켜져 있으며, 켜진 상태에서는 도구에 포함된 불용어 목록에 해당하는 단어가 빈도 집계에서 빠집니다. 기능을 끄면 그 조건을 적용하지 않고 입력에서 추출된 토큰을 대상으로 결과를 확인할 수 있습니다.
- 표시할 상위 결과 수를 정합니다. 값을 따로 바꾸지 않을 때의 기본값은 20입니다. 변환할 수 있는 값은 정수로 처리되고, 결과 수는 최소 5개에서 최대 100개 사이로 제한됩니다. 원하는 개수보다 작은 값이나 큰 값을 입력하면 이 범위를 벗어나지 않도록 조정됩니다.
- 분석을 실행한 뒤 빈도순 목록을 확인합니다. 입력은 소문자로 변환되어 토큰으로 추출되고, 불용어 제외 조건을 통과한 토큰마다 횟수가 집계됩니다. 목록은 집계 횟수가 높은 항목부터 낮은 항목 순서로 정렬됩니다.
- 각 항목의 횟수, 비율, 상대 막대 값을 함께 읽습니다. 설정을 바꿔 다시 실행할 때에는 같은 텍스트라도 불용어 조건이나 표시 개수에 따라 화면에 보이는 목록이 달라질 수 있으므로, 비교하는 자료에 동일한 조건을 적용하세요.
수치와 집계 범위 읽기
단어별 횟수는 조건을 통과한 토큰이 해당 항목으로 몇 번 집계되었는지를 나타냅니다. 비율은 그 단어의 횟수를 추출된 전체 토큰 수로 나눈 뒤 소수 둘째 자리까지 반올림한 값입니다. 상대 막대 값은 해당 단어의 횟수를 가장 높은 빈도를 기록한 항목과 비교한 수치이며, 소수 첫째 자리까지 반올림됩니다.
두 지표는 서로 다른 질문에 답합니다. 비율은 전체 추출 토큰 중 해당 단어가 차지하는 몫을 살펴볼 때 유용하고, 상대 막대 값은 목록 안에서 다른 단어보다 얼마나 자주 나왔는지 비교할 때 유용합니다. 불용어를 제외한 상태에서는 전체 토큰과 목록의 기준이 그 설정에 따라 달라질 수 있으므로, 결과를 비교할 때 설정을 함께 기록하는 편이 좋습니다.
입력이 비어 있으면 분석은 성공하지만 전체 단어 수와 고유 단어 수가 0인 빈 분석으로 반환됩니다. 한국어 글자, 숫자, 일반 문장부호, 하이픈이 섞인 표현은 문서화된 추출 규칙에서 하나의 온전한 토큰으로 인식되지 않을 수 있습니다. 그러므로 예상과 다른 목록이 나오면 먼저 입력 언어, 철자, 기호, 불용어 설정을 차례로 살펴보세요.
사용 예시
영어 고객 의견에서 반복적으로 사용된 표현을 찾아 문서의 어휘 분포를 살펴보려는 상황입니다.
영어로 작성된 고객 의견을 입력하고 불용어 제외 설정을 확인한 다음 상위 결과 수를 10으로 지정해 분석을 실행합니다.
분석 결과에는 전체 단어 수와 고유 단어 수가 표시되고, 빈도순 단어 목록에는 각 항목의 횟수, 전체 추출 토큰 기준 비율, 최고 빈도 대비 상대 막대 값이 포함됩니다.
제한 사항
- 토큰 추출은 ASCII 영어 알파벳 a부터 z까지와 아포스트로피를 기준으로 하므로 한국어, 숫자, 일반 문장부호, 하이픈이 포함된 표현은 하나의 온전한 단어로 처리되지 않을 수 있습니다.
자주 발생하는 오류
- 한국어 문장이나 숫자, 하이픈이 들어간 자료를 일반적인 단어 분석처럼 해석하면 결과가 달라질 수 있습니다. 영어 알파벳과 아포스트로피를 사용하는 토큰인지 확인하고, 불용어 제외 설정도 확인한 뒤 조건에 맞는 텍스트로 다시 분석하세요.
자주 묻는 질문
텍스트를 입력하지 않아도 분석할 수 있나요?
텍스트를 생략하면 빈 문자열이 사용되므로 분석은 성공하지만, 전체 단어 수와 고유 단어 수가 0인 빈 분석이 반환됩니다. 단어 목록을 확인하려면 분석할 내용을 입력해야 합니다.
상위 단어를 몇 개까지 볼 수 있나요?
상위 결과 수를 지정하지 않으면 기본값 20이 적용됩니다. 변환할 수 있는 값은 정수로 처리되며, 표시 개수는 최소 5개와 최대 100개 사이로 제한됩니다.
한국어 텍스트의 단어 빈도도 확인할 수 있나요?
한국어 글자를 하나의 온전한 토큰으로 세는 결과를 기대하기는 어렵습니다. 추출 규칙이 ASCII 영어 알파벳 a부터 z까지와 아포스트로피를 기준으로 하므로, 한국어 자료에서는 입력 표기와 결과를 함께 확인해야 합니다.