Ուղեցույց

Ինչպես օգտագործել բառերի հաճախականության վերլուծությունը

Տեղադրեք վերլուծվող տեքստը, անհրաժեշտության դեպքում փոխեք կանգառային բառերի զտումը, նվազագույն երկարությունը և ցուցադրվող եզրերի սահմանը, ապա գործարկեք վերլուծությունը։ Արդյունքը ցույց կտա պահպանված եզրերի հաճախականությունը, տոկոսը, հարաբերական սանդղակի արժեքը և ամփոփ վիճակագրությունը։

Գործիք Բառերի հաճախականության հաշվարկ

Ինչ է ցույց տալիս վերլուծությունը

Այս գործիքը նախատեսված է տրված տեքստում պահպանված բառային միավորների հաճախականությունը տեսնելու համար։ Այն կարող է օգնել նկատել կրկնվող եզրերը, համեմատել կարճ տեքստերի բառապաշարը կամ նախնական պատկերացում կազմել տեքստի բառային կառուցվածքի մասին։ Վերլուծության վրա ազդում են կանգառային բառերի զտումը, բառի նվազագույն երկարությունը և ցուցադրվող եզրերի քանակը։

Կարևոր է հաշվի առնել մուտքի նորմալացումը։ Տեքստը վերածվում է փոքրատառի, իսկ ASCII տառերից, բացատներից և ապաթարցներից բացի մյուս նիշերը փոխարինվում են բացատներով։ Այդ պատճառով հայերեն տառերը, թվերը և սովորական կետադրական նշանները չեն պահպանվում որպես վերլուծվող բառի մաս։ Հայերեն տեքստի անմիջական վերլուծությունը կարող է հանգեցնել նրան, որ պահպանվող բառեր չմնան։

Ինչպես կատարել վերլուծությունը

  1. Պատրաստեք տեքստը։ Տեղադրեք այն տեքստի մուտքի դաշտում։ Տեքստը պարտադիր չէ. եթե այն չտրամադրեք կամ թողնեք դատարկ, գործողությունը հաջողությամբ կավարտվի, սակայն բառերի գրառումներ և ընդհանուր քանակներ չեն լինի։ Եթե անհրաժեշտ է ստանալ օգտակար արդյունք, օգտագործեք ASCII տառերով գրված տեքստ և նախապես որոշեք՝ արդյոք թվերը կամ կետադրությունը պետք է անտեսվեն։

  2. Ընտրեք կանգառային բառերի զտման կարգավորումը։ Այն միացված է սկզբնապես։ Միացված վիճակում ներկառուցված կանգառային բառերը չեն ներառվում արդյունքի մեջ, և այդ զտումը կիրառվում է բառի նվազագույն երկարության ստուգումից հետո։ Անջատեք այն, եթե այդ բառերը նույնպես պետք է հաշվվեն։

  3. Սահմանեք բառի նվազագույն երկարությունը։ Սկզբնական արժեքը 3 նիշ է։ Տրված արժեքը վերածվում է ամբողջ թվի, իսկ զրոյական, բացակայող կամ այլ կերպ կեղծ համարվող արժեքի դեպքում կիրառվում է 3-ը։ Վերջնական արժեքը չի կարող 1-ից փոքր լինել։ Ավելի բարձր շեմը կարող է հեռացնել կարճ բառերը, իսկ 1 կամ 2 արժեքը թույլ է տալիս պահել ավելի կարճ բառային միավորներ։

  4. Սահմանեք ցուցադրվող եզրերի առավելագույն քանակը։ Սկզբնական սահմանը 30 է։ Արժեքը վերածվում է ամբողջ թվի և սահմանափակվում է 5-ից 100 ներառյալ միջակայքում։ Եթե արժեքը կեղծ է, կիրառվում է 30-ը։ Անվավեր տեքստային կամ թվային արժեքը կարող է ձախողել մշակումը, ուստի օգտագործեք ամբողջ թվի վերածվող արժեք։

  5. Գործարկեք վերլուծությունը և դիտեք վերադարձված ցուցակը։ Պահպանված բառերը դասավորվում են ըստ հանդիպումների քանակի՝ նվազող կարգով, իսկ ցուցակը կրճատվում է ընտրված սահմանին։

Ինչպես կարդալ արդյունքը

Յուրաքանչյուր ցուցադրված եզրի համար արդյունքը ներառում է դրա հանդիպումների քանակը, պահպանված բառային միավորների ընդհանուր քանակի մեջ ունեցած տոկոսը և հարաբերական սանդղակի արժեքը։ Տոկոսը կլորացվում է մինչև երկու տասնորդական, իսկ սանդղակի արժեքը՝ մինչև մեկ տասնորդական։ Բացի ցուցակից, հաշվետվությունը ցույց է տալիս պահպանված բառային միավորների ընդհանուր քանակը և տարբեր պահպանված եզրերի քանակը։

«Պահպանված» բառը այստեղ կարևոր սահմանափակում է։ Ընդհանուր քանակը վերաբերում է միայն նորմալացումից, նվազագույն երկարության ստուգումից և, եթե միացված է, կանգառային բառերի զտումից հետո մնացած միավորներին։ Հետևաբար տոկոսները չեն ներկայացնում սկզբնական տեքստի յուրաքանչյուր բառի բաժինը։ Եթե ցուցադրվող սահմանը փոքր է տարբեր եզրերի քանակից, ցուցակում կերևա միայն վերևում դասավորված մասը, ոչ թե բառապաշարի ամբողջ բազմազանությունը։

Օրինակ՝ ASCII տառերով «apple apple pear banana banana banana» մուտքը կարող է օգտագործվել որպես կոնկրետ ստուգման դեպք։ Գործարկումից հետո արդյունքի ձևը պետք է ներառի հանդիպումների քանակով նվազող դասավորված եզրերի ցուցակ, յուրաքանչյուր եզրի տոկոսի և հարաբերական սանդղակի արժեքի հետ, ինչպես նաև պահպանված միավորների ընդհանուր և տարբեր եզրերի քանակները։

Գործնական օրինակ

Փոքր ASCII տեքստի կրկնվող բառերը ցանկանում եք համեմատել ըստ հանդիպումների հաճախականության։

Մուտքագրեք «apple apple pear banana banana banana» տեքստը, թողեք սկզբնական զտման և սահմանաչափի կարգավորումները, ապա գործարկեք վերլուծությունը։

Արդյունքը պարունակում է հանդիպումների քանակով նվազող եզրերի ցուցակ, յուրաքանչյուր եզրի տոկոս և հարաբերական սանդղակի արժեք, ինչպես նաև պահպանված միավորների ընդհանուր և տարբեր եզրերի քանակներ։ 6 պահպանված տոկենից ամենահաճախ հանդիպողը «banana»-ն է՝ 3 հանդիպումով։

Սահմանափակումներ

  • Արդյունքը վերաբերում է միայն նորմալացումից, նվազագույն երկարության շեմից և կանգառային բառերի հնարավոր զտումից հետո պահպանված միավորներին։ Ոչ ASCII տառերը, թվերը և ապաթարցից կամ բացատից բացի մյուս նիշերը չեն պահպանվում, իսկ փոքր ցուցադրման սահմանը կարող է թաքցնել տարբեր եզրերի մի մասը։

Հաճախակի սխալներ

  • Եթե արդյունքը դատարկ է կամ գործողությունը չի ավարտվում, պատճառ կարող է լինել հայերեն կամ այլ ոչ ASCII տեքստի օգտագործումը, չափազանց բարձր նվազագույն երկարությունը կամ ամբողջ թվի չվերածվող սահմանաչափը։ Օգտագործեք ASCII տառերով փորձնական մուտք, ընտրեք առնվազն 1 նվազագույն երկարություն և 5-ից 100 միջակայքում ամբողջ թվի վերածվող ցուցադրման սահման։

Հաճախ տրվող հարցեր

Պարտադի՞ր է տեքստ մուտքագրել։

Այո, սակայն դատարկ կամ բաց թողնված տեքստի դեպքում գործողությունը հաջողությամբ կավարտվի առանց բառերի գրառումների և զրոյական ընդհանուր քանակներով։

Ո՞րն է բառի նվազագույն երկարության սկզբնական արժեքը։

Սկզբնական նվազագույն երկարությունը 3 նիշ է։ Տրված արժեքը վերածվում է ամբողջ թվի, իսկ վերջնական արժեքը սահմանափակվում է այնպես, որ 1-ից փոքր չլինի։

Քանի՞ եզր է ցուցադրվում սկզբնապես։

Սկզբնական սահմանը 30 ցուցադրվող եզր է։ Այն վերածվում է ամբողջ թվի և սահմանափակվում է 5-ից 100 ներառյալ միջակայքով։

Գործիք

Բառերի հաճախականության հաշվարկ