Ինչպես վերլուծել անգլերեն բառերի հաճախականությունը տեքստում
Մուտքագրեք անգլերեն տեքստը, ընտրեք անտեսվող բառերի զտման կարգավորումը և ստացեք դասավորված հաճախականություններ՝ տոկոսներով ու համեմատական գծային չափումներով։ Հայերեն տեքստի բառային հաշվարկի համար այս գործիքի արդյունքը հարմար չէ, քանի որ այն ճանաչում է միայն ASCII տառային միավորներ։
Ինչի համար է պետք վերլուծիչը
Բառերի հաճախականության վերլուծիչը օգնում է տեսնել, թե տեքստում որ անգլերեն բառերն են կրկնվում առավել հաճախ։ Այն հաշվում է պահպանված բառերի հանդիպումները և յուրաքանչյուր արդյունքի համար ցույց է տալիս հարաբերական տոկոս ու համեմատական գծային չափում։ Այս մոտեցումը հարմար է կարճ հոդվածի, նկարագրության կամ սևագրության կրկնվող բառապաշարը նախնական դիտարկելու համար։[...]
Տեքստը պարտադիր չէ. դատարկ կամ բաց թողնված դաշտի դեպքում ստացվում է հաջողված դատարկ վերլուծություն՝ զրոյական ընդհանուր և եզակի բառերի քանակով։[...]
Կարևոր է հաշվի առնել լեզվական սահմանափակումը. վերլուծիչը փոքրատառ է դարձնում մուտքագրվածը և բառային միավորներ է առանձնացնում միայն ASCII a-z տառերից ու ապոստրոֆներից։ Հայերեն տառերը, թվերը, կետադրական նշանները և գծիկով միացված ձևերը չեն ճանաչվում որպես ամբողջական բառային միավորներ։[...]
Ինչպես օգտագործել գործիքը
- Տեղադրեք անգլերեն տեքստը տեքստային դաշտում։ Կարող եք սկսել նաև դատարկ դաշտից, եթե ցանկանում եք տեսնել դատարկ վերլուծության ձևը։[...]
- Որոշեք՝ միացվա՞ծ թողնել անտեսվող բառերի զտումը։ Այդ կարգավորումը լռելյայն միացված է. միացված լինելու դեպքում ներկառուցված ցանկում ներառված բառերը չեն մտնում հաճախականությունների հաշվարկի մեջ։[...] Եթե ցանկանում եք դիտարկել նաև այդ բառերը, անջատեք զտումը։
- Անհրաժեշտության դեպքում փոխեք լավագույն արդյունքների քանակը։ Սկզբնական արժեքը 20 է. հաջողությամբ թվի վերածվող արժեքները սահմանափակվում են 5-ից 100 միջակայքով, իսկ դատարկ կամ զրոյական համարվող արժեքը կրկին օգտագործում է 20-ը։[...]
- Գործարկեք վերլուծությունը և դիտեք ընդհանուր ու եզակի բառերի քանակները, ապա՝ հաճախականությունների ցանկը։ Պահպանված բառերը ցուցադրվում են ավելի բարձր հաշվարկից դեպի ավելի ցածր հաշվարկ։[...] Յուրաքանչյուր բառի կողքին տոկոսը հաշվվում է այդ բառի քանակը բաժանելով առանձնացված բոլոր բառային միավորների ընդհանուր թվին և կլորացվում է երկու տասնորդականի։ Գծային չափումը համեմատում է տվյալ բառի քանակը պահպանված ամենաբարձր քանակի հետ և կլորացվում է մեկ տասնորդականի։[...]
Արդյունքը համադրելու համար օգտագործեք նույն տեքստը և նույն զտման կարգավորումը։ Եթե նպատակ ունեք ուսումնասիրել հայերեն նյութ, մի մեկնաբանեք զրոյական կամ թերի ցուցակը որպես հայերեն բառերի իրական հաճախականություն, քանի որ առանձնացման կանոնը նախատեսված չէ ոչ ASCII տառերի համար։[...]
Ինչպես կարդալ արդյունքը
Ավելի բարձր հաշվարկ ունեցող բառերը հայտնվում են ցանկի վերևում։ Տոկոսը ցույց է տալիս տվյալ պահպանված բառի բաժինը առանձնացված բոլոր բառային միավորների նկատմամբ, իսկ գծային չափումը թույլ է տալիս տեսողականորեն համեմատել այն ամենահաճախ հանդիպող պահպանված բառի հետ։ Այդ երկու ցուցանիշները նույնը չեն. տոկոսը կապված է ընդհանուր քանակի, իսկ գծային չափումը՝ առավելագույն պահպանված հաճախականության հետ։[...]
Անտեսվող բառերի զտումը միացված լինելու դեպքում ցուցակում բացակայող բառը կարող է պարզապես պատկանել ներկառուցված անտեսվող բառերի ցանկին։ Ուստի արդյունքը պետք է մեկնաբանել որպես ընտրված կարգավորումներով ստացված բառային հաշվարկ, ոչ թե որպես տեքստի ամբողջ լեզվական վերլուծություն։[...] Եթե փոխեք լավագույն արդյունքների քանակը, ցուցակի երկարությունը կարող է փոխվել 5-ից 100 սահմաններում, սակայն դա չի նշանակում, որ մուտքային տեքստում այդքան տարբեր բառ կա։[...]
Օրինակ՝ անգլերեն «red apple, red tree» տեքստը մուտքագրելուց և վերլուծությունը գործարկելուց հետո արդյունքի կառուցվածքում կարող եք ակնկալել ընդհանուր ու եզակի քանակներ, դասավորված բառերի հաճախականությունների ցանկ, յուրաքանչյուր բառի տոկոս և համեմատական գծային չափում։ Թվային արժեքները կախված են ընտրված զտումից և գործարկված մուտքից։
Գործնական օրինակ
Խմբագիրը ցանկանում է արագ տեսնել կարճ անգլերեն նկարագրության մեջ կրկնվող բառերը։
Մուտքագրեք «red apple, red tree», թողեք անտեսվող բառերի զտումը միացված և գործարկեք վերլուծությունը։
Կստանաք ընդհանուր և եզակի բառերի քանակներ, դասավորված հաճախականությունների ցանկ, ինչպես նաև յուրաքանչյուր պահպանված բառի տոկոս և համեմատական գծային չափում։ 4 առանձնացված տոկենից ամենահաճախ հանդիպողը «red»-ն է՝ 2 հանդիպումով։
Սահմանափակումներ
- Արդյունքները սահմանափակվում են ASCII a-z տառերից ու ապոստրոֆներից առանձնացված միավորներով, իսկ միացված անտեսվող բառերի զտումը հեռացնում է ներկառուցված ցանկի բառերը հաշվարկից։
Հաճախակի սխալներ
- Եթե հայերեն տեքստից արդյունք չեք ստանում, պատճառը կարող է լինել այն, որ գործիքը բառեր է առանձնացնում միայն ASCII a-z տառերից և ապոստրոֆներից։ Օգտագործեք համապատասխան անգլերեն մուտք՝ անտեսելով այն բառերը, որոնք պարունակում են հայերեն կամ այլ ոչ ASCII տառեր։
Հաճախ տրվող հարցեր
Ի՞նչ է պատահում, եթե տեքստ չմուտքագրեմ։
Այո, սակայն վերլուծությունը դատարկ կլինի և կունենա զրոյական ընդհանուր ու եզակի բառերի քանակներ, եթե տեքստը բացակայում է։
Քանի՞ բառ է ցուցադրվում արդյունքներում։
Կարող եք փոխել լավագույն արդյունքների քանակը։ Սկզբնական արժեքը 20 է, իսկ հաջողությամբ թվի վերածվող արժեքները սահմանափակվում են 5-ից 100 միջակայքով։
Կարո՞ղ եմ այս գործիքով վերլուծել հայերեն տեքստ։
Ոչ ամբողջությամբ։ Հայերեն տառերը, թվերը, կետադրական նշանները և գծիկով ձևերը չեն առանձնացվում որպես ամբողջական բառեր, քանի որ գործիքը ճանաչում է ASCII a-z տառեր և ապոստրոֆներ։