Ինչպես վերլուծել տեքստը և հաշվել բառերն ու նիշերը
Տեղադրեք տեքստը վերլուծիչում և գործարկեք ստուգումը՝ բառերի, նիշերի, կառուցվածքի, ընթեռնելիության ու ժամանակային գնահատականների վիճակագրությունը տեսնելու համար։ Դատարկ մուտքն էլ մշակվում է, բայց վերադարձնում է զրոյական արդյունքներ և հասանելի չլինող ընթեռնելիության մակարդակ։
Ինչի համար օգտագործել վերլուծիչը
Տեքստի վերլուծիչը նախատեսված է տեղադրած նյութի հիմնական քանակական պատկերը արագ ստանալու համար։ Այն վերադարձնում է նիշերի, բառերի, նախադասությունների, պարբերությունների և տողերի քանակը, ինչպես նաև տառերի, թվանշանների, բացատների, կետադրական նշանների և մեծատառերի ու փոքրատառերի վիճակագրությունը։ Արդյունքում կարելի է տեսնել նաև ընթերցման ու բարձրաձայն կարդալու հաշվարկային գնահատականներ և ընթեռնելիության հետ կապված ցուցանիշներ։ [Եթե ցանկանում եք ստուգել հայերեն նյութը, արդյունքները մեկնաբանեք զգուշությամբ, քանի որ տառերի և վանկերի մշակման որոշ մասը սահմանափակված է լատինական A-Z և a-z տառերով։]
Քայլ առ քայլ օգտագործում
-
Բացեք տեքստի վերլուծիչը և գտեք տեքստի մուտքագրման դաշտը։ Մուտքագրեք կամ տեղադրեք այն նյութը, որի վիճակագրությունն ուզում եք ստանալ։ Մուտքը պարտադիր չէ. եթե ոչինչ չներկայացնեք, օգտագործվում է դատարկ տեքստ։
-
Գործարկեք վերլուծությունը համապատասխան կոճակով կամ կառավարմամբ։ Դատարկ մուտքի դեպքում գործողությունը հաջող է ավարտվում, և արդյունքներում ցուցադրվում են զրոյական քանակներ, զրոյական ժամանակային գնահատականներ ու զրոյական ընթեռնելիության միավոր։ Ընթեռնելիության մակարդակը այդ դեպքում հասանելի չէ։
-
Ոչ դատարկ նյութի համար նախ դիտարկեք ընդհանուր քանակները՝ նիշերը, UTF-8 բայթերը, բառերը, եզակի բառերը, նախադասությունները, պարբերությունները և տողերը։ Բառերի եզակիությունը որոշելիս համեմատությունը կատարվում է փոքրատառի վերածելուց հետո, ուստի մեծատառով և փոքրատառով գրված նույն բառը կարող է հաշվվել որպես մեկ եզակի բառ։
-
Այնուհետև ուսումնասիրեք բնույթի բաժանումը՝ տառեր, թվանշաններ, բացատներ, կետադրական նշաններ, մեծատառեր և փոքրատառեր։ Հայերեն Unicode տեքստը մուտքագրվում է, իսկ նիշերի ընդհանուր քանակն ու UTF-8 բայթերի քանակը հաշվվում են առանձին։ Մի շփոթեք այդ երկու արժեքները. մեկ Unicode նիշը կարող է զբաղեցնել մեկից ավելի բայթ։
-
Վերջում նայեք միջին վիճակագրությանը, ընթեռնելիության ցուցանիշներին և ժամանակային գնահատականներին։ Միջին բառի երկարությունն ու մեկ նախադասության բառերի միջին քանակը կլորացվում են մինչև մեկ տասնորդականը։ Ընթերցման և բարձրաձայն կարդալու ժամանակները հաշվարկվում են բառերի քանակից՝ համապատասխանաբար րոպեում 200 և 130 բառի դրույքներով, իսկ ոչ դատարկ նյութի համար նվազագույնը սահմանվում է մեկ րոպե։
Ինչպես կարդալ արդյունքները
Արդյունքները նախ և առաջ նկարագրում են նյութի ծավալն ու կառուցվածքը, ոչ թե դրա բովանդակային որակը։ Բառերի և եզակի բառերի թվերը օգտակար են կրկնությունների ու ծավալի մոտավոր պատկերը ստանալու համար, իսկ նախադասությունների, պարբերությունների և տողերի քանակը ցույց է տալիս նյութի բաժանումը։ Նախադասությունները հաշվարկելիս դիտարկվում են կետերի, բացականչական և հարցական նշանների հաջորդականությունները՝ շրջակա բացատները հեռացնելուց հետո։ Եթե բառեր կան, բայց այդպիսի ավարտի նշան չկա, օգտագործվում է մեկ նախադասության պահուստային հաշվարկ։ Պարբերությունների համար հաշվի են առնվում դատարկ չլինող հատվածները, որոնք բաժանված են երկու նոր տողի նիշով։
Ընթեռնելիության միավորն ու մակարդակը պետք չէ մեկնաբանել շատ կարճ նյութի դեպքում։ Դրանք հաշվարկվում են միայն այն ժամանակ, երբ նյութում կա հինգից ավելի բառ և առնվազն մեկ նախադասություն։ Այդ հաշվարկները սահմանափակվում են 0-ից 100 միավորի և 0-ից 18 մակարդակի միջակայքերում։ Վանկերի հաշվարկը հիմնվում է համապատասխանեցված բառերից պահված լատինական տառերի և ձայնավորների խմբերի վրա, ուստի հայերեն տեքստի համար այդ ցուցանիշը կարող է ամբողջությամբ չարտացոլել հայերենի ընթեռնելիությունը։
Ժամանակային արժեքները չափված տևողություններ չեն. դրանք բառերի քանակից կլորացված գնահատականներ են։ Դրանցով կարելի է համեմատել նույն նյութի տարբերակները, բայց ոչ կանխատեսել յուրաքանչյուր ընթերցողի իրական արագությունը։
Գործնական օրինակ
Հայերեն կարճ հաղորդագրության հեղինակն ուզում է նախքան հրապարակելը տեսնել դրա ծավալն ու կառուցվածքային հիմնական ցուցանիշները։
Տեղադրեք «Բարև։ Սա կարճ տեքստ է։» նախադասությունները վերլուծիչում և գործարկեք վերլուծությունը։
Արդյունքում կտեսնեք 22 նիշ և 40 UTF-8 բայթ (բայթերն ավելի շատ են, քանի որ հայերեն նիշերը մի քանի բայթ են զբաղեցնում), 5 բառ, նախադասությունների վիճակագրությունը, բնույթի կատեգորիաները, ինչպես նաև համապատասխան ժամանակային գնահատականները։
Սահմանափակումներ
- Տառերի և վանկերի որոշ հաշվարկներ սահմանափակված են ASCII լատինական տառերով, ուստի հայերեն տեքստի այդ ցուցանիշները չեն ներկայացնում հայերենի լիարժեք լեզվական չափում։
- Ընթերցման և բարձրաձայն կարդալու արժեքները բառերի քանակից ստացված կլորացված գնահատականներ են, ոչ թե չափված տևողություններ։
Հաճախակի սխալներ
- Հայերեն տեքստի տառերի կամ ընթեռնելիության թվերը կարող են սխալ մեկնաբանվել որպես հայերենի ամբողջական լեզվական գնահատում։ Պատճառը լատինական տառերով սահմանափակված մշակման մասն է։ Ընդհանուր ծավալի համար դիտարկեք նիշերի և UTF-8 բայթերի քանակը, իսկ լեզվական եզրակացությունների համար մի հիմնվեք միայն այդ երկու ցուցանիշների վրա։
Հաճախ տրվող հարցեր
Կարո՞ղ եմ վերլուծել հայերեն տեքստ։
Այո, Unicode մուտքն ընդունվում է, և նիշերի ու UTF-8 բայթերի քանակները հաշվարկվում են առանձին։ Սակայն տառերի ու վանկերի մշակման որոշ մասը վերաբերում է միայն ASCII լատինական տառերին, ուստի հայերեն նյութի լեզվական մեկնաբանությունը սահմանափակ է։
Ի՞նչ կստանամ դատարկ դաշտը թողնելու դեպքում։
Եթե մուտքը դատարկ է, գործողությունը հաջող է ավարտվում․ քանակներն ու ժամանակային գնահատականները զրո են, ընթեռնելիության միավորը՝ զրո, իսկ մակարդակը հասանելի չէ։
Ե՞րբ են ցուցադրվում ընթեռնելիության արդյունքները։
Միայն հինգից ավելի բառ և առնվազն մեկ նախադասություն ունեցող նյութի դեպքում են հաշվարկվում ընթեռնելիության միավորն ու մակարդակը։ Ավելի կարճ նյութի համար երկուսն էլ ստանում են զրո արժեք։