Ուղեցույց

Ինչպես կատարել տեքստի համապարփակ վերլուծություն

Տեղադրեք տեքստը մեկ մուտքի դաշտում, գործարկեք վերլուծությունը և արդյունքներում ուսումնասիրեք ծավալը, հաճախականությունները, նիշերի տեսակները, ընթերցելիությունը և ժամանակի գնահատականները։ Դատարկ մուտքը նույնպես հաջողությամբ մշակվում է, բայց դրա վիճակագրությունը զրոյական է։

Գործիք Տեքստի վիճակագրության վերլուծիչ

Ինչ է տալիս տեքստի վերլուծությունը

Text Statistics Dashboard-ը նախատեսված է մեկ տեքստային դաշտում տեղադրված նյութը արագ ուսումնասիրելու համար։ Այն ներկայացնում է բառերի և նիշերի քանակները, բառերի հաճախականությունը, նիշերի տեսակների բաշխումը, ինչպես նաև ընթերցելիության, բառերի երկարության և ընթերցման ու բարձրաձայն կարդալու ժամանակի գնահատականներ։ Այսպիսի վերլուծությունը կարող է օգտակար լինել հոդվածի, հայտարարության, ուսումնական նյութի կամ սևագրության նախնական ստուգման ժամանակ։ Գործիքը ընդունում է մեկ կամընտիր տեքստային մուտք, որի սկզբնական արժեքը դատարկ է, և հաջող արդյունք է վերադարձնում թե՛ դատարկ կամ բաց թողնված, թե՛ ոչ դատարկ մուտքի դեպքում։

Ինչպես կատարել վերլուծությունը

  1. Պատրաստեք վերլուծվող նյութը և տեղադրեք այն տեքստի համար նախատեսված մեկ մուտքի դաշտում։ Կարող եք նաև դաշտը դատարկ թողնել, եթե ցանկանում եք տեսնել դատարկ մուտքի համար վերադարձվող վիճակագրությունը։
  2. Գործարկեք վերլուծությունը և սպասեք արդյունքին։ Ոչ դատարկ տեքստի դեպքում հաշվարկվում են բացատներով առանձնացված բառերը, սկզբնական տեքստի նիշերը, առանց բացատների նիշերը, նախադասությունները, պարբերությունները և տողերը։
  3. Ուսումնասիրեք բառերի հաճախականության բաժինը։ Յուրաքանչյուր բառ հաշվարկից առաջ փոքրատառավորվում է, իսկ հաճախականությունը հաշվելիս պահպանվում են միայն տառերն ու թվերը։ Արդյունքում ցուցադրվում են առավել հաճախ հանդիպող մինչև տասնհինգ նորմալացված բառերը և տարբեր նորմալացված բառերի քանակը։
  4. Ստուգեք նիշերի դասակարգումը։ Արդյունքները առանձին հաշվում են տառերը, թվերը, բացատային նիշերը, կետադրական նշանները, մեծատառերը և փոքրատառերը՝ սկզբնական տեքստի հիման վրա։
  5. Եթե տեքստն ունի վեցից ավելի բառ, դիտարկեք ընթերցելիության գնահատականն ու դրա վեց մակարդակի պիտակը։ Գնահատականը ստացվում է վանկերի ձայնավոր-խմբերի մոտարկմամբ, կլորացվում է և սահմանափակվում է 0-ից 100 միջակայքում։
  6. Վերջում համեմատեք բառերի երկարության և ժամանակի ցուցանիշները։ Գործիքը վերադարձնում է մինչև հինգ տարբեր ամենաերկար այբբենական բառաձև, կլորացված միջին բառի երկարություն, մեկ նախադասության միջին բառաքանակ և ոչ դատարկ մուտքի համար առնվազն մեկ միավորից սկսվող ընթերցման ու խոսքի ժամանակի գնահատականներ՝ համապատասխանաբար րոպեում 200 և 130 բառի հիմքով։

Ինչպես մեկնաբանել արդյունքները

Արդյունքները կարդացեք որպես տեքստի կառուցվածքի և ծավալի նկարագրություն, ոչ թե որպես խմբագրական վերջնական դատողություն։ Բառերի ընդհանուր քանակը և նախադասությունների միջին երկարությունը օգնում են նկատել նյութի խտությունը, իսկ պարբերությունների ու տողերի քանակը՝ դրա ձևավորման առանձնահատկությունները։ Հաճախականության ցուցակը հիմնված է փոքրատառ տառերից և թվերից կազմված նորմալացված ձևերի վրա, ուստի նույն բառի տարբեր գրությունը կարող է առանձին արդյունք տալ, եթե նորմալացված ձևերը տարբեր են։

Դատարկ կամ միայն բացատներից կազմված մուտքի դեպքում վիճակագրական արժեքները զրո են, բառերի ցուցակները դատարկ են, ընթերցելիության մակարդակը հասանելի չէ, իսկ ընթերցման և խոսքի գնահատված ժամանակը զրո է։ Այդ պատճառով դատարկ արդյունքը պետք չէ համեմատել ոչ դատարկ նյութի ընթերցելիության հետ։ Հինգ կամ ավելի քիչ բառ ունեցող նյութի համար ընթերցելիության գնահատականը չպետք է մեկնաբանել որպես հաշվարկված գնահատական։

Երկարագույն բառերի հավասար երկարության դեպքում դրանց հերթականությունը երաշխավորված չէ։ Ժամանակի արժեքները մոտավոր են, քանի որ հիմնված են բառերի հաստատուն արագությունների վրա, իսկ ընթերցելիության ցուցանիշը վանկերի մոտարկված հաշվարկ է։ Գործիքը հայտարարում է, որ ցանցային հասանելիությունը անջատված է, սակայն այդ հանգամանքը ինքնին չի հաստատում տվյալների պահպանման, տեղային կատարման կամ գաղտնիության պայմաններ։

Գործնական օրինակ

Խմբագիրը ցանկանում է արագ ստուգել կարճ հայերեն հայտարարության կառուցվածքն ու բառերի կրկնությունները նախքան այն հրապարակելը։

Տեղադրեք «Այս կարճ նյութը ստուգվում է այսօր» նախադասությունը մուտքի դաշտում և գործարկեք վերլուծությունը։ Այնուհետև համադրեք վերադարձված հաշվարկների բաժինները՝ առանց կարճ տեքստի ընթերցելիության արժեքը որպես ամբողջական գնահատական մեկնաբանելու։

Արդյունքում կտեսնեք բառերի և նիշերի քանակներ, մինչև տասնհինգ հաճախակի նորմալացված բառ, նիշերի դասակարգման հաշվարկներ, իսկ վեցից ավելի բառի դեպքում՝ ընթերցելիության գնահատական ու մակարդակ։ Կցուցադրվեն նաև մինչև հինգ երկարագույն այբբենական բառաձև և ժամանակի գնահատականներ։

Սահմանափակումներ

  • Ընթերցելիության գնահատականը կիրառելի է միայն վեցից ավելի բառ ունեցող նյութի դեպքում, երկարագույն բառերի հավասար երկարության հերթականությունը երաշխավորված չէ, իսկ ժամանակի արժեքները մոտավոր են։

Հաճախակի սխալներ

  • Սխալ կարող է առաջանալ, երբ հաճախականության ցուցակը մեկնաբանվում է որպես բառերի սկզբնական ուղղագրությունների ճշգրիտ ցանկ։ Ուղղումը՝ հաշվի առեք, որ հաճախականության համար բառերը փոքրատառավորվում են և նորմալացվում՝ թողնելով միայն տառերն ու թվերը։

Հաճախ տրվող հարցեր

Կարո՞ղ եմ վերլուծել դատարկ տեքստ։

Այո, բայց դատարկ կամ միայն բացատներից կազմված մուտքի դեպքում վերադարձվում են զրոյական վիճակագրական արժեքներ, դատարկ բառերի ցուցակներ, անհասանելի ընթերցելիության մակարդակ և զրոյական ժամանակ։

Ե՞րբ է հասանելի ընթերցելիության գնահատականը։

Ընթերցելիության գնահատականը հաշվարկվում է միայն վեցից ավելի բառ ունեցող տեքստի համար։ Հինգ կամ ավելի քիչ բառի դեպքում այն պետք չէ մեկնաբանել որպես հաշվարկված ընթերցելիության արդյունք։

Արդյո՞ք ամենաերկար բառերի հերթականությունը միշտ նույնն է։

Ոչ։ Հավասար երկարություն ունեցող ամենաերկար բառերի հերթականությունը երաշխավորված չէ, այնպես որ նույն երկարության բառերի դասավորությունը պետք չէ օգտագործել որպես առաջնահերթության ցուցիչ։

Գործիք

Տեքստի վիճակագրության վերլուծիչ