Ուղեցույց

Ինչպես PDF-ից հանել տեքստը՝ ըստ ընտրված էջերի

Տրամադրեք բովանդակություն ունեցող PDF-ը, ապա ամբողջ փաստաթղթի համար էջերի դաշտը թողեք դատարկ կամ նշեք մեկից սկսվող էջերը՝ ստորակետերով բաժանված։ Հաջող պատասխանը տալիս է ընտրված էջերի տեքստը էջի նշիչներով, ինչպես նաև էջերի քանակի վերաբերյալ տեղեկություն։

Գործիք PDF-ից տեքստի փոխարկիչ

PDF-ի տեքստը ստանալու նպատակը

Այս գործիքը PDF ֆայլում առկա տեքստային բովանդակությունը վերածում է ընթեռնելի տեքստային արդյունքի։ Այն օգտակար է, երբ պետք է ուսումնասիրել երկար հաշվետվություն, առանձնացնել պայմանագրի որոշ բաժիններ կամ հետագա աշխատանքի համար ստանալ փաստաթղթի տեքստը՝ առանց ամբողջ PDF-ը նույն ձևով կարդալու։ Կարող եք աշխատել ամբողջ փաստաթղթի հետ կամ ընտրել միայն անհրաժեշտ էջերը։

Էջերի սահմանափակ ընտրությունը հարմար է, երբ ձեզ հետաքրքրում են, օրինակ, հաշվետվության ամփոփումը, հավելվածը կամ մի քանի առանձին բաժիններ։ Արդյունքում էջերի տեքստերը միավորվում են մեկ ավելի մեծ տեքստային արդյունքի մեջ, սակայն յուրաքանչյուր ընտրված հատվածի առաջ դրվում է էջի նշիչ, որպեսզի կարողանաք կողմնորոշվել դրա սկզբնաղբյուրում։ Գործիքը նախատեսված է PDF-ում արդեն առկա տեքստի հանման համար։ Սկանավորված կամ միայն պատկերներից կազմված փաստաթղթերի համար OCR-ի աջակցությունը հաստատված չէ, ուստի այդպիսի ֆայլի արդյունքը նախապես կանխորոշել հնարավոր չէ։ Նախքան գործարկումը որոշեք՝ ցանկանում եք ամբողջ փաստաթուղթը, թե միայն ընտրված էջերը։ Այդ որոշումը կօգնի ճիշտ լրացնել էջերի ընտրության դաշտը։

Գործարկման քայլերը

  1. Ընտրեք բովանդակություն ունեցող PDF ֆայլը և տրամադրեք այն որպես կոդավորված PDF տվյալ պարունակող ֆայլային մուտք։ Դատարկ ֆայլային մուտքը գործողության ձախողման պատճառ է, հետևաբար նախ ստուգեք, որ տրամադրվող տվյալը վերաբերում է հենց այն փաստաթղթին, որի տեքստն անհրաժեշտ է ստանալ։

  2. Ամբողջ PDF-ի համար էջերի ընտրության դաշտը չլրացնեք։ Այդ դեպքում էջերի ընտրությունը լռելյայն տարածվում է փաստաթղթի բոլոր էջերի վրա, և արդյունքը վերաբերում է ամբողջ հասանելի փաստաթղթին։

  3. Առանձին էջերի համար գրեք դրանց մեկից սկսվող ամբողջ թվերը՝ ստորակետերով բաժանված։ Օրինակ՝ 2,4,7 գրառումը նշանակում է երկրորդ, չորրորդ և յոթերորդ էջերի ընտրություն։ Նախքան գործարկումը վերանայեք յուրաքանչյուր նիշը, քանի որ ոչ ամբողջ թվով կամ այլ անվավեր էջային նշումը կարող է խափանել գործողությունը։

  4. Գործարկեք մշակումը և սպասեք վերադարձվող պատասխանին։ Հաջող ընթացքի դեպքում ընտրված էջերի տեքստը կհավաքվի մեկ ավելի մեծ արդյունքի մեջ, իսկ տվյալ էջերի տեքստից առաջ կերևա էջի նշիչ։ Այդ նշիչները պահեք արդյունքը կարդալիս, եթե հետագայում պետք է որևէ հատված կապել կոնկրետ էջի հետ։

  5. Ստուգեք պատասխանի էջային տեղեկությունը։ Այն ներառում է փաստաթղթի ընդհանուր էջերի քանակը և ընտրված էջերի քանակը, ինչը թույլ է տալիս համեմատել ձեր մտադրությունը ստացված պատասխանի հետ։ Փաստաթղթի հասանելի միջակայքից դուրս նշված էջահամարները բաց են թողնվում։

  6. Եթե մշակումը չի ավարտվում հաջողությամբ, կարդացեք վերադարձված սխալի հաղորդագրությունը։ PDF-ի վերլուծման կամ տեքստի հանման սխալի դեպքում գործողությունը ձախողվում է, և նույնը կարող է տեղի ունենալ, եթե անհրաժեշտ PDF վերլուծման աջակցությունը հասանելի չէ։ Այդ իրավիճակում նախ ստուգեք ֆայլային մուտքը և էջերի գրառումը, ապա կրկին գործարկեք գործողությունը՝ ուղղված տվյալներով։

Պատասխանի ընթերցումը և սահմանները

Պատասխանը գնահատելիս դիտարկեք երեք տարբեր բաղադրիչ՝ ստացված տեքստը, փաստաթղթի ընդհանուր էջաքանակը և ընտրված էջերի քանակը։ Էջի նշիչը ցույց է տալիս, թե միավորված տեքստի հաջորդ հատվածը որ ընտրված էջից է վերցված։ Այդ կառուցվածքը հատկապես օգտակար է, երբ մի քանի էջերի բովանդակությունը ներկայացված է մեկ ընդհանուր արդյունքով, բայց անհրաժեշտ է պահպանել էջերի միջև տարբերությունը։

Եթե էջերի դաշտը դատարկ եք թողել, վերադարձված տեքստը պետք է մեկնաբանել որպես ամբողջ փաստաթղթի մշակման արդյունք։ Եթե նշել եք առանձին էջեր, ընտրվածների հաշվիչը պետք է հասկանալ փաստաթղթում առկա և մշակման ենթարկված էջերի համատեքստում, քանի որ միջակայքից դուրս համարները բաց են թողնվում և ինքնուրույն հատված չեն ստեղծում։

Տեքստի բացակայությունը կամ թերի պատասխանը կարող է մատնանշել PDF-ի վերլուծման կամ տեքստի հանման խնդիր։ Սկանավորված էջերի դեպքում մի գնահատեք արդյունքը որպես պատկերից տեքստի ճանաչում, քանի որ OCR-ի աջակցությունը հաստատված չէ։ Եթե էջերի գրառումը սխալ է, նախ ուղղեք այն վավեր ամբողջ թվերի միջոցով, իսկ մշակման սխալի դեպքում հաշվի առեք վերադարձված հաղորդագրությունը և PDF վերլուծման աջակցության հասանելիությունը։

Գործնական օրինակ

Օգտատերը ութ էջանոց PDF-ից ցանկանում է ստանալ միայն երկրորդ և չորրորդ էջերի տեքստը։ Սահմանափակ ընտրությունը թույլ է տալիս արդյունքը կենտրոնացնել այդ երկու էջերի վրա։

Տրամադրեք ութ էջանոց կոդավորված PDF և էջերի ընտրության դաշտում գրեք 2,4։ Գործարկումից հետո ստուգեք, որ երկու վերադարձված տեքստային հատվածներն ունեն իրենց էջերի նշիչները և վերաբերում են հենց այդ էջերին։ Ապա համեմատեք էջերի երկու հաշվիչները փաստաթղթի կառուցվածքի հետ։ Այդ ձևով ստուգվում է արդյունքի ձևը՝ առանց տեքստի բովանդակության նախապես ենթադրվող արժեք սահմանելու։

Պատասխանը ներառում է երկրորդ և չորրորդ էջերի տեքստային հատվածները՝ յուրաքանչյուրի առաջ համապատասխան էջի նշիչով, ինչպես նաև ութ էջանոց փաստաթղթի ընդհանուր էջաքանակն ու երկու ընտրված էջի քանակը։

Սահմանափակումներ

  • Միայն պատկերներից կազմված կամ սկանավորված PDF-ի համար OCR-ի աջակցությունը հաստատված չէ, ուստի տեքստային արդյունքի բովանդակությունը կանխորոշված չէ։

Հաճախակի սխալներ

  • Պատճառ՝ ֆայլային մուտքը դատարկ է, և գործողությունը չի ստանում մշակման ենթակա PDF տվյալ։ Ուղղում՝ տրամադրեք բովանդակություն ունեցող, կոդավորված PDF տվյալ պարունակող ֆայլային մուտք և կրկին գործարկեք գործողությունը։

Հաճախ տրվող հարցեր

Կարո՞ղ եմ հանել ամբողջ PDF-ի տեքստը։

Երբ էջերի ընտրության դաշտը դատարկ է, լռելյայն ընտրվում են PDF-ի բոլոր էջերը։ Այդ պայմանով ստացված տեքստը վերաբերում է ամբողջ հասանելի փաստաթղթի բովանդակությանը։ Եթե մուտքը դատարկ է, գործողությունը չի հաջողվի։

Ինչպե՞ս ընտրել միայն որոշ էջեր։

Գրեք անհրաժեշտ էջերի մեկից սկսվող համարները և բաժանեք դրանք ստորակետերով, օրինակ՝ 1,3,5։ Փաստաթղթի էջերի միջակայքից դուրս նշված համարները բաց են թողնվում, իսկ անվավեր ոչ ամբողջ գրառումը կարող է ձախողել գործողությունը։

Կաշխատի՞ գործիքը սկանավորված PDF-ի դեպքում։

Սկանավորված կամ պատկերային PDF-ի դեպքում արդյունքը կարող է չպարունակել սպասված տեքստը։ Պատճառն այն է, որ նկարագրված հնարավորությունը վերաբերում է PDF-ում առկա տեքստի հանմանը, իսկ OCR-ի աջակցությունը հաստատված չէ։

Գործիք

PDF-ից տեքստի փոխարկիչ