Dumiretso sa nilalaman
Mga file format

Bakit hindi searchable ang na-scan na PDF mo, at paano ito ayusin

Binuksan mo ang PDF, pinindot ang Ctrl+F, at tinype ang salitang kitang-kita sa page — pero walang nahanap. O sinubukan mong kopyahin ang isang talata at walang lumabas, o sinabi ng converter na walang teksto ang file. Hindi sira ang dokumento. Scan ito, at litrato ng papel ang scan. Kapag naintindihan ang pagkakaiba, maipapaliwanag ang maraming nakalilitong nangyayari, at makikita ang solusyon.

Mula sa PDF Tool PH3 min na basahinInilathala

Dalawang uri ng PDF na magkamukha

Iniimbak bilang mga character ang teksto ng PDF na ginawa sa computer — in-export mula sa Word, ni-print bilang PDF mula sa browser, o ginawa ng bangko: ang letrang ito, sa font na ito, sa posisyong ito. Kaya itong hanapin, piliin at kopyahin ng PDF reader mo, at kaya itong basahin nang malakas ng screen reader.

Ang PDF na gawa ng scanner o camera ng phone ay nag-iimbak ng bawat page bilang larawan. Nakikita mo ang mga salita dahil binabasa ng mata mo ang larawan; pixel lang ang laman ng file. Para sa computer, walang "INVOICE" sa page, kundi pattern lang ng madilim at maliwanag na tuldok na nagkataong mukhang salita.

Paano malalaman kung alin ang hawak mo

Subukang i-highlight ang isang pangungusap gamit ang mouse, o pindutin ang Ctrl+F at hanapin ang salitang nakikita mo. Kung nahi-highlight ang teksto at nahahanap ito, may totoong teksto ang PDF. Kung buong page ang natatakpan ng highlight, o walang nahi-highlight, larawan ang page.

May mga dokumentong halo: report na tinype sa computer na may na-scan na pinirmahang page sa dulo. Suriin ang mga page na mahalaga sa iyo, hindi lang ang una.

Ano ang ginagawa ng OCR

Ang OCR — optical character recognition — ay software na tumitingin sa larawan ng page at inaalam kung aling mga letra ang naroon. Idinaragdag ng mahusay na OCR tool ang mga letrang iyon sa PDF bilang hindi nakikitang text layer, eksaktong nakahanay sa mga salita sa larawan. Pareho pa rin ang itsura ng page, pero gumagana na ang search, pagpili at pagkopya, dahil may totoong teksto na silang mahahanap.

Ang text layer ding iyon ang nagpapagana sa ibang tool sa scan: pag-convert sa Word o Excel, pag-summarize, o paghahanap sa bawat lugar na lumalabas ang isang pangalan para ma-redact ito.

Subukan ang toolOCR PDFGawing searchable ang na-scan na PDF, na may tekstong napipili at nakokopya.

Gaano ito katumpak, at ano ang dapat suriin

Sa malinis at tuwid na scan ng nakalimbag na teksto, halos lahat ng salita ay tama ang makabagong OCR. Humihina ito kapag malabo, may anino, nakatagilid ang page, mababa ang resolution, maliit ang letra o palamuti ang font, at karaniwang hindi maaasahang nababasa ang sulat-kamay. Mahalaga rin ang tamang wika: madalas halos-tama lang ang salitang Filipino na binasa ng modelong English lang.

Dahil hindi nakikita ang text layer, hindi rin nakikita ang mga pagkakamali nito. Pagkatapos mag-OCR, hanapin sa dokumento ang mahahalagang pangalan, petsa at halaga at tiyaking nahahanap ang mga ito. Ang zero na nabasang letrang O ay ang uri ng mali na nakatago hanggang may maghanap ng account number at hindi ito lumabas.

Kaugnay na tool at gabay

Ibahagi ang gabay na ito