Bakit hindi searchable ang na-scan na PDF mo, at paano ito ayusin
Binuksan mo ang PDF, pinindot ang Ctrl+F, at tinype ang salitang kitang-kita sa page — pero walang nahanap. O sinubukan mong kopyahin ang isang talata at walang lumabas, o sinabi ng converter na walang teksto ang file. Hindi sira ang dokumento. Scan ito, at litrato ng papel ang scan. Kapag naintindihan ang pagkakaiba, maipapaliwanag ang maraming nakalilitong nangyayari, at makikita ang solusyon.
Dalawang uri ng PDF na magkamukha
Iniimbak bilang mga character ang teksto ng PDF na ginawa sa computer — in-export mula sa Word, ni-print bilang PDF mula sa browser, o ginawa ng bangko: ang letrang ito, sa font na ito, sa posisyong ito. Kaya itong hanapin, piliin at kopyahin ng PDF reader mo, at kaya itong basahin nang malakas ng screen reader.
Ang PDF na gawa ng scanner o camera ng phone ay nag-iimbak ng bawat page bilang larawan. Nakikita mo ang mga salita dahil binabasa ng mata mo ang larawan; pixel lang ang laman ng file. Para sa computer, walang "INVOICE" sa page, kundi pattern lang ng madilim at maliwanag na tuldok na nagkataong mukhang salita.
Paano malalaman kung alin ang hawak mo
Subukang i-highlight ang isang pangungusap gamit ang mouse, o pindutin ang Ctrl+F at hanapin ang salitang nakikita mo. Kung nahi-highlight ang teksto at nahahanap ito, may totoong teksto ang PDF. Kung buong page ang natatakpan ng highlight, o walang nahi-highlight, larawan ang page.
May mga dokumentong halo: report na tinype sa computer na may na-scan na pinirmahang page sa dulo. Suriin ang mga page na mahalaga sa iyo, hindi lang ang una.
Ano ang ginagawa ng OCR
Ang OCR — optical character recognition — ay software na tumitingin sa larawan ng page at inaalam kung aling mga letra ang naroon. Idinaragdag ng mahusay na OCR tool ang mga letrang iyon sa PDF bilang hindi nakikitang text layer, eksaktong nakahanay sa mga salita sa larawan. Pareho pa rin ang itsura ng page, pero gumagana na ang search, pagpili at pagkopya, dahil may totoong teksto na silang mahahanap.
Ang text layer ding iyon ang nagpapagana sa ibang tool sa scan: pag-convert sa Word o Excel, pag-summarize, o paghahanap sa bawat lugar na lumalabas ang isang pangalan para ma-redact ito.
Gaano ito katumpak, at ano ang dapat suriin
Sa malinis at tuwid na scan ng nakalimbag na teksto, halos lahat ng salita ay tama ang makabagong OCR. Humihina ito kapag malabo, may anino, nakatagilid ang page, mababa ang resolution, maliit ang letra o palamuti ang font, at karaniwang hindi maaasahang nababasa ang sulat-kamay. Mahalaga rin ang tamang wika: madalas halos-tama lang ang salitang Filipino na binasa ng modelong English lang.
Dahil hindi nakikita ang text layer, hindi rin nakikita ang mga pagkakamali nito. Pagkatapos mag-OCR, hanapin sa dokumento ang mahahalagang pangalan, petsa at halaga at tiyaking nahahanap ang mga ito. Ang zero na nabasang letrang O ay ang uri ng mali na nakatago hanggang may maghanap ng account number at hindi ito lumabas.