Kur ndërtova shikuesin dhe mjetin OCR të laboratorit të kësaj faqeje, mendoja se problemi kryesor i PDF-ve ishte përputhshmëria mes programeve. Gabohesha: problemi më i shpeshtë është se shumë PDF nuk përmbajnë fare tekst. Janë fotografi faqesh. Duken shkëlqyeshëm, por për funksionin "Gjej", për një motor kërkimi dhe mbi të gjitha për kë përdor një screen reader, janë bosh.
Që atëherë fillova t'i shoh PDF-të ndryshe. Në këtë artikull mbledh çfarë e bën vërtet të aksesueshëm një PDF dhe kontrollet praktike që përdor unë.
Kontrolli që m'i hapi sytë
Në OCR-në time, për çdo faqe hapi i parë është t'i kërkoj PDF-së shtresën e tekstit. Nëse ekziston, e përdor ashtu siç është: është i menjëhershëm dhe i saktë. Vetëm faqet pa tekst shndërrohen në imazh dhe i kalojnë njohjes optike:
const content = await page.getTextContent();
if (content.items.length === 0) {
// No text layer: this page is just a picture.
// Search, copy-paste and screen readers get nothing.
queueForOcr(page);
}
Ai kontroll, i lindur për të kursyer kohë, është edhe testi më i thjeshtë i aksesueshmërisë që ekziston. Në shikues e bëra të dukshëm: kur një dokument nuk ka tekst të nxjerrshëm, shfaqet një njoftim që sugjeron OCR-në. Pa të, përdoruesi kërkon një fjalë, merr zero rezultate dhe mendon se kërkimi është i prishur; për këtë kam folur në këtë artikull.
Çfarë i duhet një PDF-je për të qenë e aksesueshme
Teksti real është vetëm kërkesa e parë. Standardi i referencës është PDF/UA (ISO 14289), në përputhje me udhëzimet WCAG. Në praktikë, një PDF i aksesueshëm ka:
- Tekst të vërtetë, jo imazhe teksti.
- Etiketa strukture: tituj, paragrafë, lista dhe tabela të shënuara si të tilla, që një screen reader të dijë çfarë po lexon.
- Një rend leximi të saktë: në një faqosje me dy kolona pa etiketa, teksti mund të lexohet rresht pas rreshti duke kaluar mes kolonave.
- Tekst alternativ për imazhet që përmbajnë informacion, si grafikë dhe skema.
- Gjuhën e dokumentit të vendosur, që sinteza zanore të shqiptojë saktë.
- Një titull në metadata, jo vetëm emrin e skedarit.
- Fusha formularësh me etiketa, nëse PDF-ja plotësohet.
Që nga qershori 2025, me European Accessibility Act, aksesueshmëria është detyrim për shumë shërbime dixhitale për konsumatorët, dhe dokumentet që ato shërbime ofrojnë, si kontratat dhe faturat në PDF, janë pjesë e përvojës.
Kontrollet praktike që bëj (për pesë minuta)
- Provoj të zgjedh tekstin dhe të kërkoj një fjalë me Ctrl+F. Nëse nuk ndodh asgjë, PDF-ja është imazh.
- Hap vetitë e dokumentit në Acrobat Reader: te "Tagged PDF" duhet të jetë "Yes", dhe titulli e gjuha duhet të jenë të plotësuara.
- Përdor leximin me zë të lexuesit PDF në një faqe me dy kolona: nëse kërcen nga një kolonë te tjetra, rendi i leximit është i gabuar.
- Kopjoj një tabelë dhe e ngjis në një fletë llogaritëse: nëse vjen si një bllok i vetëm teksti, struktura mungon.
- Për një kontroll të plotë përdor PAC (PDF Accessibility Checker), falas, që verifikon kërkesat PDF/UA një nga një.
Një rast tipik: formulari i skanuar
Rasti që shoh më shpesh është formulari i printuar, i plotësuar me stilolaps dhe i riskanuar. Nga pikëpamja e aksesueshmërisë është më i keqi i mundshëm: pa tekst, pa strukturë, pa fusha. OCR-ja e bën të kërkueshëm dhe të kopjueshëm, që është tashmë një hap i madh përpara, por nuk e bën një PDF të aksesueshëm: mungojnë ende etiketat, rendi i leximit dhe emërtimet e fushave. Mjeti im OCR, për shembull, e nxjerr tekstin, por nuk e rindërton strukturën: është hapi i parë, jo i fundit.
Zgjidhja e vërtetë është në burim: të publikosh dokumentin origjinal, jo skanimin e tij.
Si të krijosh PDF të aksesueshëm që në fillim
- Në Word ose LibreOffice përdor stilet (Heading 1, Heading 2, lista të vërteta) në vend të tekstit të zmadhuar dhe të theksuar: ato bëhen etiketat e PDF-së.
- Shto tekst alternativ te imazhet para eksportimit.
- Eksporto me etiketat aktive: në Word është opsioni "Document structure tags for accessibility" gjatë ruajtjes si PDF.
- Shmang "printimin" në PDF përmes një printeri virtual ose nga një imazh: struktura shpesh humbet.
- Vendos titullin dhe gjuhën te vetitë e skedarit.
Në përmbledhje
Një PDF i aksesueshëm nuk është një PDF "i veçantë": është një PDF i bërë mirë, me tekst të vërtetë, strukturë, rend leximi, tekst alternativ dhe gjuhë. Duke ndërtuar OCR-në time kuptova se testi më zbulues është edhe më i thjeshti: provo të kërkosh një fjalë. Nëse nuk e gjen ti, nuk do ta gjejë as një screen reader. Për dokumentet që i ke vetëm të skanuara, OCR-ja është hapi i parë për t'i bërë të paktën të lexueshme; për të gjitha të tjerat, aksesueshmëria vendoset në momentin kur i krijon.