<link rel="stylesheet" href="/assets/fonts/jetbrains-mono/jetbrains-mono.css" />
All posts

OCR: si të nxjerrësh tekst nga skanimet dhe fotot (dhe pse ndonjëherë gabon)

Merr një PDF, e hap, provon të kërkosh një fjalë: zero rezultate. Provon të përzgjedhësh një rresht me miun: nuk përzgjidhet. Dokumenti është aty, lexohet shkëlqyeshëm me sy, por për kompjuterin është një fotografi. Është situata ku duhet OCR-ja — njohja optike e karaktereve — dhe momenti kur shumica e njerëzve zbulojnë se rezultati varet shumë më tepër nga figura fillestare sesa nga programi.

Çfarë bën vërtet OCR-ja (dhe pse nuk "lexon")

Një motor OCR nuk e kupton tekstin: e rindërton. Procesi kalon nëpër faza mekanike — gjetja e zonave me tekst, drejtimi i figurës, izolimi i rreshtave, pastaj i fjalëve, pastaj i karaktereve — dhe vetëm në fund krahason çdo formë me modelet e shkronjave që njeh, duke zgjedhur atë më të mundshmen.

Kjo shpjegon gabimet tipike, që në pamje të parë duken absurde: rn i lexuar si m, 0 i ngatërruar me O, 1 me l. Nuk janë gabime kuptimi, janë gabime ngjashmërie pamore. Njeriu i korrigjon automatikisht falë kontekstit; motori OCR, që arsyeton mbi formën përpara kuptimit, jo.

Cilësia e figurës peshon më shumë se programi

Kjo është pjesa kundërintuitive: ndërrimi i motorit OCR përmirëson pak, përmirësimi i skanimit përmirëson shumë. Faktorët që peshojnë vërtet, sipas ndikimit:

FaktoriProblemiZgjidhja
RezolucioniNën 200 DPI karakteret e vogla ngjiten me njëri-tjetrinSkanim në 300 DPI, standardi de facto
KontrastiLetër e zverdhur ose foto në gjysmerrësirë: shkronjat dhe sfondi përzihenBardhezi ose rritje e kontrastit përpara përpunimit
PjerrësiaRreshta të shtrembër: motori i ndan gabimDrejtimi i figurës, qoftë edhe me pak gradë
Hijet dhe lakimiFoto e një libri të hapur: teksti deformohet drejt palosjesFotografim me dritë të shpërndarë, faqja e sheshuar

Një foto e bërë me nxitim me telefon, e shtrembër dhe me hijen e dorës sipër, jep rezultate mesatare me çdo motor. Ia vlen ta përsëritësh marrjen: skaneri me kamerë zbaton drejtim, prerje dhe filtra kontrasti përpara se skedari të mbërrijë fare te njohja, dhe kjo është pothuajse gjithmonë ndryshimi mes një teksti të përdorshëm dhe një teksti për ta rishkruar me dorë.

Pikëzimi i besueshmërisë: e dhëna më e dobishme dhe më e shpërfillur

Çdo faqe e përpunuar merr një vlerë besueshmërie, pra sa e konsideron motori të saktë leximin e vet. Është informacioni më i vlefshëm i gjithë procesit dhe pothuajse askush nuk e shikon.

Rregulli praktik: mbi 90% teksti është përgjithësisht i besueshëm dhe duhet vetëm rilexuar; mes 70% dhe 90% ka gabime të shpërndara për t'u korrigjuar; nën 70% ia vlen të përsëritet marrja në vend që të humbet kohë duke korrigjuar. Një pikëzim i ulët në një të vetme faqe nga njëzet tregon pothuajse gjithmonë një problem fizik të asaj faqeje — një palosje, një hije, një njollë — jo një kufi të sistemit.

Si të nxjerrësh tekstin, hap pas hapi

  1. Hap OCR-në falas online — pa regjistrim.
  2. Ngarko skedarët: figura PNG, JPG, WEBP, BMP, TIFF ose PDF, edhe të skanuara. Deri në 15 MB për skedar dhe 30 skedarë njëherësh.
  3. Përzgjidh gjuhën e duhur përpara nisjes. Është hapi që ndikon më shumë në saktësi: janë të disponueshme shqipja, anglishtja, italishtja, spanjishtja, frëngjishtja, gjermanishtja dhe portugalishtja.
  4. Nis njohjen dhe kontrollo pikëzimin e besueshmërisë faqe pas faqeje.
  5. Kopjo tekstin, ose dërgoje te workspace për t'ia kaluar një mjeti tjetër — zakonisht një përmbledhjeje ose një përkthimi — pa ngarkuar asgjë sërish.

Ku gabon OCR-ja në mënyrë sistematike

  • Gjuha e gabuar prish gjithçka. Një tekst shqip i përpunuar si anglisht humbet sistematikisht ë-të dhe ç-të, sepse motori kërkon forma që në shqip nuk ekzistojnë.
  • Tabelat bëhen tekst linear. Qelizat lexohen njëra pas tjetrës: vlerat janë aty, lidhja rresht-kolonë jo.
  • Kolonat e shumta përzihen. Në gazeta dhe revista teksti mund të rindërtohet duke i kaluar kolonat tërthorazi në vend që t'i ndjekë.
  • Kursivi dhe shkronjat dekorative kanë shkallë gabimi shumë më të lartë se një shkronjë tipografike e rregullt.
  • Shkrimi me dorë është teknologji tjetër. OCR-ja klasike njeh karaktere të shtypura; dorëshkrimi kërkon modele të tjera dhe mbetet pak i besueshëm.

Pyetje të shpeshta

Cilat formate mund të ngarkoj?

Figura në PNG, JPG, WEBP, BMP dhe TIFF, si dhe PDF, përfshirë ato të skanuara që nuk përmbajnë tekst të përzgjedhshëm. Kufiri është 15 MB për skedar, deri në 30 skedarë për përpunim.

Cilat gjuhë njeh?

Shtatë: shqip, anglisht, italisht, spanjisht, frëngjisht, gjermanisht dhe portugalisht. Gjuha duhet zgjedhur përpara përpunimit, sepse e udhëzon motorin në njohjen e karaktereve me shenja diakritike dhe kombinimeve tipike të asaj gjuhe.

Si e di nëse një PDF ka nevojë për OCR?

Provo të përzgjedhësh një fjalë me miun ose të kërkosh një term me Ctrl+F. Nëse përzgjedhja nuk funksionon dhe kërkimi nuk gjen asgjë edhe për fjalë qartësisht të pranishme, PDF-ja përmban figura dhe kërkon OCR.

A mund ta përdor OCR-në në një foto të bërë me telefon?

Po, dhe është një nga përdorimet më të shpeshta. Rezultati përmirësohet ndjeshëm nëse faqja është kuadruar drejt, e ndriçuar mirë dhe pa hije: kalimi më parë nga skaneri, që e drejton dhe rrit kontrastin, jep pothuajse gjithmonë tekst më të pastër.


Përmbledhje

OCR-ja e shndërron një figurë teksti në tekst të vërtetë, dhe është parakusht për pothuajse gjithçka tjetër: kërkimin brenda një dokumenti, përkthimin, përmbledhjen, konvertimin. Saktësia varet mbi të gjitha nga tri gjëra, me këtë radhë: cilësia e marrjes, gjuha e përzgjedhur saktë, dhe kontrolli i pikëzimit të besueshmërisë përpara se t'i besosh rezultatit. OCR-ja falas online pranon figura dhe PDF deri në 15 MB në shtatë gjuhë; nëse dokumenti është ende në letër ia vlen të nisesh nga skaneri, dhe prej andej teksti mund të vazhdojë drejt mjeteve të tjera PDF dhe IA.

💬 Shënime nga lexuesit

0 shënime

Shkruaj një shënim

Ndaj mendimin tënd, një sugjerim ose një kompliment

Shënimet e fundit

Ende asnjë shënim. Bëhu i pari që komenton!