Malkovri tekston: OSR/OCR, vortofteco kaj komunuma helpo

25. julio 2025

Kiam ni ricevas skanaĵojn de malnovaj Esperanto-gazetoj kaj libroj, ne ĉiam la teksto estas kompleta. Foje papero, gluaĵo aŭ difekto kaŝas vortojn — kaj la OSR (optika signorekono; angle OCR) ne povas diveni tion, kio ne videblas.

Jen ekzemplo el ricevita skanaĵo: la frazo estas interrompita, kaj parto de la vortoj mankas sub papereto:

Skanita paĝo kun difektita teksto
Skanita paĝo kun difektita teksto

Helpo de la komunumo

En tiaj kazoj ni ne provas «inventi» la mankantajn vortojn. Ni petas helpon al la Esperanto-komunumo — ekzemple per la retpoŝta listo bibliotekoj — por ke iu, kiu konas la verkon aŭ havas kompletan ekzempleron, helpu nin rekonstrui la tekston.

Dank' al tiu kunlaboro, la sama fragmento povas reaperi kompleta:

Rekonstruita teksto dank' al komunuma helpo
Rekonstruita teksto dank' al komunuma helpo

Vortofteco: vortpezlisto por Esperanto

Por plibonigi la aŭtomatan rekonon de Esperanto-teksto, ni kreis dosieron nomatan vortofteco. Ĝi estas vortpezlisto: listo de vortoj (kaj vortoderivaĵoj) kun ilia ofteco en Esperanto, konstruita el korpusoj kiel tekstaro.com kaj la enhavo de Vikipedio en Esperanto.

Tiaj oftecoj helpas programojn de optika signorekono elekti la plej verŝajnan vorton, kiam la bildo estas neklara — ekzemple inter similaj literoj aŭ difektitaj signoj.

La jena diagramo montras, kiel la skanaĵoj, la tekstokorpuso kaj la vortpezlisto eniras la OSR-procezon (kun motoroj kiel ABBYY FineReader kaj Tesseract), kaj kiel el tio rezultas serĉebla PDF/A kaj statistikoj:

Diagramo de OSR kun vortpezlisto
Diagramo de OSR kun vortpezlisto

Programetoj por amasa OSR

Ĉe BitArkivo ni ankaŭ evoluigis programetojn (skriptojn), kiuj aŭtomatigas la aplikon de OSR al tutaj dosierujoj de PDF-oj aŭ skanitaj JPG/TIFF-bildoj. Tiel ni ŝparas tempon kaj povas trakti grandajn kolektojn sen ripeti la saman manan laboron paĝon post paĝo.

Poste la OSR rekonas la vortojn sur la bildo, kun konfidencaj procentoj por ĉiu fragmento:

Ekzemplo de OSR kun rekonitaj vortoj
Ekzemplo de OSR kun rekonitaj vortoj

Tiel skanaĵoj iĝas serĉebla teksto — kaj kiam la maŝino ne sufiĉas, la komunumo kompletigas tion, kion la papero kaŝis.

Artefarita inteligenteco kaj la estonteco de OSR

La artefarita inteligenteco ankaŭ helpos multe en la estonteco al pli bona OSR — ekzemple por dokumentoj, leteroj aŭ poŝtkartoj skribitaj permane. Jen manuskripta Esperanto-letero, kaj kiel unu el la plej altnivelaj IA-oj de la merkato rekonas ĝin perfekte:

Manuskripta Esperanto-letero
Manuskripta Esperanto-letero
Transskribo de la letero per moderna IA
Transskribo de la letero per moderna IA

Sed oni devas agnoski, ke nuntempe la prioritato de BitArkivo estas trovi kaj skani milojn da gazetoj perditaj tra la mondo… Kaj havante la bildojn konservitaj, en la estonteco ni povos utiligi plibonigojn de la OSR-teknologio, kiuj ŝparos al ni la homan korektadon por havi pli bonajn ciferecigitajn tekstojn en Esperanto.

Krome, la IA-oj jam parolas Esperanton tre bone, ĉar ili «manĝis» korpusojn generitajn de aliaj volontulaj projektoj (ekzemple vortaro.netVikipedio). Do ciferecigi revuojn helpos fari ilin eĉ pli konantaj de Esperantujo…

CC BY-NC 4.0

← Reen al blog