Hvad er en OCR-algoritme, og hvorfor er den nyttig?

Oct 20, 2022 Læg en besked

Bærbar 3,46 tommer oversætter 112 sprog Optag stemme 99 procent nøjagtig scanningssprog Oversættelseslæser Pen Smart Translator

Detail-01

Brug af den nyeste teknologi:

1. Vedtag den senesteOCRtekstgenkendelsesteknologi;

2. Selvudvikletgrafikgenkendelsealgoritme teknologi;

3. Vedtagelse af Kinas senesteTTStalegenkendelsesteknologi.

Brug af den nyeste {{0}}kerne ARM Cortex-A9 2GHz-chip med kraftfuld TTS- og lydoversættelsesteknologi for at sikre nøjagtig oversættelse, nøjagtig udtale, hurtig scanningsevne og den hastighed, der kun er nødvendig 0,5 sek


Hvad er en optisk tegngenkendelsesalgoritme, og hvorfor er den nyttig?


OCR

Optisk tegngenkendelse (OCR)er en type annotering, der tillader billeder af maskinskrevne eller håndskrevne oplysninger at blive transskriberet til maskinlæsbar tekst.


Selvom OCR ofte overses, er det en uerstattelig hjælper, når vi taler om automatisering. Det eliminerer strømmen af ​​unødvendige papirdokumenter. Det giver dig mulighed for at klassificere, organisere, gemme, administrere og dele information, mens du undgår sikkerhedsrisici forbundet med papirdokumenters fysiske karakter.


Tilgængeligheden af ​​OCR er blevet bredere. Du skal have set det i filmbilletscannere eller lufthavne og togstationer. Det bruges til dataudtræk og sikkerhedsovervågning (tænk på bilnummerplader eller gadeskilte). Elektroniske signaturer er en anden form for OCR. Men uden tvivl er den mest almindelige brug af OCR at konvertere billeder af forretningsdokumenter til digital tekst, der kan søges, redigeres og administreres.


Lad os forestille os en situation. Du deltager i et vigtigt møde. Din forretningspartner viser dig et dokument; du trækker din smartphone frem og tager et hurtigt billede. Du ser ud til at have de oplysninger, du har brug for, men det er i form af et billede. Du kan ikke bruge dette dokument direkte. I stedet skal du konvertere billedets pixels til et læsbart format, så du kan redigere og manipulere de oplysninger, det indeholder.


Desuden handler OCR-baseret automatisering ikke kun om at dele information i digital form. Når du har mange dokumenter, kan maskiner bruge dem som dataindtastninger til at finde mønstre og tendenser. Visualisering er også blevet nemmere: Hvis du har brug for diagrammer, skemaer eller regneark, er det meget hurtigere at bruge digitale dokumenter end at skrive en visuelt tiltalende rapport i hånden. OCR giver dig mulighed for at bruge mindre tid på at behandle hvert nyt dokument, hvilket sparer arbejdsomkostninger og fokuserer på værdiskabende strategier.

text-attributes-for-an-ocr

Hvordan fungerer OCR-algoritmen?

Folk er meget gode til at genkende teksttegn, selvom de er håndskrevne. For en maskine er dette dog en høj ordre. De har brug for maskinlæringsalgoritmer for at lære at læse, hvordan folk læser. Til dette formål kræver OCR-algoritmer omfattende træning til at behandle tekstbilleder.


For at forstå, hvordan OCR-algoritmen fungerer, vil vi først fortælle dig mere om tekst og dens egenskaber. Hvorfor? For det er sådan, maskiner ser tekst: som en del af et billede.


Tekstegenskaber for OCR-algoritmer

Der er stor forskel på den tekst, man kan finde i kommercielle omgivelser, og den tekst, der findes "i naturen": i form af gade, håndskrevne noter, captcha osv. En i den velstrukturerede, overskuelige scanningskvartalsrapport er milevidt fra tilfældig graffiti fanget på kamera af overvågningsdroner. Disse to eksempler viser dog mange egenskaber, der hjælper med at forklare tekstbilleder til maskinlæringsalgoritmer.


  • Massefylde.Ved dokumentscanninger er tekst ofte tættere end tekst på gadehjørnefotos.

  • Struktur.Forskellen er forskellen mellem bestilte linjer med trykt tekst og dårlig struktur (eller mangel på samme) i en håndskrevet indkøbsliste.

  • Skrifttype og størrelse.Stive skrifttyper og bogstaver af samme størrelse er mere genkendelige end gadeskilte med en inkonsekvent eller frihåndsstil af håndskrift.

  • Karaktertype.Denne egenskab angiver ikke kun tilstedeværelsen af ​​bogstaver, men også tilstedeværelsen af ​​tal, symboler og specialtegn. Også sproget er vigtigt. Et dokument består normalt af ét sprog; på den anden side kan et skilt eller graffiti indeholde information på flere sprog.

  • Støj.Det er vigtigt at være opmærksom på, hvordan billedet er opnået (scannede eller fotokopierede dokumenter; fotograferede skilte og nummerplader). Afhængigt af metoden har fotos en tendens til at producere mere støj end scanninger.

Positionen og justeringen af ​​teksten på billedet. Scanningen er normalt foran og i midten med lille hældning. Billeder, på den anden side, tilbyder ikke noget strengt layout: tekst kan være i enhver del af billedet, og det kan tages fra siden.

Som du kan se, er tekst ikke kun et par linjer med tegn. Naturligvis hjælper tekstattributter med at opbygge nuancerne af OCR-algoritmer.


Nu hvor vi ved, hvordan tekst er anderledes, lad os se, hvordan man opbygger en OCR-algoritme.


Processen med at bygge, mærke og træne tekstgenkendelsesalgoritmer

scheme-ocr


Byg, mærk og undervis tekstgenkendelsesalgoritmer Byg, mærk og undervis tekstgenkendelsesalgoritmer

Opbygning af en OCR-algoritme fra bunden tager mange trin.


Tip: Dette er en kort oversigt over de vigtigste trin, der kræves for at bygge en OCR-motor. Hvis du ønsker en mere detaljeret opdeling, skal du følge dette link for at læse en lang artikel om AI-projektets livscyklus.


— Trin 1. Samling

Den første ting du skal gøre er at samle en database med dokumenter. Du kan allerede nu have papirdokumenter, som du ønsker at digitalisere. Men for at opbygge en optisk tegngenkendelsesalgoritme skal du vælge en tilstrækkelig stor repræsentativ prøve. Det betyder, at det sæt af dokumenter, du vælger, skal være relevante for dit slutmål.


Derudover omfatter dette trin scanning, kopiering eller fotografering af dokumenter. Hvis billederne er af høj kvalitet, vil det i høj grad gavne og lette træningsprocessen. Læs mere om gode datasætegenskaber i vores artikel.


— Trin 2. Forbehandling

Inden man begynder at genkende tekst, skal dokumentbilleder forberedes, renses og optimeres til OCR-algoritmer. Der er mange problemer, der kan forårsage dårlig billedkvalitet: utilstrækkelig belysning, papirflimmer og refleksioner, dårlig kamera- eller scannerkvalitet, skæve vinkler, manglende tegn eller dårlig udskriftskvalitet osv.


Hvis du vil træne OCR-algoritmen korrekt, bør du overveje at gøre følgende før næste trin:

Konverter billedet til sort/hvid. Fjernelse af farver kan reducere tvetydighed i tekstgenkendelse.

Ret og juster. Ulige vinkler komplicerer detektionsprocessen betydeligt.

Klip og centrer tekst. Lad kun de vigtige dele være: Teksten skal være foran og i midten, ikke skjult et sted i hjørnerne.

Anvend filtre for at reducere støj. Individuelle karakterer skal skille sig ud fra baggrunden. Husk, at scanninger normalt er skarpere end billeder.


— Trin 3. Datamærkning

Dette er et kritisk trin i OCR-algoritmen, og det er her, vi er her for at hjælpe dig. Tekstgenkendelsesprocessen består af to opgaver: registrering af tekst og genkendelse.


Vi bruger boksning til at fremhæve og skitsere tekstområdet. Dette fortæller OCR-algoritmen, hvad den skal kigge efter på billedet.

Vores annotatorer transskriberer derefter (indtast tekst manuelt) på billederne. Senere vil OCR-algoritmer kunne bruge billedklassificering til at finde mønstre mellem pixelsæt og tegntyper.

Derudover gennemførte vi også flere runder QA. Folk er meget bedre til at genkende tekst i billeder end maskiner, men selv da vil vi sikre os, at der ikke går glip af noget.


Dette trin med datamærkning tager meget tid og kræfter, men du behøver ikke bekymre dig om det. Vi tager gerne denne opgave fra dine skuldre. Dataannotering til OCR-opgaver er en af ​​Mærk dine datas funktioner. Vi har gjort det før, og vi vil meget gerne gøre det igen til dit OCR-projekt. Ring til os i dag for at lære mere!


— Trin 4. træning

Nu hvor du har annoterede dokumenter, kan du begynde at træne OCR-algoritmen. Dette trin afhænger af den type strategi, du bruger til at bygge din OCR-algoritme. Disse strategier varierer meget, fra klassiske computervisionsteknikker til specialiserede dyb læringsmetoder baseret på opbygning af neurale netværk.


Hver strategi har sine fordele. Men uanset hvilken metode du vælger, virker ML-algoritmetræning normalt ikke i første forsøg. Omskoling og forbedring er almindelig praksis. Bliv ikke afskrækket, hvis OCR-algoritmen ikke umiddelbart giver perfekt nøjagtig tekstgenkendelse. Med øvelse og vedholdenhed kommer du derhen!


— Trin 5. Efterbehandling og kvalitetssikring

Faktisk, hvis du ikke vil gøre alt igen, skal du kvalitetssikre hvert trin på vejen. Men dette er det sidste QA-trin og få din OCR-algoritme til at fungere. Det er tid til at høste frugterne af dit hårde arbejde og endelig digitalisere din dokumentarbejdsgang, hvilket sparer din virksomhed tid og penge.


image

Selvom det ikke ofte diskuteres uden for maskinlæringsindustrien, har optisk tegngenkendelse en af ​​de højeste brugervenlighedsvurderinger inden for AI. Virksomheder opererer stadig baseret på enorme mængder papirdokumenter, en forældet og næsten skadelig praksis. OCR kan hjælpe virksomheder med at håndtere det ved at digitalisere arbejdsgangen.


Derudover stopper anvendelsesområdet for OCR ikke der. Enhver tekst, uanset om det er en pænt arrangeret rapport, et tilfældigt butiksskilt eller en håndskrevet note, kan behandles med OCR og konverteres til maskinlæsbar tekst. Dette er et skridt mod big data automation.


Mærkeligt nok, selvom det ikke er en ny teknologi at bygge tekstgenkendelsesalgoritmer, er det lige så udfordrende som nogensinde. Selvfølgelig er open source OCR-algoritmer tilgængelige for offentligheden. Men hvis du vil have en avanceret tekstgenkendelsesmodel til dit specifikke formål, er det bedst at bygge en selv. Vi kan hjælpe dig! Fortæl os om dit projekt, og vi vil professionelt annotere dokumenterne for at træne din OCR-algoritme.