Optisk tegngenkendelse understøtter nu kvitteringsscanning, ID-verifikation, fakturaautomatisering, digitalisering af historiske arkiver og stylus-baserede note-apps. OCR-markedet forventes at nå 32.90 milliarder dollars i 2030 med en årlig vækstrate på 14.8 % (Grand View Research, 2024), hvor intelligent tegngenkendelse – håndskriftlæsningsgrenen inden for OCR – vokser hurtigst. Uanset om du bygger dokumentparsing, scenetekstdetektion eller håndskrifttranskription, sætter det OCR-datasæt, du træner på, dit nøjagtighedsloft. Denne guide dækker 22 gratis OCR-datasæt med åben kildekode – inklusive de bedste håndskriftdatasæt – organiseret efter use case og opdateret med de stærkeste udgivelser frem til 2024.
Nøgleforsøg
- OCR (Optical Character Recognition): teknologi, der konverterer billeder af trykt, scene- eller håndskrevet tekst til maskinlæsbare data.
- OCR-datasæt er opdelt i fem grupper: dokument/formular, scenetekst, ciffer/tegn, håndskrift og flersproget.
- Dokument OCR-datasæt indfange strukturerede sider som formularer og kvitteringer; scene-tekst datasæt optag tekst "i naturen".
- IAM, MNIST, ICDAR og SROIE er fortsat de mest citerede OCR-benchmarks på tværs af forskningen.
- Licensvilkårene varierer meget – bekræft hvert OCR-datasæt før kommerciel træning.
Hvad er OCR (Optical Character Recognition)?
OCR er teknologi, der konverterer forskellige typer dokumenter, såsom scannede papirdokumenter, PDF'er eller billeder af tekst, til redigerbare og søgbare data. Det virker ved:
- Analyse af tekstens struktur i et billede
- Opdeling af teksten i linjer og tegn
- Konvertering af disse visuelle tegn til maskinlæsbar tekst
Almindelige anvendelser omfatter:
- Konvertering af scannede dokumenter til redigerbare tekstfiler
- Digitalisering af trykte bøger
- Udtræk tekst fra fotos
- Konvertering af håndskrevne recepter til digital tekst
- Nummerpladegenkendelse
Hvordan vælger du det rigtige OCR-datasæt?
Valg af et OCR-datasæt afhænger af fire faktorer: teksttype, optagelsesmiljø, annotationsgranularitet og licens. OCR for trykte dokumenter kræver andre træningsdata end håndskrevet kursiv eller buet scenetekst. Dokumentdatasæt er egnede til fakturaer, formularer og kvitteringer; scenetekstdatasæt er egnede til skiltning og produktlæsning; håndskriftsdatasæt er egnede til noter, manuskripter og stylusinput. Annotationer på ord- og linjeniveau understøtter fulde OCR-pipelines, mens tegnniveausæt passer til klassificeringsgrundlinjer. Bekræft altid licensvilkårene, da nogle OCR-datasæt kun er til forskning eller kræver registrering.
Hvad er de bedste OCR-datasæt til dokumenter og formularer?
Dokument-OCR-datasæt træner modeller til at analysere strukturerede sider såsom fakturaer, formularer, kvitteringer og id'er. Disse styrker automatisering af forretningsdokumenter og udtrækning af nøgleværdier.
- FUNSD — 199 kommenterede scannede formularer med støjende, virkelighedsnært udseende. Standardbenchmarken for formularforståelse og nøgleværdiudtrækning.
- SROIE — ICDAR 2019-datasæt med scannede kvitteringer på cirka 1,000 kvitteringer, der understøtter tekstdetektion, genkendelse og informationsudtrækning i et enkelt sæt.
- SNOR — Et konsolideret kvitteringsdatasæt bygget til post-OCR-parsing, med omfattende feltniveauetiketter til automatisering af fakturaer og kvitteringer.
- XFUND — Flersproget udvidelse af FUNSD, der dækker syv sprog (tysk, spansk, fransk, italiensk, japansk, portugisisk, kinesisk) med 199 sider hver. Ideel til flersprogede dokumenter med AI.
- DDI-100 — Omkring 100,000 forvrængede dokumentbilleder til detektion og genkendelse under virkelige forringelser som skævhed, sløring og støj.
Hvad er de bedste OCR-datasæt til scenetekst?
Scene-tekst OCR-datasæt træner modeller til at læse tekst i naturlige billeder såsom skilte, produkter og gadescener. Disse er afgørende for OCR i naturen, hvor baggrunde er rodede.
- ICDAR Robust Aflæsning — Benchmark-familien bag det meste scenetekst-forskning, herunder udfordringerne med fokuseret og tilfældig scenetekst med afgrænsningsbokse og transkriptioner på ordniveau.
- COCO-tekst — Storskala scenetekstannotationer lagt lagvis oven på MS-COCO-billeder. Stærk til tekstdetektion i stor skala i naturlige scener.
- Totaltekst — Specialiserer sig i buet og vilkårligt orienteret tekst, et kendt svagt punkt for ældre OCR-modeller.
- SVT (Street View-tekst) — Word-billeder hentet fra Google Street View, ofte lav opløsning og høj variabilitet. Tilgængelig via Papers med Code-spejle.
- HerTekst — Hierarkisk annotering fra afsnit til linje til ord, der dækker både håndskrevet og trykt scenetekst. Nyttig til layoutbevidst OCR.
Hvad er de bedste OCR-datasæt til cifre og tegn?
OCR-datasæt med cifre og tegn træner modeller til at genkende individuelle symboler i kontrollerede omgivelser. Disse er standardudgangspunkterne for klassificeringsgrundlinjer.
- MNIST — 70,000 håndskrevne gråtonebilleder af cifre. Den hurtigste basislinje til validering af en cifferklassifikator.
- EMNIST — Udvider MNIST med 814,255 håndskrevne bogstaver og cifre afledt af NIST Special Database 19.
- SVHN (Street View Husnumre) — Over 600,000 billeder af husnumre i den virkelige verden. Et praktisk skridt op fra MNIST til støjende forhold.
- Tegn74K — 74,107 billeder, der dækker engelske og kannadaske tegn fra naturlige billeder og computerfonte.
- NIST Specialdatabase 19 — 810,000+ håndtrykte figurbilleder fra 3,600 forfattere. Kilden, som mange engelske OCR-benchmarks stammer fra.
Hvad er de bedste håndskriftsdatasæt til OCR?
Håndskriftsdatasæt træner OCR-modeller til at læse kursiv, trykt og historisk håndskrevet tekst. De stærkeste åbne håndskriftsdatasæt er fortsat de mest citerede benchmarks for håndskrevet tekstgenkendelse (HTR).
- IAM-håndskriftdatabase — Den engelske håndskrifts guldstandard med 13,353 tekstlinjer fra 657 forfattere. Stadig det mest citerede håndskriftsdatasæt i OCR-forskning fra 2024-2025.
- IAM-OnDB — Online pennestrøgsversionen af IAM, der indsamler banedata. Det kanoniske håndskriftsdatasæt til genkendelse af pen og tablet.
- Bentham-papirerne — Transskriberede historiske engelske manuskripter fra filosoffen Jeremy Bentham. Den førende standard for historisk håndskrift OCR, tilgængelig via Transkribus.
- GNHK (GoodNotes håndskriftsamling) — Et datasæt fra 2021 med ubegrænsede, virkelige, engelskskrevne håndskrevne noter. Tættere på rodede produktionsdata end laboratorieren IAM.
Hvad er de bedste flersprogede og ikke-latinske OCR-datasæt?
Flersprogede OCR-datasæt træner modeller på skrifttyper ud over engelsk, herunder kinesisk, arabisk og matematisk notation. Disse er afgørende for global dokument- og håndskriftsgenkendelse.
- CASIA-HWDB — Den standard kinesiske OCR-benchmark med 1.17 millioner håndskrevne tegnprøver fra 1,020 forfattere.
- KHATT — 1,000 arabiske håndskrevne formularer fra 1,000 forskellige forfattere, scannet i flere opløsninger. Det mest omfattende åbne arabiske OCR-datasæt.
- CROHME — Konkurrence om genkendelse af online håndskrevne matematiske udtryk: 10,000+ udtryk på tværs af 101+ matematiske symboler, i både online- og offlinevarianter. Essentielt for håndskrevne lignings-OCR.
Hvad er de almindelige faldgruber, når man bruger gratis OCR-datasæt?
Tre faldgruber rammer de fleste hold.
Domænematch: Træning i ren IAM eller COCO-Text og implementering på krøllede fakturaer garanterer dårlig nøjagtighed.
Kørekortblindhed: Adskillige scenetekst- og historiske OCR-datasæt er kun til forskning eller kræver registrering før kommerciel brug.
Huller i annotationerne: Mange OCR-datasæt mangler de layoutmetadata, afgrænsningsbokse på linjeniveau eller feltetiketter, som produktionssystemer har brug for.
Forestil dig en mellemstor logistikvirksomhed, der automatiserer læsning af fragtetiketter. Offentlig træning i scenetekst får dem op på 80% på benchmarks, men rigtige etiketter med genskin og folder sænker dem til 58%. At lukke dette hul kræver målrettet dataarnnotering af 6,000 billeder af domæneetiketter før lancering.
Fordele og udfordringer ved Open-Source-datasæt
Virksomheder er nødt til at sætte fordelene og udfordringerne op mod hinanden for at forstå, om de skal vælge gratis data til deres ML-applikationer.
Fordele
- Dataene er let tilgængelige. På grund af datatilgængelighed reduceres omkostningerne ved at udvikle applikationen betydeligt.
- Den tid og indsats, der bruges på at indsamle data til applikationen, reduceres betydeligt, da datasættet er let tilgængeligt.
- Der er en overflod af fællesskabsfora eller hjælpegrupper, der hjælper med at lære, tilpasse og optimere datasættet.
- En af de største fordele ved open source-datasættet er, at det ikke lægger nogen begrænsninger på tilpasning.
- Open Source-data er tilgængelige for en stor del af befolkningen, hvilket gør analyse og innovation mulig uden monetære barrierer.
Udfordringer
- De data, der er specifikke for projektet, er svære at tilegne sig. Derudover er der mulighed for manglende information og forkert brug af de tilgængelige data.
- At erhverve proprietære data tager tid og kræfter og er dyrt
- Selvom det kan være lettere at erhverve data, kan viden og analyseomkostninger opveje den indledende fordel.
- Andre udviklere gør også brug af de samme data til at udvikle applikationer.
- Disse datasæt er meget sårbare over for sikkerhedsbrud, privatliv og samtykke.
Hvordan understøtter Shaip OCR- og håndskriftgenkendelsesprojekter?
Shaips OCR-træningsdatatjenester par åbne datasætkuratering med brugerdefineret dataindsamling på tværs af over 60 sprog, der spænder over trykte dokumenter, håndskrift, kvitteringer og ID'er. Shaips annotationsworkflows tilføjer de lag, som offentlige OCR-datasæt mangler: afgrænsningsbokse på linjeniveau, etiketter på feltniveau, transskriptionskvalitetskontrol og forfattermetadata.
Konklusion
De 22 OCR-datasæt ovenfor giver dig et komplet open source-fundament på tværs af dokument-, scenetekst-, ciffer-, håndskrifts- og flersproget genkendelse i 2026. Start med det OCR-datasæt, der matcher din teksttype og dit optagelsesmiljø, valider mod en udvalgt stikprøve af dine faktiske data, og budgetter med brugerdefinerede annotationer for at lukke domænegabet. Den kombination leveres hurtigere end at bygge fra bunden.
Hvad er det bedste gratis OCR-datasæt til maskinlæring?
Det bedste gratis OCR-datasæt afhænger af opgaven. ICDAR Robust Reading fører til scenetekst, FUNSD og SROIE fører til dokument- og kvitterings-OCR, og IAM fører til håndskrift. Til ciffergenkendelse er MNIST og SVHN standard. De fleste teams kombinerer to eller tre OCR-datasæt på tværs af kategorier i stedet for at stole på ét.
Er open source OCR-datasæt gratis til kommerciel brug?
Open source OCR-datasæt er ikke alle gratis til kommerciel brug. MNIST, SVHN og COCO-Text bruger permissive licenser, mens IAM, ICDAR-sæt og historiske håndskriftsdatasæt ofte kræver registrering eller begrænser brugen til forskning. Gennemgå altid hvert datasæts licens, før du træner en kommerciel model.
Hvad er forskellen mellem OCR-datasæt og håndskriftsdatasæt?
OCR-datasæt dækker al maskinlæsbar tekstgenkendelse, herunder trykte dokumenter, scenetekst og cifre, mens håndskriftsdatasæt er den delmængde, der fokuserer på håndskrevet indhold. Håndskriftsdatasæt som IAM og Bentham træner HTR-modeller, hvorimod OCR-datasæt for dokumenter og scenetekst håndterer trykt og eksisterende tekst.
Hvilke OCR-datasæt understøtter flersproget genkendelse?
Flersprogede OCR-datasæt inkluderer XFUND for syv formularsprog, CASIA-HWDB for kinesisk, KHATT for arabisk og ICDAR MLT for flersproget scenetekst. Kombination af scriptspecifikke OCR-datasæt med syntetisk augmentation overgår normalt træning på et enkelt datasæt alene.
Hvor mange brugerdefinerede annotationer har jeg brug for ud over gratis OCR-datasæt?
Behovet for brugerdefinerede annotationer afhænger af, hvor langt dine dokumenter er fra offentlige data. Rene, udskrevne formularer kan kræve 1,000-5,000 eksempler i domænet, mens rodet håndskrift, kvitteringer eller sjældne manuskripter ofte kræver 10,000-50,000. Shaips annotationspipelines leverer typisk en nøjagtighedsforøgelse på 15-30 % i forhold til offentlig OCR-træning.



