Arabisk & thai & vietnamesisk & hindi & engelsk & kinesisk sprogdatasæt
Diverse tekstgenkendelsesdatasæt til avancerede OCR-applikationer: Skilte, menuer og mere
Brugsscenarie: OCR
Format: Billede
Antal: 150k
Annotation: Ja
Beskrivelse: Arabisk & thailandsk & vietnamesisk & hindi & engelsk & kinesisk sprogdatasæt
Brugsscenarie: OCR
Format: Billede
Antal: 1k
Annotation: Ja
Beskrivelse: Datasættet for arabisk tekst indeholder en samling af teksteksempler skrevet på arabisk. Det omfatter forskellige former for indhold, såsom nyhedsartikler, opslag på sociale medier, litteratur og dialog, der spænder over forskellige emner og skrivestile. Dette datasæt bruges til opgaver som naturlig sprogbehandling (NLP), tekstklassificering, sentimentanalyse og maskinoversættelse i arabiske sprogapplikationer.
Brugsscenarie: OCR
Format: Billede
Antal: 38k
Annotation: Ja
Beskrivelse: Datasæt for kinesisk, engelsk, tibetansk og uigurisk sprog
Brugsscenarie: OCR
Format: Billede
Antal: 60k
Annotation: Ja
Beskrivelse: Datasættet for kinesiske og engelske menuer indeholder billeder eller teksteksempler på restaurantmenuer, der findes på både kinesisk og engelsk. Det omfatter forskellige skrifttyper, layouts og menustrukturer, der præsenterer tosprogede rettnavne, beskrivelser og priser. Dette datasæt er nyttigt til opgaver som optisk tegngenkendelse (OCR), maskinoversættelse og menudigitalisering i flersprogede miljøer.
Brugsscenarie: OCR
Format: Billede
Antal: 3k
Annotation: Ja
Beskrivelse: Datasættet for håndskrevne kinesiske kompositioner indeholder eksempler på håndskrevet kinesisk tekst, herunder kompositioner, essays og anden langtekst. Det indeholder forskellige håndskriftstile og kompleksitetsniveauer og bruges til opgaver som håndskriftgenkendelse, tekstanalyse og træning af maskinlæringsmodeller.
Brugsscenarie: OCR
Format: Billede
Antal: 1k
Annotation: Ja
Beskrivelse: Det kinesiske WIFI-promptdatasæt består af teksteksempler, der findes i WIFI-prompter og loginskærme, og som er skrevet på kinesisk. Det indeholder typisk forskellige prompter, instruktioner og fejlmeddelelser relateret til at oprette forbindelse til eller administrere WIFI-netværk. Dette datasæt bruges til opgaver som tekstgenkendelse, behandling af naturligt sprog og forbedring af brugergrænseflader til netværksforbindelse.
Brugsscenarie: OCR
Format: Billede
Antal: 12k
Annotation: Ja
Beskrivelse: Datasættet om engelsk og kinesisk håndskrift indeholder håndskrevne eksempler på både engelsk og kinesisk, der viser forskellige skrivestile og tegnkompleksiteter. Det bruges typisk til træning og evaluering af håndskriftgenkendelsesmodeller, understøttelse af flersproget tekstanalyse og anden relateret forskning. Datasættet indeholder en bred vifte af tegn, cifre, ord og sætninger på begge sprog.
Brugsscenarie: OCR
Format: Billede
Antal: 30k
Annotation: Ja
Beskrivelse: Datasættet for engelske og kinesiske butiksskilte indeholder billeder af butiksskilte med både engelsk og kinesisk tekst. Det indfanger forskellige skilteelementer såsom butiksnavne, reklamer, kampagner og rutevejledninger, vist i forskellige skrifttyper, stilarter og formater. Dette datasæt bruges til opgaver som tekstdetektion og -genkendelse, flersproget sceneforståelse og forbedring af computervisionsmodeller til fortolkning af tosproget skiltning.
Brugsscenarie: OCR
Format: Billede
Antal: 50k
Annotation: Ja
Beskrivelse: Datasættet for engelsk og kinesisk specialvinkeltekst indeholder billeder af tekst vist i forskellige vinkler og retninger på både engelsk og kinesisk. Det inkluderer tekst fra kilder som skilte, reklamer og dokumenter, der ikke præsenteres i standard horisontale formater. Dette datasæt bruges til at træne og evaluere tekstdetektions- og genkendelsesmodeller, især dem, der er i stand til at håndtere tekst i ikke-traditionelle retninger og perspektiver.
Brugsscenarie: OCR
Format: Billede
Antal: 20k
Annotation: Ja
Beskrivelse: Datasættet English Menu indeholder billeder eller teksteksempler på restaurantmenuer skrevet på engelsk. Det indeholder en række forskellige skrifttyper, layouts og formateringsstile, med indhold lige fra rettnavne til beskrivelser og priser. Dette datasæt bruges ofte til opgaver som optisk tegngenkendelse (OCR), tekstudtrækning og menudigitalisering i fødevarerelaterede applikationer.
Brugsscenarie: OCR
Format: Billede
Antal: 33k
Annotation: Ja
Beskrivelse: Datasættet English Scenes Text består af billeder, der indeholder naturscener med indlejret engelsk tekst. Teksten vises i forskellige former, såsom skilte, billboards og plakater, ofte i forskellige skrifttyper, størrelser og retninger. Dette datasæt bruges almindeligvis til træning og test af modeller inden for tekstdetektion, genkendelse og sceneforståelsesopgaver.
Brugsscenarie: Dokument AI
Format: HEIC (billeder) og .mov (videoer)
Antal: 94053
Annotation: Nej
Beskrivelse: Live Photos med håndskrevet tekst til japansk, koreansk og russisk
Optageenhed: iPhone og iPad kamera
Optagelsesforhold: - Kraftig belysning/genskin - Kamerablitz tændt - Farvet lys - Svagt lys, ingen kamerablitz - Normal
Brugsscenarie: OCR
Format: Billede
Antal: 40k
Annotation: Ja
Beskrivelse: Datasættet for japansk og koreansk sprog indeholder teksteksempler på både japansk og koreansk. Det indeholder en række forskellige indholdstyper, såsom sætninger, sætninger og ord, der omfatter forskellige kontekster og stilarter. Dette datasæt bruges til opgaver som naturlig sprogbehandling (NLP), maskinoversættelse og tekstanalyse i flersprogede applikationer.
Brugsscenarie: Dokument AI
Format: HEIC (billeder) og .mov (videoer)
Antal: 23930
Annotation: Nej
Beskrivelse: Live Photos med håndskrevet tekst til japansk, koreansk og russisk
Optageenhed: iPhone og iPad kamera
Optagelsesforhold: - Kraftig belysning/genskin - Kamerablitz tændt - Farvet lys - Svagt lys, ingen kamerablitz - Normal
Brugsscenarie: Tekst + Audiovisuel (Flersproget / OCR / NLP)
Format: Videoer
Antal: 100+ forelæsningsvideoer + PPT-videoer i langt format
Annotation: Nej
Beskrivelse: Kinesiske bøger, engelske bøger, tidsskrifter, offentlig politik, romaner, børn, kantonesisk lyd + tekst, forelæsningsvideo + PPT, langformatvideo. En halv milliard bøger, spørgsmål-svarpar, artikler.
Vi bruger cookies til at forbedre din oplevelse på vores side. Ved at bruge vores side giver du samtykke til cookies.
Administrer dine cookie-præferencer nedenfor:
Væsentlige cookies aktiverer grundlæggende funktioner og er nødvendige for, at webstedet fungerer korrekt.
Google Tag Manager forenkler administrationen af marketingtags på dit websted uden kodeændringer.
Statistikcookies indsamler oplysninger anonymt. Disse oplysninger hjælper os med at forstå, hvordan besøgende bruger vores hjemmeside.
Google Analytics er et effektivt værktøj, der sporer og analyserer hjemmesidetrafik for at træffe informerede markedsføringsbeslutninger.
Tjenestens URL: policies.google.com (åbner i et nyt vindue)
Marketingcookies bruges til at følge besøgende på hjemmesider. Hensigten er at vise annoncer, der er relevante og engagerende for den enkelte bruger.
Google Ads er en online annonceringsplatform, der gør det muligt for virksomheder at oprette målrettede annoncer, der vises i Googles søgeresultater og på partnersider.
Tjenestens URL: policies.google.com (åbner i et nyt vindue)
HubSpot er en alt-i-én marketing-, salgs- og kundeserviceplatform, der strømliner forretningsvækst.
Tjenestens URL: legal.hubspot.com (åbner i et nyt vindue)
Du kan finde flere oplysninger i vores Cookiepolitik og Privatlivspolitik.