Casestudie om indsamling af data om indisk sprog og tale: 300 timer på tværs af hindi, telugu og engelsk
Tilbød indsamling af lyddata, transskription og annotationstjenester af høj kvalitet for at træne deres AI-drevne talebehandlings-, flersprogede stemmesuite.
Projektoversigt: Taledata til en platform til lokalisering af indiske sprog
Klienten bygger teknologier, der bygger bro over sprogkløften i den digitale verden. Indhold fra apps og portaler kan leveres på flere sprog i realtid via deres Language-as-a-Service-platform. Sprogplatformen leverer statisk og dynamisk indhold fra apps og portaler på flere sprog i realtid.
De leverer sproglokalisering på tværs af adskillige kunder, såsom mobilmærker, chipsetproducenter, forbrugerinternet, banker og finansielle institutioner, uddannelsesmyndigheder, underholdning og mere.
Nøgleresultater: 300 timer indsamlet på tværs af 3 sprog
Lyddata indsamlet, transskriberet og annoteret
300 Hrs
Antal
Sprog
3 (100 timer x 3 sprog)
Sprog transskriberet og annoteret
Indisk engelsk, hindi, telugu
Projekt
Tidslinje
12 uger
Udfordringen: At finde demografisk forskelligartet samtalesprog
Manglende adgang til dygtige lingvister, eksperter i dataannotering og strenge tidsfrister har været en flaskehals i udviklingen og implementeringen af konversationel AI. Det er tidskrævende og dyrt at finde lingvister, transskribere og annotere datasæt i store mængder med den nødvendige kvalitet, der er tilstrækkelig til at opbygge AI-kapaciteter.
Kundens kritiske krav var:
- Adgang til dygtige lingvister til lydsamling: Saml 300 timers lyd til sprog som indisk engelsk, hindi og telugu fra lingvisteksperter med demografisk diversitet.
- Kompleks lydtranskription og annotation med en minimumsnøjagtighed på 90%:
- Transskriberede alle lydfilerne og optog alle ord som de blev sagt – inklusive tøven, fyldord, falske starter og andre verbale tics
- Leverede fejlfri output på trods af strenge transskriptionsretningslinjer forbundet med dialektale udtaler, forkert udtalte ord, ikke-standard brug og tegnsætning.
- Datalevering: Levering af lydfiler af høj kvalitet og varieret indhold sammen med tilhørende transskriptioner (JSON-format) til 3 sprog inden for en tidsramme på 12 uger.
Løsningen: Domænespecifik lydindsamling, transskription og annotering
Med vores dybe forståelse af konversationsbaseret AI hjalp vi klienten med at indsamle, transskribere og annotere dataene ved hjælp af et team af ekspertlingvister og annotatorer for at træne deres AI-drevne flersprogede Voice Suite.
Efter at have evalueret mange leverandører valgte klienten Shaip på grund af vores ekspertise i at gennemføre samtalebaserede AI-projekter inden for strenge tidsfrister, omkostningseffektivt og med den krævede kvalitet. Deres team var også imponerede over Shaips robuste og omfattende projekteksekveringskapacitet.
| Sprog | Antal timer | Umanuskriptbaseret generel samtale (50%) | Uscripteret callcentersamtale (30%) | Online scrap-medieindhold (20%) |
|---|---|---|---|---|
| Hindi | 100 | 50 | 30 | 20 |
| Engelsk | 100 | 50 | 30 | 20 |
| Telegu | 100 | 50 | 30 | 20 |
| Samlet beløb | 300 | 150 | 90 | 60 |
- Yderligere krav til lydsamling
- Frekvens: Samplingfrekvens – 16 kHz
- Format: WAV
- Varighed – Generel varighed (5-30 min) – samtaler
- Taledomæne – BFSI, telekommunikation og detailhandel
- Demografisk diversitet – Køn: 1:1-forhold, aldersgruppe: 18-60, indfang taler-ID for at identificere hver unikke taler
- Retningslinjer for lydsegmentering, transskription og annotering fulgt
2.1 Segmentering- Opret segmenter på 15 sekunder hver (tidsstemplet til millisekunder) for individuelle filer, der er større end 30 sekunder
- Segmentlydtyper – tale, snak, musik, støj, overlap
- Segmentmærkning – starttidspunkt, sluttidspunkt, segment-ID, lydstyrkeniveau, primær lydtype,
sprogkode, taler-ID
2.2 Transskription og annotation- Transskriberet alle lydfilerne, og optog alle ord som de blev sagt – inklusive tøven, fyldord, falske starter og andre verbale tics, f.eks. symboler og tegn.
- Leverede fejlfri output på trods af strenge transskriptionsretningslinjer forbundet med dialektale udtaler, forkert udtalte ord, ikke-standardiseret brug, tegnsætning, store bogstaver, forkortelser, sammentrækninger, tal, akronymer, uflydende og uforståelig tale, ikke-målrettet
sprog og mere.
- Datalevering
Alle WAV-lyd- og transskriptionsfiler blev leveret i JSON-format i overensstemmelse med den unikke demografiske gruppe, der blev inkluderet, inden for 12 uger.
Resultatet: En produktionsklar flersproget stemmepakke
De annoterede lyddata af høj kvalitet fra ekspertlingvister gjorde det muligt for klienten at træne deres AI-drevne talebehandlings-flersprogede stemmepakke præcist på 3 sprog, dvs. indisk engelsk, hindi og telugu, inden for den angivne tid.
Med guldstandard-træningsdatasættene kunne klienten tilbyde intelligente og robuste tale-til-tekst-, sprogoversættelses- og flersprogede tastaturtjenester til at løse virkelige problemer.
Vi var imponerede over Shaips robuste projekteksekveringskapacitet, deres ekspertise i at finde, transskribere og annotere de nødvendige lyddata fra ekspertlingvister. Deres mange kvalitetskontroller, overholdelse af strenge tidsfrister og det omkostnings- og værdiskabende perspektiv, de tilbyder, er uovertruffent.