Casestudie om indsamling af data om indisk sprog og tale: 300 timer på tværs af hindi, telugu og engelsk

Tilbød indsamling af lyddata, transskription og annotationstjenester af høj kvalitet for at træne deres AI-drevne talebehandlings-, flersprogede stemmesuite.

Flersproget konversations-AI til indiske sprog

Projektoversigt: Taledata til en platform til lokalisering af indiske sprog

Klienten bygger teknologier, der bygger bro over sprogkløften i den digitale verden. Indhold fra apps og portaler kan leveres på flere sprog i realtid via deres Language-as-a-Service-platform. Sprogplatformen leverer statisk og dynamisk indhold fra apps og portaler på flere sprog i realtid.

De leverer sproglokalisering på tværs af adskillige kunder, såsom mobilmærker, chipsetproducenter, forbrugerinternet, banker og finansielle institutioner, uddannelsesmyndigheder, underholdning og mere.

Samtale ai

Nøgleresultater: 300 timer indsamlet på tværs af 3 sprog

Lyddata indsamlet, transskriberet og annoteret

300 Hrs

Antal
Sprog

3 (100 timer x 3 sprog)

Sprog transskriberet og annoteret

Indisk engelsk, hindi, telugu

Projekt
Tidslinje

12 uger

Udfordringen: At finde demografisk forskelligartet samtalesprog

Manglende adgang til dygtige lingvister, eksperter i dataannotering og strenge tidsfrister har været en flaskehals i udviklingen og implementeringen af ​​konversationel AI. Det er tidskrævende og dyrt at finde lingvister, transskribere og annotere datasæt i store mængder med den nødvendige kvalitet, der er tilstrækkelig til at opbygge AI-kapaciteter.

Kundens kritiske krav var:

  1. Adgang til dygtige lingvister til lydsamling: Saml 300 timers lyd til sprog som indisk engelsk, hindi og telugu fra lingvisteksperter med demografisk diversitet.
  2. Kompleks lydtranskription og annotation med en minimumsnøjagtighed på 90%:
    • Transskriberede alle lydfilerne og optog alle ord som de blev sagt – inklusive tøven, fyldord, falske starter og andre verbale tics
    • Leverede fejlfri output på trods af strenge transskriptionsretningslinjer forbundet med dialektale udtaler, forkert udtalte ord, ikke-standard brug og tegnsætning.
  3. Datalevering: Levering af lydfiler af høj kvalitet og varieret indhold sammen med tilhørende transskriptioner (JSON-format) til 3 sprog inden for en tidsramme på 12 uger.

Løsningen: Domænespecifik lydindsamling, transskription og annotering

Med vores dybe forståelse af konversationsbaseret AI hjalp vi klienten med at indsamle, transskribere og annotere dataene ved hjælp af et team af ekspertlingvister og annotatorer for at træne deres AI-drevne flersprogede Voice Suite.

Efter at have evalueret mange leverandører valgte klienten Shaip på grund af vores ekspertise i at gennemføre samtalebaserede AI-projekter inden for strenge tidsfrister, omkostningseffektivt og med den krævede kvalitet. Deres team var også imponerede over Shaips robuste og omfattende projekteksekveringskapacitet.

Sprog Antal timer Umanuskriptbaseret generel samtale (50%) Uscripteret callcentersamtale (30%) Online scrap-medieindhold (20%)
Hindi 100 50 30 20
Engelsk 100 50 30 20
Telegu 100 50 30 20
Samlet beløb 300 150 90 60
  1. Yderligere krav til lydsamling
    • Frekvens: Samplingfrekvens – 16 kHz
    • Format: WAV
    • Varighed – Generel varighed (5-30 min) – samtaler
    • Taledomæne – BFSI, telekommunikation og detailhandel
    • Demografisk diversitet – Køn: 1:1-forhold, aldersgruppe: 18-60, indfang taler-ID for at identificere hver unikke taler
  2. Retningslinjer for lydsegmentering, transskription og annotering fulgt

    2.1 Segmentering
    • Opret segmenter på 15 sekunder hver (tidsstemplet til millisekunder) for individuelle filer, der er større end 30 sekunder
    • Segmentlydtyper – tale, snak, musik, støj, overlap
    • Segmentmærkning – starttidspunkt, sluttidspunkt, segment-ID, lydstyrkeniveau, primær lydtype,
      sprogkode, taler-ID


    2.2 Transskription og annotation

    • Transskriberet alle lydfilerne, og optog alle ord som de blev sagt – inklusive tøven, fyldord, falske starter og andre verbale tics, f.eks. symboler og tegn.
    • Leverede fejlfri output på trods af strenge transskriptionsretningslinjer forbundet med dialektale udtaler, forkert udtalte ord, ikke-standardiseret brug, tegnsætning, store bogstaver, forkortelser, sammentrækninger, tal, akronymer, uflydende og uforståelig tale, ikke-målrettet
      sprog og mere.
  3. Datalevering
    Alle WAV-lyd- og transskriptionsfiler blev leveret i JSON-format i overensstemmelse med den unikke demografiske gruppe, der blev inkluderet, inden for 12 uger.

Resultatet: En produktionsklar flersproget stemmepakke

De annoterede lyddata af høj kvalitet fra ekspertlingvister gjorde det muligt for klienten at træne deres AI-drevne talebehandlings-flersprogede stemmepakke præcist på 3 sprog, dvs. indisk engelsk, hindi og telugu, inden for den angivne tid.

Med guldstandard-træningsdatasættene kunne klienten tilbyde intelligente og robuste tale-til-tekst-, sprogoversættelses- og flersprogede tastaturtjenester til at løse virkelige problemer.

Citat ikon

Vi var imponerede over Shaips robuste projekteksekveringskapacitet, deres ekspertise i at finde, transskribere og annotere de nødvendige lyddata fra ekspertlingvister. Deres mange kvalitetskontroller, overholdelse af strenge tidsfrister og det omkostnings- og værdiskabende perspektiv, de tilbyder, er uovertruffent.

★ ★ ★ ★ ★
Citat ikon