Indisk sproglig lydtransskription og annotation: Casestudie om samtalebaseret AI

Tilbød lydtranskription og annotationstjenester af høj kvalitet for at træne deres AI-drevne talebehandlingsmotor.

Flersproget konversations-AI

Projektoversigt: Opbygning af en flersproget talemotor til indiske sprog 

Kunden er Indiens banebrydende AI-produktlaboratorium med markedstilstedeværelse i USA, Indien, Canada og adskillige andre lande. Deres vision er at øge det menneskelige potentiale gennem teknologi. De har mere end ti års erfaring med banebrydende NLP, videnskabelig forskning på tværs af kunstig intelligens, ML, analyse, visualiseringer og tilhørende teknologier.

De flytter grænserne inden for menneske-maskine-interaktion med deres AI-produkter, dvs. ICOG og Autovox. ICOG er en AI-baseret, personlig intelligent virtuel læringsassistent til læring og transformation af arbejdsstyrken, hvorimod Autovox er en AI-drevet taleløsning.
Behandlingsmotor til indiske sprog.

Samtale ai

Nøgleresultater: 1,200 timer kommenteret på tværs af 6 sprog

Lydtransskriberet og kommenteret

1,200 Hrs

Antal
Sprog

6 (200 timer x 6 sprog)

Sprog transskriberet og annoteret

Indisk engelsk, hindi, tamil, telugu, kannada, malayalam

Projekt
Tidslinje

10 uger

Udfordringen: At finde ekspertlingvister til lydannotation på indisk sprog

Manglende adgang til dygtige lingvister, eksperter i dataannotering og time-to-market har været en flaskehals i udviklingen og implementeringen af ​​konversationel AI. Indkøb af lingvister, transskribering og annotering af datasæt i store mængder med den nødvendige kvalitet, tilstrækkelig til at opbygge AI-kapaciteter, har altid været en tidskrævende og dyr opgave, der kræver dygtige ressourcer fra forskellige domæner. På trods af at have et internt team af annotatorer, stod de over for problemer med rettidig levering og kvaliteten af ​​annoteringerne.

Kundens kritiske krav var:

  1. Adgang til dygtige lingvister: Manglende adgang til ekspertlingvister inden for indiske sprog såsom indisk engelsk, hindi, tamil, telugu, kannada og malayalam
  2. Lydtransskription og annotering: Komplekse retningslinjer for lydannotering og transskription med en minimumsnøjagtighed på 95 %
  3. Datalevering: Transskriptionsfiler skal leveres i JSON-format inden for 10 uger.

Løsningen: Lydtransskription og annotation af ekspertlingvister

Med vores dybe forståelse af konversationsbaseret AI hjalp vi klienten med at transskribere og annotere de leverede datasæt ved at udnytte et team af ekspertlingvister og annotatorer til at træne deres AI-drevne talebehandlingsmotor til indiske sprog.

Efter at have evalueret mange leverandører (herunder et par sværvægtere i branchen), valgte klienten Shaip på grund af vores ekspertise i at gennemføre store konversationsbaserede AI-projekter inden for strenge tidsfrister og den kvalitet, vi tilbyder til konkurrencedygtige priser.

  1. Retningslinjer for lydtransskription og annotering fulgt
    • Annoteret lydtype som tale og ikke-tale
    • Hvis lydtypen for det valgte segment er markeret som tale, skal taletypen vælges, dvs. ren tale, tale+musik, tale+støj, uforståelig tale.
    • Det valgte talesegment skal være specifikt mærket til det sprog, som taleren taler
    • Annotatoren skal markere områderne med højttalertags. Forskellige højttalere skal være
      markeret med forskellige højttalermærker.
    • Annotatoren skal vælge talerens køn, dvs. mand eller kvinde.
    • Teksten skal skrives som den bliver sagt i lydoptagelsen og skal være grammatisk korrekt
    • Hvis den valgte lydtype er ikke-tale, skal den tildeles en af ​​følgende etiketter – ingen tale, musik, læbesmæk, åndedræt, hoste, latter, ring, DTMF, pludren, køretøjsstøj og intermitterende forgrundsstøj.
    • Alle segmenter i lyden skal markeres med tags og kan først derefter uploades til systemet.
  2. Datalevering
    Alle transskriptionsfiler blev leveret i JSON-format i overensstemmelse med de specificerede metadatakrav inden for 10 uger.

Resultatet: En produktionsklar flersproget samtalemotor med AI

De annoterede lyddata i høj kvalitet fra ekspertlingvister gjorde det muligt for klienten at træne deres AI-drevne talebehandlingsmotor præcist på 6 indiske sprog, dvs. indisk engelsk, hindi, tamil, telugu, kannada og malayalam, inden for den angivne tid.

Med guldstandard-træningsdatasættene vil klienten være i stand til at tilbyde et intelligent og robust talesystem med flersproget kapacitet, der bruger end-to-end (E2E) og hybridmodeller til at løse virkelige problemer. Kort sagt, at bygge konversationsbaseret AI (såsom Alexa, Siri) specifikt henvender sig til indiske forbrugere.

Citat ikon

Vi blev positivt overraskede over Shaips robuste workflowstyring, hurtige ekspeditionstid, deres erfaring med konversationel AI og deres netværk af ekspertlingvister. Derudover er deres omkostnings- og værdiskabende ledelse uovertruffen.

★ ★ ★ ★ ★
Citat ikon