Indisk sproglig lydtransskription og annotation: Casestudie om samtalebaseret AI
Tilbød lydtranskription og annotationstjenester af høj kvalitet for at træne deres AI-drevne talebehandlingsmotor.
Projektoversigt: Opbygning af en flersproget talemotor til indiske sprog
Kunden er Indiens banebrydende AI-produktlaboratorium med markedstilstedeværelse i USA, Indien, Canada og adskillige andre lande. Deres vision er at øge det menneskelige potentiale gennem teknologi. De har mere end ti års erfaring med banebrydende NLP, videnskabelig forskning på tværs af kunstig intelligens, ML, analyse, visualiseringer og tilhørende teknologier.
De flytter grænserne inden for menneske-maskine-interaktion med deres AI-produkter, dvs. ICOG og Autovox. ICOG er en AI-baseret, personlig intelligent virtuel læringsassistent til læring og transformation af arbejdsstyrken, hvorimod Autovox er en AI-drevet taleløsning.
Behandlingsmotor til indiske sprog.
Nøgleresultater: 1,200 timer kommenteret på tværs af 6 sprog
Lydtransskriberet og kommenteret
1,200 Hrs
Antal
Sprog
6 (200 timer x 6 sprog)
Sprog transskriberet og annoteret
Indisk engelsk, hindi, tamil, telugu, kannada, malayalam
Projekt
Tidslinje
10 uger
Udfordringen: At finde ekspertlingvister til lydannotation på indisk sprog
Manglende adgang til dygtige lingvister, eksperter i dataannotering og time-to-market har været en flaskehals i udviklingen og implementeringen af konversationel AI. Indkøb af lingvister, transskribering og annotering af datasæt i store mængder med den nødvendige kvalitet, tilstrækkelig til at opbygge AI-kapaciteter, har altid været en tidskrævende og dyr opgave, der kræver dygtige ressourcer fra forskellige domæner. På trods af at have et internt team af annotatorer, stod de over for problemer med rettidig levering og kvaliteten af annoteringerne.
Kundens kritiske krav var:
- Adgang til dygtige lingvister: Manglende adgang til ekspertlingvister inden for indiske sprog såsom indisk engelsk, hindi, tamil, telugu, kannada og malayalam
- Lydtransskription og annotering: Komplekse retningslinjer for lydannotering og transskription med en minimumsnøjagtighed på 95 %
- Datalevering: Transskriptionsfiler skal leveres i JSON-format inden for 10 uger.
Løsningen: Lydtransskription og annotation af ekspertlingvister
Med vores dybe forståelse af konversationsbaseret AI hjalp vi klienten med at transskribere og annotere de leverede datasæt ved at udnytte et team af ekspertlingvister og annotatorer til at træne deres AI-drevne talebehandlingsmotor til indiske sprog.
Efter at have evalueret mange leverandører (herunder et par sværvægtere i branchen), valgte klienten Shaip på grund af vores ekspertise i at gennemføre store konversationsbaserede AI-projekter inden for strenge tidsfrister og den kvalitet, vi tilbyder til konkurrencedygtige priser.
- Retningslinjer for lydtransskription og annotering fulgt
- Annoteret lydtype som tale og ikke-tale
- Hvis lydtypen for det valgte segment er markeret som tale, skal taletypen vælges, dvs. ren tale, tale+musik, tale+støj, uforståelig tale.
- Det valgte talesegment skal være specifikt mærket til det sprog, som taleren taler
- Annotatoren skal markere områderne med højttalertags. Forskellige højttalere skal være
markeret med forskellige højttalermærker. - Annotatoren skal vælge talerens køn, dvs. mand eller kvinde.
- Teksten skal skrives som den bliver sagt i lydoptagelsen og skal være grammatisk korrekt
- Hvis den valgte lydtype er ikke-tale, skal den tildeles en af følgende etiketter – ingen tale, musik, læbesmæk, åndedræt, hoste, latter, ring, DTMF, pludren, køretøjsstøj og intermitterende forgrundsstøj.
- Alle segmenter i lyden skal markeres med tags og kan først derefter uploades til systemet.
- Datalevering
Alle transskriptionsfiler blev leveret i JSON-format i overensstemmelse med de specificerede metadatakrav inden for 10 uger.
Resultatet: En produktionsklar flersproget samtalemotor med AI
De annoterede lyddata i høj kvalitet fra ekspertlingvister gjorde det muligt for klienten at træne deres AI-drevne talebehandlingsmotor præcist på 6 indiske sprog, dvs. indisk engelsk, hindi, tamil, telugu, kannada og malayalam, inden for den angivne tid.
Med guldstandard-træningsdatasættene vil klienten være i stand til at tilbyde et intelligent og robust talesystem med flersproget kapacitet, der bruger end-to-end (E2E) og hybridmodeller til at løse virkelige problemer. Kort sagt, at bygge konversationsbaseret AI (såsom Alexa, Siri) specifikt henvender sig til indiske forbrugere.
Vi blev positivt overraskede over Shaips robuste workflowstyring, hurtige ekspeditionstid, deres erfaring med konversationel AI og deres netværk af ekspertlingvister. Derudover er deres omkostnings- og værdiskabende ledelse uovertruffen.