Hvordan Shaip leverede et skalerbart kvalitetsevalueringsprogram for stemmekloning til en AI-taleklient

Fra demokvalitet til implementeringsklar – hvordan struktureret menneskelig evaluering hjalp en AI-taleklient med at lukke kløften mellem laboratoriemålinger og ydeevne i den virkelige verden.

Stemmekloning

Projektoversigt

Stemmekloningsmodeller kan lyde imponerende i demoer, men stadig have problemer i den virkelige verden. Klienten havde brug for en pålidelig måde at måle, om deres model rent faktisk forbedrede sig – især for indisk engelsk, som var et prioriteret implementeringsmarked.

Shaip blev hyret ind for at designe og administrere et menneskeligt evalueringsprogram, der kunne besvare tre centrale forretningsspørgsmål:

  • Lyder talen naturlig?
  • Lyder den stadig som den originale højttaler?
  • Er det sikkert og pålideligt nok til produktionsbrug?

I stedet for kun at stole på automatiserede målinger, brugte projektet trænede menneskelige anmeldere til at evaluere reelle lydoutput og identificere, hvor modellen stadig manglede.

Stemmekloningskvalitet

Vigtige datasætmetrikker

Use Case

Vurdering af stemmekloningskvalitet

Projektets varighed

12 uger

Gennemgåede prøver

12,400 syntetiserede lydklip

Annotatorer implementeret

48 uddannede engelske evaluatorer

Udfordringer ved vurdering af TTS og stemmekloningskvalitet

  • Modellen skulle fungere godt på tværs flere engelske accenter, især indisk engelsk.
  • Lydkvaliteten skulle forbedres på måder, der er vigtige for slutbrugerne, ikke kun i laboratoriemålinger.
  • Holdet havde brug for en klar måde at identificere hvad gik galt i taleoutputtet.
  • Lange lydklip mistede sommetider den oprindelige talers identitet med tiden.
  • Klienten havde også brug for tjek til sikkerhed, risiko for personefterligning og tilstedeværelse af vandmærke.

Løsning: Menneskelig evalueringsramme for AI-stemmekvalitet

Evalueringsstrategi

Shaip udviklede en struktureret evalueringsramme for at vurdere naturlighed, klarhed, stemmelighed, konsistens og sikkerhed.

Menneskelig gennemgang i stor skala

48 uddannede evaluatorer gennemgik 12,400 lydprøver på tværs af indisk engelsk, neutral amerikansk engelsk og et hinglisk underspor.

Tredelt vurdering

  • Anmelderne vurderede, hvor naturligt og forståeligt hvert klip lød.
  • De sammenlignede par af klip for at identificere hvilken version der var bedre.
  • De mærkede tilbagevendende kvalitetsproblemer såsom unaturlig rytme, tonehøjdeproblemer og højttalerdrift.

Kvalitetskontrol

Shaip brugte kalibreringsopgaver, guldstandardtjek, gentagne gennemgange og kvalitetssikringsovervågning for at holde scoren ensartet og pålidelig.

Handlingsrettet feedback-loop

Resultaterne fra hver sprint blev ført tilbage til klientens tuningproces, hvilket hjalp modellen med at forbedres over flere runder.

Projektomfang: Sprog, accenter og anmeldelsesdækning

Miljø Anvendelsesområde
Sprog Engelsk
Prioriterede accenter Indisk engelsk, neutral amerikansk engelsk
Sekundær dækning Britisk engelsk, hinglisk underspor
Prøvetyper Korte referenceklip, få optagelser, lang tale
Gennemgå output Kvalitetsbedømmelser, præferenceetiketter, problemmærkning
Forlovelseslængde 12 uger

Resultater: Målbare forbedringer i stemmekloning

  • Klar forbedring af stemmekvaliteten: Modellens samlede kvalitetsscore forbedredes fra 3.41 til 4.12, hvilket viser, at tale blev mere naturlig og produktionsklar.
  • Bedre højttalertilpasning: Systemet blev meget bedre til at bevare den oprindelige talerens stemme og forbedrede ligheden fra 0.71 til 0.87.
  • Færre synlige fejl: Taleproblemer faldt fra 31 % af prøverne ved baseline til 11 % i den endelige sprint.
  • Stærk forståelighed: Den endelige ordfejlrate for indisk engelsk nåede 4.8 %, hvilket overgik målgrænsen.
  • Sikrere implementeringsberedskab: Evalueringen bekræftede også stærke resultater på vigtige sikkerhedskontroller, herunder screening for risiko for personefterligning og verifikation af vandmærke.
Vigtigst af alt fik klienten et gentageligt evalueringssystem, de ikke blot kunne bruge til at bedømme modelkvaliteten, men også til løbende at forbedre den. Det, der startede som et teknisk gennemgangsprogram, blev et praktisk beslutningsværktøj for produktteams, modelteams og interessenter i implementeringen.
Citat ikon

Shaip hjalp os med at forvandle subjektiv lydkvalitet til et målbart forbedringsprogram. Deres evalueringsramme gav os klare signaler om, hvad der skulle rettes, hvor der skulle forbedres, og hvordan vi kunne komme tættere på produktion med tillid.

— Produktleder inden for AI-tale

★ ★ ★ ★ ★
Citat ikon