Medicinsk datakatalog til sundhedsvæsenets AI

Off-the-shelf Healthcare/Medical Datasæt for at sætte gang i dit Healthcare AI-projekt

Medicinske datakatalog

Medicinske og sundhedsmæssige datasæt til maskinlæring

Hvad indeholder Shaip Medical Data Catalog?

Shaip Medical Data Catalog er et HIPAA-forberedt, færdigt bibliotek med anonymiserede sundhedstræningsdata, der spænder over 31 medicinske specialer, herunder 257,977 timers lægedikteringslyd, transskriberede patientjournaler, elektroniske patientjournaler og multimodale datasæt. Hvert datasæt er licenseret til kommerciel AI-træning og leveres med Safe Harbor- eller Expert Determination-anonymisering.

Læge diktat lyddata

Vores anonymiserede datasæt for sundhedsvæsenet indeholder lydfiler på tværs af 31 specialer dikteret af læger, der beskriver patienters kliniske tilstand og plejeplan baseret på læge-patient-møder i kliniske omgivelser.

Off-the-Shelf Læge Dikteringslydfiler:

  • 257,977 timers datasæt om lægers dikteringstale fra 31 specialer til træning af talemodeller inden for sundhedsvæsenet
  • Dikteringslyd optaget fra forskellige enheder som telefondiktering (54.3 %), digital optager (24.9 %), talemikrofon (5.4 %), smarttelefon (2.7 %) og ukendt (12.7 %)
  • PII-redigeret lyd og transskriptioner, der overholder Safe Harbor-retningslinjerne i overensstemmelse med HIPAA
Læge diktering lyddata

Transskriberet lægejournal

Transskriberede patientjournaler refererer til transskription af læge- og patientsamtaler, transskription af medicinske rapporter og medicinske vurderinger. Det hjælper med at kortlægge patientens sygehistorie til fremtidige besøg og fungerer også som et referencepunkt for lægerne. Det hjælper med at evaluere patientens nuværende tilstand og foreslå en passende behandling.

Off-the-shelf transskriberede lægejournaler:

  • Transskription af 257,977 timers lægediktation fra den virkelige verden fra 31 specialer for at træne Healthcare-talemodeller
  • Transskriberede lægejournaler fra forskellige arbejdstyper som operationsrapport, udskrivningsoversigt, konsultationsnotat, indlæggelsesnotat, ED-notat, kliniknotat, radiologirapport osv.
  • PII-redigeret lyd og transskriptioner, der overholder Safe Harbor-retningslinjerne i overensstemmelse med HIPAA
Transskriberede lægejournaler

Electronic Health Records (EPJ)

Elektroniske journaler eller EPJ er medicinske journaler, der indeholder patientens sygehistorie, diagnoser, recept, behandlingsplaner, vaccinations- eller immuniseringsdatoer, allergier, røntgenbilleder (CT-scanning, MR, røntgenstråler) og laboratorietests og mere.

Off-the-Shelf Electronic Health Records (EPJ):

  • 5.1M + optager og lægefilmfiler i 31 specialiteter
  • Medicinske journaler fra den virkelige verden til at træne Clinical NLP og andre Document AI-modeller
  • Metadataoplysninger som MRN (Anonymiseret), Indlæggelsesdato, Udskrivningsdato, Opholdslængde, Køn, Patientklasse, Betaler, Finansklasse, Stat, Udskrivningsdisposition, Alder, DRG, DRG Beskrivelse, $ Refusion, AMLOS, GMLOS, Risiko for dødelighed, sygdoms sværhedsgrad, grouper, hospitals postnummer osv.
  • Lægejournaler fra forskellige amerikanske stater og regioner - Nordøst (46%), Syd (9%), Midtvest (3%), Vest (28%), Andre (14%)
  • Lægejournaler, der tilhører alle dækkede patientklasser - indlæggelse, ambulant (klinisk, genoptræning, tilbagevendende, kirurgisk dagpleje), nødsituation.
Elektroniske sundhedsjournaler (ehr)
  • Lægejournaler tilhørende alle patientaldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
  • Patient kønsforhold på 46 % (mand) og 54 % (kvinde)
  • PII-redigerede dokumenter, der overholder Safe Harbor-retningslinjerne i overensstemmelse med HIPAA

Fem grunde til købere licens Shaip i stedet for at sy det sammen.

Shaip Medical Data Catalog eksisterer fordi De fleste AI-teams i sundhedsvæsenet mister ni til tolv måneder Indhentning af kompatible træningsdata, før en enkelt model trænes. Her er, hvad der ændrer sig, når disse måneder returneres.

01

Katalogskala, som de fleste teams ikke kan matche.

Shaip-kataloget spænder over 257,977 timer af lægediktat, transskriptioner fra 31 medicinske specialerog EHR-journaler, der dækker alle patienters aldersgrupper — den slags volumen, der giver købere mulighed for træne og evaluere modeller uden at sammensætte et dusin åbne datasæt.

02

Overholdelse af regler er en startbetingelse, ikke en funktion.

Alle medicinske datasæt fra Shaip leveres med HIPAA Safe Harbor-anonymisering som standard, Ekspertvurdering på anmodning, GDPR-tilpasset håndtering og BAA-parathed for berørte enheder. Købere behøver ikke at eftermontere compliance efterfølgende.

HIPAA Safe Harbor Ekspertbestemmelse GDPR-tilpasset BAA-klar
03

Sundhedsuddannede specialister, ikke generiske crowd workers.

Annotering, transskription og kvalitetssikring af Shaips medicinske katalog udføres af sundhedsuddannede specialisterShaip-workflowet inkluderer flerlags QA og human-in-the-loop-validering kalibreret efter kliniske nøjagtighedsstandarder.

04

Standard i dag, specialfremstillet efter behov.

Købere kan licensere eksisterende Shaip-datasæt med det samme eller bestille brugerdefinerede samlinger, der er skræddersyet til specifikke demografiske områder, geografiske områder, sprog og modaliteter — uden at skifte leverandør eller gentage compliance-gennemgangen.

05

Tilgængelig hvor datateams allerede arbejder.

Shaips anonymiserede EHR- og lægedikteringsdatasæt er tilgængelige på Databricks Marketplace, med levering i dataformater, som allerede anvendes af ML-teams — JSON, CSV, WAV. Eksempeldatasæt er tilgængelige før enhver forpligtelse.

JSON CSV WAV FHIR

Sikkerhed og overholdelse

GDPR
HIPAA
ISO 9001: 2015
SOC 2 Type II
ISO 27001
Shaip kontakt os

Kan du ikke finde det, du leder efter?

Nye hyldevare medicinske datasæt bliver indsamlet på tværs af alle datatyper 

Kontakt os nu for at give slip på dine bekymringer om dataindsamling af sundhedstræning

  • Dette felt er til validering og bør overlades uændret.
  • Ved tilmelding er jeg enig med Shaip Privatlivspolitik og Servicevilkår og give mit samtykke til at modtage B2B marketingkommunikation fra Shaip.

Medicinske datasæt er sundhedsdata, der bruges til at træne, evaluere og forbedre AI/ML-modeller. De kan omfatte lægedikteringslyd, transskriberede patientjournaler, elektroniske patientjournaler, syntetiske læge-patientdialoger og multimodale sundhedsdatasæt, der kombinerer relevant tekst, tale og strukturerede kliniske data.

Shaip Medical Data Catalog indeholder lægedikteringslyd, transskriberede patientjournaler, elektroniske patientjournaler, syntetiske læge-patientdialoger og multimodale datasæt, der forbinder tekst, tale og strukturerede kliniske data på patient- eller mødeniveau. Det indeholder 257,977 timers lægedikteringslyd på tværs af 31 medicinske specialer og er tilgængeligt for kommerciel AI-træning.

Ja. Shaips medicinske datasæt er som standard anonymiserede i henhold til HIPAA Safe Harbor, hvilket fjerner de 18 kategorier af identifikatorer, der er angivet i HIPAA-privatlivsreglen. Anonymisering ved hjælp af ekspertbestemmelse er også tilgængelig, når statistisk certificering er påkrævet, og Shaip er BAA-klar til dækkede enheder.

Ja. Shaips medicinske datasæt kan forberedes til at understøtte HIPAA, GDPR og andre gældende krav til sundhedsdata afhængigt af projektets omfang, geografi, datatype og kontraktmæssige krav.

Begge muligheder er tilgængelige. Shaip tilbyder standard sundhedsdatasæt via Shaip Medical Data Catalog til kommerciel AI-træning. Hvis et projekt kræver et specifikt sprog, en specifik demografisk gruppe, et specifikt speciale, en specifik modalitet eller et specifikt klinisk miljø, kan Shaip også køre brugerdefineret medicinsk dataindsamling under de samme compliance-standarder.

Ja. Shaip kan tilpasse medicinske datasæt efter speciale, patientens aldersgruppe, køn, geografi, sprog, modalitet, klinisk miljø, format, volumen og projektkrav. Tilpassede datasæt er omfattet af en arbejdsbeskrivelse og følger gældende standarder for anonymisering og overholdelse af regler.

Ja. Shaip leverer repræsentative eksempeldatasæt under en fortrolighedsaftale, så AI-teams kan evaluere format, kvalitet, demografisk dækning og modeltilpasning før licensering. Adgang til eksempler er typisk det første trin før en standardlicens eller en brugerdefineret samling.

Shaip leverer medicinske datasæt i AI-klare formater, herunder JSON, CSV og FHIR til strukturerede journaler; WAV-filer med parrede transkripter til lyd; og transkriptfiler til tale- og sprogdatasæt. Multimodale datasæt kan omfatte manifestfiler, der linker tekst, lyd og strukturerede kliniske journaler.

Shaip sikrer kvaliteten af ​​medicinske datasæt gennem ekspertgennemgang, domænespecialist-annotering, valideringsworkflows og strukturerede QA-kontroller. Disse processer hjælper med at sikre nøjagtighed, pålidelighed og modelberedskab til udvikling af AI inden for sundhedsvæsenet.

Ja. Shaips medicinske datasæt er skalerbare til både små pilotprojekter og AI/ML-projekter i store virksomheder. De kan understøtte projekter, der kræver store mængder patientjournaler, strukturerede kliniske data, transskriptioner eller hundredtusindvis af timers lægediktatlyd.

Ja. Shaip leverer medicinske datasæt i brugsklare formater som JSON, CSV, FHIR, WAV og transkriptfiler. Disse formater understøtter integration i eksisterende arbejdsgange inden for AI, ML, NLP, tale, sundhedsvidenskabelig LLM og multimodal modeludvikling.

Standardiserede medicinske datasæt kan typisk leveres inden for få dage efter prøvegennemgang, kontraktunderskrift og færdiggørelse af licensering. Tilpassede indsamlingstidslinjer afhænger af projektets omfang, datasætstørrelse, modalitet, compliancekrav og kompleksitet og er defineret i arbejdsbeskrivelsen.

Prisen på medicinske datasæt afhænger af datasættype, modalitet, volumen, tilpasningskrav, licensbetingelser, leveringstidslinje og overholdelsesbehov. Teams kan dele deres krav via kontaktformularen for at modtage et skræddersyet tilbud.

Medicinske datasæt af høj kvalitet er afgørende for at kunne træne præcise, pålidelige og klinisk nyttige AI-modeller inden for sundhedsvæsenet. De hjælper med at forbedre medicinsk dokumentation, klinisk NLP, talegenkendelse, opsummering, beslutningsstøtte, automatisering, arbejdsgange inden for patientpleje og dataintelligens inden for sundhedsvæsenet.