Anonymiserede elektroniske patientjournaler (EHR)-datasæt til AI- og ML-projekter

Kommercielt licenserede, HIPAA-kompatible elektroniske patientjournaldata – klar til klinisk AI, NLP og prædiktiv modellering.

Elektroniske sundhedsjournaler (ehr) data

Hvad er EHR-data, og hvorfor er det vigtigt for AI?

EHR-datasæt i AI/ml

Elektroniske patientjournaler (EHR'er) er digitale patientjournaler, der vedligeholdes af sundhedsudbydere på tværs af hele plejeområdet – hospitaler, ambulatorier, speciallægepraksis og laboratorier. I modsætning til elektroniske patientjournaler (EMR'er), som er øjebliksbilleder fra én udbyder, dækker EHR-data hele patientforløbet og registrerer interaktioner på tværs af flere sundhedsmiljøer.

Shaips katalog over anonymiserede elektroniske patientjournaler dækker begge dele – hvilket giver dit team én enkelt, compliance-klar kilde til hele spektret af AI-udvikling inden for sundhedsvæsenet.

EHR-datasæt indeholder to kritiske datatyper for AI-udvikling: strukturerede data (demografi, ICD-10-diagnosekoder, DRG-koder, medicinlister, laboratorieværdier, vitale tegn) og ustrukturerede data (kliniske notater, epikriser, radiologirapporter, lægediktat). Cirka 80 % af EHR-informationen er ustruktureret, hvilket gør den til det primære brændstof til klinisk NLP-modeltræning.

Find de rigtige elektroniske sundhedsjournaler (EPJ)-data til din sundhedspleje AI

Forbedr dine maskinlæringsmodeller med de bedste træningsdata i sin klasse. Shaip tilbyder kommercielt tilgængelige, anonymiserede elektroniske patientjournaler (EHR)-datasæt, der er specielt designet til AI- og maskinlæringsteams. Vores færdige EHR-datakatalog leverer strukturerede, forskningsklare patientjournaler på tværs af over 20 medicinske specialer - dækker diagnoser, recepter, laboratorieresultater, radiologirapporter, immuniseringshistorik og kliniske notater - alt sammen fuldt anonymiseret i henhold til HIPAA Safe Harbor- og GDPR-standarder.

Uanset om du bygger kliniske beslutningsstøttesystemer, træner NLP-modeller på lægejournaler, udvikler algoritmer til sygdomsforudsigelse eller driver automatiseringsværktøjer til sundhedsvæsenet, giver Shaips EHR-datasæt dig den dybde, diversitet og compliance-sikring, som dit AI-projekt kræver. Tilgængelig til øjeblikkelig licensering, brugerdefineret kohorteudvælgelse eller download af eksempler.

Off-the-Shelf Electronic Health Records (EPJ):

  • 5.1M + optager og lægefilmfiler i 31 specialiteter
  • Medicinske journaler fra den virkelige verden til at træne Clinical NLP og andre Document AI-modeller
  • Metadataoplysninger som MRN (Anonymiseret), Indlæggelsesdato, Udskrivningsdato, Opholdslængde, Køn, Patientklasse, Betaler, Finansklasse, Stat, Udskrivningsdisposition, Alder, DRG, DRG Beskrivelse, $ Refusion, AMLOS, GMLOS, Risiko for dødelighed, sygdoms sværhedsgrad, grouper, hospitals postnummer osv.
  • Lægejournaler fra forskellige amerikanske stater og regioner - Nordøst (46%), Syd (9%), Midtvest (3%), Vest (28%), Andre (14%)
  • Lægejournaler, der tilhører alle dækkede patientklasser - indlæggelse, ambulant (klinisk, genoptræning, tilbagevendende, kirurgisk dagpleje), nødsituation.
  • Lægejournaler tilhørende alle patientaldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
  • Patient kønsforhold på 46 % (mand) og 54 % (kvinde)
  • PII-redigerede dokumenter, der overholder Safe Harbor-retningslinjerne i overensstemmelse med HIPAA
EHR-data efter placering
Lokation Tekstdokumenter
NorthEast 4,473,573
Syd 1,801,716
Midtvest 781,701
Vest 1,509,109
EHR-data efter større diagnosekategori
Hoveddiagnosekategori Tekstdokumenter
Alkohol / stofbrug og alkohol / stofinducerede organiske mentale lidelser48,717
I alt inklusive alt (Tilfælde med og uden MDC-kategori)8,566,687
Sager uden refusion genereret (MDC ikke specificeret)790,697
Polikliniske sager (MDC ikke specificeret)1,980,606
Sager, der bruger en specialgruppe som 3M (MDC ikke specificeret)1,619,682
I alt med MDC4,175,702
Alkohol-/stofbrug eller inducerede psykiske lidelser48,717
Burns444
Eye3,549
Mandligt reproduktionssystem9,230
Infektioner hos humant immundefektvirus12,422
Myeloproliferative sygdomme og lidelser, dårligt differentierede svulster15,620
Faktorer, der påvirker sundhedsstatus og andre kontakter med sundhedstjenester21,294
Kvindeligt reproduktionssystem17,010
Øre, næse, mund og hals22,987
Flere signifikante traumer27,902
Kredsløbssygdomme589,730
Blod, bloddannende organer og immunologiske lidelser48,990
Skader, forgiftning og toksiske virkninger af stoffer64,097
Hud, subkutan væv og bryst89,577
Lever og galdeveje127,172
Endokrine, ernæringsmæssige og metaboliske sygdomme og lidelser142,808
Nyfødte og andre nyfødte med tilstande, der stammer fra den perinatale periode163,605
Graviditet, fødsel og Puerperium165,303
Nyre og urinveje209,561
Psykiske sygdomme og lidelser282,501
Nervous System316,243
Fordøjelsessystemet346,369
Muskuloskeletalsystemet og bindevæv329,344
Åndedrætssystem561,983
Infektiøse og parasitære sygdomme559,244

Vi beskæftiger os med alle typer af datalicenser, dvs. tekst, lyd, video eller billede. Datasættene består af medicinske datasæt til ML: Lægediktationsdatasæt, lægekliniske noter, medicinske samtaledatasæt, medicinsk transskriptionsdatasæt, læge-patientsamtale, medicinske tekstdata, medicinske billeder – CT-scanning, MR, ultralyd (opsamlet basis tilpassede krav) .

Virkelige anvendelser af EHR-datasæt i AI/ML

  • Forudsigelse og diagnose af sygdomTræn AI-modeller til at forudsige sygdomme som diabetes, kræft og hjerte-kar-sygdomme.
  • Klinisk beslutningsstøtteTræne modeller til at identificere diagnoseanbefalinger, markere lægemiddelinteraktioner og assistere i behandlingsplanlægning ved hjælp af strukturerede EHR-data.
  • Personlig medicinBrug demografiske og diagnosedata til at anbefale personlige behandlingsplaner.
  • SundhedsautomatiseringAutomatiser administrative opgaver som aftaleplanlægning eller fakturering med NLP-drevne værktøjer, der er trænet i EHR-datasæt.
  • Prædiktiv sundhedsmodellering — Opbyg risikostratificerings- og sygdomsforudsigelsesmodeller ved hjælp af longitudinelle patientjournaler, DRG-koder og sygdomssværhedsgradsscorer. 
  • Studier af den virkelige verden (RWE) — Generer evidens efter markedsføring og indsigt i lægemiddelovervågning ved at analysere EHR-resultatdata på tværs af patientkohorter.
  • NLP til kliniske noter — Udtræk enheder, tilstande og procedurer fra ustrukturerede lægenotater og epikriser ved hjælp af annoterede EHR-træningsdata.

Hvorfor vælge Shaip til EHR-datasæt?

Ekspert arbejdsstyrke

Dygtige fagfolk sikrer nøjagtig dataannotering af høj kvalitet.

Regulatory Compliance

Fuldt anonymiserede datasæt i overensstemmelse med HIPAA og GDPR.

Konkurrencedygtige Priser

Omkostningseffektive løsninger leveret uden at gå på kompromis med kvaliteten.

Bias-fri data

Strenge protokoller eliminerer bias og sikrer pålidelige AI-resultater.

Hurtig og præcis

Strømlinede processer sikrer hurtig levering af forskelligartede data af høj kvalitet.

Tilgængelighed og levering

Høj netværksoptid og levering til tiden af ​​data, tjenester og løsninger.

Bevist i stor skala

Tillid fra Google og førende virksomheder inden for sundheds-AI. Kvalitetssikret af 6 Sigma Black Belt-processer og medicinsk ekspertvurdering.

Kommercielt klar

Shaips standardkatalog over elektroniske patientjournaler er licenseret, anonymiseret og klar til download eller tilgåelse via Databricks Marketplace i dag.

Fuld livscyklussupport

Har du brug for annotering oven på rådata? Shaip tilbyder anonymisering, klinisk NER-mærkning og dataudvidelse fra én partner.

Shaip kontakt os

Kan du ikke finde det, du leder efter?

Nye hyldevare medicinske datasæt bliver indsamlet på tværs af alle datatyper 

Kontakt os nu for at give slip på dine bekymringer om dataindsamling af sundhedstræning

  • Dette felt er til validering og bør overlades uændret.
  • Ved tilmelding er jeg enig med Shaip Privatlivspolitik og Servicevilkår og give mit samtykke til at modtage B2B marketingkommunikation fra Shaip.

EHR-datasæt bruges til at træne AI-modeller til sygdomsforudsigelse, klinisk beslutningstagning og personlig behandling.

EHR-data bruges til at træne AI-modeller til klinisk beslutningsstøtte, sygdomsforudsigelse, personlig behandlingsplanlægning og automatisering af sundhedsvæsenet.

Ja, alle EHR-data anonymiseres for at fjerne personligt identificerbare oplysninger (PII) og overholde privatlivsreglerne.

EHR-data indeholder detaljer som patientdemografi, sygehistorie, diagnoser, behandlingsplaner, laboratorietestresultater, radiologiske billeder (f.eks. CT, MR, røntgenbilleder), recepter og immuniseringsjournaler.

Ja, dataene overholder HIPAA, GDPR og andre globale privatlivsstandarder for at sikre sikker og etisk brug.

Ja, datasæt kan skræddersys baseret på specifikke medicinske specialer, regioner, patientdemografi eller projektkrav.

Ja, datasættene leveres i standardformater (f.eks. JSON, CSV) for nem integration i AI- og ML-arbejdsgange.

Data gennemgår grundige validerings- og kvalitetskontroller for at sikre nøjagtighed, konsistens og pålidelighed.

Omkostningerne afhænger af faktorer som datamængde, tilpasning og projektets omfang. Vi beder dig om at udfylde formularen "Kontakt os" med dine behov for at modtage det bedste tilbud.

Leveringstider varierer afhængigt af projektets størrelse og kompleksitet, men er designet til at overholde aftalte deadlines.

EHR-datasæt gør det muligt for AI-systemer at levere bedre diagnostik, prædiktiv indsigt og personlig behandling, hvilket forbedrer patientresultater og effektiviteten i sundhedsvæsenet.

Ja, Shaip tilbyder skræddersyede EHR-datasæt baseret på speciale, aldersgruppe, geografi eller projektkrav.

Elektroniske patientjournaler (EMR'er) indeholder kliniske data fra en enkelt udbyder; elektroniske patientjournaler (EHR'er) spænder over hele plejeprocessen på tværs af flere udbydere, miljøer og tidsperioder. Shaip tilbyder både EHR- og EMR-datasætvarianter, med longitudinelle journaler fra flere udbydere tilgængelige for komplekse AI-træningskrav.

Alle journaler anonymiseres ved hjælp af HIPAA Privacy Rule Safe Harbor-metoden – hvor alle 18 PHI-identifikatorer fjernes, herunder navn, fødselsdato, adresse og journalnumre. Det anonymiserede MRN-felt bevares til journalkobling i datasættet, hvilket muliggør longitudinel analyse uden risiko for genidentifikation.