Anonymiserede elektroniske patientjournaler (EHR)-datasæt til AI- og ML-projekter
Kommercielt licenserede, HIPAA-kompatible elektroniske patientjournaldata – klar til klinisk AI, NLP og prædiktiv modellering.
Hvad er EHR-data, og hvorfor er det vigtigt for AI?
Elektroniske patientjournaler (EHR'er) er digitale patientjournaler, der vedligeholdes af sundhedsudbydere på tværs af hele plejeområdet – hospitaler, ambulatorier, speciallægepraksis og laboratorier. I modsætning til elektroniske patientjournaler (EMR'er), som er øjebliksbilleder fra én udbyder, dækker EHR-data hele patientforløbet og registrerer interaktioner på tværs af flere sundhedsmiljøer.
Shaips katalog over anonymiserede elektroniske patientjournaler dækker begge dele – hvilket giver dit team én enkelt, compliance-klar kilde til hele spektret af AI-udvikling inden for sundhedsvæsenet.
EHR-datasæt indeholder to kritiske datatyper for AI-udvikling: strukturerede data (demografi, ICD-10-diagnosekoder, DRG-koder, medicinlister, laboratorieværdier, vitale tegn) og ustrukturerede data (kliniske notater, epikriser, radiologirapporter, lægediktat). Cirka 80 % af EHR-informationen er ustruktureret, hvilket gør den til det primære brændstof til klinisk NLP-modeltræning.
Find de rigtige elektroniske sundhedsjournaler (EPJ)-data til din sundhedspleje AI
Forbedr dine maskinlæringsmodeller med de bedste træningsdata i sin klasse. Shaip tilbyder kommercielt tilgængelige, anonymiserede elektroniske patientjournaler (EHR)-datasæt, der er specielt designet til AI- og maskinlæringsteams. Vores færdige EHR-datakatalog leverer strukturerede, forskningsklare patientjournaler på tværs af over 20 medicinske specialer - dækker diagnoser, recepter, laboratorieresultater, radiologirapporter, immuniseringshistorik og kliniske notater - alt sammen fuldt anonymiseret i henhold til HIPAA Safe Harbor- og GDPR-standarder.
Uanset om du bygger kliniske beslutningsstøttesystemer, træner NLP-modeller på lægejournaler, udvikler algoritmer til sygdomsforudsigelse eller driver automatiseringsværktøjer til sundhedsvæsenet, giver Shaips EHR-datasæt dig den dybde, diversitet og compliance-sikring, som dit AI-projekt kræver. Tilgængelig til øjeblikkelig licensering, brugerdefineret kohorteudvælgelse eller download af eksempler.
Off-the-Shelf Electronic Health Records (EPJ):
- 5.1M + optager og lægefilmfiler i 31 specialiteter
- Medicinske journaler fra den virkelige verden til at træne Clinical NLP og andre Document AI-modeller
- Metadataoplysninger som MRN (Anonymiseret), Indlæggelsesdato, Udskrivningsdato, Opholdslængde, Køn, Patientklasse, Betaler, Finansklasse, Stat, Udskrivningsdisposition, Alder, DRG, DRG Beskrivelse, $ Refusion, AMLOS, GMLOS, Risiko for dødelighed, sygdoms sværhedsgrad, grouper, hospitals postnummer osv.
- Lægejournaler fra forskellige amerikanske stater og regioner - Nordøst (46%), Syd (9%), Midtvest (3%), Vest (28%), Andre (14%)
- Lægejournaler, der tilhører alle dækkede patientklasser - indlæggelse, ambulant (klinisk, genoptræning, tilbagevendende, kirurgisk dagpleje), nødsituation.
- Lægejournaler tilhørende alle patientaldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
- Patient kønsforhold på 46 % (mand) og 54 % (kvinde)
- PII-redigerede dokumenter, der overholder Safe Harbor-retningslinjerne i overensstemmelse med HIPAA
| Lokation | Tekstdokumenter |
|---|---|
| NorthEast | 4,473,573 |
| Syd | 1,801,716 |
| Midtvest | 781,701 |
| Vest | 1,509,109 |
| Hoveddiagnosekategori | Tekstdokumenter |
|---|---|
| Alkohol / stofbrug og alkohol / stofinducerede organiske mentale lidelser | 48,717 |
| I alt inklusive alt (Tilfælde med og uden MDC-kategori) | 8,566,687 |
| Sager uden refusion genereret (MDC ikke specificeret) | 790,697 |
| Polikliniske sager (MDC ikke specificeret) | 1,980,606 |
| Sager, der bruger en specialgruppe som 3M (MDC ikke specificeret) | 1,619,682 |
| I alt med MDC | 4,175,702 |
| Alkohol-/stofbrug eller inducerede psykiske lidelser | 48,717 |
| Burns | 444 |
| Eye | 3,549 |
| Mandligt reproduktionssystem | 9,230 |
| Infektioner hos humant immundefektvirus | 12,422 |
| Myeloproliferative sygdomme og lidelser, dårligt differentierede svulster | 15,620 |
| Faktorer, der påvirker sundhedsstatus og andre kontakter med sundhedstjenester | 21,294 |
| Kvindeligt reproduktionssystem | 17,010 |
| Øre, næse, mund og hals | 22,987 |
| Flere signifikante traumer | 27,902 |
| Kredsløbssygdomme | 589,730 |
| Blod, bloddannende organer og immunologiske lidelser | 48,990 |
| Skader, forgiftning og toksiske virkninger af stoffer | 64,097 |
| Hud, subkutan væv og bryst | 89,577 |
| Lever og galdeveje | 127,172 |
| Endokrine, ernæringsmæssige og metaboliske sygdomme og lidelser | 142,808 |
| Nyfødte og andre nyfødte med tilstande, der stammer fra den perinatale periode | 163,605 |
| Graviditet, fødsel og Puerperium | 165,303 |
| Nyre og urinveje | 209,561 |
| Psykiske sygdomme og lidelser | 282,501 |
| Nervous System | 316,243 |
| Fordøjelsessystemet | 346,369 |
| Muskuloskeletalsystemet og bindevæv | 329,344 |
| Åndedrætssystem | 561,983 |
| Infektiøse og parasitære sygdomme | 559,244 |
Vi beskæftiger os med alle typer af datalicenser, dvs. tekst, lyd, video eller billede. Datasættene består af medicinske datasæt til ML: Lægediktationsdatasæt, lægekliniske noter, medicinske samtaledatasæt, medicinsk transskriptionsdatasæt, læge-patientsamtale, medicinske tekstdata, medicinske billeder – CT-scanning, MR, ultralyd (opsamlet basis tilpassede krav) .
Virkelige anvendelser af EHR-datasæt i AI/ML
- Forudsigelse og diagnose af sygdomTræn AI-modeller til at forudsige sygdomme som diabetes, kræft og hjerte-kar-sygdomme.
- Klinisk beslutningsstøtteTræne modeller til at identificere diagnoseanbefalinger, markere lægemiddelinteraktioner og assistere i behandlingsplanlægning ved hjælp af strukturerede EHR-data.
- Personlig medicinBrug demografiske og diagnosedata til at anbefale personlige behandlingsplaner.
- SundhedsautomatiseringAutomatiser administrative opgaver som aftaleplanlægning eller fakturering med NLP-drevne værktøjer, der er trænet i EHR-datasæt.
- Prædiktiv sundhedsmodellering — Opbyg risikostratificerings- og sygdomsforudsigelsesmodeller ved hjælp af longitudinelle patientjournaler, DRG-koder og sygdomssværhedsgradsscorer.
- Studier af den virkelige verden (RWE) — Generer evidens efter markedsføring og indsigt i lægemiddelovervågning ved at analysere EHR-resultatdata på tværs af patientkohorter.
- NLP til kliniske noter — Udtræk enheder, tilstande og procedurer fra ustrukturerede lægenotater og epikriser ved hjælp af annoterede EHR-træningsdata.
Hvorfor vælge Shaip til EHR-datasæt?
Ekspert arbejdsstyrke
Dygtige fagfolk sikrer nøjagtig dataannotering af høj kvalitet.
Regulatory Compliance
Fuldt anonymiserede datasæt i overensstemmelse med HIPAA og GDPR.
Konkurrencedygtige Priser
Omkostningseffektive løsninger leveret uden at gå på kompromis med kvaliteten.
Bias-fri data
Strenge protokoller eliminerer bias og sikrer pålidelige AI-resultater.
Hurtig og præcis
Strømlinede processer sikrer hurtig levering af forskelligartede data af høj kvalitet.
Tilgængelighed og levering
Høj netværksoptid og levering til tiden af data, tjenester og løsninger.
Bevist i stor skala
Tillid fra Google og førende virksomheder inden for sundheds-AI. Kvalitetssikret af 6 Sigma Black Belt-processer og medicinsk ekspertvurdering.
Kommercielt klar
Shaips standardkatalog over elektroniske patientjournaler er licenseret, anonymiseret og klar til download eller tilgåelse via Databricks Marketplace i dag.
Fuld livscyklussupport
Har du brug for annotering oven på rådata? Shaip tilbyder anonymisering, klinisk NER-mærkning og dataudvidelse fra én partner.
Kan du ikke finde det, du leder efter?
Nye hyldevare medicinske datasæt bliver indsamlet på tværs af alle datatyper
Kontakt os nu for at give slip på dine bekymringer om dataindsamling af sundhedstræning
Ofte stillede spørgsmål (FAQ)
1. Hvad bruges EHR-datasæt til i AI?
EHR-datasæt bruges til at træne AI-modeller til sygdomsforudsigelse, klinisk beslutningstagning og personlig behandling.
2. Hvordan bruges EHR-data i AI/ML-projekter?
EHR-data bruges til at træne AI-modeller til klinisk beslutningsstøtte, sygdomsforudsigelse, personlig behandlingsplanlægning og automatisering af sundhedsvæsenet.
3. Er EHR-data anonymiserede?
Ja, alle EHR-data anonymiseres for at fjerne personligt identificerbare oplysninger (PII) og overholde privatlivsreglerne.
4. Hvad er de vigtigste komponenter i EHR-data?
EHR-data indeholder detaljer som patientdemografi, sygehistorie, diagnoser, behandlingsplaner, laboratorietestresultater, radiologiske billeder (f.eks. CT, MR, røntgenbilleder), recepter og immuniseringsjournaler.
5. Overholder dataene HIPAA og andre regler?
Ja, dataene overholder HIPAA, GDPR og andre globale privatlivsstandarder for at sikre sikker og etisk brug.
6. Kan EHR-datasæt tilpasses?
Ja, datasæt kan skræddersys baseret på specifikke medicinske specialer, regioner, patientdemografi eller projektkrav.
7. Kan dataene integreres i mine AI-modeller?
Ja, datasættene leveres i standardformater (f.eks. JSON, CSV) for nem integration i AI- og ML-arbejdsgange.
8. Hvordan sikres datakvaliteten?
Data gennemgår grundige validerings- og kvalitetskontroller for at sikre nøjagtighed, konsistens og pålidelighed.
9. Hvad koster EHR-datasæt?
Omkostningerne afhænger af faktorer som datamængde, tilpasning og projektets omfang. Vi beder dig om at udfylde formularen "Kontakt os" med dine behov for at modtage det bedste tilbud.
10. Hvad er leveringstidslinjerne for EHR-datasæt?
Leveringstider varierer afhængigt af projektets størrelse og kompleksitet, men er designet til at overholde aftalte deadlines.
11. Hvordan kan EHR-datasæt forbedre AI-løsninger inden for sundhedsvæsenet?
EHR-datasæt gør det muligt for AI-systemer at levere bedre diagnostik, prædiktiv indsigt og personlig behandling, hvilket forbedrer patientresultater og effektiviteten i sundhedsvæsenet.
12. Kan jeg få tilpassede EHR-datasæt?
Ja, Shaip tilbyder skræddersyede EHR-datasæt baseret på speciale, aldersgruppe, geografi eller projektkrav.
13. Hvad er forskellen på et EHR-datasæt og et EMR-datasæt?
Elektroniske patientjournaler (EMR'er) indeholder kliniske data fra en enkelt udbyder; elektroniske patientjournaler (EHR'er) spænder over hele plejeprocessen på tværs af flere udbydere, miljøer og tidsperioder. Shaip tilbyder både EHR- og EMR-datasætvarianter, med longitudinelle journaler fra flere udbydere tilgængelige for komplekse AI-træningskrav.
14. Hvordan afidentificeres EHR-data?
Alle journaler anonymiseres ved hjælp af HIPAA Privacy Rule Safe Harbor-metoden – hvor alle 18 PHI-identifikatorer fjernes, herunder navn, fødselsdato, adresse og journalnumre. Det anonymiserede MRN-felt bevares til journalkobling i datasættet, hvilket muliggør longitudinel analyse uden risiko for genidentifikation.