인공지능 및 머신러닝 프로젝트를 위한 개인 식별 정보가 제거된 전자 건강 기록(EHR) 데이터 세트

상업적으로 라이선스를 취득하고 HIPAA를 준수하는 전자 건강 기록 데이터는 임상 AI, 자연어 처리 및 예측 모델링에 바로 활용할 수 있습니다.

전자 건강 기록(ehr) 데이터

EHR 데이터란 무엇이며, AI에 왜 중요한가요?

AI/ML의 Ehr 데이터 세트

전자건강기록(EHR)은 병원, 외래진료소, 전문의 진료소, 검사실 등 의료기관 전반에 걸쳐 의료 서비스 제공자가 관리하는 장기적인 디지털 환자 기록입니다. 단일 의료기관에서 기록된 특정 시점의 정보만 담고 있는 전자의무기록(EMR)과 달리, EHR 데이터는 환자의 전체 진료 과정을 포괄하며 여러 의료기관에서의 상호 작용을 기록합니다.

Shaip의 익명화된 EHR 데이터 카탈로그는 이 두 가지 모두를 포괄하므로 의료 AI 개발의 모든 영역에 걸쳐 규정을 준수하는 단일 소스를 팀에 제공합니다.

EHR 데이터 세트에는 AI 개발에 필수적인 두 가지 데이터 유형이 포함되어 있습니다. 구조화 된 데이터 (인구 통계, ICD-10 진단 코드, DRG 코드, 투약 목록, 검사 결과, 활력 징후) 및 비정형 데이터 (임상 기록, 퇴원 요약, 영상의학과 보고서, 의사 구술 기록). EHR 정보의 약 80%는 비정형 데이터이므로 임상 NLP 모델 학습의 주요 자원이 됩니다.

의료 AI에 적합한 전자 건강 기록(EHR) 데이터 찾기

동급 최강의 교육 데이터로 기계 학습 모델을 개선하세요. Shaip은 AI 및 머신러닝 팀을 위해 특별히 설계된, 상업적으로 이용 가능한 익명화된 전자 건강 기록(EHR) 데이터 세트를 제공합니다. 당사의 기성 EHR 데이터 카탈로그는 20개 이상의 의료 전문 분야에 걸쳐 진단, 처방전, 검사 결과, 영상 보고서, 예방 접종 기록 및 임상 기록을 포함하는 구조화되고 연구 준비가 완료된 환자 기록을 제공하며, 모든 데이터는 HIPAA 세이프 하버 및 GDPR 표준에 따라 완벽하게 익명화되어 있습니다.

임상 의사결정 지원 시스템을 구축하든, 의사 진료 기록을 기반으로 자연어 처리(NLP) 모델을 학습시키든, 질병 예측 알고리즘을 개발하든, 의료 자동화 도구를 활용하든, Shaip의 EHR 데이터 세트는 AI 프로젝트에 필요한 깊이, 다양성 및 규정 준수 보장을 제공합니다. 즉시 라이선스 구매, 맞춤형 데이터 세트 선택 또는 샘플 다운로드가 가능합니다.

기성 전자 건강 기록(EHR):

  • 5.1개 전문 분야의 31백만 개 이상의 기록 및 의사 오디오 파일
  • Clinical NLP 및 기타 Document AI 모델을 훈련하기 위한 실제 세계 표준 의료 기록
  • MRN(익명), 입원 날짜, 퇴원 날짜, 체류 기간, 성별, 환자 등급, 지불인, 재정 등급, 주, 퇴원 처분, 연령, DRG, DRG 설명, $ 환급, AMLOS, GMLOS, 위험 사망률, 질병의 심각도, 그루퍼, 병원 우편번호 등
  • 다양한 미국 주 및 지역의 의료 기록 - 북동부(46%), 남부(9%), 중서부(3%), 서부(28%), 기타(14%)
  • 입원 환자, 외래 환자(임상, 재활, 반복, 외과 데이 케어), 응급 등 모든 환자 클래스에 속하는 의료 기록.
  • 모든 환자 연령 그룹에 속하는 의료 기록 10세 미만(7.9%), 11~20세(5.7%), 21~30세(10.9%), 31~40세(11.7%), 41~50세(10.4%) ), 51-60세(13.8%), 61-70세(16.1%), 71-80세(13.3%), 81-90세(7.8%), 90세 이상(2.4%)
  • 환자 성별 비율 46%(남성) 및 54%(여성)
  • HIPAA에 따라 세이프 하버 지침을 준수하는 PII 수정 문서
위치별 EHR 데이터
오시는 길 텍스트 문서
북동 4,473,573
남쪽 1,801,716
중서부 781,701
West 1,509,109
주요 진단 범주별 EHR 데이터
주요 진단 범주 텍스트 문서
알코올/마약 사용 및 알코올/마약 유발성 기질성 정신 장애48,717
모든 것을 포함한 합계(MDC 카테고리가 있는 케이스와 없는 케이스)8,566,687
환급이 없는 케이스가 생성됨(MDC가 지정되지 않음)790,697
외래 환자 사례(MDC 지정되지 않음)1,980,606
3M 등의 특수 그루퍼를 사용하는 경우(MDC 미지정)1,619,682
MDC 포함 합계4,175,702
알코올/마약 사용 또는 유도된 정신 장애48,717
화상444
3,549
남성 생식기9,230
인간 면역 결핍 바이러스 감염12,422
골수증식성 질환 및 장애, 미분화된 신생물15,620
건강 상태 및 기타 건강 서비스 접촉에 영향을 미치는 요소21,294
여성 생식기17,010
귀, 코, 입 및 목22,987
다발성 중대 외상27,902
순환기 시스템589,730
혈액, 조혈 기관 및 면역 질환48,990
부상, 중독 및 약물의 독성 효과64,097
피부, 피하 조직 및 유방89,577
간담도계 및 췌장127,172
내분비, 영양 및 대사 질환 및 장애142,808
주산기에 기원한 상태를 가진 신생아 및 기타 신생아163,605
임신, 출산 및 산욕기165,303
신장 및 요로209,561
정신 질환 및 장애282,501
신경계316,243
소화 시스템346,369
근골격계 및 결합 조직329,344
호흡계561,983
감염 및 기생충 질환559,244

우리는 텍스트, 오디오, 비디오 또는 이미지와 같은 모든 유형의 데이터 라이선스를 다룹니다. 데이터 세트는 ML용 의료 데이터 세트로 구성됩니다. 의사 받아쓰기 데이터 세트, 의사 임상 노트, 의료 대화 데이터 세트, 의료 전사 데이터 세트, 의사-환자 대화, 의료 텍스트 데이터, 의료 이미지 – CT 스캔, MRI, 초음파(수집된 기본 사용자 정의 요구 사항) .

AI/ML에서 EHR 데이터세트의 실제 적용

  • 질병 예측 및 진단: 당뇨병, 암, 심혈관 질환 등의 질병을 예측하기 위해 AI 모델을 훈련합니다.
  • 임상 의사 결정 지원구조화된 EHR 데이터를 사용하여 진단 권장 사항을 제시하고, 약물 상호작용을 표시하며, 치료 계획 수립을 지원하는 모델을 학습시킵니다.
  • 맞춤 의학: 인구 통계 및 진단 데이터를 사용하여 개인화된 치료 계획을 추천합니다.
  • 의료 자동화: EHR 데이터 세트를 기반으로 훈련된 NLP 기반 도구를 사용하여 약속 일정 예약이나 청구와 같은 관리 작업을 자동화합니다.
  • 예측 의료 모델링 — 장기 환자 기록, DRG 코드 및 질병 중증도 점수를 사용하여 위험 계층화 및 질병 예측 모델을 구축합니다. 
  • 실제 증거(RWE) 연구 — 다양한 환자 코호트에 걸쳐 EHR 결과 데이터를 분석하여 시판 후 증거 및 약물감시 관련 통찰력을 생성합니다.
  • 임상 기록용 자연어 처리 — 주석이 달린 EHR 학습 데이터를 사용하여 비정형 의사 진료 기록 및 퇴원 요약에서 개체, 상태 및 절차를 추출합니다.

EHR 데이터세트를 위해 Shaip을 선택하는 이유는 무엇입니까?

전문 인력

숙련된 전문가가 정확하고 고품질의 데이터 주석을 보장합니다.

규제 준수

HIPAA 및 GDPR을 준수하는 완전히 익명화된 데이터 세트입니다.

경쟁력 있는 가격

품질 저하 없이 비용 효율적인 솔루션을 제공합니다.

편향 없는 데이터

엄격한 프로토콜을 통해 편견을 없애고 신뢰할 수 있는 AI 결과를 보장합니다.

빠르고 정확함

간소화된 프로세스를 통해 다양하고 고품질의 데이터를 빠르게 제공합니다.

가용성 및 배송

높은 네트워크 가동 시간 및 데이터, 서비스 및 솔루션의 정시 제공.

대규모로 검증됨

구글과 주요 헬스케어 AI 기업들이 신뢰하는 제품입니다. 6시그마 블랙벨트 프로세스와 의료 전문가 검토를 통해 품질 관리를 거쳤습니다.

상용화 준비 완료

Shaip의 기성 EHR 카탈로그는 라이선스가 부여되었고, 개인 식별 정보가 제거되었으며, 지금 바로 Databricks Marketplace를 통해 다운로드하거나 이용할 수 있습니다.

전체 수명 주기 지원

원시 데이터에 주석을 추가해야 하시나요? Shaip은 단일 파트너를 통해 비식별화, 임상 NER 라벨링 및 데이터 증강 기능을 제공합니다.

샤이프 문의하기

찾고 있는 것을 찾을 수 없습니까?

모든 데이터 유형에서 새로운 기성 의료 데이터 세트가 수집되고 있습니다. 

헬스케어 트레이닝 데이터 수집 고민은 지금 바로 연락주세요

  • 이 필드는 검증 목적이며 변하지 남아 있어야합니다.
  • 등록함으로써 Shaip에 동의합니다. 개인정보 처리방침 서비스약관 그리고 Shaip의 B2B 마케팅 커뮤니케이션 수신에 동의합니다.

EHR 데이터 세트는 질병 예측, 임상적 의사 결정, 개인화된 치료를 위한 AI 모델을 훈련하는 데 사용됩니다.

EHR 데이터는 임상적 의사결정 지원, 질병 예측, 개인화된 치료 계획, 의료 자동화를 위한 AI 모델을 훈련하는 데 사용됩니다.

네, 모든 EHR 데이터는 개인 식별 정보(PII)를 제거하고 개인정보 보호 규정을 준수하기 위해 익명화됩니다.

EHR 데이터에는 환자 인구 통계, 병력, 진단, 치료 계획, 실험실 검사 결과, 방사선 이미지(예: CT, MRI, X선), 처방전 및 예방 접종 기록과 같은 세부 정보가 포함됩니다.

네, 데이터는 HIPAA, GDPR 및 기타 글로벌 개인정보 보호 표준을 준수하여 안전하고 윤리적인 사용을 보장합니다.

네, 데이터 세트는 특정 의료 전문 분야, 지역, 환자 인구 통계 또는 프로젝트 요구 사항에 따라 맞춤화될 수 있습니다.

네, 데이터 세트는 AI 및 ML 워크플로에 쉽게 통합할 수 있도록 표준 형식(예: JSON, CSV)으로 제공됩니다.

데이터는 정확성, 일관성, 신뢰성을 보장하기 위해 엄격한 검증과 품질 검사를 거칩니다.

비용은 데이터 양, 맞춤 설정, 프로젝트 범위 등의 요인에 따라 달라집니다. 최적의 견적을 받으시려면 "문의하기" 양식을 작성해 주세요.

납품 일정은 프로젝트 규모와 복잡성에 따라 다르지만 합의된 마감일을 충족하도록 설계되었습니다.

EHR 데이터 세트를 사용하면 AI 시스템이 더 나은 진단, 예측적 통찰력, 개인화된 치료를 제공하여 환자 결과와 의료 효율성을 개선할 수 있습니다.

네, Shaip은 전문 분야, 연령대, 지역 또는 프로젝트 요구 사항에 따라 맞춤형 EHR 데이터 세트를 제공합니다.

전자 의료 기록(EMR)은 단일 의료 제공자의 임상 데이터를 포함하고, 전자 건강 기록(EHR)은 여러 의료 제공자, 진료 환경 및 기간에 걸친 전체 진료 과정을 기록합니다. Shaip은 복잡한 AI 학습 요구 사항을 충족하기 위해 여러 의료 제공자의 장기적인 진료 기록을 포함한 EHR 및 EMR 데이터 세트를 모두 제공합니다.

모든 기록은 HIPAA 개인정보보호법(Safe Harbor Method)에 따라 익명화 처리됩니다. 이름, 생년월일, 주소, 의료 기록 번호를 포함한 18가지 개인 건강 정보(PHI) 식별자가 모두 제거됩니다. 익명화된 의료 기록 번호(MRN) 필드는 데이터 세트 내 기록 연결을 위해 유지되므로 재식별 위험 없이 장기적인 분석이 가능합니다.