의료 AI를 위한 의료 데이터 카탈로그

의료 AI 프로젝트를 시작하기 위한 기성 의료/의료 데이터 세트

의료 데이터 카탈로그

기계 학습을 위한 의료 및 의료 데이터 세트

샤이프 의료 데이터 카탈로그에는 무엇이 포함되어 있습니까?

샤이프 의료 데이터 카탈로그는 HIPAA(미국 의료정보 보호법)를 준수하는 즉시 사용 가능한 익명화된 의료 교육 데이터 라이브러리로, 31개 의료 전문 분야에 걸쳐 257,977시간 분량의 의사 음성 녹음, 전사된 의료 기록, 전자 건강 기록 및 멀티모달 데이터 세트를 포함합니다. 각 데이터 세트는 상업용 AI 교육에 사용할 수 있도록 라이선스가 부여되었으며, 세이프 하버(Safe Harbor) 또는 전문가 판단에 의한 익명화 처리가 적용되어 제공됩니다.

의사 받아쓰기 오디오 데이터

의료를 위한 익명화된 데이터 세트에는 의사가 임상 환경에서 의사-환자 접촉을 바탕으로 환자의 임상 상태와 치료 계획을 설명하는 31개 전문 분야의 오디오 파일이 포함되어 있습니다.

기성 의사 받아쓰기 오디오 파일:

  • 257,977개 전문 분야의 31시간 분량의 실제 의사 받아쓰기 음성 데이터 세트를 사용하여 의료 음성 모델을 훈련합니다.
  • 전화 받아쓰기(54.3%), 디지털 녹음기(24.9%), 음성 마이크(5.4%), 스마트폰(2.7%) 및 알 수 없음(12.7%)과 같은 다양한 장치에서 캡처한 받아쓰기 오디오
  • HIPAA에 따라 세이프 하버 지침을 준수하는 PII 수정 오디오 및 대본
의사 받아쓰기 오디오 데이터

필사본 의료 기록

의료 기록 필사란 의사와 환자 간의 대화, 진료 기록, 그리고 의료 평가 내용을 필사하는 것을 말합니다. 이는 향후 진료를 위해 환자의 병력을 체계적으로 정리하는 데 도움이 되며, 의사에게 참고 자료로 활용됩니다. 환자의 현재 상태를 평가하고 적절한 치료를 제안하는 데에도 도움이 됩니다.

기성 필사 의료 기록:

  • 257,977개 전문 분야의 실제 의사 받아쓰기 31시간을 전사하여 Healthcare Speech 모델 훈련
  • 수술 보고서, 퇴원 요약, 진료 기록, 입원 기록, ED 기록, 진료 기록, 방사선 보고서 등 다양한 업무 유형의 의무 기록
  • HIPAA에 따라 세이프 하버 지침을 준수하는 PII 수정 오디오 및 대본
전사된 의료 기록

전자 건강 기록(EHR)

전자 건강 기록 또는 EHR은 환자의 병력, 진단, 처방, 치료 계획, 예방 접종 또는 예방 접종 날짜, 알레르기, 방사선 영상(CT 스캔, MRI, X-레이) 및 실험실 검사 등이 포함된 의료 기록입니다.

기성 전자 건강 기록(EHR):

  • 5.1개 전문 분야의 31백만 개 이상의 기록 및 의사 오디오 파일
  • Clinical NLP 및 기타 Document AI 모델을 훈련하기 위한 실제 세계 표준 의료 기록
  • MRN(익명), 입원 날짜, 퇴원 날짜, 체류 기간, 성별, 환자 등급, 지불인, 재정 등급, 주, 퇴원 처분, 연령, DRG, DRG 설명, $ 환급, AMLOS, GMLOS, 위험 사망률, 질병의 심각도, 그루퍼, 병원 우편번호 등
  • 다양한 미국 주 및 지역의 의료 기록 - 북동부(46%), 남부(9%), 중서부(3%), 서부(28%), 기타(14%)
  • 입원 환자, 외래 환자(임상, 재활, 반복, 외과 데이 케어), 응급 등 모든 환자 클래스에 속하는 의료 기록.
전자 건강 기록(ehr)
  • 모든 환자 연령 그룹에 속하는 의료 기록 10세 미만(7.9%), 11~20세(5.7%), 21~30세(10.9%), 31~40세(11.7%), 41~50세(10.4%) ), 51-60세(13.8%), 61-70세(16.1%), 71-80세(13.3%), 81-90세(7.8%), 90세 이상(2.4%)
  • 환자 성별 비율 46%(남성) 및 54%(여성)
  • HIPAA에 따라 세이프 하버 지침을 준수하는 PII 수정 문서

구매자들이 선택하는 다섯 가지 이유 라이선스 Shaip 꿰매는 대신에.

샤이프 의료 데이터 카탈로그가 존재하는 이유는 다음과 같습니다. 대부분의 의료 AI 팀은 9개월에서 12개월을 허비합니다. 단일 모델을 학습시키기 전에 규정을 준수하는 학습 데이터를 확보하는 것입니다. 해당 월의 데이터가 반환되면 다음과 같은 변경 사항이 발생합니다.

01

대부분의 팀이 따라잡을 수 없는 카탈로그 규모.

Shaip 카탈로그는 다음과 같은 내용을 포함합니다. 257,977 시간 의사의 구술 내용, 녹취록 31개 의료 전문 분야또한 모든 연령대의 환자를 포괄하는 EHR 기록 등 구매자가 활용할 수 있는 방대한 양의 데이터가 있습니다. 여러 개의 공개 데이터셋을 짜깁기하지 않고도 모델을 학습하고 평가할 수 있습니다..

02

규정 준수는 시작 조건이지, 특징이 아닙니다.

모든 Shaip 의료 데이터 세트는 다음과 함께 제공됩니다. HIPAA 세이프 하버 기본 비식별화요청 시 전문가 감정, GDPR 준수 처리, 그리고 대상 기업을 위한 BAA(사업 제휴 계약) 준비까지 모두 지원합니다. 구매자는 사후에 규정 준수를 위한 추가적인 조치를 취할 필요가 없습니다.

HIPAA 안전 항구 전문가 결정 GDPR 준수 BAA 준비 완료
03

일반적인 군중 참여자가 아닌, 의료 분야 교육을 받은 전문가들입니다.

Shaip 의료 목록에 대한 주석, 전사 및 품질 보증은 다음 담당자가 수행합니다. 의료 교육을 받은 전문가Shaip 워크플로는 다단계 QA와 임상 정확도 표준에 맞춰 조정된 사람 참여 검증을 포함합니다.

04

지금 바로 구매 가능한 기성품도 있고, 주문 제작도 가능합니다.

구매자는 기존 Shaip 데이터 세트를 즉시 라이선스하거나 특정 인구 통계, 지역, 언어 및 방식에 맞춰 맞춤형 데이터 수집을 의뢰할 수 있습니다. 벤더를 변경하거나 규정 준수 검토를 다시 실행하지 않고도.

05

데이터 팀이 이미 근무하는 곳에서 이용 가능합니다.

Shaip의 익명 처리된 EHR 및 의사 음성 녹음 데이터 세트는 다음에서 이용할 수 있습니다. Databricks 마켓플레이스데이터 및 머신러닝 팀에서 이미 사용하고 있는 JSON, CSV, WAV 형식으로 제공됩니다. 계약 전에 샘플 데이터 세트를 받아보실 수 있습니다.

JSON CSV WAV FHIR

보안 및 컴플라이언스

GDPR
HIPAA
ISO 9001:2015
SOC 2 유형 II
ISO 27001
샤이프 문의하기

찾고 있는 것을 찾을 수 없습니까?

모든 데이터 유형에서 새로운 기성 의료 데이터 세트가 수집되고 있습니다. 

헬스케어 트레이닝 데이터 수집 고민은 지금 바로 연락주세요

  • 이 필드는 검증 목적이며 변하지 남아 있어야합니다.
  • 등록함으로써 Shaip에 동의합니다. 개인정보 처리방침 서비스약관 그리고 Shaip의 B2B 마케팅 커뮤니케이션 수신에 동의합니다.

의료 데이터 세트는 AI/ML 모델을 학습, 평가 및 개선하는 데 사용되는 의료 데이터입니다. 여기에는 의사의 음성 녹음, 전사된 의료 기록, 전자 건강 기록, 합성된 의사-환자 대화, 그리고 관련 텍스트, 음성 및 구조화된 임상 데이터를 결합한 멀티모달 의료 데이터 세트가 포함될 수 있습니다.

샤이프 의료 데이터 카탈로그는 의사 음성 녹음, 전사된 의료 기록, 전자 건강 기록, 의사와 환자 간의 합성 대화, 그리고 환자 또는 진료 기록 수준에서 텍스트, 음성 및 구조화된 임상 데이터를 연결하는 멀티모달 데이터 세트를 포함합니다. 이 카탈로그는 31개 의료 전문 분야에 걸쳐 257,977시간 분량의 의사 음성 녹음을 제공하며, 상업용 AI 학습에 사용할 수 있습니다.

예. Shaip의 의료 데이터 세트는 HIPAA 세이프 하버(Safe Harbor) 규정에 따라 기본적으로 익명화되어 HIPAA 개인정보 보호 규칙에 명시된 18가지 식별자 범주가 제거됩니다. 통계 인증이 필요한 경우 전문가 판정 익명화도 가능하며, Shaip은 BAA(사업 제휴 계약)를 준수하여 관련 기관에서 사용할 수 있습니다.

예. Shaip의 의료 데이터 세트는 프로젝트 범위, 지역, 데이터 유형 및 계약 요구 사항에 따라 HIPAA, GDPR 및 기타 관련 의료 데이터 요구 사항을 충족하도록 준비될 수 있습니다.

두 가지 옵션 모두 이용 가능합니다. Shaip은 Shaip 의료 데이터 카탈로그를 통해 상업용 AI 학습에 사용할 수 있는 기성 의료 데이터 세트를 제공합니다. 프로젝트에 특정 언어, 인구 통계, 전문 분야, 영상 진단 방식 또는 임상 환경이 필요한 경우, Shaip은 동일한 규정 준수 기준에 따라 맞춤형 의료 데이터 수집도 진행할 수 있습니다.

예. Shaip은 전문 분야, 환자 연령대, 성별, 지역, 언어, 검사 방식, 임상 환경, 형식, 용량 및 프로젝트 요구 사항에 따라 의료 데이터 세트를 맞춤 설정할 수 있습니다. 맞춤형 데이터 세트는 작업 명세서를 통해 범위가 정해지며, 적용 가능한 개인 식별 정보 삭제 및 규정 준수 기준을 따릅니다.

네. Shaip은 AI 팀이 라이선스를 취득하기 전에 형식, 품질, 인구 통계학적 범위 및 모델 적합성을 평가할 수 있도록 NDA(비밀유지협약)에 따라 대표적인 샘플 데이터 세트를 제공합니다. 샘플 접근은 일반적으로 표준 라이선스 또는 맞춤형 데이터 수집 계약을 체결하기 전 첫 번째 단계입니다.

Shaip은 구조화된 기록의 경우 JSON, CSV, FHIR을 비롯한 AI 친화적인 형식으로 의료 데이터 세트를 제공하며, 오디오 데이터의 경우 WAV 파일과 해당 음성 파일의 전사본을, 음성 및 언어 데이터 세트의 경우 전사본 파일을 제공합니다. 멀티모달 데이터 세트에는 텍스트, 오디오 및 구조화된 임상 기록을 연결하는 매니페스트 파일이 포함될 수 있습니다.

Shaip은 전문가 검토, 분야별 전문가 주석, 검증 워크플로 및 체계적인 QA 검사를 통해 의료 데이터 세트의 품질을 보장합니다. 이러한 프로세스는 의료 AI 개발을 위한 정확성, 신뢰성 및 모델 준비 상태를 확보하는 데 도움이 됩니다.

네. Shaip의 의료 데이터 세트는 소규모 파일럿 프로젝트부터 기업용 AI/ML 프로젝트까지 확장 가능합니다. 대량의 의료 기록, 구조화된 임상 데이터, 녹취록 또는 수십만 시간 분량의 의사 음성 녹음 파일이 필요한 프로젝트도 지원할 수 있습니다.

네. Shaip은 JSON, CSV, FHIR, WAV 및 전사 파일과 같은 바로 사용할 수 있는 형식으로 의료 데이터 세트를 제공합니다. 이러한 형식은 기존 AI, ML, NLP, 음성, 의료 언어 모델(LLM) 및 멀티모달 모델 개발 워크플로에 통합할 수 있도록 지원합니다.

일반적으로 기성 의료 데이터 세트는 샘플 검토, 계약 체결 및 라이선스 확정 후 며칠 내에 제공될 수 있습니다. 맞춤형 데이터 수집 일정은 프로젝트 범위, 데이터 세트 크기, 방식, 규정 준수 요건 및 복잡성에 따라 달라지며, 작업 명세서에 명시됩니다.

의료 데이터 세트 비용은 데이터 세트 유형, 방식, 용량, 맞춤 설정 요구 사항, 라이선스 조건, 납품 일정 및 규정 준수 요구 사항에 따라 달라집니다. 팀은 문의 양식을 통해 요구 사항을 공유하여 맞춤 견적을 받을 수 있습니다.

정확하고 신뢰할 수 있으며 임상적으로 유용한 의료 AI 모델을 학습시키려면 고품질 의료 데이터 세트가 필수적입니다. 이러한 데이터 세트는 의료 문서 작성, 임상 자연어 처리, 음성 인식, 요약, 의사 결정 지원, 자동화, 환자 관리 워크플로 및 의료 데이터 인텔리전스를 개선하는 데 도움이 됩니다.