인공지능 의료기술의 부상과 평가 패러다임의 진화
인공지능(artificial intelligence, AI)이 우리 생활에 직접적인 영향을 주고 있다. AI 의료기술은 흉부 X선과 컴퓨터단층촬영(computed tomography) 판독을 보조하는 영상 AI, 광간섭단층영상(optical coherence tomography)과 안저영상을 분석해 망막질환 진단을 돕는 AI, 유방암의 림프절 전이 여부 평가, 전립선암과 대장암의 디지털 병리 슬라이드를 분석해 암 의심 부위를 표시하거나 병리의가 우선 확인해야 할 영역을 제시하는 AI, 전자의무기록을 바탕으로 생체 신호, 각종 검사 결과, 약물 사용 과거력 등을 종합한 패혈증 위험 예측 AI 등의 영역으로 확산되고 있다. 미국 식품의약국(Food and Drug Administration, FDA)의 AI-enabled medical devices 목록에는 2026년 5월 27일 현재 AI/machine learning 기반 의료기기 1,431건이 보고되어 있다[
1]. 한국 식품의약품안전처도 의료영상 AI, 디지털치료기기 등 다양한 품목을 허가한 바 있다. 최근에는 의료기기형 AI뿐 아니라, 이들과는 규제 범주가 상이한 면담 및 문서화를 통한 임상업무 지원용 생성형 AI의 도입도 증가하고 있다.
AI 의료기술은 전통적인 의료기술과 여러 면에서 다르기 때문에, 이를 평가하는 방법 역시 AI의 특성에 맞게 보완될 필요가 있다. 첫째, AI의 성능은 어떤 데이터를 학습했는지에 좌우되므로, 특정 기관이나 환자군에서 개발된 알고리즘이 다른 의료기관이나 인구집단에서도 동일한 성능을 보인다고 단정하기 어렵다. 둘째, 일부 알고리즘, 특히 업데이트와 재학습이 빈번하거나 지속학습을 허용하는 기술은 배포 이후에도 성능이 변동될 수 있으므로, 단 한 번의 허가나 평가만으로 장기적 안전성과 유효성을 담보하기 어렵다. 셋째, 모형의 불투명성, 즉 블랙박스(black box) 특성으로 인해 임상 의사결정의 근거와 책임 소재가 모호해질 수 있다. 넷째, 인간 사용자와 AI 간 상호작용이 임상 결과에 영향을 미칠 수 있으므로 알고리즘 기술 자체의 정확도만으로는 임상적 가치를 단정할 수 없다. 이러한 특성들은 오랫동안 사용되어 온 의료기술평가(health technology assessment, HTA) 방법론에 대해 근본적 재검토를 요구하고 있다.
근거기반의학의 핵심 원칙과 인공지능 의료기술평가
근거기반의학(evidence-based medicine, EBM)은 ‘최선의 연구 근거와 임상 전문성, 환자의 가치관을 통합한 의사결정’을 지향한다[
2]. 체계적 문헌고찰(systematic review)과 비뚤림 위험(risk of bias) 평가, Grading of Recommendations Assessment, Development and Evaluation (GRADE) 방법론을 통한 근거의 확실성 평가는 지난 30여 년간 임상진료지침 제정과 의료기술평가의 핵심 도구로 정착되었다[
3]. 이는 AI 의료기술평가에서도 유효한 원칙이다. 알고리즘의 진단 정확도가 아무리 높더라도 그 근거가 단일 기관의 후향적 분석에 머문다면 임상적 권고의 강도는 높을 수 없으며, 임상진료의 결과에 미치는 영향이 입증되지 않은 알고리즘의 성능을 기준으로 바로 진료에 도입할 수는 없다[
4]. 다만 EBM이 본래 무작위배정임상시험(randomized controlled trial, RCT)을 정점으로 하는 위계적 근거 체계를 적용한다는 점에서, 근거가 축적되지 않은 혁신적 AI 의료기술평가에서는 방법론적 변화가 필요하다는 인식도 확산되고 있다. AI 의료기술평가에서는 알고리즘 개발, 외부 검증, 임상 적용으로 이어지는 단계별 근거 생성 과정을 고려해야 한다. 따라서 진단 정확도 연구, 임상적 영향 평가, 전향적 코호트 연구 결과를 함께 검토하는 다층적 근거 합성이 중요하다. EBM의 원칙은 유지하되 그 적용 방식은 AI의 특성에 맞게 정교화되어야 한다. 즉, EBM의 핵심은 RCT가 ‘만능’이 아니라 질문에 맞는 최적 설계와 편향 통제, 그리고 근거의 확실성 평가에 있으므로, AI 의료기술평가는 개발–검증–도입–사후감시 단계에 맞춰 근거 생성 전략을 재구성하되 EBM의 원칙은 유지되어야 할 것이다.
인공지능 의료기술을 위한 새로운 평가 기준
AI 의료기술평가를 지원하기 위한 국제 보고·평가 지침이 최근 잇따라 발표되고 있다. AI 의료기술 관련 임상시험 보고·평가 지침은 CONSORT-AI [
5]와 SPIRIT-AI [
6], 예측모형 보고 지침은 TRIPOD+AI [
7], AI 임상 도입 초기 평가는 DECIDE-AI [
8]가 각각 평가 틀을 제시하고 있다. 이들 지침은 체계적 문헌고찰과 GRADE 평가 등 EBM의 핵심 절차에 활용될 수 있다.
그러나 이상의 보고 표준 지침만으로 모든 문제가 해결되지는 않는다. 다수의 AI 연구는 여전히 (1) 외부 검증 없이 단일 데이터에 의존하고, (2) area under the receiver operating characteristic curve (AUROC) 등 알고리즘 성능 지표 개선에 치우쳐 있으며, (3) 비교군 설계가 부적절하다는 한계를 안고 있다. 최근에는 데이터 편향, 공정성 및 환경적 영향까지 포괄하는 후속 평가 프레임워크에 관한 논의도 등장하고 있는데, 앞으로 표준 지침들을 통합하여 적용할 수 있는 방법론적 가이드라인 마련이 시급하다.
실사용 근거와 주기적 평가 체계로의 변환
AI 의료기술의 또 다른 특성은 ‘임상 도입 후에도 변화하는 기술’이라는 점이다. 미국 FDA의 사전허가변경계획(predetermined change control plan) [
9]과 유럽연합의 인공지능법(EU AI Act, 2024) [
10]은 학습 알고리즘의 변화 자체를 규제 대상에 포함하고, 시판 후 감시와 실사용 성능 모니터링을 시행하도록 규정하고 있다. 따라서 의료기술평가도 일회성 평가가 아니라 ‘살아 있는 평가(living HTA)’로 전환할 필요가 있다. 최근에는 리빙 체계적 문헌고찰(living systematic review) 및 리빙 가이드라인(living guideline)처럼 새로운 근거가 축적될 때마다 일정 기간마다 결론과 권고를 갱신하는 접근이 확산되고 있다[
11]. 그러므로 AI 의료기술에 대한 모형의 외부 검증, 성능저하 감지, 하위 표본집단 간의 성능격차 등을 실사용 근거(real-world evidence)로 지속 모니터링하는 평가 체계를 마련하고[
12], 이를 위한 표준화된 임상 데이터 인프라 구축이 동시에 이루어져야 한다.
국제 표준인 Observational Medical Outcomes Partnership (OMOP) 공통데이터모델[
13]을 기반으로 한 국내 청구·임상 데이터는 다기관 외부 검증과 시판 후 성능 추적에 활용될 수 있다. 우리나라 국민건강보험공단과 건강보험심사평가원의 청구 자료, 국가 단위 등록자료, 거점 병원의 임상 정보가 결합된 국가 단위 ‘대용량 데이터 자산’은 한국이 AI 평가에서 비교우위를 가질 수 있는 핵심 기반이 될 수 있을 것이다.
의료기술평가 제도와 한국보건의료연구원
우리나라는 의약품 및 의료기기의 허가와는 별도로 신의료기술평가(new health technology assessment, nHTA) 제도를 운영하고 있다. 한국보건의료연구원(National Evidence-based Healthcare Collaborating Agency, NECA)은 2009년 설립 이래 합성된 근거를 기반으로 신의료기술의 임상적 안전성과 유효성에 대해 평가해왔다[
14]. AI 기반 의료기술을 정확하게 평가하기 위해 NECA는 기존 평가 방법론을 AI 기술의 특성에 맞게 수정 적용하며 평가 과정을 향상시키고 있다. 구체적으로 (1) AI 의료기술평가를 위한 별도 평가 가이드라인의 개발 및 고도화, (2) 디지털 의료기술 및 AI 기반 기술 도입의 장단점을 종합적으로 고려한 혁신의료기술평가와 제한적 의료기술평가 등 근거가 충분히 축적되지 않은 기술의 단계적 시장 진입을 허용하는 선진입제도 운영하며 임상 진입 이후의 평가를 강화하여 안전성과 유효성을 지속적으로 검증하는 사후 평가체계 마련, (3) AI 의료기술평가를 위한 국제 보고·평가 표준 지침의 적극 도입, (4) 산업화 경험이나 역량이 충분하지 않은 연구자·벤처 단계 개발자를 지원하기 위한 근거창출 지원 사업 도입을 추진해 왔다. NECA가 수행 중인 환자중심 의료기술 최적화 연구(PACEN) 사업은 향후 AI 의료기술의 비교효과와 임상적 가치를 실증하는 공익적 임상연구 플랫폼으로 활용될 수 있다. 또한 NECA는 보건의료 빅데이터 플랫폼 사업, OMOP-CDM 기반 다기관 네트워크 연구, 실사용근거 활용체계를 수립하여 AI 의료기술평가에 필요한 데이터 인프라 구축에도 기여하고 있다.
이러한 노력을 바탕으로 향후 식품의약품안전처의 허가, NECA의 의료기술평가, 건강보험심사평가원의 급여 결정 세 단계를 유기적으로 연계하여 단계별 근거 요건을 정합적으로 설계하는 것이 핵심 과제이다. 그러므로 AI 의료기술의 도입 후 모니터링과 재평가로 이어지는 ‘근거 생애주기’ 관리 및 평가에서 NECA의 역할은 더욱 중요해질 것으로 전망된다.
향후 과제와 미래 전망
AI 시대의 의료기술평가는 임상의학, 통계학, 보건경제학, 법학·윤리학 등 다양한 분야의 협력이 필요하다. 평가의 신뢰성을 높이기 위해서는 평가 전문 인력 양성, 임상의사의 적극적 참여, 환자와 시민 관점의 반영, 평가 결과의 투명한 공개와 국제 협력이 함께 이루어져야 한다.
AI 의료기술은 특정 인구집단이나 의료기관, 진료환경에 편중될 경우 의료 격차를 심화시킬 수 있다. 따라서 AI 의료기술을 평가할 때에는 임상적 유효성과 비용효과성뿐 아니라 형평성, 접근성, 환자 가치 등 다양한 요소를 함께 고려해야 한다.
EBM은 근거가 충분하지 않은 상황에서도 가장 합리적인 판단을 돕는 방법론이라는 점에서 AI 시대에도 여전히 중요하다. 알고리즘이 임상 의사결정의 일부를 담당하게 될수록, 그 판단이 어떤 근거에 기반하는지, 누구에게 어떤 영향을 미치는지, 어떻게 검증되었는지를 묻는 EBM의 정신은 더욱 중요해지기 때문이다.
의료기술평가 제도는 AI와 디지털 기술의 발전을 지원하면서도 국민의 안전을 보호하고 보건의료자원이 합리적으로 사용되도록 하는 역할을 해야 한다. 따라서 AI 시대의 의료기술평가는 기술 혁신에 대응하면서도 환자 중심과 근거 중심이라는 본질을 지켜 나가야 한다.
NECA는 그동안 축적한 평가 경험과 연구 역량을 바탕으로 AI 시대 의료기술평가의 방법론적·제도적 전환에 적극적으로 대응해 나가야 할 것이다.