최신 뉴스
오늘의 주요 소식을 한눈에 정리합니다
#news#이란#미국#AI

원본 기사

Clinical chatbots are taking medicine by storm. Should doctors trust them?
📰
Clinical chatbots are taking medicine by storm. Should doctors trust them?
STAT statnews.com
🕐 2026년 7월 29일 PM 05:33
기사

임상 AI 챗봇, 범용 모델보다 성능 떨어져…의사들 신뢰 논란

NYU 랑곤 헬스 연구팀이 임상 특화 AI가 범용 LLM보다 임상 질문 응답에서 성능이 낮다는 결과를 네이처 메디신에 발표해 의료 AI 신뢰성 논쟁이 가열되고 있다.
Wed Jul 29 2026

미국에서 수십만 명의 의사가 임상 특화 AI 챗봇을 사용하고 있지만, 최근 연구 결과 이 도구들이 빅테크의 범용 모델보다 오히려 성능이 낮다는 사실이 확인되면서 의료계에 파장이 일고 있다.

임상 AI, 범용 모델에 뒤처진 벤치마크 결과

NYU 랑곤 헬스 연구팀은 OpenEvidence, Doximity, UpToDate Expert AI 등 임상 특화 대형언어모델(LLM)과 범용 모델을 세 가지 임상 질문 세트로 비교 평가한 결과를 올해 6월 국제 학술지 *네이처 메디신*에 발표했다. 결론은 충격적이었다. 임상 AI가 범용 모델보다 낮은 성능을 보인 것이다.

'안전한 대안'이라는 마케팅에 의문

OpenEvidence, Doximity, UpToDate 등의 임상 AI 기업들은 빅테크 범용 모델의 '환각(hallucination)' 위험을 극복한 안전한 대안으로 자사 제품을 홍보해왔다. 그러나 이번 연구는 그 주장에 근거를 요구한다. 일부 개발사는 현행 벤치마크 방법론 자체가 결함이 있다며 반박하고 있어, 임상 AI 평가 기준을 둘러싼 논쟁은 계속될 전망이다.

한국 의료 AI 도입에도 시사점

국내에서도 의료 AI 솔루션 도입이 빠르게 확산되는 가운데, 이번 연구는 임상 특화 AI라는 라벨만으로 신뢰를 부여하는 것이 위험할 수 있음을 시사한다. 식품의약품안전처와 의료계는 AI 의료기기의 실제 임상 성능을 검증하는 독립적 평가 체계의 필요성을 재검토할 필요가 있다.

*출처: STAT (2026-07-29)*

공유 Facebook X 이메일

관련 기사

📧 뉴스레터 구독

매일 아침 글로벌 뉴스 브리핑을 이메일로 받아보세요.

아직 무료입니다.