OpenAI o1, ER 트리아지에서 의사 능가 — 67% vs 55%, 그런데 저자가 "쓰지 말라"고 하는 이유
機械翻訳 / Machine-translated
하버드대학교와 Beth Israel Deaconess Medical Center(BIDMC)의 공동 연구에서 OpenAI의 o1-preview가 응급 외래의 초기 트리아지(triage)에서 의사를 능가했다고 보고했다. 정확도 67% 대 50~55%라는 수치만 보면 'AI 승리'라는 헤드라인이 나온다. 그런데 정작 논문 저자들 스스로가 이 결과가 의료 AI 기업의 홍보에 활용되는 것을 공개적으로 경계하고 있다 — 그 아이러니야말로 오늘 가장 주목해야 할 구조를 보여준다.
연구의 배경은 응급 외래의 '초기 트리아지'. 내원 환자의 긴급도를 5단계로 분류하는 과정으로, 오판은 직접적으로 환자의 예후에 영향을 미친다.
BIDMC의 실제 사례 데이터를 활용한 평가에서 o1-preview는 67%의 정답률을 기록했다. 베테랑 의사 그룹의 5055%를 약 1217포인트 상회한 수치다.
"논문 저자 본인들이 이 결과가 AI 의료 기업의 세일즈 포인트로 활용되는 것을 강하게 경계하고 있다"
— X(트위터)상의 연구 소개 중 (원문 취지를 요약)
2026년 5월 2일 시점에 논문 프리프린트가 유통 중이며, 동료 심사(peer review)를 거친 게재 이전 단계라는 점에도 주의가 필요하다.
의료 분야에서의 LLM 평가 연구는 2023년 이후 급증했으며, 미국 의사 국가고시(USMLE) 합격 수준 돌파나 GPT-4를 활용한 진단 정확도 검증 등 'AI vs 의사'의 구도를 전면에 내세운 발표가 이어져 왔다.
그러나 임상 현장에서는 '벤치마크상의 정확도'와 '실제 운용에서의 안전성' 사이에 깊은 간극이 존재한다. 트리아지는 단순한 지식 문제가 아니라, 환자의 표정·활력징후·문진을 실시간으로 통합 판단하는 과정이며, 텍스트 기반 사례 데이터로 평가한 정확도가 그대로 현장에 적용되는 것은 아니다.
연구자들이 경계하는 것은 이러한 맥락에서다. 67%라는 수치가 혼자 돌아다니게 됨으로써, 규제 정비가 따라잡기 전에 임상 도입 논의가 가속화될 리스크를 저자들 스스로 우려하고 있다.
이번 평가는 텍스트 사례 데이터에 대한 분류 정확도다. 실제 응급실에서는 비언어적 정보(호흡 상태·피부색·의식 수준)가 판단의 30~40%를 차지한다고 알려져 있으며, 텍스트 정확도의 높낮이는 필요조건의 일부에 불과하다.
이 수치가 낮아 보이는 이유는, 트리아지가 본질적으로 '분포의 양 끝(최중증·최경증)을 놓치지 않는 것'을 목표로 하는 과제이기 때문이다. 정답률의 절댓값보다 누락률·과대평가율의 내역이 임상적으로 더 중요하다. o1의 오류 분포는 현 시점에서 공개된 정보가 제한적이다.
AI 연구자가 스스로 상업적 활용에 제동을 거는 발언을 하는 사례는 드물다. 2024년 스탠퍼드 영상 진단 AI 논문 등 과거에 정확도 논문이 단순화되어 홍보에 전용된 사례에 대한 반성이 업계 내에 축적되고 있음을 보여주는 움직임으로 볼 수 있다.
FDA·PMDA 모두 AI 의료기기 승인 프로세스는 아직 정비 중이다. 동료 심사 이전의 논문 수치가 미디어나 기업 IR에 앞서 유통되는 패턴은, 규제 당국의 판단을 '기정사실'로 우회할 리스크를 내포한다.
이번에 사용된 것은 현행 o1 시리즈가 아닌 preview 버전이다. OpenAI가 o3·o4-mini로 추론 모델을 지속적으로 업데이트하고 있는 가운데, preview의 성능이 어떤 위치에 있는지를 명확히 한 뒤 비교할 필요가 있다.
이 논문이 주목받는 본질은 정확도 수치 자체가 아니라, '연구자가 결과 해석에 선제적으로 개입했다'는 구조에 있다.
AI 의료 연구에서는 오랫동안 논문 → 보도자료 → 미디어 보도 → 투자자 설명의 흐름으로 수치가 증폭·단순화되어 왔다. 저자가 경고를 논문에 담는 것은, 그 증폭 회로에 대한 내부로부터의 브레이크다.
한편, 67% 대 55%라는 차이가 통계적으로 유의미하다면, 그 자체는 무시할 수 없는 사실이다. 중요한 것은 '그러니 당장 임상에 도입해야 한다'도, '그러니 쓸모없다'도 아니라, 어떤 업무 흐름·어떤 감독 체계 하에서 부분적으로 통합할 것인지에 대한 설계 논의로 나아가는 일일 것이다.
한국의 응급의료 역시 만성적인 의사 부족 문제와 맞닿아 있다. ER 트리아지 지원 도구로서의 구체적인 검토가 2026년 내에 여러 대학병원에서 시작될 것으로 예상된다.
o1-preview가 ER 트리아지에서 의사를 능가했다 — 이 사실은 변하지 않는다. 다만 저자 자신의 경고가 보여주듯, 수치가 혼자 돌아다니는 것이야말로 지금 이 단계의 최대 리스크다. 정확도의 '바깥' — 측정되지 않은 변수, 오류 분포, 규제의 공백 — 을 읽지 않고 다음 수를 두면, 그 판단은 67%보다 낮은 정확도가 될 것이다.
당신이 'AI 의료'에 관여하는 입장이라면, 지금 물어야 할 것은 '쓸 수 있는가'가 아니라 '어디에 쓸 것인가, 어디에는 쓰지 않을 것인가'가 아닐까.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.