Perspect Med Educ. 2026 Sep 29;15(1):959-969.doi: 10.5334/pme.2593. eCollection 2026.

Validity in the Era of Competency-Based Health Professions Education: Tensions and Potential Solutions 

 

 

역량바탕교육 시대의 평가 타당도: 세 가지 긴장과 해법 (Ryan et al., 2026)

Ryan MS, Touchie C, Frank JR, Chen HC, Kinnear B, as members of the International Competency-Based Health Professions Education Collaborators. Validity in the Era of Competency-Based Health Professions Education: Tensions and Potential Solutions. Perspectives on Medical Education. 2026;15(1):959–969. https://doi.org/10.5334/pme.2593

📌 한눈에 보기

  • 역량바탕 보건의료인교육(competency-based health professions education, CBHPE)으로 오면서 평가 방식만 바뀐 게 아니에요. 평가 결과를 믿을 수 있는지 따지는 방식, 즉 타당도(validity) 를 논증하는 방식도 다시 생각해야 해요.
  • 저자들은 세 가지 긴장(tension)을 짚어요.
    • ① 어떤 패러다임(paradigm) 으로 평가를 볼 것인가,
    • ② 개별 도구와 평가 시스템 중 어느 수준(level) 에서 타당화할 것인가,
    • ③ 무엇을 역량의 기준점(reference for competence) 으로 삼을 것인가.
  • 세 긴장 모두에 대한 저자들의 답은 비슷해요. 한쪽을 고르지 말고, 평가 목적에 맞게 균형(balance) 과 정렬(alignment) 을 찾자는 거예요.

🧐 왜 지금 타당도를 다시 이야기할까요?

지난 100년 동안 보건의료인 교육(health professions education, HPE)의 평가는 크게 변해 왔어요. 고부담 선다형 시험과 표준화가 지배하던 측정의 시대(measurement era) 가 있었고, 이후 사람의 판단이 가진 가치를 인정하면서 작업장 기반 평가(workplace-based assessment, WBA) 와 시뮬레이션이 널리 쓰이게 됐어요. 최근에는 여러 평가 방법을 의도적으로 하나의 프로그램으로 묶는 프로그램식 평가(programmatic assessment) 까지 왔고요.

 

그렇다고 옛 방식이 사라진 건 아니에요. 저자들은 이렇게 말해요.

측정은 사라지지 않았고, 판단도 마찬가지다.

"Measurement is not extinct, nor is judgment."

 

타당도 개념도 함께 발전했어요. Messick과 Kane의 작업에 기반해서, 요즘은 타당도를 "평가 데이터의 해석과 사용에 관한 논증"으로 보는 논증 기반 접근(argument-based approach) 이 널리 쓰여요. 문제는 CBHPE가 이 논증에 새로운 숙제를 던진다는 점이에요.

CBHPE는 단일 평가만을 겨냥한 논증을 만드는 대신, 평가 시스템의 통합과 성장 및 역량 성취의 측정을 지지하며, 이를 통해 수련 중 지속적인 발달에 정보를 제공하고자 한다. 이제 타당도 논증은 전문가 집단(즉, 역량위원회)이 내리는 역량(또는 역량 미달) 판정처럼 복잡한 의사결정까지 설명해야 한다.

"Instead of making arguments aimed only at single assessments, CBHPE endorses the integration of assessment systems and the measurement of growth and competency attainment to inform continued development during training. Validity arguments must now account for complex decision-making, such as claims of competence (or incompetence) made by a group of experts (i.e., a competence committee)."

 

시험 하나가 타당한지만 보면 되던 시절과 달리, 이제는 여러 평가 데이터를 모아 위원회가 내리는 판정까지 타당한지 따져야 한다는 거죠. 그럼 세 가지 긴장을 하나씩 볼게요.


🧭 긴장 1. 평가의 패러다임: 객관성과 주관성 사이

여기서 말하는 패러다임은 인식론적 입장(epistemological stance)이에요. 지식이란 무엇이고, 그걸 어떻게 측정하는 게 가장 좋은지에 대한 믿음 체계죠. 저자들은 CBHPE와 관련이 깊은 세 패러다임을 비교해요.

패러다임 핵심 가정 선호하는 데이터 근거의 예 CBHPE에서의 쓰임
후기실증주의 (post-positivism) 특정 역량 영역에서 학습자의 능력을 반영하는 "진점수(true score)"가 있다 객관적·수치적·표준화된 데이터 고전검사이론, 문항반응이론, 평가자 간 신뢰도 선다형 시험, OSCE 같은 표준화 평가
구성주의 (constructivism) 진점수는 없다. 역량의 정의는 사회적으로 구성된다 주관적·질적·비표준화 데이터 주제분석, 일반화가능도 이론* 작업장 기반 평가
실용주의 (pragmatism) 역량은 집단 간 상호 이해와 "작동 가능성(workability)"을 통해 형성된다 질적 데이터와 양적 데이터의 결합 효과적인 집단 과정 집단 의사결정 (역량위원회)

원문 Table 1을 옮겼어요. 일반화가능도 이론은 분산의 출처(평가자인지 학습자인지)는 알려주지만, 그 출처 안에서 의미 있는 평가자 차이와 구인무관분산(construct-irrelevant variance)을 구분하지는 못해요.

후기실증주의: 100년 넘게 이어진 주류

1800년대 중후반부터 HPE 평가는 후기실증주의가 이끌었어요. 의료인의 역량에 대한 사회적 우려가 커지면서 면허·인증 시험, 객관성, 표준화, 공정성, 신뢰도가 강조됐죠. 이 심리측정의 시대(psychometric era) 에는 주관성은 피해야 할 것이었고, 실제 현장에서의 수행 관찰은 불공정하다고 여겨졌어요. 고전검사이론(classical test theory)에 따라 학습자에게는 진점수가 있고, 평가의 목표는 데이터에 섞인 오차(noise)가 얼마인지 알아내는 것이었고요.

구성주의: '공유된 주관성'

구성주의는 지난 수십 년 동안 CBHPE 전문가들이 역량 판정에 내재한 공유된 주관성(shared subjectivity) 과 작업장 측정의 비표준성에 주목하면서 등장했어요. 이 관점에서는 의미 형성(sense-making), 맥락, 사회적 과정이 타당도의 중심이 돼요. 그래서 개별 평가자의 신뢰도보다 역량위원회(competency committee, CC) 수준에서 내려지는 판정의 신뢰도를 보자고 해요. 역량위원회는 누적된 평가 데이터를 모아 총괄적 판정을 내리는 집단이에요.

실용주의: 결과와 작동 가능성

실용주의는 Morgan의 정리대로 "작동 가능성(workability)"과 공유된 의미 형성, 상호 이해, 협력을 중시해요. 타당도 측면에서는 평가와 그에 따른 결정이 낳는 이득과 해악, 즉 결과 근거(consequences evidence) 를 앞세우죠. 집단 의사결정 과정의 질이나 위원회 간 판정의 일치도 같은 것이 근거가 될 수 있어요. 양적·질적 자료를 모두 쓰는 통합적 입장이에요.

각 패러다임의 한계 ⚠️

후기실증주의에 대한 비판은 그 역사만큼이나 오래됐어요. 저자들은 Valentine 등의 말을 인용해요.

평가에서의 객관성은 "선형적 인과에 대한 순진한 신뢰로 이어질 수 있다."

"[objectivity in assessment] can lead to naive trust in linear causality"

 

측정이 불가능한 경우에도 복잡한 전문 과업을 측정 가능한 것으로만 줄여 버리는 오류라는 거예요. 모든 측정에는 편향이 끼기 때문에 객관성은 도달할 수 없고, 의도와 무관하게 형평성 문제를 키울 수도 있다는 주장도 있어요. 작업장 평가는 그 시점, 그 맥락에서 평가자가 본 것과 학습자의 수행에 달려 있으니 원래 주관적이고요.

 

Gingerich 등은 평가자가 "의미 있게 개별적(meaningfully idiosyncratic)" 일 수 있다고 했어요. 평가자마다 한 측면만 보고, 그 관점들을 합칠 때 학습자의 모습이 가장 정확하게 드러난다는 뜻이에요. 그래서 저자들은 WBA에서 어느 정도의 불일치, 즉 낮은 신뢰도는 예상해야 한다고 말해요.

 

그렇다고 구성주의와 실용주의가 문제가 없는 건 아니에요. 역량은 사회적 구성물이라 관습과 규범에 따라 정의가 달라져요. 그러니 위원회 수준의 신뢰도라는 게 정말 가능한지, 아니면 이론적으로만 그럴듯한 개념인지 의문이 생기죠. 실제 연구를 보면 많은 역량위원회가 일화에 기대고, 정식 훈련을 받지 않았고, 규준참조에 의존하면서 역량바탕 틀의 취지를 무시하거나 오해하는 경우가 많았어요. 이때 평가자 간 불일치는 의미 있는 관점 차이가 아니라 타당도와 신뢰도에 대한 실제 위협(예: 응답 과정 근거의 부족)일 가능성이 커요.

신중하게 완화하지 않으면, 선의에서 출발한 주관적·집단 기반 의사결정은 자의적이고 편향되며 일화에 의존하는 의사결정이 될 수 있다.

"If not carefully mitigated, well-intentioned subjective, group-based decision-making can become arbitrary, biased, and anecdotal decision-making."

어떻게 관리할까? 💡

저자들은 이 긴장이 쉽게 풀리지 않는다는 걸 인정하면서 몇 가지 질문을 던져요.

유용한 주관성(즉, 전문가들의 공유된 주관성)과 자의적이거나 일화에 기댄 의사결정 사이에서 어떻게 효과적으로 길을 찾을 것인가?

"How does one effectively negotiate between useful subjectivity (i.e., shared subjectivity of experts) and arbitrary or anecdotal decision-making?"

 

이 밖에도 위원회 수준의 신뢰도가 확보되면 개별 평가 수준의 신뢰도는 필요 없는지 같은 질문이 이어져요. 저자들의 답은 Tavares 등의 양립성 원칙(compatibility principle), 즉 패러다임·평가·타당도 사이의 양립성을 추구하자는 주장에서 출발해요.

하나의 패러다임이 다른 것보다 낫다고 주장하기보다, 우리는 패러다임과 데이터 출처 사이의 신중하고 숙고된 정렬을 통해 이 긴장을 관리할 수 있다고 제안한다.

"Rather than arguing for one paradigm over another, we suggest that the tensions may be managed through careful, considered alignment between paradigms and data sources."

정리하면 이래요.

  • 표준화가 중요한 평가(인증시험, OSCE)에서는 문항반응이론, 평가자 간 신뢰도 같은 전통적 심리측정이 여전히 큰 가치가 있어요.
  • 개인의 판단이 들어가는 평가(WBA)에서는 구성주의가 필요해요. 이때도 심리측정은 쓸모가 있어요. 일반화가능도 이론(generalizability theory)으로 점수 변동이 평가자 때문인지 학습자 때문인지 나눠 볼 수 있으니까요. 다만 평가자 차이가 의미 있는 개별성인지 구인무관 요인인지는 알려주지 못해서, 작업장 판단에서는 여전히 주관적 의사결정이 빠질 수 없어요.
  • 집단 의사결정(역량위원회)처럼 상위 추론이 필요한 곳에서는 실용주의가 유용해요. 저자들은 효과적인 집단 과정(effective group process)을 이런 결정의 틀이자 실용주의와 잘 맞는 방법으로 봐요.

그러면서 양 극단을 모두 경계해요.

복잡한 사회적 장(場)을 순수하게 수치적이고 정량화 가능한 측정으로 환원할 수 있다는 생각은 비현실적이며 이론적 근거가 없다. 그러므로 우리는 그와 반대되는 요구가 있음에도, 진급, 역량 판정, 전공의 선발을 뒷받침하는 데 표준화 시험에만 의존하는 것에 반대한다. 마찬가지로, 순수하게 주관적인 의사결정에 의존하는 것 역시 다양한 편향의 위험과 불충분한 공유 정신모형 때문에 문제가 있음을 인정한다.

"the notion that one can distill a complex social field into purely numerical and quantifiable measurements is unrealistic and theoretically unfounded. We would therefore advocate against exclusive reliance on standardized tests to support advancement, competency decisions, or residency selection, despite demands to the contrary. Similarly, though, we acknowledge that the reliance on purely subjective decision-making is problematic due to risk of numerous biases and inadequate shared mental models."

 

결국 평가 목적, 패러다임, 타당도 근거 수집 사이의 정렬을 추구하는 균형 잡힌 접근을 권한다는 게 첫 번째 긴장에 대한 결론이에요.


🏗️ 긴장 2. 타당화의 수준: 부분과 전체 사이

개별 도구에서 평가 시스템으로

20세기에는 후기실증주의 문화 속에서 타당도를 주로 개별 도구(individual instrument) 단위로 따졌어요. 도구마다 근거가 충분한지 평가했고, 부담이 클수록 더 많은 근거가 필요했죠. 특정 시점에 학습자를 판단하는 인증시험이라면 이 방식이 맞아요.

하지만 지금 HPE 프로그램은 WBA, OSCE 점수, 필기시험 점수에 더해 전자의무기록(electronic health record) 데이터, 앰비언트 AI(ambient artificial intelligence) 데이터까지 활용하기 시작했어요. 이 데이터들은 하나의 평가 시스템(system of assessment) 으로 묶이고, 역량위원회가 이를 종합해 진급이나 졸업·자격 같은 고부담 결정을 내려요. 그러니 개별 평가뿐 아니라 평가 프로그램 전체의 타당도도 따져야 하는 상황이 된 거예요.

분해와 총체

여기서 교육학의 오래된 논쟁이 등장해요. 분해(decomposition) 와 총체(holism) 의 긴장이에요.

 

  • 분해 관점은 역량을 측정 가능한 단위로 나누고, 그 단위들을 더해 역량을 판정해요. 개별 구성요소가 타당하면 최종 판정도 타당하다고 가정하죠.
  • 총체 관점은 구성요소를 더하는 것만으로는 역량 판단의 복잡성을 담을 수 없으니 전체적인 판단이 필요하다고 봐요.

 

이 논쟁은 모든 수준에서 나타나요. 개별 평가 도구도 총체적일 수 있고(예: 위임-감독 척도 entrustment-supervision rating), 단위로 쪼개질 수도 있어요(예: 하위역량 평정 subcompetency rating). 역량위원회의 결정도 마찬가지예요. 게다가 하나의 역량을 여러 평가가 다루고, 하나의 평가가 여러 역량을 측정하기도 하죠. 그래서 저자들은 타당도를 이렇게 보자고 해요.

타당도는 여러 근거 조각이 바로 그 하나의 역량 성취를 얼마나 말해 주는가의 정도로 보는 편이 더 나을 수 있다.

"validity may be better viewed as the degree to which pieces of evidence speak to achievement of that one competency."

해법: "둘 중 하나"가 아니라 "둘 다" 🔧

저자들은 양자택일(either/or) 대신 양자병행(both/and) 을 제안하면서 건물 짓기를 예로 들어요.

부품(철골, 리벳, 콘크리트)이 고품질이고 믿을 만하다는 근거는 건물이 튼튼한 재료로 지어졌음을 보장해 줄 것이다. 그러나 공학적 결정이 적절했고, 부품들이 제대로 맞물렸으며, 그 결과 건물이 구조적으로 견고하다는 근거 또한 필요하다.

"Evidence that the parts (steel, rivets, concrete) are high-quality and reliable would ensure the building is made of solid materials. However, evidence is also needed that the engineering decisions were appropriate, the pieces fit together properly, and the resulting building is structurally sound."

 

WBA와 역량위원회를 예로 들면 이런 근거를 모을 수 있어요.

수준 질문 근거 유형
개별 WBA 평가자가 평정하는 것을 실제로 관찰하고, 평가 과제를 이해하는가? 응답 과정 (response process)
개별 WBA 관찰 중에 중요한 기술이 평가되는가? 내용 (content)
개별 WBA 수집된 데이터가 학습자 성장에 유용한 피드백이 되는가? 결과 (consequences)
역량위원회 고부담 결정을 내릴 만큼 관찰 횟수가 충분했는가? 내적 구조 (internal structure)
역량위원회 위원들이 의사결정 과정과 자신이 해석하는 데이터를 이해하는가? 응답 과정 (response process)

저자들은 이 모든 과정에서 정의 지향적 관점(justice-oriented lens) 을 지켜야 한다고 강조해요. 지배적인 의사 원형(dominant physician archetype)을 위해, 또는 그들이 만든 평가 프로그램 때문에 모든 학습자, 특히 소수자 배경(minoritized backgrounds)의 학습자가 불리해지지 않도록 각별히 주의하라는 거예요.

현실의 벽: 자원 💸

모든 수준에서 타당도 근거를 모으는 건 비용과 인력이 많이 드는 일이에요. 저자들도 이 점을 솔직하게 인정해요.

그러므로 이 긴장은 이론적이라기보다 실용적인 것일지도 모른다. 교육자와 프로그램은 모든 수준에서 타당도 근거를 모으고, 그 근거를 최종 결정을 위한 일관된 논증으로 연결할 역량을 갖추고 있는가?

"Thus, the tension is perhaps more pragmatic than theoretical: do educators and programs have the capacity to collect validity evidence at all levels and then connect the evidence into a coherent argument for ultimate decisions?"

 

여기에 프로그램식 평가가 지닌 이중 목적(dual purpose), 즉 학습을 위한 형성평가이면서 의사결정을 위한 총괄평가라는 문제까지 더해져요. 이 부분은 같은 특집호에 실린 Ryan 등의 다른 논문에서 따로 다뤘다고 해요.

 

그래서 저자들의 제안은 이래요.

타당도 근거를 수집하는 일은 장기적이고, 반복적이며, 협력적인 과정, 그리고 그 자체로 하나의 학술 프로그램이 될 수 있는 과정으로 보아야 한다.

"the opportunity to collect validity evidence must therefore be viewed as a longitudinal, iterative, and collaborative process that can be its own program of scholarship."

 

시작점을 고르는 방법도 구체적이에요. WBA가 평가 시스템에서 가장 큰 비중을 차지한다면 WBA부터, 역량위원회가 데이터를 종합하는 과정이 걱정된다면 거기부터 시작하라는 거예요. 비슷한 맥락에서 이미 타당도 근거가 충분히 쌓인 도구는 새로 타당화하지 않아도 되고요.

 

그리고 두 방향 모두 필요하다는 점을 분명히 해요.

평가 시스템의 구성요소를 뒷받침하는 타당도 근거가 없다면, 프로그램 수준의 결정에 쓰이는 데이터는 의심스러울 수 있다. 반대로 타당화가 개별 도구에만 집중된다면, 프로그램 전체는 응집성과 방어 가능성에 대한 근거가 부족할 수 있다.

"Without evidence of validity supporting the component parts of an assessment system, the data informing program-level decisions may be questionable. Conversely, if validation focuses only on individual instruments, the program as a whole may lack evidence of cohesion and defensibility"

 

저자들 표현으로는 구성요소를 '확대해서 보기(zooming in)' 와 프로그램 전체를 '축소해서 보기(zooming out)' 사이의 긴장이에요.


📏 긴장 3. 역량의 기준점: 무엇과 비교할 것인가

마지막 긴장은 "이 학습자는 역량이 있다"고 판단할 때의 기준(standard) 이에요. 진급, 수련 수료, 인증, 면허를 결정하려면 역량 성취 수준이 정해져 있어야 하죠. 저자들은 명확한 성과 기준이 사회적 책무성(social accountability) 에 뿌리를 두고 있다고 말해요. 선택지는 세 가지예요.

① 규준참조 기준 (norm-reference standard)

전통적인 타당도 논증은 개인 간 성취 차이, 즉 피험자 간 분산(between-subject variance) 으로 역량의 기준선을 정해 왔어요. 크론바흐 알파(Cronbach's alpha)나 일반화가능도 이론 같은 신뢰도 측정도 사람마다 점수가 달라야 성립하죠. 본질적으로 집단 안에서 비교하는 규준참조 방식이에요.

② 준거참조 기준 (criterion-reference standard)

그런데 이게 CBHPE와 정면으로 부딪혀요.

피험자 간 분산이 필요하다는 요건은 CBHPE의 근본 전제에 반한다. CBHPE는 정의상 결과 중심의 교육·수련 접근이며, 따라서 이 패러다임의 관심은 학습자가 역량 기준선에 도달하는지 '여부'가 아니라 '언제' 도달하는지에 있다.

"The requirement for between-subject variance is contrary to the underlying premise of CBHPE. By definition, CBHPE is an outcomes-based approach to education and training, and, as such, the paradigm is concerned with when, not if, a learner achieves a threshold of competence to demonstrate accountability to the public."

 

임상 현장에서는 분산 자체가 작을 수도 있어요. 모든 학습자가 정해진 성과에 도달해서 차이가 거의 없어지는 고원 효과(plateau effect) 때문이에요. 이럴 때 피험자 간 분산만으로 기준선을 정하면 결국 정해진 준거가 아니라 동료와의 비교로 역량을 판단하게 되고, 편향도 끼어들어요. 그래서 CBHPE 지지자들은 준거참조 방식을 주장하고, 지금은 고부담 시험에서도 흔히 쓰여요. 전문가 합의와 평가 데이터를 결합해 기준을 정하는 표준 설정(standard setting) 이 대표적이죠.

③ 종단적 성장 기준 (longitudinal growth standard) 📈

세 번째는 피험자 내 분산(within-subject variance), 즉 한 사람이 수련 기간과 경력 전반에 걸쳐 얼마나 성장하는지를 보는 거예요. 사람마다 기술을 익히는 속도가 다르니, 성장을 추적하는 건 형평성 측면에서도, 역량바탕 측면에서도 이론적으로 타당해 보여요. 정해진 성과를 향한 개인의 성장을 재고, 그 과정에서 필요한 개입을 할 수 있으니까요.

 

실제 연구도 있어요. Park 등은 가정의학과 전공의의 성장 곡선에서 역량 기준 도달을 예측하는 패턴과 보충교육(remediation)이 필요한 패턴을 찾아냈어요. Bok 등은 수의대생을 대상으로 세 가지 평가 도구에서 무선계수 모형(random coefficient modeling)으로 개인 성장을 측정했고, 다른 연구들은 잠재계층 성장곡선 모형(latent class growth curve model)으로 학습 궤적을 모델링했어요. 성장은 공식 수련에서 끝나지도 않아요. 평생학습(lifelong learning)은 보건의료 전문직의 특징이니까요.

그런데, 질문은 남아요 🤔

저자들은 성장 기준이 매력적이지만 생각만큼 단순하지 않다고 지적해요. 준거참조 방식도 완전히 자유롭지 않아요. Hofstee나 Angoff 같은 방법도 기준을 만들 때 학습자 데이터를 일부 쓰니 여전히 규준참조의 영향을 받거든요. 성장 기준에 대해서는 이런 질문을 던져요.

  • 기대되는 성장 궤적이라는 게 있을까? 있다면 어느 정도 벗어나야 정상 발달 범위 밖일까?
  • 개인의 성장이 진짜 향상인지, 구인무관분산인지 어떻게 알 수 있을까?
  • 이미 정해진 역량 수준에 도달했는데 성장 곡선이 평평한 학습자는 어떻게 해석해야 할까?
  • 시간이 지나면서 역량이 줄어드는 건 어떻게 반영할까?

결국 성장은 측정할 수 있지만, 저자들 말대로 "분명히 더 복잡하다(admittedly more complex)"는 거예요.

해법: 세 기준의 균형 ⚖️

그러나 성장의 측정은 대중에 대한 우리의 책무와 균형을 이루어야 한다. 성장은 중요하지만, 학습자가 궁극적으로 유능한 진료의 기준선을 충족하는 한에서만 그렇다.

"However, the measurement of growth must be balanced against our accountability to the public; growth is important, but only to the extent that the learner ultimately meets the threshold for competent practice."

 

그래서 최소 역량 기준을 정하는 일과 그 기준을 향한 진전을 측정하는 일이 둘 다 필요하다고 해요. 규준참조와 준거참조 사이의 균형, 그리고 종단적 성장 추적이 함께 있어야 어려움을 겪는 학습자에게 피드백과 보충교육을 제공하고, 모든 학습자가 진급·졸업·자격 취득의 최소 기준을 충족하도록 도울 수 있다는 거예요.


✍️ 저자들의 결론

저자들은 세 긴장을 철학의 충돌이면서 동시에 기회로 봐요.

이 긴장 지점들은 철학의 충돌을 나타내지만, 동시에 옛 접근과 새 접근 사이에서 균형을 잡을 기회를 주며, 그럼으로써 CBHPE를 더 깊이 실현하도록 돕는다.

"Though these tension points represent a clash of philosophies, they also present an opportunity to strike a balance between old and new approaches, thus promoting a deeper realization of CBHPE."

 

앞으로의 평가가 갖춰야 할 모습은 이렇게 제시해요.

앞으로 21세기 보건의료인 평가는 프로그램식이어야 하고, 타당도 논증을 구성하도록 설계되어야 하며, 실제적인 WBA, 여러 유형의 평가에서 오는 정보, 그리고 역량에 대한 발달적 관점과 관련된 긴장을 고려해야 한다.

"Moving forward, 21st-century assessment of health professionals should be programmatic, designed to construct a validity argument, and take into account tensions related to authentic WBA, input from multiple types of assessments, and a developmental view of competence."


💬 덧붙이는 생각

이 논문은 어느 한쪽 편을 들지 않아요. "심리측정은 낡았다"거나 "주관적 판단이 답이다" 같은 결론 대신, 평가 목적에 맞춰 패러다임과 근거를 정렬하라고 말하죠. 새로운 이론을 제시하는 글은 아니지만, 역량바탕 평가를 설계하는 사람이 자주 부딪히는 문제를 세 갈래로 정리해 준다는 점에서 쓸모가 커요.

 

국내에서도 전공의 수련에 WBA와 역량 판정 체계를 도입하려는 논의가 이어지고 있는데요, 실무에서 바로 생각해 볼 만한 질문을 몇 가지 뽑아 봤어요.

  • 우리 프로그램의 역량 판정 회의는 근거에 기반한 집단 과정인가요, 아니면 "그 전공의 괜찮던데" 같은 일화가 오가는 자리인가요?
  • WBA 평가자들이 무엇을 관찰하고 어떤 기준으로 평정하는지 이해하고 있다는 근거(응답 과정 근거)를 갖고 있나요?
  • 판정 기준이 동료와의 비교(규준참조)로 흘러가고 있지는 않나요?
  • 모든 걸 한꺼번에 타당화할 수 없다면, 우리 프로그램에서 가장 비중이 크거나 가장 걱정되는 부분은 어디인가요?

타당화를 "한 번 하고 끝내는 연구"가 아니라 "장기적인 학술 프로그램"으로 보자는 저자들의 제안은 자원이 넉넉하지 않은 현장에 특히 현실적인 조언이라고 생각해요. 🙂


서론 (INTRODUCTION) 

지난 100년 동안 보건의료전문직 교육(health professions education, HPE)의 평가는 발전해 왔다. 측정의 시대(measurement era)에는 고부담 선다형 시험(high-stakes multiple choice question examinations)과 표준화(standardization)가 평가 영역을 지배했다 [1]. 그러나 평가 전문가들이 인간의 판단(human judgement)이 갖는 가치를 인식하면서, 다른 접근들, 예를 들어 일터기반 평가(workplace-based assessment, WBA)와 시뮬레이션(simulation) 등이 점차 수용되고 널리 활용되었다 [2–4]. 더 최근에는 평가를 시스템 관점(systems lens)에서 개념화하여, 여러 방법을 하나의 프로그램에 의도적으로 통합하게 되었다 [5]. 측정(measurement)이 사라진 것도 아니고, 판단(judgment)이 사라진 것도 아니다. 그러나 평가 포트폴리오(assessment portfolios)의 다양성 확대부터 프로그램적 평가(programmatic assessment)에 대한 강조에 이르기까지 [6, 7], 이러한 현대적 고려사항들은 복잡성(complexity), 불확실성(uncertainty), 방법론적 다양성(methodological diversity)을 한층 더 증가시켰다.

 

평가의 변화와 더불어 HPE에서는 평가 타당도(assessment validity)에 관한 사고도 발전해 왔다. 다른 분야 학자들의 연구 [8, 9]를 토대로, 타당도를 평가자료(assessment data)의 해석(interpretations)과 활용(uses)에 관한 논증(argument)으로 개념화하는 방식이 점점 더 널리 사용되고 있다 [10]. 논증기반 접근(argument-based approach)은 어떤 근거(evidence)를 얼마나 많이 찾을 것인지에 유연성을 제공하는 동시에, 그러한 근거를 찾는 데 방법론적으로 다양한 접근을 허용한다 [11]. 타당도를 논증으로 보는 개념이 여전히 널리 받아들여지고 있지만 [12], 역량기반 보건의료전문직 교육(competency-based health professions education, CBHPE)으로의 전환은 타당도 논증을 어떻게 개발하는지 검토할 것을 요구한다. CBHPE는 개별 평가만을 대상으로 논증을 만드는 대신, 수련 중 지속적인 발달(continued development)에 정보를 제공하기 위해 평가체계(assessment systems)의 통합과 성장(growth) 및 역량 달성(competency attainment)의 측정을 지지한다. 이제 타당도 논증은 전문가 집단, 즉 역량위원회(competence committee)가 내리는 역량을 갖추었다는, 또는 갖추지 못했다는 주장과 같은 복잡한 의사결정(complex decision-making)을 설명해야 한다. 따라서 CBHPE는 타당도에 관한 HPE의 관점이 전환되고 있음을 나타낸다.

 

이 논문에서는 CBHPE의 타당도 논증과 관련된 세 가지 긴장, 즉 평가의 패러다임(paradigms of assessment), 타당화의 수준(level of validation), 역량의 참조 기준(reference for competence)을 탐색한다. 이러한 긴장을 검토함으로써, CBHPE가 현재의 타당도 개념화에 제기하는 과제를 상세히 설명하고, 가능한 경우 이러한 긴장을 관리할 잠재적 해결 방안(potential solutions)을 제시하고자 한다. 긴장을 요약한 내용은 그림 1에 제시되어 있다.

긴장 #1: 평가의 패러다임 (TENSION #1: THE PARADIGM OF ASSESSMENT) 

이 절에서는 개인의 패러다임적 지향(paradigmatic orientation)이 타당도의 개념화에 미치는 영향을 탐색한다. 여기서 패러다임(paradigm)은 인식론적 입장(epistemological stance), 즉 개인의 관점에 영향을 미치는 신념체계(belief system)를 뜻하는 용어로 정의한다. 여기에는 지식의 본질(nature of knowledge), 지식을 측정하는 최선의 접근 등이 포함된다 [13]. HPE에는 다른 패러다임들도 존재하지만, 여기서는 CBHPE와 관련된 세 가지 지향, 즉 후기실증주의(post-positivism), 구성주의(constructivism), 실용주의(pragmatism)에 초점을 맞춘다.

후기실증주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A POST-POSITIVIST PARADIGM) 

1800년대 중·후반부터 후기실증주의 패러다임(post-positivist paradigm)은 HPE 평가를 지배해 왔다 [1, 14]. 후기실증주의 접근에 대한 강조는 상당 부분 보건의료전문직 종사자(health care professionals)의 역량에 대한 우려에서 비롯되었다. 이에 대응하여 서구 사회에서는 공식 평가위원회(assessment boards)와 인증기관(accrediting bodies)을 점차 도입했으며, 대중에 대한 책무성(accountability to the public)을 높이기 위해 고부담 면허시험 및/또는 자격인증시험(high-stakes licensure and/or certification examinations), 객관성(objectivity), 표준화(standardization), 공정성(fairness), 신뢰도(reliability)에 노력을 집중했다 [15, 16]. 이 심리측정의 시대(psychometric era)에는 주관성(subjectivity)은 바람직하지 않고, 실제 현장에서 수행을 관찰하는 것은 불공정하며, 좋은 평가는 표준화되어 있어 편향(bias)으로부터 자유로운 평가라고 주장했다 [4]. 고전검사이론(classical test theory)을 토대로 하는 이 패러다임의 암묵적 가정은, 특정 영역에서 학습자가 일관되게 보이는 능력을 반영하는 ‘진점수(true score)’가 실제로 존재한다는 것이다. 따라서 목표는 평가자료에 오차(error), 즉 잡음(noise)이 얼마나 포함되어 있는지를 확인하는 데 있다 [17].

구성주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A CONSTRUCTIVIST PARADIGM) 

후기실증주의 패러다임의 한 대안은 타당도에 대한 구성주의적/주관주의적 지향(constructivist/subjectivist orientation)이다. 이러한 접근은 지난 수십 년 동안 CBHPE 전문가들이 역량에 관한 결정(competency decisions)에 내재한 ‘공유된 주관성(shared subjectivity)’ [18]과 일터기반 측정(workplace-based measurement)의 표준화 부족 [19]을 강조하면서 등장했다. 이에 따라 구성주의자들은 주관주의적/구성주의적 지향에서 공통적으로 중시하는 의미 형성(sense-making), 맥락(context), 사회적 과정(social processes)을 중심으로 타당도를 다루어야 한다고 주장한다 [4, 19]. 개별 평가자의 신뢰도(individual rater reliability)를 고려하기보다는, 역량위원회(competency committee, CC) 수준에서 역량 또는 준비도(readiness)에 관한 결정의 신뢰도를 검토해야 한다 [20]. 역량위원회는 집계된 평가자료(aggregate assessment data)를 활용하여 총괄적 판정(summative determination)을 내리는 사람들의 집단이다 [21]. 양적 방법(quantitative methods)이 일부 상황, 즉 위원회들 간 CC 결정의 신뢰도를 측정하는 데 유용할 수 있지만, 이 구성주의 패러다임에서는 근거에 더 많은 질적 요소(qualitative components)가 포함될 수 있다.

실용주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A PRAGMATIC PARADIGM) 

마지막으로 타당도에 대한 실용주의적 지향(pragmatic orientation)을 살펴본다. Morgan이 요약한 바와 같이, 실용주의(pragmatism)는 주로 ‘작동 가능성(workability)’에 관심을 두며, 당사자들 사이의 공유된 의미 형성(shared meaning-making), 상호 이해(mutual understanding), 협력(collaboration)을 강조한다 [13]. 타당도와 역량에 관한 의사결정(competency-decision-making)의 맥락에서, 이는 평가와 그에 뒤따르는 결정이 미치는 영향, 즉 이익과 해악(benefits and harms)에 관한 결과 근거(consequences evidence)를 우선시한다는 뜻이다 [22]. 이 패러다임의 타당도 근거에는 집단 의사결정 과정(group decision-making process)의 질 [23]과 위원회 간 의사결정의 신뢰도가 포함될 수 있다. 후기실증주의나 구성주의와 대조적으로, 실용주의는 타당도에 대해 더 통합적인 지향을 나타낸다. 즉 양적 측정과 질적 측정(quantitative and qualitative measures)을 모두 활용한다 [13].

 

그림 1. 역량기반 보건의료전문직 교육 시대의 타당도에 내재한 긴장 (Figure 1. Inherent tensions to validity in the era of competency-based health professions education.) 

 

  • 그림 내 제목: 역량기반 보건의료전문직 교육 시대의 타당도: 세 가지 긴장 (Validity in the era of Competency-Based Health Professions Education: Three Tensions)

 

긴장 1: 평가의 패러다임 (Tension 1: The paradigm of assessment) 긴장 2: 타당화의 수준 (Tension 2: Level of validation) 긴장 3: 역량의 참조 기준 (Tension 3: Reference for competence)
후기실증주의(Post-positivism)
구성주의(Constructivism)
실용주의(Pragmatism)
개별 평가(Individual assessments)
평가체계(Systems of assessment)
규준참조(Norm-reference)
준거참조(Criterion-reference)
종단적 성장(Longitudinal growth)

각 패러다임의 과제 (THE CHALLENGES IN EACH PARADIGM) 

객관성의 추구(pursuit of objectivity) [24]는 100년 넘게 널리 이어져 왔지만, 후기실증주의 접근에 대한 우려 역시 거의 그만큼 오래 제기되어 왔다 [4, 24, 25]. Valentine과 동료들이 명료하게 지적하듯, ‘[평가에서의 객관성(objectivity in assessment)]은 선형적 인과관계(linear causality)에 대한 순진한 신뢰를 초래할 수 있다.’ 이는 복잡한 전문직 업무(complex professional tasks)의 평가를 측정 가능한 것들로만 축소하는 오류이며, 심지어 그러한 측정이 불가능한 경우에도 그렇게 한다 [24]. 이론적 관점에서 저자들은 모든 측정이 편향의 영향을 받으므로 객관성은 달성할 수 없으며, 객관성은 의도적으로 또는 의도치 않게 형평성(equity)에 관한 문제를 심화시킬 수 있다고 주장해 왔다 [4, 26]. 또한 일터에서의 평가는 평가자인 인간의 인식(perceptions)과 해당 시점, 해당 맥락에서 수련생(trainee)이 보이는 수행에 의존하기 때문에 본질적으로 주관적이며 표준화되어 있지 않다 [17]. 마지막으로 Gingerich와 동료들이 설명하듯, 평가자(assessors)는 ‘의미 있는 고유성을 지닐 수 있다(meaningfully idiosyncratic)’ [27]. 이는 각 평가자가 한 가지 측면만을 볼 수 있으며, 그러한 관점들을 결합하면 학습자의 모습을 가장 진실하게 파악할 수 있다는 뜻이다 [27]. 따라서 인식, 경험 또는 맥락에서 나타나는 실제적이고, 심지어 의미 있는 차이 때문에 WBA에서는 어느 정도의 비일관성(inconsistency), 즉 낮은 신뢰도(low reliability)가 나타날 수 있음을 예상해야 한다 [4, 24, 27].

 

그러나 구성주의 패러다임과 실용주의 패러다임에도 과제가 있다. 역량(competence)은 사회적 구인(social construct)이므로, 이를 어떻게 정의하는지는 본질적으로 관습(customs), 규범(norms), 사회적 기대(social expectations)에 의존한다 [28, 29]. 이는 예상할 수 있는 일이지만, 위원회 수준의 신뢰도라는 개념이 과연 달성 가능한 것인지, 아니면 단지 이론적으로 매력적인 개념에 불과한지라는 질문을 제기한다 [30]. 또한 이 패러다임들에는 신중하게 관리해야 하는 내재적 위험이 있다. 예를 들어 CC 의사결정에 관한 문헌의 근거는 많은 CC가 일화(anecdotes)에 기대고, 공식적인 훈련(formal training)이 부족하며, 규준참조(norm-referencing)에 의존하면서 결정을 내릴 때 역량기반 프레임워크(competency-based frameworks)의 취지를 무시하거나 오해하는 경우가 많음을 시사한다 [31–33]. 따라서 평가자들 사이의 일부 비일관성은 반드시 인식, 수행 또는 맥락의 실제 차이 때문이라고 볼 수 없으며, 오히려 타당도와 신뢰도에 대한 실질적인 위협, 즉 반응과정 타당도(response-process validity)를 뒷받침하는 근거의 부족 때문일 가능성이 있다 [34]. 이를 신중하게 완화하지 않으면, 선의에서 출발한 주관적 집단 의사결정(subjective, group-based decision-making)이 자의적이고 편향되며 일화에 의존하는 의사결정으로 변할 수 있다.

긴장의 관리 (MANAGING THE TENSION) 

앞서 제시한 이유들 때문에 CBHPE 시대의 패러다임적 지향 사이의 긴장은 해소하기 어렵다.

 

  • 유용한 주관성(useful subjectivity), 즉 전문가들의 공유된 주관성과, 자의적이거나 일화에 의존하는 의사결정 사이에서 어떻게 효과적으로 조율할 수 있는가?
  • 더 형평성 있는 평가체계에 대한 헌신을 훼손하지 않으면서 역량평가(competency assessment)에 내재한 주관성을 어떻게 다룰 수 있는가?
  • 역량이 맥락에, 그리고 어쩌면 위원회에도 의존한다면 위원회 평정(committee ratings)의 신뢰도를 어떻게 검토할 수 있는가?
  • CC 수준의 신뢰도가 확보되면 개별 평가 수준에서 신뢰할 수 있는 자료가 필요하지 않게 되는가?

 

Tavares 등의 논의처럼 [35], 패러다임(paradigm), 평가(assessment), 타당도(validity) 사이의 양립 가능성(compatibility)을 추구해야 한다. 특정 패러다임이 다른 패러다임보다 우월하다고 주장하기보다는, 패러다임과 자료원을 신중하고 사려 깊게 정렬(alignment)함으로써 긴장을 관리할 수 있다고 제안한다(표 1).

 

  • 후기실증주의 패러다임은 표준화와 객관성이 무엇보다 중요한 상황에서 가치가 있다 [14]. 여기에는 선다형 검사(multiple-choice tests), 예를 들어 자격인증시험(certification examinations)과, 객관구조화임상시험(objective structured clinical examinations)처럼 표준화를 추구하는 임상평가(clinical assessments)가 포함된다. 이러한 상황에서는 전통적 심리측정학(traditional psychometrics), 예를 들어 문항반응이론(item-response theory)과 평가자 간 신뢰도(inter-rater reliability)가 여전히 매우 유용하다.
  • 마찬가지로 구성주의는 특히 평가에 개인의 판단이 포함되는 경우 중요한 역할을 한다. 대표적인 예는 본질적으로 평가자와 그 맥락에 의존하는 WBA이다 [19]. 중요한 점은 구성주의 패러다임에서도 심리측정학이 여전히 역할을 할 수 있다는 것이다. 예를 들어 일반화가능도이론(generalizability theory)은 분산의 원천(sources of variance)을 구분하여, 점수 변동(score variation)이 평가자, 학습자 또는 다른 요인들에 얼마나 기인하는지 판단할 수 있다 [36, 37]. 다만 일반화가능도이론은 평가자 간 차이의 원천, 즉 의미 있는 고유성(meaningful idiosyncrasies) [27]과 구인무관 영향(construct-irrelevant influences)을 더 세부적으로 구분할 수 없다는 점이 중요하다 [38]. 따라서 주관적 의사결정은 여전히 일터기반 판단(workplace-based judgments)의 필수 요소이다.
  • 마지막으로 실용주의 패러다임은 역량위원회의 판정에 요구되는 것처럼 집단 의사결정과 관련된 고차 추론(higher-order inferences)을 고려하는 데 매우 유용하다. 효과적인 집단 과정(effective group process)은 그러한 결정을 내리기 위한 프레임워크이며 [23], 실용주의 패러다임과 부합하는 방법이다.

 

요약하면, 복잡한 사회적 영역을 순전히 수치적이고 정량화 가능한 측정으로 환원할 수 있다는 생각은 비현실적이며 이론적 근거가 없다 [4, 18]. 따라서 이에 반대되는 요구가 있더라도 [39, 40], 진급(advancement), 역량에 관한 결정(competency decisions), 전공의 선발(residency selection)을 뒷받침하기 위해 표준화 검사(standardized tests)에만 의존하는 것에 반대한다. 한편 순전히 주관적인 의사결정에 의존하는 것 역시 수많은 편향의 위험 [41]과 불충분한 공유 정신모형(shared mental models) [31] 때문에 문제가 있다는 점을 인정한다. 이러한 이유로 평가의 목적(purpose of assessment), 패러다임적 지향(paradigmatic orientation), 타당도 근거의 수집(collection of validity evidence) 사이의 정렬을 촉진하는 균형 잡힌 접근을 권고한다.

 

표 1. 평가의 패러다임과 역량기반 보건의료전문직 교육에서의 타당도 적용 (Table 1. Paradigms of assessment and application to validity in competency-based health professions education.) 

패러다임적 지향 (PARADIGMATIC ORIENTATION) 정의 (DEFINITION) 선호하는 자료 유형 (TYPES OF DATA FAVORED) 근거의 예 (EXAMPLES OF EVIDENCE) 역량기반 보건의료전문직 교육에서의 활용 (USE IN COMPETENCY-BASED HEALTH PROFESSIONS EDUCATION)
후기실증주의(Post-positivism) 특정 역량 영역(competency domain)에서 학습자의 능력을 반영하는 ‘진점수(true score)’가 존재한다. 객관적·수치적·표준화된 자료(objective, numerical, standardized data) 고전검사이론(Classical test theory)
문항반응이론(Item-response theory)
평가자 간 신뢰도(Inter-rater reliability)
표준화된 검사 상황(standardized test settings): 예를 들어 선다형 문항 검사(multiple-choice item tests), 객관구조화임상시험(objective structured clinical examinations) 등
구성주의(Constructivism) ‘진점수(true score)’는 존재하지 않으며, 역량의 정의는 사회적으로 구성된다(socially constructed). 주관적·질적·비표준화된 자료(subjective, qualitative, non-standardized data) 주제분석(Thematic analysis)
일반화가능도이론(Generalizability theory)*
일터기반 평가(Workplace-based assessments)
실용주의(Pragmatism) 역량은 집단 간 상호 이해(mutual understanding)와 ‘작동 가능성(workability)’을 통해 발달한다. 질적 자료와 양적 자료의 결합(combination of qualitative and quantitative data)을 지지한다. 효과적인 집단 과정(Effective group process) 집단 의사결정(Group decision-making), 즉 역량위원회(competency committees)

 

  • *일반화가능도이론(generalizability theory)은 분산의 원천, 즉 평가자와 학습자를 구분해 제시할 수 있지만, 각 원천 내부를 더 세부적으로 구분할 수는 없다. 예를 들어 의미 있는 평가자 간 차이(meaningful rater differences)와 구인무관 분산(construct-irrelevant variance)을 구분할 수 없다.

 

긴장 #2: 타당화의 수준 (TENSION #2: LEVEL OF VALIDATION) 

두 번째 긴장은 타당도 논증을 평가 프로그램(assessment program)의 개별 구성요소(individual components)에 집중할 것인지, 아니면 더 총체적으로(holistically) 고려할 것인지에 관한 것이다. 이 논의를 시작하기 위해 현대적 타당도 실천(modern validity practices)의 기원과 개별 도구(individual instruments)에 대한 근거에 초점을 맞추어 온 경향을 살펴본다.

현대 타당도 이론과 개별 도구의 ‘타당화’ (MODERN VALIDITY THEORY AND THE ‘VALIDATION’ OF INDIVIDUAL INSTRUMENTS) 

20세기 평가문화(assessment culture)의 후기실증주의적 초점과 맞물려, HPE 프로그램은 개별 도구 수준에서 평가의 타당도를 검토하는 경우가 많았다 [8, 9]. 각 도구에 대해서는 결과의 해석을 지지하거나 반박하는 근거가 상대적으로 얼마나 충분한지를 판단했다. 의사결정의 중요도가 높을수록 더 많은 근거가 요구되었다 [38]. 흔히 사용되는 프레임워크는 도구 간 비교를 허용했지만, 예를 들어 Messick의 다른 변인과의 관계에 관한 근거(relations to other variable evidence) [8]나 Kane의 외삽(extrapolation) [42] 등이 그러했지만, 이러한 비교는 해당 도구를 다른 유사하거나 상이한 측정치에 비추어 검토하도록 설계되어 있었다.

 

이러한 접근은 고부담 양적 평가(high-stakes quantitative assessments), 예를 들어 자격인증시험에 적용할 때 논리적이다. 특정 시점에서 수련생을 판단하는 것이 목표이므로 단일 평가(single assessment)의 타당도가 무엇보다 중요하기 때문이다. 그러나 최근 수십 년 동안 HPE 프로그램에서 사용하는 평가의 수와 다양성이 증가해 왔다. 더욱이 평가와 CBHPE 전문가들은 개별 평가뿐 아니라 복잡한 평가체계(complex systems of assessment)도 고려해야 한다고 주장해 왔다 [5]. 따라서 CBHPE에서는 개별 평가의 타당도뿐 아니라 전체 평가 프로그램의 타당도도 이해해야 한다. 이에 따라 평가 실천(assessment practices)에 새로운 접근이 필요해졌으며, 이는 타당화 실천(validation practices)에도 영향을 미쳤다.

프로그램적 평가 접근의 중요성 (The importance of a programmatic assessment approach) 

프로그램적 평가(programmatic assessment)는 형성적 목적(formative purposes)을 위해 서로 다른 맥락에 걸쳐 여러 자료원에서 매우 다양한 자료를 의도적으로 수집하고, 이를 나중의 총괄적 결정(summative decisions)을 위해 취합하는 것으로 정의된다 [1]. 흔히 수집하는 자료의 예에는 WBA, 객관구조화임상시험 점수, 필기시험 점수(written examination scores)가 포함된다. 더 최근에는 교육 분야의 리더들이 전자의무기록(electronic health record)과 앰비언트 인공지능(ambient artificial intelligence)에서 생성된 자료 등 임상자료(clinical data)의 활용을 개척해 왔다 [49–51].

 

이러한 다양한 평가들은 도구와 과정(instruments and processes)이 통합된 생태계(integrated ecosystem)로 작동하는 평가체계로 결합되며, 의사결정은 여러 수준에서 이루어진다 [5]. 프로그램적 평가에서는 이러한 현장자료(frontline data)를 집계하고 종합하여 역량위원회가 검토하도록 하고, 수련 단계의 진급이나 졸업/자격 부여(graduation/credentialing)에 대한 준비도에 관해 더 고부담인 결정을 내린다 [6, 7]. 이론적으로, 체계의 여러 부분에서 나온 평가자료를 종합하는 집단 과정(group process)은 학습자의 수행을 가장 다각적이고 완전하게 보여 주며, 따라서 역량을 향한 진전(progress toward competence)을 명확하게 파악하도록 한다.

체계 수준에서 타당도 확보하기: 총체적 결정인가, 분해인가 (Obtaining validity at a systems level: holistic decisions or decomposition) 

CBHPE에서 사용하는 다면적 평가체계(multifaceted systems of assessment)는 중요한 질문을 제기한다.

 

  • 전체 평가체계에 대한 타당도 논증을 어떻게 개발할 것인가?
  • 역량을 순전히 총체적 판단(holistic judgment)으로 보아야 하는가, 아니면 최종 판단을 가산적(additive)인 것으로 보고, 개별적으로 타당화된 평가들에서 나온 여러 자료점(data points)의 합산에 근거한 것으로 보아야 하는가?

 

의학교육 이외의 교육환경에서는 이를 흔히 분해(decomposition), 즉 역량을 측정 가능한 단위로 분해하는 것과, 총체주의(holism), 즉 역량을 총체적 판단으로 보는 것 사이의 긴장이라고 한다 [43].

 

  • 분해 관점(decomposition view)은 개별 단위를 합산하여 역량에 관한 판정을 내리고자 한다. 이 관점의 가정은 개별 구성요소가 타당하면 최종 총괄적 결정(final summative decision)도 타당할 것이라는 것이다.
  • 총체적 관점(holistic view)은 전체 결정(overall decision)에 더 명시적으로 초점을 맞춘다. 이 관점의 가정은 개별 구성요소를 합산하는 것만으로는 전체 역량 판단(overall competency judgment)의 복잡성을 충분히 포착할 수 없으므로, 총체적 판정(holistic determination)이 필요하다는 것이다 [43].

 

이 긴장을 다룰 수 있는가? (Can we navigate the tension?) 

분해와 총체주의 사이의 논쟁은 모든 수준에서 전개될 수 있으므로 이 긴장은 단순하지 않다. 개별 평가도구(individual assessment instruments)는 총체적일 수도 있고, 예를 들어 위임-감독 평정(entrustment-supervision ratings)이 그러하며, 단위로 분해될 수도 있는데, 예를 들어 하위역량 평정(subcompetency ratings)이 그러하다. 역량위원회의 결정도 마찬가지이다. 더욱이 여러 평가가 하나의 역량에 관한 정보를 제공할 수 있고, 각 평가는 둘 이상의 역량을 측정할 수 있다 [44, 45]. 이런 점에서 타당도는 여러 근거가 해당 역량 하나의 달성에 관해 어느 정도로 정보를 제공하는지로 이해하는 편이 더 적절할 수 있다.

 

이 긴장을 다룰 수 있는 한 가지 잠재적 전략은, 더 큰 평가체계를 고려하는 이점과 개별 평가에 관한 타당도 근거를 수집하는 이점을 인정함으로써, 양자택일(either/or)이 아닌 양쪽을 모두 취하는 접근(both/and)을 사용하는 것이다. 건물의 건축이 유용한 비유가 될 수 있다. 부품과 재료, 즉 강철(steel), 리벳(rivets), 콘크리트(concrete)가 고품질이고 신뢰할 만하다는 근거는 건물이 견고한 재료로 지어졌음을 보장한다. 그러나 공학적 결정(engineering decisions)이 적절했는지, 각 부분이 제대로 맞물리는지, 완성된 건물이 구조적으로 안전한지에 관한 근거도 필요하다.

 

마찬가지로 각 평가에 대해서는 그로부터 생성된 자료를 뒷받침할 타당도 근거를 수집할 수 있다.

 

  • WBA를 예로 들면,
    • 평가자들이 자신이 평정하는 것을 실제로 관찰하고 평가 과제(assessment task)를 이해하는지를 확인하기 위한 근거, 즉 반응과정 근거(response process evidence)를 수집할 수 있다.
    • 다른 근거에는 관찰 과정에서 중요한 기술(skills)이 평가되는지에 관한 내용 근거(content evidence)나,
    • 수집된 자료가 학습자의 성장에 정보를 제공하는 유용한 피드백(feedback)을 제공하는지에 관한 결과 근거(consequences evidence)가 포함될 수 있다 [8].
  • 그러나 이후 이루어지는 역량위원회 결정(downstream competency committee decisions)의 타당도 근거 역시 찾아야 할 수 있다 [20].
    • 더 고부담인 결정에 정보를 제공하기에 충분한 수의 관찰이 이루어졌다는 근거, 즉 내적 구조(internal structure)에 관한 근거나,
    • CC 위원들이 의사결정 과정과 자신들이 해석하는 평가자료를 이해한다는 근거, 즉 반응과정(response process)에 관한 근거는 전체 평가체계를 뒷받침하는 타당도 논증에 의미가 있을 것이다.

 

이 과정 전반에서 평가를 정의 지향적 관점(justice-oriented lens)으로 바라보는 것이 매우 중요하다 [46, 47]. 지배적인 의사 전형(dominant physician archetype)을 위해, 그리고 그러한 전형에 해당하는 사람들이 만든 평가 프로그램으로 인해 모든 학습자, 특히 소수자화된 배경(minoritized backgrounds)의 학습자들이 불이익을 받지 않도록 극도로 주의를 기울여야 한다.

 

평가체계 내부의 모든 수준과 체계 자체를 뒷받침하는 타당도 근거를 수집하는 일에는 많은 자원이 필요하다(resource-intensive endeavor). 따라서 이 긴장은 이론적이라기보다 실무적(pragmatic)일 수 있다. 교육자와 프로그램은 모든 수준에서 타당도 근거를 수집하고, 그 근거들을 궁극적 결정을 위한 일관된 논증(coherent argument)으로 연결할 역량(capacity)이 있는가? 일부 환경에서는 필요한 자원이 비용과 인력 측면에서 모두 감당하기 어려울 수 있다. 또한 프로그램적 평가 접근을 채택한다면, 평가가 수행하는 이중 목적(dual purpose), 즉 학습을 위한 형성평가(formative assessment for learning)와 의사결정을 위한 총괄평가(summative assessment for decision-making)를 어떻게 다룰 것인가 [48]?

 

이러한 우려 때문에 타당도 근거를 수집할 기회는 그 자체로 하나의 학술활동 프로그램(program of scholarship)이 될 수 있는 종단적(longitudinal), 반복적(iterative), 협력적(collaborative) 과정으로 보아야 한다. 교육자들은 초기 노력에서 가장 중요하거나 가장 면밀한 검토를 받는 영역에 우선순위를 둘 수 있다. 예를 들어 WBA가 평가체계의 가장 큰 부분을 차지한다면 타당화 노력(validation efforts)은 거기서 시작할 수 있다. 마찬가지로 역량위원회가 평가자료를 총괄적 결정으로 종합하는 과정에 우려가 있다면, 그 부분이 초기 노력을 집중하기에 가장 좋은 지점일 수 있다. 마지막으로 평가 전문가들은 자신의 맥락에서 어떤 평가가 실제로 타당화를 필요로 하는지, 어떤 도구가 유사한 맥락에서 이미 충분한 타당도 근거를 갖추고 있는지에 따라 우선순위를 정할 수 있다.

 

그러면 전체 타당도 논증(overall validity argument)은 건축 비유에서의 건물처럼 서로 맞물릴 수 있다. 체계의 구성 부분들이 타당도 근거로 뒷받침되면 체계의 전체 구조도 강화된다. 건물이 형태를 갖추어 가면서 최종 형태에 관한 타당도 논증을 만들 수 있다.

 

  • 평가체계의 구성 부분들을 뒷받침하는 타당도 근거가 없다면, 프로그램 수준의 결정(program-level decisions)에 정보를 제공하는 자료에 의문이 제기될 수 있다.
  • 반대로 타당화가 개별 도구에만 집중된다면, 특히 평가와 프로그램 수준의 결정 사이의 정렬에 주의를 기울이지 않을 경우, 프로그램 전체는 응집성(cohesion)과 정당화 가능성(defensibility)에 관한 근거가 부족할 수 있다.

교육자들은 타당도 논증을 구축할 때 구성 부분들을 ‘확대해서 보기(zooming in)’, 즉 분해(decomposition)하는 것과, 전체 평가 프로그램을 ‘축소해서 보기(zooming out)’, 즉 총체적 판정(holistic determination)을 하는 것 사이의 긴장에 직면한다 [43]. 또한 교육자들이 CBHPE 패러다임 안에서 평가의 이중 목적을 관리할 전략을 고려할 것을 제안한다. 이 특별호에 함께 실린 Ryan과 동료들의 논문에는 도움이 되는 여러 제안이 제시되어 있다 [48].

 

긴장 #3: 역량의 참조 기준 (TENSION #3: REFERENCE FOR COMPETENCE) 

마지막으로 살펴볼 긴장은 역량을 판정할 때 사용하는 기준(standard)에 관한 것이다. 수련 단계의 진급이나 수련 완료, 자격인증(certification), 면허 취득(licensure)과 같은 자격 부여(credentialing)에 대한 준비도를 판단하려면, 역량 달성의 수준(level of competency attainment)이 정의되어 있어야 한다. 명확한 성과 기준(outcomes standards)은 사회적 책무성(social accountability)에 뿌리를 두며 [49], 모든 수련생이 특정 기준에 도달했음을 보장하는 데 필요하다. 고려할 수 있는 일반적인 접근은 세 가지, 즉 규준참조(norm-reference), 준거참조(criterion-reference), 종단적 성장(longitudinal growth)이다. 이 절에서는 각각의 접근을 탐색한다.

규준참조 기준 (A NORM-REFERENCE STANDARD) 

타당도에 대한 전통적 접근에서는 개인 간 성취의 차이, 즉 개체 간 분산(between-subject variance)을 흔히 역량의 문턱값(thresholds for competence)을 설정하는 데 사용한다 [50]. 개체 간 분산이라는 개념은 전통적 타당도 논증의 토대이다. 신뢰도 측정(measurement of reliability), 예를 들어 크론바흐 알파(Cronbach’s alpha)와 일반화가능도이론(generalizability theory)은 개인별 분산(individual variance)에 의존하며, 개인의 성취가 사람마다 달라야 한다는 요건을 전제로 한다 [17, 50]. 이러한 접근은 본질적으로 규준참조적(norm-referenced)이며, 모집단(population) 내부의 비교 측정(comparative measures)을 사용하여 달성 수준을 평가한다.

준거참조 기준 (A CRITERION-REFERENCE STANDARD) 

개체 간 분산이 필요하다는 요건은 CBHPE의 근본 전제와 상충한다. 정의상 CBHPE는 교육과 수련에 대한 성과기반 접근(outcomes-based approach)이다 [51]. 따라서 이 패러다임의 관심은 대중에 대한 책무성을 입증하기 위해 학습자가 역량의 문턱값에 도달하는지 여부(if)가 아니라 언제(when) 도달하는가에 있다. 더욱이 특히 임상환경(clinical environment)에서는 분산이 작을 수 있다. 고원효과(plateau effect)는 모든 학습자가 정의된 성과(defined outcome)에 도달하여 학습자 간 차이가 미미해지는 이러한 현상을 설명한다 [52]. 이러한 상황에서 개체 간 분산만으로 역량의 문턱값을 결정하면 규준참조와 편향으로 되돌아갈 위험이 있다. 즉 확립된 준거(established criteria)가 아니라 동료들과 수련생을 비교하여 역량에 관한 결정을 내리게 된다 [53]. 따라서 CBHPE 지지자들은 준거기반 접근(criterion-based approaches)을 주장하며 [53], 그중 많은 접근은 이제 여러 고부담 시험에서 흔히 사용되고 있다. 예를 들어 기준설정 절차(standard-setting procedures)는 전문가 합의(expert consensus)와 평가자료를 결합하여 수용 가능한 성취 문턱값(acceptable achievement threshold)을 설정한다 [54].

종단적 성장 기준 (A LONGITUDINAL GROWTH STANDARD) 

매력적인 세 번째 선택지는 개체 내 분산(within-subject variance), 다시 말해 보건의료전문직 종사자가 수련 전 과정과 경력 전반에 걸쳐 보이는 성장이다. 보건의료전문직 종사자들은 서로 다른 속도로 기술(skills)을 습득하므로, 성장을 모니터링하는 것은 형평성 관점과 역량기반 관점(equity- and competency-based lens) 모두에서 실행 가능하고 이론적으로 타당해 보인다 [52, 55, 56]. 정의된 성과를 향한 개인의 성장이나 학습을 측정하고, 그 과정에서 표적화된 개입(targeted interventions)을 제공할 수 있다. 예를 들어 Park과 동료들은 최근 가정의학과 전공의(family medicine residents)의 성장곡선(growth curves)을 기술하여, 역량의 문턱값에 도달할 것을 예측하는 양상과 보완교육(remediation)이 필요한 양상을 확인했다 [57]. 중요한 점은 성장이 정규 수련(formal training)에 국한되지 않는다는 것이다. 보건의료전문직의 특징 중 하나는 역량의 유지(maintenance of competence)와, 적절한 경우 새로운 역량의 습득(acquisition of new competencies)을 보장하기 위한 평생학습(lifelong learning)에 대한 헌신이다 [58].

이 긴장을 어떻게 다룰 수 있는가? (HOW CAN WE NAVIGATE THE TENSION?) 

역량 달성에 대한 규준참조 접근에 반대하는 중요한 개념적 논거(conceptual arguments)가 있다 [51, 53]. 그러나 많은 준거기반 접근, 예를 들어 Hofstee 방법과 Angoff 방법(Hofstee and Angoff methods) [59]은 준거를 생성하기 위해 여전히 어느 정도 학습자 수준의 자료(learner-level data)를 포함하므로 규준참조로 기울기 쉽다 [60]. 달성(attainment)에만 집중하기보다 성장에 노력을 집중하는 것은 매력적이고 비교적 단순하게 들린다.

  • 그러나 기대되는 성장궤적(expected growth trajectory)이 존재하는가?
  • 존재한다면 그 궤적에서 벗어나는 정도 중 어디까지가 전형적인 발달(typical development)의 범위에 속하고, 어디부터가 기대 범위를 벗어나는가?
  • 개인의 성장이 구인무관 분산(construct-irrelevant variance)이 아니라 실제 향상(true improvement)을 반영한다는 것을 어떻게 알 수 있는가?
  • 사전에 정해진 역량 수준(predetermined level of competency)에 도달했지만 성장곡선이 평평한 학습자는 어떻게 해석해야 하는가?
  • 시간이 흐르면서 역량이 상실되는 것은 어떻게 설명할 것인가?

Bok 등 [61]은 역량기반 접근을 적용한 수의학 학생(veterinary students) 대상 프로그램적 평가 전략에서 세 가지 서로 다른 평가도구와 무선계수 모형화(random coefficient modeling)을 사용하여, 시간에 따른 개인의 성장을 측정할 수 있음을 보여 주었다. 다른 연구들에서는 잠재계층 성장곡선모형(latent class growth curve models)을 사용하여 종단적 학습궤적(longitudinal learning trajectories)을 모형화했으며, 상승하는 성장 양상을 확인했다 [57, 62]. 이러한 연구들은 성장의 측정이 더 복잡하다는 점은 인정하면서도, 그것이 가능함을 보여 준다.

 

그러나 성장의 측정은 대중에 대한 책무성과 균형을 이루어야 한다. 성장은 중요하지만, 학습자가 궁극적으로 역량 있는 실무 수행(competent practice)에 필요한 문턱값에 도달하는 범위에서만 중요하다. 이러한 이유로 최소 역량 기준(minimum competency standards)을 정의하는 것과 그 기준을 향한 진전(progress)을 측정하는 것 모두가 필요할 가능성이 높다. 종단적 성장 추적(longitudinal growth tracking)과 더불어 규준참조 기준과 준거참조 기준 사이에서 이러한 균형을 이루면, 어려움을 겪는 학습자들에게 피드백과 보완교육을 제공하여 모든 학습자가 진급(promotion), 졸업(graduation) 또는 자격 부여(credentialing)에 필요한 최소 기준(minimum standards)에 도달하도록 보장할 수 있다.

결론 (CONCLUSIONS)  

보건의료전문직의 평가는 근본적인 변화를 겪고 있다. CBHPE 운동은 보건의료 교육 프로그램 전반에 걸친 교육철학(educational philosophy)의 근본적 전환을 나타낸다. 이러한 변화는 프로그램 목표(program objectives)와 교육과정 내용(curricular content)의 개혁뿐 아니라, 평가자료에 근거한 타당도 논증을 어떻게 구성하는지에 대한 재고를 의미한다. CBHPE 시대의 타당도를 다시 생각할 때 적어도 세 가지 주요 긴장 지점이 존재한다. 이러한 긴장 지점들은 철학의 충돌(clash of philosophies)을 나타내지만, 동시에 기존 접근과 새로운 접근 사이에서 균형을 이루어 CBHPE를 더욱 깊이 구현할 기회도 제공한다. 앞으로 21세기 보건의료전문직 평가는 프로그램적(programmatic)이어야 하고, 타당도 논증을 구축하도록 설계되어야 하며, 실제성을 갖춘 일터기반 평가(authentic WBA), 여러 유형의 평가에서 얻는 정보(input), 역량에 대한 발달적 관점(developmental view of competence)과 관련된 긴장을 고려해야 한다.

 

 

 

 

 

 

 

질적 연구의 신뢰성(trustworthiness)을 떠받치는 네 개의 기둥

📄 Ahmed SK. The pillars of trustworthiness in qualitative research. Journal of Medicine, Surgery, and Public Health. 2024;2:100051. doi:10.1016/j.glmedi.2024.100051


🧭 들어가며: 질적 연구, 어떻게 믿을 수 있을까요?

의학과 간호학 분야에서 질적 연구는 이제 낯선 방법이 아니에요. 단독으로 쓰이기도 하고, 혼합방법 연구의 중요한 한 축으로 쓰이기도 하죠. 그런데 질적 연구를 하거나 심사하다 보면 늘 따라오는 질문이 있어요. "숫자도 없고 통계 검정도 없는데, 이 결과를 어떻게 믿을 수 있지?"

 

이 글은 이 질문에 답하기 위해 Lincoln과 Guba가 제시한 신뢰성(trustworthiness) 의 네 가지 기준을 정리하고, 각 기준을 확보하기 위한 전략을 표로 제시한 짧은 글이에요. 정식 연구 논문이 아니라 편집자에게 보내는 서신(Letter to the Editor) 형식이라 분량이 4쪽으로 짧아요. 그래서 질적 연구의 질 관리 개념을 처음 접하는 분들이 큰 그림을 잡기에 좋아요.

 

저자는 질적 연구의 성격을 이렇게 설명해요.

질적 연구는 수치 자료에 의존하기보다, 관찰된 현상의 미묘한 차이, 맥락, 그리고 그 밑에 깔린 의미를 탐구하는 데 중점을 둔다는 점에서 양적 연구와 다르다.

"Qualitative research diverges from quantitative research by emphasizing the exploration of the nuances, context, and underlying significance of observed occurrences rather than relying on numerical data."

 

그리고 바로 이 특성 때문에 신뢰성 확보가 중요하다고 말해요.

질적 연구 결과는 주관적인 성격을 지니기 때문에, 신뢰성을 확보하는 것은 그 결과의 신빙성과 믿을 만함을 확립하는 데 매우 중요하다.

"Ensuring trustworthiness is crucial in establishing the credibility and reliability of qualitative findings, given their subjective nature."


📋 체크리스트만으로는 부족하다

그동안 질적 연구의 엄밀성(rigor)에 대한 우려가 제기되면서 여러 지침과 체크리스트가 나왔어요. 대표적인 것이 질적 연구 보고 기준인 COREQ(Consolidated Criteria for Reporting Qualitative Research) 의 32개 항목 체크리스트죠. 연구팀, 방법, 맥락, 결과, 분석, 해석을 어떻게 기술했는지 평가하는 도구예요.

 

하지만 저자는 체크리스트의 한계를 분명히 짚어요. ⚠️

체크리스트는 프로젝트와 그 절차의 모든 측면을 측정 가능하게 만드는 데 유용하지만, 체크리스트를 사용한다고 해서 질적 연구 프로젝트의 질이 보장되는 것은 아니다.

"A qualitative project's quality cannot be guaranteed by using a checklist, even though it is useful for making sure all aspects of the project and its procedures are measurable."

 

그래서 이 글은 이론적 기반과 실천적 측면을 함께 고려하는 전략을 제시하겠다고 해요. 그 이론적 기반이 Lincoln과 Guba의 네 가지 기준이에요.


🏛️ 신뢰성의 네 기둥

1. 신빙성(credibility): 결과가 참여자의 현실을 잘 반영하는가?

연구 결과가 참여자들이 경험한 현실을 얼마나 정확하게 반영하는지는 질적 연구의 근본적인 측면이다.

"The degree to which the findings accurately reflect the reality that the participants experienced is a fundamental aspect of qualitative research."

 

저자가 제시하는 신빙성 확보 방법은 세 가지예요.

  • 장기적 관여(prolonged engagement): 현장에서 충분한 시간을 보내며 참여자와 관계(rapport)를 쌓고 그들의 활동을 자세히 살펴서 깊이 있는 통찰을 얻는 것
  • 지속적 관찰(persistent observation): 저자는 이를 연구 과정 전체에서 열린 태도를 유지하고, 개인적 편향을 인식하며, 자기 성찰을 실천하는 것으로 설명해요.
  • 삼각검증(triangulation): 여러 자료원이나 방법을 통합해서 결과를 검증하는 것

2. 전이가능성(transferability): 다른 맥락에도 적용할 수 있는가?

전이가능성은 연구 결과를 다른 맥락이나 상황으로 확장할 수 있는 정도를 말해요. 질적 연구자는 연구 환경, 참여자, 절차를 풍부하고 자세하게 기술해서 전이가능성을 높여요.

상세하고 포괄적인 설명을 제공함으로써, 연구자는 독자가 결과를 비슷한 상황에 얼마나 적용할 수 있는지 평가할 수 있게 하고, 이를 통해 연구의 전이가능성을 높인다.

"By providing detailed and comprehensive explanations, researchers allow readers to evaluate how applicable the findings are to similar situations, thus improving the study's transferability."

 

여기서 포인트는 전이가능성을 판단하는 주체가 연구자가 아니라 독자라는 점이에요. 연구자의 몫은 독자가 판단할 수 있을 만큼 충분한 정보를 주는 것이죠.

3. 의존가능성(dependability): 연구 과정이 투명하게 기록되었는가?

저자는 의존가능성을 이렇게 정의해요.

의존가능성은 시간이 지나도 지속되고 흔들리지 않는 연구 결과의 성격에 관한 것이다.

"Dependability pertains to the enduring and unwavering nature of the research findings across time."

 

이를 위해 연구자는 접근법, 자료 수집 기법, 분석 절차를 엄격하게 기록해요. 특히 연구 과정 전반의 결정을 기록한 감사 추적(audit trail) 을 만들고 보존하는 것이 핵심이라고 해요.

4. 확인가능성(confirmability): 결과가 연구자의 편향이 아니라 자료에서 나왔는가?

확인가능성은 결과의 공정성과 객관성에 관한 것으로, 결과가 연구자의 편향이나 선호에 영향을 받지 않도록 보장하는 것이다.

"Confirmability pertains to the impartiality and objectivity of the findings, guaranteeing that they remain unaffected by any biases or preferences of the researchers."

저자는 확인가능성을 높이는 방법으로 세 가지를 들어요.

  • 동료 검토(peer debriefing): 동료나 전문가에게 해석에 대한 의견을 구해서 해석을 검증하고 연구자 편향을 줄이는 것
  • 구성원 확인(member checking): 참여자가 결과를 검토하고 정확성을 확인하는 것
  • 성찰 일지(reflexive journaling): 연구자가 자신의 생각, 편향, 성찰을 기록해서 투명성을 높이고 주관성을 줄이는 것

📊 한눈에 보는 신뢰성 확보 전략

논문의 Table 1을 정리하면 이래요.

기준 연구자 전략 세부 내용
신빙성 장기적 관여(prolonged engagement) 현장에서 충분한 시간을 보내며 참여자와 관계를 쌓아 그들의 관점을 깊이 이해한다. 짧은 상호작용에서는 드러나지 않는 풍부한 자료를 포착할 수 있다.
  성찰성(reflexivity) 연구 과정 전반에서 자신의 편향과 선입견을 인정한다. 이 자기 인식은 결과의 왜곡 가능성을 줄인다.
  삼각검증(triangulation) 면담, 관찰, 문서 등 여러 자료원이나 방법으로 결과를 교차 검증한다. 단일 방법이나 자료원의 편향을 줄인다.
전이가능성 두꺼운 기술(thick descriptions) 연구 맥락, 참여자, 방법을 자세히 기술해서 독자가 자기 맥락과의 유사성을 평가하고 적용 가능성을 판단할 수 있게 한다.
  표집 전략(sampling strategies) 표집 과정과 참여자 선정 기준을 명확히 밝혀, 결과가 비슷한 집단이나 환경에 전이될 수 있는지 판단을 돕는다.
의존가능성 방법론적 기록(methodological documentation) 연구 절차와 연구 중 내린 결정을 자세히 기록해서 투명성을 높이고, 다른 사람이 같은 절차를 따라가며 결정의 근거를 이해할 수 있게 한다.
  감사 추적(audit trails) 연구 결정, 변경 사항, 자료 분석 과정을 기록해서 추적 가능성을 확보한다. 잠재적 편향에 대한 통찰도 제공한다.
확인가능성 동료 검토(peer debriefing) 동료나 전문가에게 해석을 검토받아 대안적 관점을 얻고 개인적 편향을 줄인다.
  구성원 확인(member checking) 참여자가 결과를 검토하고 확인하게 해서, 그들의 관점과 경험이 정확히 표현되었는지 확인하고 해석을 바로잡을 기회를 준다.
  성찰 일지(reflexive journaling) 연구 과정에서 변화하는 생각, 편향, 성찰을 기록해서 투명성을 높이고 연구자의 주관성에 대한 통찰을 제공한다.

💡 신뢰성은 왜 중요한가?

저자는 신뢰성 있는 질적 연구가 세 가지 측면에서 중요하다고 말해요.

 

  • ① 후속 연구와 지식 축적 📚 신뢰할 수 있는 결과는 가설 개발과 후속 연구 설계의 토대가 돼요. 투명하고 철저한 기록은 결과를 확장하거나 이론적 틀에 통합하는 것을 가능하게 해서 누적적 지식(cumulative knowledge)을 쌓는 데 기여하죠.
  • ② 정책 결정 🏛️ 정책 입안자는 사회 문제를 다루고 공정한 결과를 이끌어낼 정책을 만들기 위해 강력한 근거가 필요해요. 맥락에 대한 깊은 이해와 다양한 관점을 담은 신뢰할 수 있는 질적 연구 결과는 정책 결정에 중요한 근거가 될 수 있어요.
  • ③ 실천 현장 🩺 보건의료, 사회복지, 심리학, 교육 등 여러 분야의 전문가들은 신뢰할 수 있는 질적 연구 결과를 활용해 개인과 공동체의 요구에 더 잘 맞는 해결책을 만들 수 있어요.

 


⚠️ 한계와 강점

저자는 질적 연구와 신뢰성 확보 전략의 한계도 함께 짚어요.

질적 연구의 본질적인 한계는 그 주관적 성격이다.

"An essential limitation of qualitative research is its subjective nature."

연구자들은 성찰성과 삼각검증을 활용해 편향을 줄이고 공정성을 유지하려 노력하지만, 질적 연구에 내재된 해석적 성격은 연구자의 관점이 여전히 결과에 영향을 미칠 수 있음을 의미한다.

"Although researchers strive to mitigate biases and uphold impartiality by employing reflexivity and triangulation, the inherent interpretative character of qualitative research implies that the researcher's perspective might still impact the findings."

 

또 장기적 관여나 철저한 기록 같은 방법은 시간, 비용, 현실성 측면에서 부담이 될 수 있어요. 구성원 확인이나 동료 검토에도 한계가 있고요.

참여자나 동료가 사회적 바람직성 편향, 권력 역학, 또는 연구 목적에 대한 제한된 이해 같은 요인 때문에 정확한 확인이나 대안적 관점을 제공하지 못하는 상황이 있을 수 있다.

"there may be situations where participants or peers are unable to offer accurate validations or alternative perspectives due to factors such as social desirability bias, power dynamics, or a limited comprehension of the research objectives."

 

그럼에도 저자는 이 전략들의 강점을 강조해요.

이러한 방법들을 체계적으로 적용하면 질적 연구의 정밀성과 신뢰도가 크게 향상된다.

"The methodical application of these measures greatly enhances the precision and reliability of qualitative research."

더 나아가 이러한 전략의 실행은 투명성을 촉진하며, 이는 다시 연구 과정을 원활하게 하고 학계의 비판적 평가를 받을 수 있게 한다.

"Moreover, the implementation of these strategies encourages transparency, which in turn facilitates the research process and makes it available for critical evaluation by the scholarly community."


📝 결론

연구 과정 전반에 걸쳐 엄밀한 기법을 실행하고, 투명성을 유지하고, 성찰성을 실천함으로써, 질적 연구는 신빙성을 확보하고 다양한 학문 분야에 의미 있는 기여를 할 수 있다.

"By implementing rigorous techniques, maintaining transparency, and practicing reflexivity throughout the research process, qualitative research can achieve credibility and make significant contributions to diverse disciplines of study."


✍️ 읽으며 함께 생각해볼 점

이 글은 신뢰성의 네 기준을 짧고 쉽게 정리했다는 장점이 있지만, 입문용 요약이라는 점을 감안하고 읽으면 좋겠어요. 몇 가지 덧붙여 생각해볼 점을 적어볼게요. 🤔

 

  • 1. 기법과 기준의 연결이 원전과 조금 달라요. Lincoln과 Guba의 Naturalistic Inquiry(1985)에서는 동료 검토(peer debriefing)와 구성원 확인(member checking)을 신빙성(credibility) 을 높이는 기법으로 제시하고, 특히 구성원 확인을 신빙성 확보의 가장 중요한 기법으로 꼽아요. 이 글은 두 기법을 확인가능성 항목에 넣었어요. 또 원전에서 지속적 관찰은 상황에서 가장 핵심적인 특성과 요소를 깊이 있게 파악하는 것을 뜻하는데, 이 글은 이를 열린 태도와 자기 성찰로 설명하고 있어요. 논문이나 연구계획서를 쓸 때는 원전을 함께 확인하는 게 안전해요.
  • 2. "객관성", "재현", "편향 제거"라는 표현을 어떻게 볼까요? Lincoln과 Guba의 신뢰성 기준은 원래 실증주의의 내적 타당도, 외적 타당도, 신뢰도, 객관성에 대응하는 기준을 자연주의적(구성주의적) 패러다임에 맞게 새로 제안한 것이에요. 그런데 이 글은 확인가능성을 "편향에 영향받지 않는 객관성"으로, 감사 추적을 "다른 연구자가 연구를 재현할 수 있게 하는 것"으로 설명하는 등 실증주의적 언어를 꽤 많이 써요. 성찰적 주제분석(reflexive thematic analysis)의 Braun과 Clarke처럼 연구자의 주관성을 제거해야 할 편향이 아니라 분석의 자원으로 보는 입장에서는, 이런 설명이 연구의 인식론적 입장과 맞지 않을 수 있어요. 어떤 질 관리 기법을 쓸지는 내 연구의 패러다임과 방법론에 맞춰 선택하는 게 중요하겠죠.
  • 3. 기법을 "체크"하는 것과 질은 다른 문제예요. 저자도 체크리스트로 질이 보장되지 않는다고 했는데, 같은 논리는 이 글의 Table 1에도 적용돼요. Varpio 등(2017)은 삼각검증, 포화, 구성원 확인 같은 기법이 방법론적 근거 없이 습관적으로 쓰일 때 생기는 문제를 지적한 바 있어요. "삼각검증을 했다", "구성원 확인을 했다"고 적는 것보다, 왜 이 기법이 내 연구에 맞는지, 그 결과 해석이 어떻게 달라졌는지를 보여주는 것이 더 중요해요.
  • 4. 진정성(authenticity) 기준도 함께 알아두면 좋아요. Guba와 Lincoln은 이후 신뢰성 기준에 더해 공정성(fairness) 등을 포함하는 진정성(authenticity) 기준을 제안했어요. 이 글에서는 다루지 않지만, 신뢰성 개념의 발전 과정을 이해하는 데 도움이 돼요.

 

질적 연구를 처음 지도하거나 심사할 때 네 기준의 큰 틀을 설명하는 자료로는 유용하고, 실제 연구에 적용할 때는 Lincoln과 Guba의 원전, 그리고 내가 쓰는 방법론의 질 기준을 함께 보는 걸 권하고 싶어요. 😊


질적 연구의 신뢰성을 떠받치는 기둥 (The pillars of trustworthiness in qualitative research)

편집자께,

전 세계 의학 및 간호학 연구자 공동체는 질적 연구 접근법(qualitative research approaches)을 점점 더 적극적으로 받아들이고 있다. 이러한 증가는 질적 연구를 독립적으로 활용하거나 혼합방법 연구(mixed-method research)의 필수 요소로 포함하는 양상으로 나타난다 [1]. 이처럼 확대되는 추세는 질적 접근법(qualitative approaches)이 연구 과정에 제공하는 추가적인 이점이 인정되면서촉진되고 있다 [2,3]. 질적 연구(qualitative research)는 인간의 행동(behavior), 태도(attitudes), 경험(experiences)의 복잡하고 세밀한 측면을 탐구하는 방법론적 접근법(methodological approach)이다. 질적 연구는 수치 자료(numerical data)에 의존하기보다 관찰된 현상(observed occurrences)의 미묘한 차이(nuances), 맥락(context), 그 이면의 의미(underlying significance)를 탐구하는 데 중점을 둔다는 점에서 양적 연구(quantitative research)와 구별된다 [4]. 질적 연구는 언제나 엄밀성(rigor)과 진실(truth)을 우선시한다 [5]. 질적 연구 결과(qualitative findings)는 주관적 성격(subjective nature)을 지니므로, 신뢰성(trustworthiness)을 확보하는 것은 연구 결과의 신빙성(credibility)과 신뢰도(reliability)를 확립하는 데 매우 중요하다 [6]. 질적 연구에서 신뢰성이라는 개념은 신빙성(credibility), 전이가능성(transferability), 의존가능성(dependability), 확인가능성(confirmability) 등 여러 필수 요소를 포함한다 [2,6–9].

 

최근 몇 년 동안 여러 논문이 질적 보건의료서비스 연구(qualitative health services research)의 엄밀성에 관한 우려를 논의하였다. 최근의 한 연구는 질적 약학 연구(qualitative pharmacy research)에서 엄밀성을 입증하는 것의 중요성을 강조하고, 이를 보장하기 위한 방법을 간결하게 설명하였다. Hadi와 Closs는 자신들의 연구에서 약학 연구(pharmaceutical research)를 간략히 개관하면서 엄밀성의 입증이 부족한 영역을 강조하였다 [10]. 약학교육(pharmacy education) 분야에서는 점검표(checklists)를 포함하여 질적 연구를 출판하기 위한 지침(guidelines)이 제시되었다 [11]. 또한 질적 연구를 개발하고 수행하며 보고하는 체계적인 과정(systematic process)에 관한 모범적 실무(best practices)가 제시되었고, 질의 특성(quality attributes)의 중요성이 강조되었다 [12]. 또 다른 주요 출판물에는 질적 연구 수행에 필요한 핵심 요소에 관한 지침이 포함되었으며, 약학교육 관련 연구에서 연구 결과의 절차(procedure), 제시(presentation), 맥락화(contextualization)를 설명하였다 [13]. 보다 일반적인 차원에서 Tong 등은 32개 항목의 점검표(32-item checklist)를 포함하는 질적 연구 보고를 위한 통합 기준(COREQ)을 제시하였다 [14]. 이 점검표는 질적 연구 논문이 연구팀(research team), 방법(methods), 맥락(context), 연구 결과(findings), 분석(analysis), 해석(interpretations)을 상세히 기술하는 방식을 연구자와 심사자가 평가하고 반영하도록 돕기 위해 고안되었다 [2]. 질적 연구의 방법론적 질(methodological quality)을 더 쉽게 평가할 수 있도록 이 도구와 그 밖의 수많은 도구가 개발되었다 [15]. 점검표는 연구 프로젝트와 그 절차의 모든 측면을 측정할 수 있도록 하는 데 유용하지만, 점검표를 사용한다고 해서 질적 연구 프로젝트의 질이 보장되는 것은 아니다. 질적 연구 방법론(qualitative research methodologies)의 활용이 증가하고 있음을 고려할 때, 사용되는 방법의 질을 보장하기 위한 철저한 지침을 제공하는 것이 중요하다. 이 글은 질적 연구 프로젝트의 질적 기준(quality standards)을 보장하는 데 필요한 이론적 토대(theoretical foundations)와 실무적 측면(practical aspects)을 모두 고려한 포괄적 전략(comprehensive strategy)을 제시하는 것을 목표로 한다. 이론적 틀(theoretical framework)을 검토하면서 Lincoln과 Guba가 제시한 중요한 기준, 즉 신빙성(credibility), 전이가능성(transferability), 의존가능성(dependability), 확인가능성(confirmability)을 상세히 설명한다 [16,17].

 

  • 연구 결과가 참여자들이 경험한 현실(reality)을 얼마나 정확하게 반영하는지는 질적 연구의 근본적인 측면이다. 연구자는 장기간 참여(extended engagement), 지속적 관찰(persistent observation), 삼각검증(triangulation)을 통해 신빙성(credibility)을 높인다 [6].
    • 장기간 참여(extended involvement)는 현장(field)에서 충분한 시간을 보내고, 참여자들과 교류하며, 그들의 활동을 면밀하게 살펴보는 것을 의미하며, 이를 통해 연구자는 포괄적인 통찰(comprehensive insights)을 얻을 수 있다 [18].
    • 지속적 관찰(persistent observation)은 연구 과정 전체에 걸쳐 열린 태도를 유지하고, 개인적 편향(personal biases)을 인식하며, 자기성찰(self-reflection)을 실천하는 것을 포함한다.
    • 또한 여러 자료원(data sources)이나 접근법(approaches)을 통합하는 삼각검증(triangulation)을 활용하면 연구 결과를 검증하는 데 도움이 되어 신빙성이 높아진다 [19].
  • 전이가능성(transferability)은 연구 결과를 다른 맥락이나 상황으로 확장하여 적용할 수 있는 정도를 의미한다 [20,21].
    • 질적 연구자는 전이가능성을 높이기 위해 연구 환경(environment), 참여자(participants), 절차(procedures)를 포괄적이고 세밀하게 묘사하고자 한다. 연구자가 상세하고 포괄적인 설명을 제공하면 독자는 연구 결과가 유사한 상황에 얼마나 적용될 수 있는지를 평가할 수 있으며, 그 결과 연구의 전이가능성이 향상된다.
  • 의존가능성(dependability)은 시간이 지나도 연구 결과가 지속적이고 일관되게 유지되는 성격을 의미한다 [20].
    • 신뢰도(reliability)를 확보하기 위해 연구자는 자신의 접근법(approaches), 자료수집 기법(data gathering techniques), 분석 절차(procedures for analysis)를 철저히 문서화한다 [2]. 연구 과정에서 이루어진 의사결정을 기록한 포괄적인 기록인 감사추적(audit trail)을 작성하고 보존하면 다른 연구자가 그 연구를 재현(reproduce)할 수 있으므로, 결과의 의존가능성이 보장된다 [22].
  • 확인가능성(confirmability)은 연구 결과의 공정성(impartiality)과 객관성(objectivity)을 의미하며, 연구자의 편향(biases)이나 선호(preferences)가 결과에 영향을 미치지 않도록 보장하는 것이다 [20]. 연구자는 연구 결과의 확인가능성을 높이기 위해 동료 검토(peer debriefing), 참여자 확인(member checking), 성찰일지 작성(reflexive journaling) 등 다양한 접근법을 활용한다 [2,17,23,24].
    • 동료 검토(peer debriefing)는 해석의 타당성을 확인하고 연구자 편향(researcher bias)을 완화하기 위해 동료나 전문가의 의견을 구하는 것을 의미한다 [2,17].
    • 참여자 확인(member checking)은 참여자들이 연구 결과를 면밀히 검토하고 그 정확성(accuracy)을 확인하는 과정으로, 확인가능성의 수준을 높인다.
    • 또한 성찰일지 작성(reflexive journaling)은 연구자가 자신의 생각, 편향, 성찰(reflections)을 기록할 수 있도록 하여 투명성(transparency)을 높이고 주관성(subjectivity)을 줄인다.
  • 표 1은 핵심 조치를 적용하여 신뢰성을 철저하게 확보하는 방법을 보여준다. 장기간의 상호작용(extended interaction)은 참여자와 긴밀한 관계를 형성하여 미묘한 차이까지 포착하는 깊이 있는 이해로 이어졌다. 성찰성(reflexivity)은 편향을 줄이는 데 도움이 되어 전 과정에서 객관성이 유지되도록 하였다. 다른 자료원에서 얻은 자료를 삼각검증함으로써 신빙성이 강화되었다. 전이가능성을 높이기 위해 맥락에 대한 투명한 기술(contextual descriptions)과 표집 절차(sampling procedures)의 중요성이 강조되었다. 방법론적 문서화(methodological documentation)와 감사추적(audit trails)은 자료의 의존가능성을 확보하였다. 마지막으로 동료 검토(peer debriefing), 참여자 검증(member verification), 성찰일지 작성(reflexive journaling)을 통해 정확성과 객관성이 확인되었다. 이러한 조치들은 함께 연구의 신뢰성을 강화하여 질적 연구의 엄밀성(qualitative rigor)을 확고하게 확보하였다.

 

표 1. 질적 연구에서 신뢰성을 확보하기 위한 전략 (Strategies for Ensuring Trustworthiness in Qualitative Research)

 

신뢰성 구성요소(Trustworthiness Component)

연구자를 위한 전략(Strategies for Researchers) 상세 설명(Detailed Information) 
신빙성(Credibility) 1. 장기간 참여(Prolonged Engagement): 현장에서 충분한 시간을 보내고 참여자들과 라포(rapport)를 형성하여 그들의 관점을 깊이 이해한다. 시간을 두고 참여자들과 신뢰(trust)와 라포(rapport)를 형성하면 연구자는 그들의 경험(experiences), 행동(behaviors), 신념(beliefs)에 관한 미묘한 차이까지 이해하는 통찰(nuanced insights)을 얻을 수 있다. 이는 짧은 상호작용에서는 곧바로 드러나지 않을 수 있는 풍부한 자료(rich data)를 확보하는 데 도움이 된다.
신빙성(Credibility) 2. 성찰성(Reflexivity): 연구 과정 전반에서 개인적 편향(personal biases)과 선입견(preconceptions)을 인식한다. 자신의 편향을 인식하면 연구자는 이러한 편향을 괄호치기(bracketing)하고, 자료수집(data collection), 분석(analysis), 해석(interpretation) 과정에서 보다 객관적인 입장을 유지할 수 있다. 이러한 자기인식(self-awareness)은 연구 결과에 나타날 수 있는 왜곡(potential distortions)을 최소화하는 데 기여한다.
신빙성(Credibility) 3. 삼각검증(Triangulation): 연구 결과를 교차검증(cross-verification)하기 위해 여러 자료원(data sources)이나 방법(methods), 예를 들어 면담(interviews), 관찰(observations), 문서(documents)를 활용한다. 다양한 자료수집 기법(data collection techniques)이나 자료원을 활용하면 연구자는 서로 다른 관점에서 정보의 일치 여부를 확인할 수 있다. 이를 통해 해석의 신빙성이 높아지고, 단일 방법이나 자료원에서 비롯될 수 있는 잠재적 편향의 영향이 줄어든다.
전이가능성(Transferability) 1. 심층적 기술(두터운 기술; Thick Descriptions): 독자가 연구 결과의 전이가능성을 평가할 수 있도록 상세한 맥락 정보(contextual information)를 제공한다. 연구 맥락(research context), 참여자(participants), 방법(methods)을 철저하게 기술하면 독자는 자신의 맥락과 해당 연구의 유사성을 평가할 수 있다. 이를 통해 연구 결과가 자신의 환경(settings)이나 상황(situations)에 얼마나 적용될 수 있고 관련성이 있는지 판단할 수 있다.
전이가능성(Transferability) 2. 표집 전략(Sampling Strategies): 연구 결과의 잠재적 전이가능성을 뒷받침하기 위해 표집 과정(sampling process)과 기준(criteria)을 명확하게 설명한다. 사용된 표집 방법(sampling methods)과 참여자 선정 기준(criteria for participant selection)을 기술하면 연구 결과가 연구 맥락 밖의 유사한 모집단(populations)이나 환경에 적용되거나 전이될 수 있는지 판단하는 데 도움이 된다.
의존가능성(Dependability) 1. 방법론적 문서화(Methodological Documentation): 연구 절차(research procedures)와 연구 중 이루어진 의사결정(decisions)을 상세히 기록한다. 연구 과정의 각 단계를 철저하게 문서화하면 투명성(transparency)을 확보하는 데 도움이 된다. 또한 다른 사람이 동일한 절차를 따르고 의사결정의 근거(rationale)를 이해함으로써 연구를 반복 수행(replicate)하거나 연구 결과의 의존가능성을 평가할 수 있다.
의존가능성(Dependability) 2. 감사추적(Audit Trails): 추적가능성(traceability)을 확보하기 위해 연구 관련 의사결정, 변경사항(changes), 자료분석 과정(data analysis processes)에 대한 감사추적 기록을 유지한다. 방법론(methodologies)이나 분석(analyses)의 변경을 포함하여 연구 중 이루어진 의사결정을 기록해 두면 투명성과 추적가능성이 높아진다. 이러한 감사추적은 연구의 의존가능성을 확립하는 데 도움이 되며 잠재적 편향(potential biases)을 파악할 수 있는 통찰을 제공한다.
확인가능성(Confirmability) 1. 동료 검토(Peer Debriefing): 동료나 전문가와 함께 해석(interpretations)과 연구 결과(findings)를 검토하여 연구자 편향(researcher bias)을 최소화한다. 동료나 전문가에게 피드백(feedback)을 구하면 해석을 검증하는 데 도움이 되고, 다른 관점(alternative perspectives)을 도입함으로써 개인적 편향을 최소화할 수 있다. 이를 통해 객관성이 높아지고 연구 결과의 정확성을 확인할 수 있다.
확인가능성(Confirmability) 2. 참여자 확인(Member Checking): 확인가능성을 높이기 위해 참여자들이 연구 결과를 검토하고 그 정확성을 확인하도록 한다. 검증 과정(verification process)에 참여자를 참여시키면 그들의 관점(viewpoints)과 경험(experiences)이 정확하게 반영되도록 할 수 있다. 참여자들이 해석을 확인하거나 수정 의견을 제시할 기회를 제공함으로써 연구 결과의 확인가능성이 강화된다.
확인가능성(Confirmability) 3. 성찰일지 작성(Reflexive Journaling): 연구 전반에서 개인적인 생각, 편향, 성찰을 기록하는 성찰일지(reflective journal)를 유지한다. 일지를 작성하면 연구자는 연구 과정에서 변화하는 자신의 생각, 편향, 성찰을 추적할 수 있다. 이러한 성찰적 실천(reflective practice)은 투명성을 높이고 연구자의 주관성(subjectivity)을 이해할 수 있는 통찰을 제공함으로써 연구 결과의 확인가능성에 기여한다.

 

질적 연구에서 신뢰도(reliability)를 확립하는 것은 향후 연구 방향(future research paths)에 영향을 미치는 데 매우 중요하다. 연구자는 신뢰할 수 있는 발견(reliable discoveries)을 정보의 토대로 활용할 수 있으며, 이는 다시 가설 개발(development of hypotheses)과 향후 연구의 계획(planning of future investigations)에 지침을 제공할 수 있다. 또한 신뢰할 수 있는 질적 연구의 전형적인 특징인 투명성(transparency)과 철저한 문서화(thorough documentation)는 연구 결과의 반복 수행(replication), 확장(expansion), 이론적 틀(theoretical frameworks)로의 통합을 가능하게 함으로써 누적적 지식(cumulative knowledge)의 발전에 기여한다 [25]. 결과적으로 이는 새로운 모형(new models)의 개발을 촉진하고, 혁신적인 접근법(innovative approaches)을 활성화하며, 다른 학문 분야와의 협력을 증진하여 궁극적으로 질적 연구 분야를 발전시킨다.

 

신뢰성(trustworthiness)이라는 개념에 의해 뒷받침되는 질적 연구는 정책의 개발(development)과 실행(execution)에 중요한 영향을 미친다 [26,27]. 정책결정자(policymakers)는 사회적 문제(social concerns)에 대응하고 공정한 결과(fair outcomes)를 촉진하는, 충분한 정보에 근거하면서도 변화에 적응할 수 있는 정책(well-informed and adaptable policies)을 만들기 위해 탄탄한 근거(strong evidence)에 의존한다. 맥락에 대한 철저한 이해와 다양한 관점에 의해 강화된 신뢰할 수 있는 질적 연구 결과는 정책 의사결정(policy decisions)에 지침을 제공하는 핵심 근거이다. 입법자(legislators)는 이러한 발견을 정책 심의(policy deliberations)에 반영함으로써 다양한 인구집단(demographics)의 현실과 요구에 부합하는, 보다 포괄적이고 문화적 맥락을 잘 이해하며 효율적인 법률을 제정할 수 있다. 이를 통해 사회정의(social justice)와 공정성(fairness)이 증진된다.

 

질적 연구에 신뢰성 지표(trustworthiness indicators)를 통합하는 것은 실제 적용(practical application)에 중요한 영향을 미친다 [4–6,8,16,18–20]. 여러 분야의 전문가는 신뢰할 수 있는 질적 연구 결과를 활용하여 복잡한 현상(intricate phenomena)에 대한 이해를 높이고, 이를 통해 서비스 제공(provision of services), 치료(treatments), 의사결정 절차(decision-making procedures)를 개선할 수 있다. 신뢰할 수 있는 질적 연구에서 얻은 통찰력 있는 관찰(discerning observations)은 보건의료(healthcare), 사회복지(social work), 심리학(psychology), 교육(education) 및 그 밖의 학문 분야의 전문가들이 개인이나 지역사회의 요구와 경험에 더 잘 부합하는 해결책을 맞춤형으로 마련하는 데 도움이 될 수 있다. 또한 자기성찰(introspection)을 장려하고 관련 당사자들의 관점을 더욱 깊이 이해하도록 함으로써, 전문가는 다양한 문화를 이해하고 존중하는 능력을 향상시킬 수 있다. 그 결과 특정 환경에 더 적합하고 더욱 공감적이고 배려 깊은 서비스를 제공할 수 있다.

 

질적 연구의 근본적인 한계 중 하나는 주관적 성격(subjective nature)이다 [23].

  • 연구자는 성찰성(reflexivity)과 삼각검증(triangulation)을 활용하여 편향을 완화하고 공정성(impartiality)을 유지하려고 노력하지만, 질적 연구에 내재한 해석적 성격(interpretative character)은 연구자의 관점(perspective)이 여전히 연구 결과에 영향을 미칠 수 있음을 의미한다 [6]. 연구자는 개인적 편향에 지속적으로 대처해야 하며, 이러한 편향은 자료수집(data collection), 분석(analysis), 해석(interpretation) 과정에 영향을 미칠 가능성이 있다.
  • 또한 장기간 참여(extended involvement)나 철저한 문서화(thorough documentation)와 같이 신뢰성을 확보하기 위한 특정 방법은 많은 노력을 요구하므로 시간, 재정적 자원(financial resources), 실행가능성(practicality) 측면에서 어려움을 초래할 수 있다. 일부 연구 프로젝트는 현장에서 충분한 시간을 확보하지 못하거나, 포괄적인 문서화와 검증 과정(verification processes)에 필요한 자원(requisite resources)이 부족할 수 있다. 이러한 제약(constraint)은 얻어진 이해의 깊이나 연구에서 얻은 발견을 검증하고 다른 상황에 적용할 수 있는 정도에 영향을 미칠 수 있다.
  • 나아가 참여자 확인(member checking)과 동료 검토(peer debriefing) 같은 기법은 결과의 신뢰도(reliability)를 높이지만, 사회적 바람직성 편향(social desirability bias), 권력 역학(power dynamics), 연구 목적(research objectives)에 대한 제한적인 이해 등의 요인 때문에 참여자나 동료가 정확한 확인(accurate validations) 또는 다른 관점(alternative perspectives)을 제공하지 못하는 상황도 있을 수 있다.

한계가 있기는 하지만, 이러한 전략의 뚜렷한 강점을 강조하는 것은 중요하다. 이러한 조치를 체계적으로 적용하면 질적 연구의 정밀성(precision)과 신뢰도(reliability)가 크게 높아진다 [24]. 삼각검증(triangulation), 성찰일지 작성(reflexive journaling), 포괄적인 문서화(comprehensive documentation)와 같이 신뢰성을 높이기 위해 활용되는 다양한 방법은 함께 편향을 줄이고 연구 결과의 신뢰도를 강화하는 데 기여한다. 이러한 활동은 연구 대상 현상(studied phenomena)에 대한 이해를 높여 질적 연구 분야를 발전시킨다. 또한 이러한 전략의 실행은 투명성(transparency)을 장려하며, 이는 다시 연구 과정을 원활하게 하고 학술공동체(scholarly community)가 비판적으로 평가(critical evaluation)할 수 있도록 연구 과정을 공개한다. 연구 과정에서 이루어지는 철저한 기록관리(record-keeping)와 근거(evidence)에 대한 상세한 검토는 연구 결과를 반복 수행(replicate)하고 면밀히 검토(scrutinize)할 수 있는 가능성을 높여 질적 연구의 신빙성(credibility)과 신뢰도(reliability)를 강화한다.

 

궁극적으로 연구 결과의 정당성(legitimacy)과 의존가능성(dependability)을 확고히 하기 위해서는 질적 연구에서 신뢰성(trustworthiness)의 확립을 우선시해야 한다. 연구자는 신빙성(credibility), 전이가능성(transferability), 의존가능성(dependability), 확인가능성(confirmability)을 확보함으로써 연구의 질을 높이고 기존 지식체계(existing body of knowledge)에 가치 있는 기여를 할 수 있다. 연구 과정 전반에서 엄밀한 기법(rigorous techniques)을 적용하고, 투명성(transparency)을 유지하며, 성찰성(reflexivity)을 실천하면 질적 연구는 신빙성을 확보하고 다양한 학문 분야에 의미 있는 기여를 할 수 있다.

 

 

 

 

Teach Learn Med. 2023 Aug-Sep;35(4):467-476. doi: 10.1080/10401334.2022.2074423. Epub 2022 May 26.

The Problematic Persistence of Tiered Grading in Medical School 

 

 

🏷️ 의대 성적 "우수·양호·통과", 왜 아직도 계속될까? 등급제 성적(Tiered Grading)의 문제적 지속성

📄 Smith JF Jr, Piemonte NM. The Problematic Persistence of Tiered Grading in Medical School. Teaching and Learning in Medicine. 2023;35(4):467–476. doi:10.1080/10401334.2022.2074423

 

안녕하세요! 지난번에 임상추론의 프로그램식 평가와 타당도를 다뤘는데요. 그 논문의 결과 추론(consequences) 이야기를 기억하시나요? 평가 결과를 어떻게 쓰느냐가 낳는 의도하지 않은 결과까지 타당도의 문제라는 거였죠. 오늘 소개할 논문은 바로 그 질문을 의대 성적 체계에 던져요.

 

미국 크레이턴대학교(Creighton University)의 의학교육학자 James F. Smith Jr. 와 의료인문학자 Nicole M. Piemonte가 쓴 관찰(Observation) 논문이에요. 새로운 데이터를 제시하는 연구가 아니라, 역사, 심리측정, 심리사회, 도덕의 네 측면에서 문헌을 검토하고 주장을 펴는 글이에요. 2023년에 나온 논문이라 앞에서 다룬 글들보다 조금 이르지만, 주제가 잘 이어져서 함께 읽어 볼게요.

 

한 줄로 줄이면 이래요. "의대의 등급제 성적은 교육적 근거가 빈약한 대학의 관행에서 왔고, 학생의 정신건강, 협력, 다양성을 해친다는 증거가 쌓이고 있다. 등급제를 유지하려는 학교는 그 이유를 스스로 입증해야 한다."


📌 1. 등급제 성적이란?

저자들은 의대 평가를 크게 두 가지로 나눠요.

  • ✅ 비등급제(non-tiered): 정해진 기준을 충족했는지만 보는 합격/불합격(pass/fail)
  • 🏷️ 등급제(tiered): 수행 수준을 여러 범주로 나누는 방식. 석차, 학점(A, B, C), 점수, 그리고 "우수(honors)", "준우수(high pass)", "통과(pass)", "낙제(fail)" 같은 서술어

등급은 다시 두 가지 기준으로 나눌 수 있어요.

  • 규준참조(norm-based): 학생들을 서로 비교해서 등급을 매김
  • 준거참조(standards-based): 동료 집단의 수행과 상관없이 미리 정한 성취 수준을 기준으로 함

저자들이 주로 문제 삼는 건 학생을 서로 비교해서 줄 세우는 규준참조식 등급제예요.


🏛️ 2. 역사: 등급제는 어디서 왔나?

저자들은 먼저 등급제가 어떻게 의학교육에 들어왔는지 추적해요. 그 과정을 보면 교육적 근거가 생각보다 빈약하다는 거예요.

  • ① 도제식 교육 시대 🧑‍⚕️
    • 초기 미국 의사들은 한 명의 개업의 밑에서 몇 년 동안 도제식으로 배웠어요. 의술은 일종의 "기예(craft)" 였고, 역량의 증거는 이후 평판과 상류층 환자 명단이었어요.
  • ② 강의실 교육과 사설 의학교의 난립 🏫
    • 18세기 말에서 19세기로 오면서 강의 중심 교육이 늘었어요. 일부는 대학의 학과로 시작해서 대학 학부의 평가 방식, 곧 등급제를 그대로 따랐고요. 반면 우후죽순 생긴 사설 의학교(proprietary medical schools) 는 입학 기준도 느슨하고 평가도 엉성했어요. 학생을 낙제시키면 등록금 수입이 줄어드니 낙제는 거의 없었고요.
  • ③ 플렉스너 보고서(1910)와 대학 모델의 정착 📜
    • 1910년 플렉스너 보고서(Flexner Report) 가 미국 의학교육의 낮은 수준을 알리면서 사설 의학교가 몰락하고 대학 기반 의학교육이 자리 잡았어요. 그러면서 대학 학부의 행정, 재정, 교육 철학이 의학교육의 기본 틀이 됐죠.

암묵적으로, 등급제는 대학 환경에서 의대생 평가의 패러다임으로 받아들여졌다.
"Tacitly, tiered grading was accepted as the paradigm for medical student assessment in the university environment."

  • ④ 비판도 오래됐다 🗣️
    • 20세기 초부터 대학의 학문 환경을 의학교육에 그대로 들이는 것에 대한 비판이 있었고, 50여 년 전에도 이미 등급, 평점(GPA), 석차가 졸업 후 의사로서의 수행과 별 관계가 없다는 지적이 나왔어요.

저자들은 역사 검토를 이렇게 정리해요.

현재 의대생들은 미국 대학의 18~19세기 지배적인 학문 철학 안에서, 그리고 그 철학을 위해 개발된 구성물로 평가받고 있으며, 그것은 의대생들이 결국 몸담게 될 임상 실무를 위해 만들어진 것이 아니다.
"currently, medical students are assessed by a construct that was developed in and intended for the prevailing academic philosophies of the American universities of the 18th and 19th centuries, not the clinical practices in which medical students will eventually find themselves."


📊 3. 현황: 임상실습에서는 오히려 등급제가 늘고 있다

미국에는 의대생 평가에 대한 국가 표준이 없어서 학교마다 다른 체계를 써요. 그런데 흥미로운 흐름이 있어요. 최근 5년 동안 임상실습 전(pre-clerkship) 에는 합격/불합격이 늘고, 임상실습(clerkship) 에서는 등급제가 늘었다는 거예요.

2020년 AAMC 자료를 보면 차이가 뚜렷해요.

단계 합격/불합격 등급제
임상실습 전 125개교 42개교
필수 임상실습 11개교 141개교

임상실습에서 가장 흔한 방식은 "우수, 준우수, 통과, 낙제" 의 4단계예요.

🎈 등급 인플레이션 문제

등급제가 제 역할을 못 하는 이유 중 하나는 등급 인플레이션(grade inflation) 이에요.

  • 같은 학교 안에서도 과마다, 학교마다 기준이 달라요.
  • 임상실습 책임자의 40% 이상이 등급 인플레이션이 학생들이 더 좋은 수련병원에 가는 데 도움이 된다고 생각하고, 60% 는 합격/불합격 방식에 반대해요.
  • 20% 넘는 학교가 등급 분포를 정해 두지 않아요. 아이러니하게도 등급 분포를 정하지 않은 것이 최고 등급 비율을 높이는 유일한 유의미한 요인이었어요.
  • 등급을 더 세분화해도 인플레이션은 줄지 않고 오히려 늘 수 있어요.

또 하나의 문제는 타이밍이에요. 임상실습 등급은 대개 실습이 끝난 뒤 총괄평가로 나와요. 그러니 학생이 실습 중에 등급을 보고 기술을 보완하는 건 사실상 불가능하죠. 등급이 피드백으로 기능하지 못한다는 거예요.


⚖️ 4. 등급제를 유지하는 논리, 하나씩 따져 보기

등급제를 지지하는 전통적인 논리는 크게 두 가지예요. 학생의 노력을 자극한다는 것, 그리고 수련 프로그램이 전공의를 선발하는 데 도움이 된다는 것. 저자들은 둘 다 근거가 약하다고 봐요.

① "등급이 있어야 공부한다"?

실제로, 의대생이 등급제 같은 외적 요인으로 동기부여되어야 한다는 전제 자체가, 평생에 걸친 내재적 동기의 학습이라는 전문직의 근본적 요청을 위협한다.
"Indeed, even the premise that medical students must be motivated by extrinsic factors, such as tiered grading, threatens the underlying professional imperative of life-long, and intrinsically motivated, learning."

근거를 보면 이래요.

  • 등급제는 단기적으로 외적 동기를 높일 수 있지만, 외적 동기 요인(등급)을 없애면 전체 동기가 원래보다 낮아질 수 있어요.
  • 학생들의 공부 습관이나 독서량은 등급제의 영향을 받지 않았고, 국가 표준화 시험 성적도 마찬가지였어요.
  • 등급 대신 서술형 피드백을 주면 스트레스와 불안을 줄이면서 학업 동기를 높일 수 있다는 연구도 있어요.

그리고 저자들은 의학교육 개혁에서 동기 이론이 제대로 반영되지 않았다고 지적해요.

② "전공의 선발에 필요하다"?

  • 수련 프로그램 책임자 상당수는 성적을 "지금 그대로" 유지하길 원해요. 그런데 임상실습 등급으로 전공의 수행을 예측하는 연구 결과는 거의 50년 동안 일관되지 않았어요. 양의 상관을 보인 연구도 있고, 그렇지 않은 연구도 있죠.
  • 저자들은 여기서 날카로운 지적을 해요. "합격/불합격은 비판적으로 검증되지 않았으니 등급제를 유지해야 한다"는 주장이 있는데, 정작 등급제 자체도 비판적 검증 없이 역사적으로 들어왔다는 점은 무시한다는 거예요. 🤔

③ "스트레스도 수련의 일부"?

평가로 인한 스트레스를 실제 진료의 스트레스에 대비해 학생을 단련하는 과정으로 보는 시각도 있어요. 저자들은 이걸 강하게 비판해요.

등급제를 의례적이고, 불안을 유발하며, 의대생 형성에 필요한 것으로 규정하는 것은 신고식(hazing)의 여러 요소를 불러낸다.
"Framing tiered grading as ritualistic, angst-provoking, and necessary in the formation of medical students invokes many of the elements of hazing."

그리고 이렇게 이어가요.

숙달이 회상을 평가하는 표준화 시험으로 측정될 때, 공감, 연민, 참여, 결속, 판단처럼 의료 실무의 숙달에 필요하고 현대 의학에서 성공하는 데 더 중요하다고 할 수 있는 속성들은 덜 평가되고, 따라서 덜 가치 있게 여겨질 것이다.
"When 'mastery' is measured by standardized tests assessing recall, then those attributes of mastery in the practice of medicine that require compassion, empathy, engagement, cohesiveness, and judgment—arguably more important for success in modern medicine—will be under-evaluated, and thus undervalued."

 

"측정되는 것이 가치 있게 여겨진다" 는 오래된 격언이 떠오르는 대목이에요.


😰 5. 심리사회적 맥락: 스트레스, 숨은 교육과정, 불평등

💔 가장 강력한 교육과정 스트레스 요인

실제로, 등급제는 현대 의학교육 환경에서 스트레스, 번아웃, 정서적 소진의 가장 강력한 교육과정 요인 중 하나이거나, 어쩌면 가장 강력한 요인으로 보인다.
"Indeed, tiered grading appears to be one of the strongest, if not the strongest, curricular source of stress, burnout, and emotional exhaustion in the contemporary medical educational environment."

 

등급제는 경쟁을 높이고 집단 결속을 낮춰요. 반대로 등급제를 없앤 곳에서는 이런 변화가 보고됐어요.

  • 😌 우울, 불안, 격차 감소
  • 🤝 협력, 집단 결속, 전문직 정체성 증가
  • 🏥 임상실습에서 필기시험 공부하느라 병동을 비우는 대신 임상 몰입, 환자·교수와의 접촉, 임상추론 능력 향상 가능성
  • ⚖️ 학생들의 공정성 인식 향상

🎭 숨은 교육과정과 등급제

저자들은 등급제가 숨은 교육과정(hidden curriculum) 을 강화한다고 봐요. 교수들은 "좋은 의사가 되는 데는 성적보다 훨씬 많은 것이 필요하다"고 말하지만, 학생들이 보기엔 현실이 다르다는 거예요.

"의사가 되는 데는 좋은 성적을 받는 것보다 훨씬 더 많은 것이 있다"는 격언은, 자신의 가까운 미래와 진로가 주로 성적, 국가면허시험 점수, 임상실습 전후의 평가로 결정된다는 것이 의대생들에게 분명해지는 순간 회의, 불신, 무시에 부딪힌다.
"The adage, 'There is much more to becoming a doctor than getting good grades' is met with skepticism, distrust, and dismissiveness when it becomes apparent to medical students that their immediate future and career path will be determined primarily by their grades, national licensure exam scores, and evaluations in the pre-clerkship and clerkship years of medical education."

 

결국 등급제는 의도했든 아니든 학생들의 진로 선택 자격을 자의적으로 층화하면서, 무엇이 정말 중요한지에 대한 암묵적 메시지를 전한다는 거예요.

⚖️ 인종적 불평등

저자들이 "가장 중요하다" 고 강조한 부분이에요.

아마 가장 중요한 것은, 등급제가 인종적 불평등과 관련된 것으로 보인다는 점이다. 인지적 수행 같은 변수를 통제해도 과소대표 소수자(URM)가 더 낮은 평가를 받는다.
"Perhaps most importantly, tiered grading appears to be associated with racial inequalities, in which URM receive lower evaluations even when variables such as cognitive performance are controlled."

 

이런 차이는 명예학회 가입, 수련 기회, 전공 선택으로 이어져서 다양한 의사 인력을 만드는 데 걸림돌이 돼요.


🧭 6. 도덕적 맥락: 교육자의 딜레마와 도덕 발달

⚖️ 판단하지 않으면서 판단해야 하는 교육자

교육자와 학생 사이에는 권력 불균형이 있고, 등급을 매기는 건 결국 교수의 몫이에요. 게다가 교육자는 분명한 이해상충에 놓여 있어요.

의학교육자이자 멘토는 학생과 안전하고 지지적이며 형성적인 관계를 맺기 위해 비판단적이어야 한다. 하지만 의학교육자는 학생의 역량을 비판적이고 정직하게 평가하는 데 있어서는 판단적이어야 하기도 하다.
"The medical educator/mentor must remain non-judgmental to form a safe, supportive, and formative relationship with the student/protégé. However, the medical educator must also be judgmental in critical and honest assessment of the competencies of students."

 

지난번 교육 동맹 논문에서 본 "코치이자 심판" 문제와 똑같은 이야기죠. 여기에 교수들도 학생에게 강의평가를 받으니, 박한 평가를 주면 자기 평가가 나빠질 수 있다는 부담까지 있어요. 이게 임상실습에서 교수들이 낮은 평가를 주길 꺼리는 이유 중 하나일 수 있다고 해요.

🧒 도덕 발달의 정체

저자들은 콜버그(Kohlberg)의 도덕 발달 이론을 끌어와서 꽤 과감한 주장을 해요.

낮은 석차의 수치심을 피하고, 인정을 얻고, 임상실습 전후 교수들에게 충성을 보이려는, 등급제가 만든 학업적 유인은 전인습적 및 인습적 도덕 단계의 특징이다. 이러한 도덕 단계는 대개 아동기와 청소년기와 연관된다.
"Academic incentives established by tiered grading to avoid the shame of low ranking, gain approval, and demonstrate loyalty to pre-clerkship and clerkship faculty characterize the preconventional and conventional moral stages. These moral stages are typically associated with childhood and adolescence."

 

부적절한 학업 유인이 인간의 존엄과 권리를 원칙으로 삼는 후인습적(post-conventional) 단계로 나아가는 걸 막을 수 있다는 거예요. 그래서 교수와 기관은 학생의 도덕 발달을 위협하는 요소를 적극적으로 없애야 한다고 말해요.


🌱 7. 등급제를 넘어서: 대안은?

🎯 기준을 낮추자는 게 아니다

저자들은 오해를 막으려고 분명히 해요.

분명히 하자면, 우리는 학생들이 높은 기준을 적용받지 않아야 한다고 제안하는 것도, 높은 기준이 충족되는지 확인하기 위해 학생들을 더 이상 시험 보지 않아야 한다고 주장하는 것도 아니다.
"To be clear, we are not suggesting that students ought not be held to high standards, nor are we arguing that students should no longer be tested in order to assure high standards are being met."

 

오히려 시험 강화 학습(test-enhanced learning) 은 엄격한 시험을 학습 도구로 계속 써야 하는 강력한 근거라고 봐요. 다만 평가는 학생을 줄 세우고, 등급 매기고, 분류하는 데 쓰일 게 아니라, 다양하고 전인적으로 훈련된 의사 인력을 만든다는 기관의 헌신 속에서 쓰여야 한다는 거예요.

📐 타당도는 "결과"까지 포함한다

지난번 Runyon 논문과 직접 이어지는 부분이에요. 저자들은 타당도는 도구의 속성이 아니라 결과의 해석과 추론의 속성이라는 점을 상기시키면서, Cook 등의 말을 인용해요.

"평가의 의도한 결과나 의도하지 않은 결과를 평가하면 이전에 알아차리지 못한 비타당성의 원천이 드러날 수 있다."
"evaluating intended or unintended consequences of an assessment can reveal previously unnoticed sources of invalidity."

 

예를 들어 번아웃 감소, 경쟁 완화, 집단 결속이 의학교육의 중요한 성과라면, 이 영역에서 등급제가 낳는 부정적 결과는 등급제의 타당도 자체를 위협한다는 거예요. 특정 소수자 집단이 일관되게 낮은 점수를 받는다면 그것도 마찬가지고요.

🏥 작업장 기반 평가와 서술형 평가

  • 작업장 기반 평가(WBA) 가 복잡하고 변화하는 실제 진료 환경의 평가와 더 잘 맞는다고 봐요.
  • 서술형 평가는 객관성 중심 평가보다 실행 가능한 피드백을 주고, 임상 진료를 위임하는 결정에도 도움이 될 수 있어요.

그런데 저자들은 대안에도 한계가 있다는 걸 솔직히 인정해요.

하지만 합격/불합격과 서술 중심의 평가 과정도 완벽하지 않으며, 편향이나 과소대표 소수자 학생에게 불리한 평가에서 자유롭지 않다는 점을 말해 두어야 한다.
"It should be said, however, that a pass/fail, narrative-driven assessment process is not infallible and is not immune to bias or disfavoring URM students."

 

그래서 어떤 평가든 의도하지 않은 결과를 계속 검토해야 하고, 타당도 평가는 지속적인 과정이어야 한다고 해요.

🎓 학점(credit) 기반 체계와 낙제시킬 용기

저자들은 필수 경로와 개별화된 경로에서 역량을 입증하면 "학점(credits)" 을 주는 체계도 제안해요. 합격/불합격과 결합하면 스트레스를 줄이고, 웰빙을 높이고, 평생학습에 맞는 숙달 지향 학습을 도울 수 있다는 거예요.

그리고 합격/불합격 체계에서는 교수에게 용기가 필요하다고 강조해요.

의학교육자는 학생들을 최선을 다해 의료 실무에 준비시켜야 하며, 동시에 역량 기준을 충족할 수 없는 학생들을 낙제시킬 준비가 되어 있어야 한다.
"Medical educators must prepare students as best they can for the practice of medicine, and at the same time be prepared to fail those students incapable of meeting competency standards."

 

임상실습에서 낙제는 역사적으로 아주 드문 일이었기 때문에, 이건 의도적인 노력이 필요하다고 해요.


✅ 8. 결론: 입증 책임을 뒤집자

저자들은 이상적인 평가를 이렇게 정의해요. 안전하고 효과적인 진료에 필요한 모든 기술의 진척을 비판적으로 평가하면서, 동시에 미래 의사 인력의 개인적 관심, 기여, 다양성을 증진하는 평가. 그리고 짧지만 분명한 한 문장을 덧붙여요.

그것은 의대생을 개인적으로도 집단적으로도 해쳐서는 안 된다.
"It must not harm medical students personally or collectively."

 

마지막 문단은 입증 책임을 뒤집자는 제안이에요.

적어도, 등급제를 유지하는 학교는 등급제와 연관된 해로운 효과를 고려할 때 그러한 모델의 사용을 옹호하도록 요구받아야 한다. 이러한 부정적 효과를 해결하지 않고 두는 것은 그것이 용인될 수 있다는 인식을 주며, 의학교육에서 등급제의 문제적 지속을 암묵적으로 지지하는 것이다.
"At the very least, those schools that retain tiered grading systems must be called to defend their use of such models, given the deleterious effects with which tiered grading has been associated. Leaving these negative effects unaddressed gives the perception that they are acceptable and tacitly supports the problematic persistence of tiered grading in medical education."


💡 9. 읽으며 든 생각과 한국 의학교육에 주는 시사점

마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.

  • ① 우리 의대의 성적 체계를 다시 보기 🔍
    • 우리 의과대학도 대부분 학점제와 석차를 쓰고, 이 성적이 인턴이나 전공의 선발에 반영되는 경우가 많은 것으로 알고 있어요. 이 논문의 질문을 우리에게 적용해 보면 이래요. 우리 성적 체계는 무엇을 위해 존재하나? 학습을 돕기 위해서인가, 선발을 위한 분류 도구인가? 만약 후자라면, 그 분류가 실제로 이후 수행을 예측하는지, 그리고 그 과정에서 어떤 대가를 치르고 있는지 따져 볼 필요가 있을 것 같아요.
  • ② 임상실습 평가의 "타이밍" 문제 ⏰
    • 실습이 끝난 뒤에 등급만 통보되면 피드백으로서의 가치가 거의 없다는 지적은 바로 적용할 만해요. 등급제를 유지하든 아니든, 실습 도중에 형성 피드백이 이뤄지는 구조가 먼저 필요하다는 이야기죠.
  • ③ 앞의 글들과 이어서 보기 🔗
    • Runyon 등의 타당도 논문: 등급제의 해로운 결과는 결과 추론의 문제이고, 여러 점수를 합산해 등급을 매기는 방식은 합산의 함정과도 연결돼요.
    • 교육 동맹 논문: 교육자가 코치이면서 심판이어야 하는 긴장이 두 논문에서 똑같이 등장해요.
    • AAMC 기초역량과 CBHPE: 역량바탕교육은 학생들을 서로 비교하기보다 기준 대비 성취를 보는 방향이라, 규준참조식 등급제와는 기본 철학이 잘 맞지 않아요.
  • ④ 비판적으로 읽을 지점 🤔
    • 이 글은 관찰(Observation) 논문이라 체계적 문헌고찰이 아니에요. 등급제에 불리한 근거를 중심으로 논지를 펴는 주장 글이라는 점을 감안해서 읽어야 해요.
    • 인용된 근거 중에는 오래된 연구나 관찰 연구가 적지 않아요. 등급제가 정신건강 문제나 인종적 격차의 원인이라는 인과적 결론을 내리기에는 조심스러운 부분이 있어요.
    • 콜버그 이론을 들어 등급제가 도덕 발달을 정체시킨다는 주장은 흥미롭지만, 경험적 근거보다는 이론적 추론에 가까워요.
    • 선발의 문제는 여전히 남아요. 등급을 없애면 수련 프로그램은 무엇으로 지원자를 구별할까요? 미국에서 USMLE Step 1이 합격/불합격으로 바뀐 뒤 경쟁이 다른 지표로 옮겨 갔다는 지적도 있는데, 이 논문은 이 질문에 대한 답은 충분히 다루지 않았어요.
    • 미국 맥락의 논의라서 URM의 범주나 수련 선발 구조가 우리와 다르다는 점도 염두에 둘 필요가 있어요.

📝 정리하며

  • 의대의 등급제 성적은 교육적 근거보다는 18~19세기 대학 학부의 관행에서 왔어요.
  • 미국에서는 임상실습 전에는 합격/불합격이 늘었지만, 임상실습에서는 오히려 등급제가 대세예요. 등급 인플레이션과 학교별 편차로 정확성도 떨어져요.
  • "동기를 자극한다", "선발에 필요하다", "스트레스도 수련이다"라는 유지 논리는 근거가 약하거나 신고식의 논리와 닮았다고 비판해요.
  • 등급제는 스트레스와 번아웃, 경쟁, 숨은 교육과정, 인종적 불평등과 관련이 있다는 증거가 쌓이고 있어요.
  • 교육자는 판단하지 않으면서 판단해야 하는 딜레마에 놓이고, 등급제의 유인은 도덕 발달을 방해할 수 있어요.
  • 대안은 기준을 낮추는 게 아니라 합격/불합격, WBA, 서술형 평가, 학점 기반 체계와 낙제시킬 용기예요. 다만 대안도 편향에서 자유롭지 않으니 결과를 계속 검토해야 해요.
  • 결론은 입증 책임의 전환이에요. 등급제를 유지하려는 학교가 그 이유를 스스로 입증해야 한다는 거죠.

함께 읽으면 좋은 글로는 Hauer & Lucey(2019), "Core clerkship grading: the illusion of objectivity"(Acad Med 94:469–472), 그리고 Lucey 등(2020), "Medical Education's Wicked Problem: Achieving Equity in Assessment for Medical Learners"(Acad Med 95(12S):S98–S108) 를 추천해요. 📎

 


매년 미국의 의학박사 학위 수여 의과대학(allopathic medical schools)에서는 약 2만 명의 학생이 졸업한다.1 이들은 의과대학에 재학하는 동안 엄격한 교육과정과 중요하고 복잡하며 논쟁적인 평가 과정을 거친다. 최근 이 과정에 관심이 집중되었음에도 현재 인가를 받은 미국의 의학박사 학위 수여 의과대학 155곳에는 통일된 평가 체계가 없다.1 많은 학교가 역량(competencies)에 초점을 맞추지만, 역량을 성공적으로 습득하고 입증했는지를 분류하는 방식은 다양하다.

  • 가장 기본적인 수준에서는 의과대학생이 진급에 필요한 인지적·기술적 능력을 습득하고 입증했는지에 따라 ‘합격(pass)’ 또는 ‘불합격(fail)’으로 판정하며, 성취도를 더 세분하지 않는다.
  • 그러나 문자 성적(letter grades), 숫자 점수(numeric scores), 석차(class ranking), ‘최우수(honors)’, ‘우수(superior)’, ‘상위 합격(high-pass)’, ‘최우수 근접(near-honors)’, ‘만족(satisfactory)’, ‘하위 합격(low-pass)’ 같은 기술어(descriptors)를 사용하는 추가적인 등급 범주 체계도 존재하며, 각 학교는 자체 기준에 따라 이를 다양하게 적용한다.2–5

의학교육에서 등급별 성적평가 체계가 형성·발전한 역사적 토대를 살펴보면 그 발전의 바탕이 된 원칙이 명확해지고 오늘날의 적용 방식도 더 잘 이해할 수 있으리라 기대할 수 있다. 그러나 우리의 검토에 따르면, 의과대학 성적평가 체계는 인지적·심리사회적 기술의 습득, 전문직 정체성 형성(professional identity formation), 의료행위에 필요한 판단력을 돕는 원칙보다는 취약한 교육학적 전제와 학생의 등급별 성적이나 서열을 통한 경쟁적 평가를 강조하는 대학 환경의 학문적 통념에 기반해 왔다.6–9 또한 우리의 검토는 의학교육에서 등급별 성적평가의 사용과 효과가 적절한 평가 방식인지에 관해 한 세기 넘게 의문이 제기되어 왔음을 보여준다.6–10 이러한 성적평가 체계가 의학교육에서 계속 사용되는 상황에는 학생의 안녕(well-being)11,12과 다양성13–15에 미치는 해로운 영향, 표준화된 의사면허시험(standardized licensing examination)16,17 또는 역사적으로는 성공적인 의료행위9와 유의한 상관관계가 없다는 점을 보여주는 문헌의 축적이 맞물려 있다. 우리는 이 관찰 논문(Observations article)에서 이러한 문제를 다루고자 한다.

의학교육과 학생 평가의 역사적 관점 (Historic perspective of medical education and student assessment) 

역사적으로 미국 초기 의사의 교육과 수련은 학생 한 명이 개업의 한 명의 지도를 받는 도제식 경험(apprenticeship-based experience)으로 이루어졌다.18,19 이러한 ‘교육’은 식민지 주민과 신생 미국 시민의 필요를 충족했지만, 실용성에 기반했고 의료행위를 하나의 ‘기술(craft)’로 규정했다.19,20 수련생은 개업의와 함께 여러 해를 일했고, 결국 독립적으로 진료하는 것이 성공적인 성장의 표지였다. 이후 의사가 얻은 평판은 역량의 증거였으며, 상류층 고객을 확보한 것은 전문직으로서 성취했다는 증거로 여겨졌다.18

 

18세기 말과 19세기에 미국 의학교육이 발전하면서 강의실 기반 의학교육(classroom-based medical education)의 효율성이 분명해졌다.19 학생들은 주로 현직 의사로 구성된 소수 교수진의 강의를 통해 집단으로 교육받았다.19 이 방식은 학생에게 더 짧은 교육기간을, 교수진에게 사회적 명성과 경제적 유인을 제공했다. 일부 의과대학은 대학 내 학과로 출발했지만,21 학문 지향적인 이들 학과의 발전 속도는 독립적인 영리 의과대학(proprietary medical schools)의 증가세를 따라가지 못했다.19

  • 대학 소속 의학과의 학생 평가는 당시 대학 학부생에게 적용하던 평가 방식에 따랐으며,22 여기에는 등급별 성적평가도 포함되었다.8,23
  • 반면 영리 의과대학은 느슨한 입학 기준, 체계 없는 교육과정, 의심스러운 학생 평가를 갖고 있었다.20 영리 의과대학에서 낙제하는 일은 드물었다. 낙제는 교수진의 등록금 수입 감소로 이어졌고, 가장 저렴하고 빠르게 의료행위에 진입할 길을 찾는 지원자들의 외면을 받을 위험도 있었기 때문이다.20

의학교육이 도제식에서 공식적인 대학 기반 교육으로 옮겨가기 시작한 기원은 1847년 미국의사협회(American Medical Association)의 설립으로 거슬러 올라간다.20 그러나 미국 의학교육의 열악한 수준을 일반 국민에게 알린 것은 1910년 에이브러햄 플렉스너(Abraham Flexner)가 카네기재단(Carnegie Foundation)에 제출한 보고서였다.20,24 이 보고서는 영리 의과대학의 쇠퇴를 가속하고 대학 기반 의학교육의 중심적 지위를 확고히 했다. 그 결과 대학 학부 교육과정의 지배적인 행정적·재정적 철학, 그리고 무엇보다 교육학적 철학이 의학교육의 기본 틀로 자리 잡았고 대학 총장들은 이를 강하게 옹호했다.25 대학 환경에서 등급별 성적평가는 묵시적으로 의과대학생 평가의 전형으로 받아들여졌다.

 

그러나 20세기 초에는 대학의 학문적 환경이 의학교육에 강요된다는 비판이 나타났고,26 대학 학부과정의 등급별 성적평가와 석차에 대한 일반적인 비판도 등장했다.27–30 의과대학에서 학생 평가의 적절한 형태와 역할을 둘러싼 최근 논쟁은 50년도 더 전에 이미 뚜렷한 뿌리를 두고 있었다. 당시에도 의과대학생의 등급별 성적, 평점 평균(grade-point averages), 석차는 졸업 후 의사로서의 궁극적인 수행과 거의 관련이 없다는 사실이 인식되었다.9,31

 

따라서 미국 의과대학생 평가의 역사에 대한 이 짧은 검토는, 현재의 의과대학생이 장차 일하게 될 임상현장이 아니라 18·19세기 미국 대학의 지배적인 학문적 철학 속에서 개발되고 그것을 위해 설계된 체계로 평가받고 있음을 시사한다.

현재의 평가 모형과 추세 (Current assessment models and trends) 

오늘날 의과대학생 평가 모형은 성격, 규준(normative standards), 적용, 활용 면에서 다양하다.32–35 그러나 모든 의과대학 졸업생은 재학 기간 내내 어떤 형태로든 평가를 받았다. 크게 보면 이러한 평가 방식은 인지적 또는 기술적 역량을 입증하기 위한 정해진 기준을 포함하는 비등급별 방식(합격/불합격)과, 수행 수준의 범주를 구별하기 위해 층화(stratification)를 설정하는 등급별 방식으로 나뉜다. 후자에는 석차, 문자 성적, 숫자 점수, ‘최우수(honors)’, ‘상위 합격(high pass)’, ‘합격(pass)’, ‘불합격(fail)’ 등 등급을 구분하는 질적 기술어가 포함된다. 구분하는 등급 범주는 학생을 서로(또는 다른 코호트를 집합적으로) 비교하는 규준 기반 자료(normative data)에 근거할 수도 있고, 코호트의 수행과 독립적으로 사전에 성취 또는 역량 수준을 명시한 기준 기반(standards-based)일 수도 있다.

 

지난 5년 동안 임상실습 전 교육과정(pre-clerkship years)에서는 합격/불합격 성적평가의 사용이 해마다 늘었고, 임상실습 교육과정(clerkship years)에서는 등급별 성적평가의 사용이 해마다 늘었다.33,34 2020년에 끝난 학년도에는 의과대학 125곳이 임상실습 전 교육에서 합격/불합격 체계를 사용했고, 42곳은 어떤 형태로든 등급별 성적평가 체계를 사용했다.34 반면 필수 임상실습(required clerkships)에서 합격/불합격 평가 체계를 사용한 의과대학은 11곳뿐이었고, 141곳은 등급별 체계를 사용했다.34 가장 흔한 임상실습 평가는 ‘최우수(honors)’, ‘상위 합격(high pass)’, ‘합격(pass)’, ‘불합격(fail)’의 네 범주로 이루어졌다. 한 학교 안에서 서로 다른 평가 체계를 사용하는 경우, 필수·선택 여부와 관계없이 임상실습 전 과목과 임상실습 과목을 경계로 나뉘는 경우가 가장 흔해 보인다.

 

의과대학생 평가에 관한 국가적 표준은 없으며, 각 학교가 사용할 평가 체계를 결정한다.

  • 의과대학은 흔히 임상실습 전 과목(예: 기초과학 또는 장기계통 과목)에 한 체계를 쓰고, 임상실습이나 임상 과목에는 다른 체계를 쓴다.34
  • 의과대학 안팎의 성적평가 방식이 다양하므로 학생들이 이를 주관적이고, 많은 경우 불공정하다고 느끼는 것은 이해할 만하다.36–39
  • 등급별 성적평가 체계의 효과성과 적절성에 관해 과거부터 현재까지 의견이 다양한 것도 놀랍지 않다.40–44

개별 의과대학이 임상실습 전 교육과 임상실습 교육 사이에서 평가 방식을 바꾸는 구체적인 이유는 여러 요인이 복합적으로 작용하기 때문일 것이다. 그럼에도 이러한 변화는 흔하다.34 등급별 성적평가는 졸업후의학교육(graduate medical education, GME) 프로그램 지원자의 임상 능력과 판단력(clinical ability and acumen)을 가려내려는 전공의 수련 프로그램에 도움이 될 수 있다.35,41,45,46 이는 역량을 평가할 뿐 아니라 수행 수준을 층화함으로써 이루어진다고 한다.42 임상 수행에 대한 등급별 성적평가는 학생이 졸업 후 전공의 수련을 준비하면서 임상 기술을 향상할 기회를 찾는 데 도움이 될 수 있다. 그러나 등급별 성적은 흔히 총괄평가(summative assessment) 결과이며, 학생이 임상실습을 마친 뒤에야 공개된다. 이 때문에 임상실습 중 등급별 성적을 바탕으로 특정 전문과목에 필요한 기술을 높이는 일은 어렵거나 불가능하다. 이러한 체계에서 학생들은 일반적으로 임상실습 중이 아니라 종료 후에 총괄평가로서 등급별 성적의 형태로 피드백을 받는다.

 

임상 판단력에 대한 평가로서 임상실습의 등급별 성적평가는 학생이 전공의 지원 과정을 거칠 때 유리한 모습으로 보이게 하는 경향이 있다.14 의과대학 임상실습 학년에서 부여되는 성적의 기준은 한 학교 안의 임상실습끼리도, 학교 사이에서도 다르다.2,5,12,32 또한 임상실습 성적은 현재에도, 역사적으로도 성적 인플레이션(grade inflation)이 특징이다.2,31,32,35,44 이는 등급별 성적평가의 전반적인 정확성과 활용 가능성을 떨어뜨린다. 그런데도 임상실습 책임자의 40% 이상은 성적 인플레이션이 학생이 더 선호하는 전공의 수련 자리를 얻는 데 도움이 된다고 생각하고, 60%는 ‘합격/불합격’ 체계의 사용에 반대한다.35 대부분의 의과대학이 임상 교육과정에서 등급별 성적의 전체 분포를 명시하지만, 20% 이상은 명시하지 않는다. 따라서 이들 학교 지원자의 ‘최상위 성적(top grade)’이 다른 지원자에 비해 얼마나 두드러진 성취인지 불분명하다. 역설적으로, 성적 분포를 명시하지 않는 것은 ‘최상위 성적’ 부여 비율이 더 높은 것과 유의하게 관련된 유일한 요인으로 확인되었다. 이는 성적 인플레이션을 부추기고 실제 성취도를 해석하기 어렵게 한다.35 성적평가 체계에 등급을 더 많이 추가해도 이에 수반되는 성적 인플레이션이 줄어들지 않으며, 오히려 증가할 수 있다.35

현상 유지로서의 등급별 성적평가 (Tiered grading as a status quo) 

등급별 성적평가를 지지하는 전통적인 주장에는 이것이 학생의 노력을 촉진하고47,48 졸업후의학교육(GME)에서 프로그램 책임자가 전공의를 선발하는 데 도움이 된다는 점이 있다.16,40–42,45–47 이러한 장점으로 인식되는 속성들은 해로운 영향에도 불구하고 의학교육에서 등급별 성적평가가 지속되는 것을 충분히 정당화하는 근거로 제시되어 왔다. 이 주장들은 타당도(validity), 신뢰도(reliability), 효율성, 졸업후의학교육 성취에 대한 예측 가치(predictive value)와 같은 평가의 특성에 초점을 맞춘다. 일부는 등급별 성적평가 자체가 의과대학생 사이에 해로운 경쟁을 만들지 않으며 학생 자신에게 책임이 있다는 주장을 반박했다.49 그러나 등급별 성적평가가 의료행위에 적합하거나 효과적인 학업 동기 요인이라는 근거는 부족하다.11,12 실제로 의과대학생에게 등급별 성적평가 같은 외재적 요인(extrinsic factors)으로 동기를 부여해야 한다는 전제 자체가, 평생 지속되는 내재적으로 동기화된 학습(intrinsically motivated learning)이라는 전문직의 근본적 책무를 위협한다.50

 

동기 이론(motivation theories)은 의학교육과정 개혁에서 충분히 반영되지 않았다.51 존재하는 근거에 따르면 등급별 성적평가는 단기적으로 외재적 동기를 높일 수 있지만, 외부 동기 요인인 등급별 성적을 제거하면 전반적인 동기 수준이 초기보다 낮아진다.52 또한 독서를 포함한 학생의 학습 습관은 등급별 성적평가의 영향을 받지 않으며,52 전국 표준화 시험의 성적 역시 영향을 받지 않는다.17 등급별 성적평가를 대신하는 서면 또는 구두의 서술형 피드백(narrative feedback)은 학업 동기를 높이면서 스트레스와 불안을 줄일 수 있다.53

 

그럼에도 많은 전공의 수련 프로그램 책임자와 일부 의과대학생은 성적평가를 ‘현재대로(as is)’ 유지하기를 원한다고 밝혀 왔다. 이는 등급별 성적이나 숫자 점수가 이후 임상 수행의 중요한 예측 인자로 남아 있다는 제한적인 근거 때문일 수 있다.41,42,45,46,54 졸업후의학교육 수행을 예측하기 위해 임상실습의 등급별 성적을 사용하는 데에는 일관성이 없으며, 이러한 문제는 거의 50년 동안 지적되어 왔다.40 비교적 최근의 일부 연구는 등급별 성적과 전공의 수행 사이에 양의 상관관계가 있다고 시사하지만45,46 다른 연구는 그렇지 않다.18,55–57 역설적으로, 합격/불합격 평가가 비판적으로 검토되지 않았으므로 등급별 성적평가를 유지해야 한다는 주장42은, 자체의 근거가 의심스러운 등급별 성적평가가 미국 의학교육에 역사적으로 도입된 사실을 비판 없이 수용하고 의존해 온 것은 도외시하는 듯하다. 석차, 성적, 우등생 학회(honor societies) 가입, 전국 표준화 시험 점수에 초점을 맞추는 것은 균형 잡힌 전인적 의학교육(holistic medical education)의 표지가 되어야 할 개인적 성장과 전문직 정체성 형성보다 측정된 수행에 관심이 쏠려 있음을 보여준다. 또한 의과대학의 평가 유발 스트레스(assessment-induced stress)를, 임상실무의 스트레스에 대비해 의과대학생을 단련하거나 길들이는 수단으로 치부해 왔다. 과거 의학교육의 어려움에 고전하는 학생에게 권했던 ‘스스로 자신을 호되게 다그치기(self-kick in the seat of the pants)’58는 당시에도 적절해 보이지 않았고,59 의과대학생과 그들이 돌보게 될 환자의 필요에 가장 잘 부응하는 오늘날의 전인적 교육 환경에도 맞지 않는다. 등급별 성적평가를 의과대학생의 형성에 필요한, 의례적이고 불안을 유발하는 과정으로 규정하는 것은 신고식 괴롭힘(hazing)의 여러 요소를 떠올리게 한다.60 이런 상황에서 수치심은 학생 간 연대(solidarity)를 약화하고, 의학교육의 집단 응집력과 임상실무의 팀 기반 진료(team-based care)라는 이상을 훼손한다. ‘숙달(mastery)’을 기억해낸 내용을 평가하는 표준화 시험으로 측정한다면, 연민(compassion), 공감(empathy), 참여(engagement), 응집력(cohesiveness), 판단력처럼 현대 의학에서 성공하는 데 더 중요하다고 주장할 수 있는 의료행위상의 숙달 속성은 충분히 평가받지 못하고, 따라서 저평가될 것이다. 등급별 성적평가에 의존하는 것은 인지적 수행과 포괄적인 현대 의료서비스 제공에 가장 중요한 의사 발달의 속성 사이의 거리를 더 벌린다.3

의과대학의 심리사회적 맥락에서 본 등급별 성적평가 (Tiered grading in the psychosocial context of medical school) 

의과대학의 학업 환경과 의과대학생의 스트레스·불안 사이의 연관성은 80년도 더 전에 분명히 인식되었다.61,62 의과대학생에게 심각한 정신건강 문제가 발생할 위험은 오늘날에도 지속된다.43 합격/불합격이라는 평가 범주를 넘어서는 등급별 성적평가가 학생의 불안, 우울, 번아웃에 기여한다는 설득력 있는 근거가 있다.38,39,43,63,64 실제로 등급별 성적평가는 오늘날 의학교육 환경에서 스트레스, 번아웃, 정서적 소진(emotional exhaustion)을 일으키는 교육과정상의 가장 강력한 원인 중 하나, 어쩌면 가장 강력한 원인으로 보인다.65 등급별 성적평가는 학생 간 경쟁 심화와 집단 응집력 저하와 관련된다.12,66,67 의과대학생 평가 과정에서 등급별 성적평가를 제거한 곳에서는 우울, 불안, 격차(disparities)가 줄고, 협력, 집단 응집력, 전문직 정체성이 높아진다.68,69 임상실습에서 등급별 성적을 평가 결과로 사용하지 않으면, 표준화 시험이나 총괄 서면시험을 준비하려고 학생이 임상현장에서 빠져나갈 유인이 없어져 임상 몰입(clinical immersion), 환자 및 교수진과의 접촉, 임상추론 능력(clinical reasoning skills)이 향상될 수 있다.70 이는 의과대학생의 공정성 인식 향상과도 관련된다.71

 

오늘날 의학교육의 지배적인 문화와 학업 환경이 학생의 안녕과 전문직 발달에 가할 수 있는 위협은 여전히 비판적 검토를 피해 가고 있다.72 학업 환경 자체는 ‘환경적 위해(environmental hazard)’에 비유되었으며,72 이는 산업보건과 안전(occupational health and safety)의 설득력 있는 관점을 불러온다. 학문의학(academic medicine)의 문화는 상당 부분 숨은 교육과정(hidden curriculum)에 의해 형성되며, 여기에는 지도전문의(attending physicians), 전공의, 동료와의 대인관계적 경험과 상호작용이 포함된다.73 전문직 정체성의 발달과 의학교육 중 실제로 중요한 것이 무엇인지에 대한 학생의 인식에 영향을 미치는 것은 바로 이 숨은 교육과정이다. 이는 60여 년 전 ‘하위문화(subculture)’로 불리기도 했다.74 실제로 의과대학생과 전공의·교수 교육자 사이의 이러한 상호작용이 ‘의학 전문직업성(professionalism)에 대한 학생의 이해에 가장 강력한 영향을 미친다’.75 (p16) ‘의사가 되는 데에는 좋은 성적을 받는 것보다 훨씬 더 많은 것이 필요하다’라는 격언도, 의과대학생의 가까운 미래와 진로가 주로 성적, 전국 의사면허시험 점수, 임상실습 전 및 임상실습 교육과정에서의 평가에 따라 결정된다는 사실이 분명해지면 회의와 불신, 일축으로 받아들여진다. 이론적 지식, 중요한 결과가 걸린 시험(high-stakes exams)의 수행, 임상환경에 대한 순응을 강조하는 숨은 교육과정은 의사가 어떤 사람이 되어야 하는지에 대한 도덕적 성찰의 여지를 거의 남기지 않는다. 이러한 사회화의 목적은 직업적 가치, 윤리, 규범을 ‘집단 또는 개인 수준의 성찰에 의한 검토를 거치기보다는 미묘하고 점진적인 방식’으로 정상적이고 일상적인 것으로 만드는 데 있다.76 (p59) 따라서 의과대학생의 인격적 형성과 의료문화로의 사회화 과정은 암묵적으로 전달되는 것에 크게 좌우된다. 여기에는, 그렇게 인식되든 아니든 의과대학생이 원하는 전문과목이나 수련 지역에 들어갈 자격을 자의적으로 층화함으로써 숨은 교육과정을 강화하는 등급별 성적평가 체계를 만들고 유지하는 일이 전달하는 메시지도 포함된다.

 

등급별 성적평가가 초래할 수 있는 스트레스와 불안뿐 아니라, 이러한 평가 체계는 소수화된 집단(minoritized groups)에 속한 학생들의 학업 수행에서 부당한 격차를 지속시킬 수도 있다. 최근의 사회·정치 운동은 매우 다원적인 미국 인구의 보건의료 요구를 충족하고, 우리 의과대학에 입학하고 졸업하는 과소대표 소수집단(under-represented minorities, URM)의 격차를 해소할 수 있는 다양한 의사 인력을 배출하는 데 의학교육 체계가 보여온 일부 실패에 주목하게 했다.13,77 아마 가장 중요한 점은, 인지적 수행 등의 변수를 통제해도 과소대표 소수집단 학생이 더 낮은 평가를 받는 인종적 불평등과 등급별 성적평가가 관련되어 보인다는 것이다.13,15,78 이는 다시 과소대표 소수집단 학생의 우등생 학회 가입, 전공의 수련 선택지, 전문과목 선택에 영향을 준다. 의과대학생 평가를 둘러싼 수많은 교육학적·사회적·과학적·임상적 쟁점과 의사의 전문직 정체성 형성에 기여하는 학업 과정은 평가 과정의 복잡성과 논쟁성을 더한다.5

의과대학생 성적평가의 도덕적 맥락 (The moral context of medical student grading) 

의학교육의 도덕적 맥락에서는 교육과 멘토링 모두 중요하다. 이는 상당 부분 교육자와 학생 사이의 권력 불균형 때문이다. 등급별 성적, 석차 또는 다른 형태의 학생 층화를 결정하는 궁극적인 책임이 교수에게 있으므로, 학업 환경 자체가 이러한 권력 불균형을 지속시킬 가능성이 있다. 또한 의학교육의 교수·평가 과정은 교육자를 이해상충(conflict of interest)이 분명한 위치에 놓는다. 효과적인 교사는 학생이 성공하기를 바라면서 동시에 성공했는지도 판단해야 한다. 의학교육자이자 멘토는 학생이자 피지도자(protégé)와 안전하고 지지적이며 형성적인 관계를 맺기 위해 비판단적인 태도를 유지해야 한다. 그러나 의학교육자는 학생의 역량을 비판적이고 정직하게 평가할 때에는 판단도 내려야 한다.79 의학교육자는 흔히 자신의 교수 효과성(teaching effectiveness)에 대해 의과대학생의 평가를 받는다. 학생 수행을 비판적으로 평가하면 학생에게서 좋지 않은 교수평가를 받을 수 있다.80 이러한 갈등은 교사가 임상실습 학년의 학생 수행을 부정적으로 비평하기를 주저하는 이유를 어느 정도 설명할 수 있다.31,32

 

역량 평가를 개선한다는 목적으로 의과대학생의 서열을 매기는 수학적 접근법을 개발·정교화·적용하고 강조하면, 성공적인 의료행위의 심리사회적 차원을 간과할 위험이 있으며9,12 궁극적으로 의과대학생과 교육기관 사이의 신뢰도 위협할 수 있다.81,82 의과대학생을 서열화하는 체계에 의존하면, 의학교육자와 학생 관계의 도덕적 토대가 학사 운영상의 편의에 종속될 수 있다. 교사와 학생 양쪽의 도덕적 발달은 교육과정의 다른 속성만큼 관심을 받지 못했다. 의료교육을, 인간적이고 지지적인 교육 과정을 통해 역량 있고 다양한 의사 인력을 배출한다는 궁극적 목표보다 교육 과정의 효과성과 효율성에 초점을 둔 기술적 사업으로 규정하면, 아마도 ‘…도덕적 기준과 같은 다른 기준은 대체로 부차적인 중요성만 갖거나 전혀 고려되지 않는다’.83 (p156) 등급별 성적평가로 특징지어지는 학업 환경은 다양하고 전인적으로 준비된 의사 인력의 양성보다 성적평가 패러다임의 작동 방식을 강조하고 중시한다. 또한 이러한 학업 환경은 의과대학생의 도덕적 발달을 멈추게 하거나, 더 나쁘게는 퇴행시킬 수 있다.84,85 낮은 석차의 수치심을 피하고, 인정을 얻고, 임상실습 전 및 임상실습 교수진에 대한 충성심을 보여주도록 등급별 성적평가가 설정한 학업 유인은 전인습적·인습적 도덕 단계(preconventional and conventional moral stages)의 특징을 보인다.84 이러한 도덕 단계는 보통 아동기와 청소년기에 연관된다.84 부적절한 학업 유인은 의과대학생이 후인습적 도덕 단계(post-conventional moral stage)로 나아가는 것을 막을 수 있다. 이 단계에서는 전문직이나 사회의 규범과 독립적으로 ‘…인간의 존엄성과 인권의 원칙이 인격에 완전히 통합되고 개인 행동의 토대를 형성한다’.84 (p504) 의과대학 교수진과 의학교육기관은 학생의 도덕적 발달을 높이기 위해 노력하고, 이를 위협하는 요소를 적극적으로 제거해야 한다.85

등급별 성적평가를 넘어서 (Beyond tiered grading) 

등급별 성적평가를 없애면 의과대학생 평가를 개선할 수 있는가? 우리는 그것이 가능할 뿐 아니라 반드시 필요하다고 믿는다. 분명히 해두자면, 학생에게 높은 기준을 요구하지 말자는 뜻도, 높은 기준이 충족되는지 확인하기 위한 시험을 더 이상 치르지 말자는 뜻도 아니다. 실제로 시험 강화 학습(test-enhanced learning)은, 우리의 견해로는 의과대학생에 대한 엄격한 시험을 학습 도구로 계속 시행해야 한다는 강력한 논거다.86 다만 이상적인 의과대학생 평가의 형태와 방법은 학생을 서열화·등급화·분류하는 데 쓰여서는 안 되며,87 다양하고 전인적으로 수련받았으며 효과적이고 회복탄력적(resilient)이며 유연한(agile) 의사 인력을 배출하려는 교육기관의 책무 속에서 학생을 평가하는 데 쓰여야 한다. 사용하는 평가 도구는 성공적인 의학교육에서 바라는 이러한 속성을 평가하는 데 초점을 맞추어야 한다.

 

평가 도구는 또한 평가한다고 주장하는 대상을 평가하는 데 충분한 타당도(validity)를 보여야 한다. 타당도는 평가 도구 자체의 속성이 아니라 그 도구가 산출한 결과에 대한 해석과 추론(interpretations and inferences)의 속성임을 기억하는 것이 중요하다.88 어떤 형태의 등급별 성적평가든, 다양하고 전인적으로 수련받았으며 효과적이고 회복탄력적이고 유연한 의사 인력을 공급하는 데 미치는 전반적 결과를 고려하지 않은 채 학생을 학문적 인정이나 전공의 선발을 위한 범주로 나누는 데 사용한다면, 그 성적평가의 해석과 추론, 그리고 타당도를 재평가해야 한다. 결과는 중요하며, ‘평가의 의도된 또는 의도되지 않은 결과를 평가하면 이전에는 눈에 띄지 않았던 타당도 결여의 원천을 밝혀낼 수 있다’.88(p166.e10) 예를 들어 번아웃과 경쟁의 감소, 집단 응집력의 향상을 의학교육의 중요한 성과로 여긴다면, 이 영역에서 등급별 성적평가가 낳는 부정적 결과는 평가 도구로서의 등급별 성적평가의 타당도를 위협한다. 또는 등급별 성적평가를 분석한 결과 어떤 소수집단의 점수나 평정이 일관되게 낮다면, 이는 모든 전문과목에서 다양한 의사 인력을 배출하는 데 있어 등급별 성적평가의 타당도를 위협한다.88 이러한 이유로 능동적인 비판적 교육학(critical pedagogy)은 매우 중요하다. 그것은 ‘…상황에 대한 인식을 높일 수 있으며, 이는 불평등을 줄이기 위한 변화를 만드는 전 단계’이기 때문이다.89(p351)

 

또한 임상환경에서 학습과 역량을 평가할 때 타당도는 환자군의 일상적 변동, 평가할 수 있는 교수자의 판단력 차이 등 여러 요인에 취약하다. 그러나 의료행위에 필요한 학습과 역량에 대한 가장 중요한 평가는 아마도 바로 임상환경에서 이루어져야 한다. 여기서는 학습, 수행, 수행 평가의 역동이 진료와 학습이 일어나는 복잡한 임상환경 속에서 모두 융합된다.90 따라서 직무 기반 평가(work-based assessments, WBA)는 의과대학생이 장차 활동하게 될 다양하고 복잡하며 끊임없이 변하는 보건의료 환경과 진료 현장에서의 의료행위 평가에 더 충실하게 부합한다. 사용하는 평가 도구의 해석과 추론에는 평가가 이루어지는 보건의료 환경과 현장이 반영되어야 한다. 이러한 환경과 현장은 사회적·지리적·시간적으로 각기 고유하며, 학생이 장차 실제로 진료할 환경이나 상황을 반영하지 않을 수도 있다. 따라서 ‘…평가 관행의 양적 평가와 관련된 전통적인 신뢰도·타당도 개념은 맥락에 놓인 수행(situated performance)에 대한 해석을 평가하는 데 유용성이 제한적이다’.90 (p1171) 평생학습 기술, 동기, 미래의 진료에 대한 적응력의 평가에서도 그 맥락에 맞는 타당도를 확보해야 한다. 중요한 것은 ‘…평가의 목적이 학습 성과를 ‘객관적으로’ ‘정확하게’ 수량화하는 것이 아니라, 수련생과 의사가 무엇을, 어떻게, 왜 배우는지를 이해하는 것임을 뜻한다’는 점이다.90 (p1169)

 

이상적인 평가는 또한 모호하지 않고, 도덕에 기반하며, 공정해야 한다. 임상실습에서 등급별 성적평가를 중단하고 합격/불합격 체계로 전환하면 공정성에 대한 인식이 개선된다.71 교육 평가에서 공정성에 대한 전통적인 접근은 신뢰도와 타당도에 초점을 맞추어 왔지만, 심리측정학(psychometrics)에 대한 객관적이고 제한적인 초점은 ‘…복잡한 직무 현장의 역량, 수행, 평가에 관한 핵심 문제를 무시할 수 있다’.91 (p714)

 

새롭게 축적되는 문헌은 특히 의학교육의 임상실습 학년에서 서술형 평가(narrative) 같은 주관적 평가를 적절하게 사용하고 해석하는 데 정보를 제공할 수 있다.91 객관성 중심 평가와 비교할 때 서술형 내용이 풍부한 평가(narrative-rich assessment)는 학습자에게 더 실행 가능한 피드백을 제공하고, 학습자에게 임상 진료를 위임할지에 관해 지도 임상 교수진이 내리는 결정에도 가치를 더할 수 있다.92 그러나 합격/불합격의 서술형 평가 과정도 완벽하지 않으며, 편향이나 과소대표 소수집단 학생에게 불리한 평가에서 자유롭지 않다는 점을 말해야 한다. 따라서 모든 평가의 결과를 신중하고 지속적으로 검토할 때 의도하지 않은 결과까지 고려해야 한다. 타당도 평가는 계속되는 과정이어야 한다.88

 

필수 학습 경로와 개별화된 학습 경로 모두에서 역량을 입증하면 ‘학점(credits)’을 부여하는 평가 체계가, 장차 임상의가 돌볼 인구집단이 기대하는 기준을 유지하면서도 의과대학생 집단의 개별화와 다양성을 더 잘 촉진할 수 있을지 모른다. 이러한 학점 기반 체계가 합격/불합격 평가로 구성된다면 의과대학생의 스트레스를 줄이고,93 안녕감을 높이며,94 평생학습에 더 잘 부합하는 숙달 지향 학습(mastery-oriented learning)을 촉진할 수 있다.71 평가의 초점이 다른 수행 평가의 세부사항(예: 미국 의사면허시험 1단계[United States Medical Licensing Exam Step 1]의 숫자 성적평가95)에서 의학 학습자의 개인적·전문직적 발달로 옮겨가면, 그러한 전환이 촉진되거나 새로운 관점에서 검토될 수 있다.

 

심리측정학적 객관성과 외부 동기에 지향된 전통적인 등급별 성적평가 체계에서, 학습을 위한 평가(assessment for learning), 학습에 대한 평가(assessment of learning), 학습으로서의 평가(assessment as learning)를 강조하는 합격/불합격 체계로 전환하는 것은 어느 교육기관에서나 어려울 것으로 예상된다.96 그러나 의학교육자가 평가를 개혁하는 데 도움이 될 요인들이 확인되었고, 유용할 수 있다.97 특히 합격/불합격 평가 패러다임에서는 교수 평가자가 충분히 견고해야 할 역량 기준에 못 미치는 학생을 비판적으로 평가하고 필요할 때 보충교육(remediation)을 시행할 용기가 필요하다.4,42 임상실습에서 불합격 성적을 부여하는 일은 역사적으로 드물었으므로 이를 위해서는 의도적인 노력이 필요하다.98 의학교육자는 학생이 의료행위를 하도록 최선을 다해 준비시켜야 하며, 동시에 역량 기준을 충족할 수 없는 학생에게는 불합격 판정을 내릴 준비도 해야 한다.

결론 (Conclusion) 

의료행위에 필요한 의과대학생의 역량을 평가하는 이상적인 방식은 의학을 성공적이고 안전하고 효과적으로 실천하는 데 필요한 모든 기술의 발달을 비판적으로 평가하면서, 동시에 미래 의사 인력의 개별적 관심, 기여, 다양성을 촉진해야 한다. 학생 개인이나 집단에 해를 끼쳐서는 안 된다. 최근 자료가 축적되면서 등급별 성적평가가 더 높은 스트레스, 우울, 불안, 불공정하다는 인식, 학생 간 응집력 저하, 전문직 정체성 형성 저해, 인종적 격차와 관련된다는 근거가 늘어나는 만큼, 의학교육자와 그들을 지원하는 학교는 교육과정에서 등급별 성적평가가 차지하는 위치를 재고해야 한다. 의학교육자는 교육의 모범적인 실천(best practices)과 새롭게 등장하는 교육학적 전문지식에 익숙해야 한다.99 다른 모든 교육자와 마찬가지로 그들은 ‘제도화된 교육이 조장할 수 있는 부정의에 민감해야 한다. 이는 단순한 숙련도가 아니라 인격의 문제다’.100(p31) 여기에는 영웅적인 교육과정 변화(heroic curricular change)를 수용하고 실현하려는 의학 분야 학문적 지도자의 용기도 필요하다.101 대안적 비등급별 평가를 조사하고, 나아가 그 방식으로 전환하는 것은 반드시 필요하다. 최소한 등급별 성적평가 체계를 유지하는 학교는, 이 방식과 관련된 해로운 영향을 고려할 때 그 사용을 정당화하도록 요구받아야 한다. 이러한 부정적 영향을 해결하지 않은 채 두는 것은 그 영향을 용인해도 된다는 인상을 주며, 의학교육에서 등급별 성적평가가 문제를 안고 지속되는 현상을 암묵적으로 지지한다.

 

 

 

 

Med Educ. 2026 Sep 11.doi: 10.1111/medu.70308. Online ahead of print.

Validity considerations in programmatic assessment of clinical reasoning  

Affiliations Expand

 

🩺 임상추론, 어떻게 "타당하게" 평가할까? Kane의 타당도 틀로 본 임상추론의 프로그램식 평가

📄 Runyon C, Zwaan L, Cuddy MM, Olson APJ, Schaye V. Validity considerations in programmatic assessment of clinical reasoning. Medical Education. 2026;1–10. doi:10.1111/medu.70308 (State of the Science, CC BY-NC-ND 오픈 액세스)

 

안녕하세요! 지금까지 CBME의 역량, 변화이론, 교육 동맹을 차례로 살펴봤는데요. 오늘은 CBME 5대 핵심 구성요소 중 하나인 프로그램식 평가(programmatic assessment) 를, 그중에서도 평가하기 가장 까다로운 역량인 임상추론(clinical reasoning) 에 적용한 논문을 소개할게요.

 

저자진은 미국 NBME의 Christopher Runyon과 Monica Cuddy, 진단 오류 연구로 알려진 에라스무스의 Laura Zwaan, 미네소타의 Andrew Olson, 그리고 LLM으로 EHR 기록의 임상추론을 평가하는 연구를 해 온 NYU의 Verity Schaye예요.

 

한 줄로 줄이면 이래요. "프로그램식 평가는 단일 평가보다 임상추론을 더 타당하게 평가할 수 있지만, 그 자체로 타당한 것은 아니다. 새로운 가정과 위협을 함께 가져오고, 생성형 AI는 그 위협을 더 복잡하게 만든다."


📌 1. 임상추론 평가는 왜 이렇게 어려울까?

🧠 임상추론의 세 가지 특성

임상추론은 의사가 환자를 진단하고 치료하기 위해 자료를 관찰하고, 수집하고, 해석하는 기술, 과정, 또는 결과로 정의돼요. 정보 수집, 감별진단 생성, 초기 치료 결정 같은 여러 하위과정으로 이뤄져 있죠.

 

그런데 이걸 평가하기 어려운 이유가 있어요.

  • 👁️ 대부분 관찰할 수 없어요. 머릿속에서 일어나는 인지 과정이라, 서면 답안, 구두 설명, 관찰된 행동, 진료 기록 같은 간접 증거에 기댈 수밖에 없어요.
  • 🧩 내용과 맥락에 따라 달라요(content- and context-dependent). 한 사례를 잘 풀었다고 다른 사례도 잘 푼다는 보장이 없어요.
  • 📈 시간이 지나며 발달해요. 기초 지식과 추론 전략이 경험을 통해 점점 더 조직되고 효율적으로 변해요.

그래서 저자들은 이렇게 말해요.

단일 평가는 특정 목적, 학습자 수준, 시점에 대해서는 유용한 정보를 줄 수 있지만, 학습자의 임상추론에 대한 탄탄한 특성 기술을 뒷받침할 수는 없다.
"A single assessment can provide useful information for a specific purpose, learner level and point in time but cannot support a robust characterisation of the learner's clinical reasoning."

🧮 그래서 프로그램식 평가

프로그램식 평가는 이런 문제에 대한 대안으로 주목받아 왔어요.

프로그램식 평가는 초점을 단일 수행에서 여러 평가 방법을 활용한, 맥락과 시간에 걸친 수행의 패턴으로 옮긴다. 그런 다음 수집된 정보를 삼각측량하여 축적된 증거의 양과 질에 비례하는 판단을 내린다.
"It shifts the focus from a single performance to patterns of performances across contexts and time using multiple assessment methods. The collected information is then triangulated to make judgements proportional to the amount and quality of the accumulated evidence."

 

그런데 저자들이 보기에 빠진 게 있었어요. 프로그램식 평가가 임상추론 평가의 어떤 약점을, 왜 해결하는지 설명하는 타당도 논증(validity argument) 은 별로 다뤄지지 않았다는 거예요. 이 논문은 바로 그 빈자리를 채우려고 해요.


📐 2. 분석 틀: Kane의 논증 기반 타당도

📖 타당도의 정의

저자들은 Kane의 논증 기반 타당도 틀(argument-based validity framework) 최신판을 사용해요. 타당도의 정의부터 볼게요.

타당도는 '이론과 증거가 제안된, 그리고 실제로 이뤄진 검사 점수의 해석, 사용, 결과를 지지하거나 반박하는 정도'로 정의할 수 있다.
"Validity can be defined as 'the extent to which theory and evidence support or refute proposed and actual or enacted test score interpretations, uses, and consequences.'"

🔗 두 가지 구성요소

Kane의 틀은 두 부분으로 이뤄져요.

  • 해석 및 사용 논증(IUA, interpretation and use argument): 평가 결과가 무엇을 의미하고 어떤 결정에 쓰일지를 명시해요.
  • 타당도 논증(validity argument): 그 주장을 뒷받침하는 증거를 평가하고, 논증이 어디서 강하고 어디서 취약한지 찾아요.

⛓️ 다섯 가지 추론의 사슬

평가 과제에서 학습자에 대한 결정까지는 다섯 개의 추론이 사슬처럼 이어져 있어요.

 

  • 수행(performance)
  • ➡️ 채점(scoring)
  • ➡️ 일반화(generalisation)
  • ➡️ 외삽(extrapolation)
  • ➡️ 결과(consequences)

 

그리고 이 사슬에는 중요한 특징이 있어요.

타당도 논증은 IUA의 그럴듯함에 달려 있으며, 가장 약한 고리만큼만 강하다.
"A validity argument depends on the plausibility of the IUA and is only as strong as its weakest link"

🏛️ IUA는 두 수준에서 작동한다

임상추론의 프로그램식 평가에서 IUA는 두 수준에서 동시에 작동해요.

  • 개별 평가 수준: 각 평가 결과가 무엇을 의미하고 어떻게 쓰이는가
  • 프로그램 수준: 모든 평가를 종합했을 때 어떤 주장을 할 수 있는가. 여기에는 개별 평가의 기여와 약점, 평가 시점과 결정 시점의 관계가 포함돼요.

👩‍⚕️ 가상의 의대생, 마야(Maya)

저자들은 추상적인 논의를 구체적으로 만들려고 마야라는 가상의 의대생을 등장시켜요. 마야가 1학년 심혈관 블록부터 졸업, 전공의 1년차까지 여러 평가를 거치는 과정을 따라가면서 각 추론의 문제를 보여 줘요. 이 글에서도 마야와 함께 가 볼게요. 🚶‍♀️


🔍 3. 다섯 가지 추론별로 본 타당도 쟁점

① 수행 추론 (Performance): 과제가 임상추론을 끌어내는가?

 

  • 핵심 질문: 평가 과제가 평가하려는 지식, 기술, 능력을 실제로 끌어내는가?

 

임상추론은 부분적으로만 관찰할 수 있고, 같은 답도 서로 다른 인지 과정으로 나올 수 있어요.

임상적으로 정답인 응답만으로는 의도한 추론의 증거로 불충분할 수 있다. 과제는 목표로 하는 추론 요소의 관찰 가능한 증거를 끌어내도록 설계되어야 한다.
"A clinically correct response alone may provide insufficient evidence of the intended reasoning; the task must be designed to elicit the observable evidence of the targeted reasoning components."

 

👩‍⚕️ 마야의 사례: 1학년 심혈관 블록에서 마야는 흉통 환자에 대한 핵심 특징 문항(key-feature) 과 확장 연결 문항(extended-matching) 시험을 잘 봤어요. 그런데 이 문항들이 정말로 경쟁하는 진단 가설을 세우고 우선순위를 매기게 했을까요, 아니면 단순 암기만으로도 맞힐 수 있었을까요?

 

또 하나의 문제는 "임상추론"이라는 말이 너무 넓다는 거예요. 정보 수집, 감별진단, 진단 근거 제시, 관리 추론처럼 어떤 하위요소를 겨냥하는지 좁혀서 정의해야 과제가 그걸 끌어냈는지 평가할 수 있어요.

 

그래도 완벽한 확신이 필요한 건 아니에요.

특정 과제가 의도한 추론 과정을 끌어냈는지 완전히 확신할 수는 없지만, 확신이 필요한 것은 아니다. 타당도는 평가 설계, 맥락, 가용 자료를 고려할 때 제안된 해석을 충분히 그럴듯하게 만드는 증거의 축적에 달려 있다.
"Although one can never be entirely certain whether a specific task elicited the intended reasoning processes, certainty is not necessary; validity rests on accumulating evidence that makes the proposed interpretation sufficiently plausible given the assessment design, context and available data."

 

✅ 프로그램식 평가가 돕는 점: 여러 과제와 맥락에서 목표 요소를 끌어낼 기회를 주고, 단서(cueing)나 과제 익숙함(예: 특정 EHR 시스템에 익숙한 것) 때문에 잘한 건지 가려낼 수 있어요.

 

⚠️ 남는 위협:

하지만 프로그램식 평가는 목표로 하는 임상추론 과정을 반복적으로 끌어내지 못하는 평가들에서 생긴 빈틈을 메울 수 없으며, 많은 관찰도 같은 요소만 드러낸다면 임상추론을 과소대표할 수 있다.
"However, programmatic assessment cannot compensate for gaps resulting from assessments that repeatedly fail to elicit the targeted clinical reasoning process, and even many observations may underrepresent clinical reasoning if they make the same components visible."

② 채점 추론 (Scoring): 수행이 방어 가능한 측정치로 바뀌는가? 

 

  • 핵심 질문: 채점 절차가 평가하려는 임상추론의 측면을 포착하고, 정확하고, 일관되고, 공정하게 적용되는가?

 

임상추론은 통합적이고 반복적이에요. 정답 진단을 나열하고도 우선순위를 못 매길 수 있고, 문제 표상(problem representation)은 잘 만들었는데 치료 결정으로 연결하지 못할 수도 있죠.

 

👩‍⚕️ 마야의 사례: 내과 실습에서 마야는 발열과 저혈압 환자를 입원시키고 EHR에 기록해요. 이 입원기록을 구조화된 루브릭으로 평가하는데, 저자들은 이런 질문을 던져요.

  • 루브릭이 임상추론을 글쓰기 능력이나 기록 관례에 대한 익숙함과 구분하는가?
  • 다른 교수가 같은 기록에 비슷한 점수를 줄까?
  • 루브릭 기준이 의도한 임상추론 과정과 정렬되어 있는가?

루브릭 유형에 따른 문제도 있어요.

  • 분석적 루브릭(체크리스트): 핵심 요소가 있는지는 알려 주지만, 그 요소들이 얼마나 잘 통합되고 우선순위가 매겨졌는지는 잘 보여 주지 못해요.
  • 총체적 루브릭(holistic): 추론의 일관성을 보존하지만, 평가자의 전문성과 기대에 크게 의존해요.

✅ 프로그램식 평가가 돕는 점: 단일 채점 방법에 대한 의존을 줄이고, 체계적인 불일치를 드러내요. 예를 들어 마야가 구두 발표에서는 괜찮은데 서면 기록에서만 낮은 점수를 받는다면, 그게 추론의 약점인지, 글쓰기의 문제인지, 채점 절차의 문제인지 살펴볼 신호가 되는 거죠.

 

⚠️ 남는 위협: 프로그램 수준에서는 서로 다른 평가 결과를 어떻게 종합할지가 새로운 문제가 돼요.

채점 추론에 대한 증거가 약한 여러 점수를 합산한다고 해서 타당도 논증이 강화되지는 않는다.
"Aggregating multiple scores with weak evidence for the scoring inference does not strengthen the validity argument."

게다가 합산은 특정 과제나 상황에서만 반복되는 어려움 같은 의미 있는 맥락적 차이를 가릴 수 있어요. 이런 변동은 학습자의 약점에 대한 중요한 정보일 수 있으니, 전체 평점 속에 "평균으로 뭉개지지(averaged out)" 않게 따로 살펴봐야 한다고 해요.

③ 일반화 추론 (Generalisation): 한 평가가 영역 전체를 대표하는가? 

 

  • 핵심 질문: 표집된 관찰이 가능한 모든 평가 조건에서의 수행에 대한 결론을 뒷받침하는가?

 

임상추론은 내용과 맥락에 따라 달라서 이 추론이 특히 어려워요. 사례의 중증도, 환경, 가용 정보, 과제 요구, 팀 구조가 달라지면 추론 방식도 달라질 수 있거든요. 그래서 저자들은 이렇게 강조해요.

관찰 간 변동을 자동으로 측정 오차로 취급해서는 안 된다. 그것은 학습자의 추론이 더 효과적이거나 덜 효과적인 의미 있는 조건을 드러낼 수 있기 때문이다.
"Variability across observations should not automatically be treated as measurement error, as it may reveal meaningful conditions under which the learner's reasoning is more or less effective."

 

👩‍⚕️ 마야의 사례: 실습 후반기, 마야는 여러 과에서 여러 지도교수에게 회진 중 증례 발표를 했어요. 어떤 평가는 훌륭하고 어떤 평가는 개선점을 지적했죠. 이걸 비일관성으로만 볼 게 아니라 환자, 환경, 지도자, 복잡도의 차이 같은 변동의 원인을 살펴봐야 한다는 거예요.

 

✅ 프로그램식 평가가 돕는 점: 여러 환자, 여러 평가자, 반복 관찰이 결론이 단일 수행을 넘어 확장된다는 논증을 강화해요. 증거가 불완전하면 추가 관찰을 할 수도 있고요.

 

⚠️ 남는 위협: 관찰을 늘린다고 다 해결되지는 않아요.

하지만 관찰을 더 한다고 해서 일반화 가능성이 반드시 향상되는 것은 아니며, 환자와 조건을 통제하기 어려운 작업장 환경에서는 특히 그렇다.
"However, more observations do not necessarily improve generalisability, particularly in workplace settings where there is less control over patients and conditions."

 

필요한 표집의 폭도 용도에 따라 달라요. 형성평가라면 특정 맥락의 피드백에 집중해도 되지만, 여러 환경에 걸친 주장을 하려면 더 넓은 표집이 필요해요.

④ 외삽 추론 (Extrapolation): 평가 수행이 실제 진료에 대해 무엇을 말해 주는가? 

 

  • 핵심 질문: 평가가 대표하는 지식, 과정, 행동, 조건이 실제 진료에서 요구되는 것과 정렬되어 있는가?

 

실제 진료의 임상추론은 변하는 환자 상태, 불확실성, 경쟁하는 요구, 팀 상호작용, 업무 흐름 속에서 일어나요. 그런데 평가는 흔히 이런 조건을 표준화하거나 일부 요소만 떼어 내요.

 

👩‍⚕️ 마야의 사례: 1학년 임상술기 과목의 형성 OSCE에서 마야는 점진적 호흡곤란을 호소하는 표준화 환자를 면담, 진찰하고 진료 후 기록(post-encounter note) 에 감별진단을 적었어요. 잘했지만, OSCE는 협조적인 환자, 통제된 시간, 미리 정해진 소견이 있는 표준화된 시뮬레이션이에요. 실제 진료의 경쟁하는 우선순위, 불확실성, 방해, 업무 부담 속에서도 잘할지는 알 수 없죠.

 

✅ 프로그램식 평가가 돕는 점: 진료와의 거리가 서로 다른 평가들을 결합할 수 있어요.

  • 비작업장 평가(필기시험 등): 사례와 임상 결정을 넓게 표집
  • OSCE: 표준화된 조건에서 선택된 추론 과정을 관찰
  • 작업장 기반 평가(WBA): 실제 환자진료 속에서 추론이 어떻게 일어나는지 확인

예를 들어 OSCE에서 감별진단을 세우던 마야가 실습에서는 그 감별진단을 수정하고 행동에 옮기는 단계로 나아가는지 종단적으로 볼 수 있어요.

 

⚠️ 남는 위협:

프로그램식 평가는 평가와 진료 사이의 간극을 없앨 수 없다.
"Programmatic assessment cannot eliminate the gap between assessment and practice."

 

WBA도 사례, 감독, 팀 구성, 책임이 환경마다 달라서 불완전한 그림을 줄 수 있어요. 결론은 평가에 반영된 조건에 비례해야 한다고 해요.

⑤ 결과 추론 (Consequences): 해석과 결정이 정당한가? 

 

  • 핵심 질문: 평가 정보를 해석하고 사용한 결과로 이어지는 의도한 결과와 의도하지 않은 결과는 무엇인가?

 

임상추론은 맥락 의존성이 커서 한 번의 좋은 수행이나 나쁜 수행이 학습자만큼이나 사례를 반영할 수 있어요. 그래서 결정의 강도가 증거의 폭과 일관성에 비례해야 한다는 비례성(proportionality) 원칙이 특히 중요해요.

정확한 증거든 축적된 증거든 모든 용도를 정당화하지는 않는다. 보충교육, 진급, 졸업, 위임에 대한 결정은 일상적인 형성 피드백보다 상당히 더 강한 증거를 필요로 한다.
"Neither accurate nor accumulated evidence justifies every use: decisions about remediation, progression, graduation or entrustment require substantially stronger evidence than routine formative feedback."

 

👩‍⚕️ 마야의 사례: 졸업할 때 임상역량위원회(CCC) 가 마야의 종단 포트폴리오, 즉 필기시험, OSCE, WBA, EHR 기록, 서술형 코멘트를 검토해요. 개별 결과가 아니라 방법, 맥락, 시간에 걸친 증거의 패턴을 보고 전공의 과정으로 넘어갈 준비가 됐다고 판단하죠. 동시에 잘못된 결정의 결과, 즉 준비 안 된 학습자를 졸업시키는 것과 준비된 학습자의 진급을 불필요하게 늦추는 것도 함께 고려해야 해요.

 

✅ 프로그램식 평가가 돕는 점: 저부담 평가와 고부담 결정 시점을 분리해서, 결정의 결과가 클수록 더 강한 증거를 요구하는 비례성을 뒷받침해요.

 

⚠️ 남는 위협: 저는 이 부분이 이 논문에서 가장 중요한 경고라고 봐요.

프로그램식 평가에서 축적된 증거의 양은, 개별 평가의 약점이 다른 평가로 보완되지 않으면 학습자의 수행을 잘못 표상할 수 있다.
"The amount of evidence accumulated in programmatic assessment can create a false representation of the learner's performance if the individual assessments have weaknesses that are not complemented by other assessments."

 

또 위원회의 판단도 사람의 판단에 따르는 의사결정 편향과 잡음(noise) 에서 자유롭지 않아요. 그래서 증거를 어떻게 검토하고 통합하는지, 불일치와 불확실성을 어떻게 다루는지, 최종 결정을 어떻게 내리는지 투명한 절차가 필요하다고 해요.

📊 한눈에 보기

추론 핵심 질문 프로그램식 평가가 돕는 점 남는 위협
수행 과제가 임상추론을 끌어내는가? 여러 과제와 맥락에서 목표 요소를 끌어낼 기회 같은 요소만 반복해서 드러내면 과소대표
채점 수행이 방어 가능한 측정치가 되는가? 단일 채점 방법 의존 감소, 체계적 불일치 발견 이질적 증거를 어떻게 종합할지에 대한 새 가정
일반화 한 평가가 영역 전체를 대표하는가? 여러 환자, 평가자, 반복 관찰 관찰을 늘린다고 일반화 가능성이 반드시 높아지진 않음
외삽 평가 수행이 실제 진료를 말해 주는가? 진료와 거리가 다른 평가의 결합 평가와 진료 사이의 간극은 남음
결과 해석과 결정이 정당한가? 저부담 평가와 고부담 결정의 분리, 비례성 증거의 양이 만드는 착시, 위원회 판단의 편향과 잡음

🤖 4. 생성형 AI: 모든 추론을 가로지르는 도전

저자들은 생성형 AI(GAI)를 특정 추론 하나의 문제가 아니라 추론 사슬 전체에 걸친 타당도 문제로 다뤄요.

① 수행: 측정 대상 자체가 바뀐다 

학습자가 GAI를 쓸 수 있을 때, 관찰된 수행은 '학습자의 임상추론'에서 'AI와 함께하는 학습자의 임상추론'으로 바뀐다.
"When GAI is available to the learner, the observed performance shifts from 'the learner's clinical reasoning' to 'the learner's clinical reasoning with AI'."

 

답이 학습자가 만든 건지, AI가 제안한 건지, 둘의 상호작용에서 나온 건지 알기 어려워진다는 거죠. 그래서 이런 결정이 먼저 필요해요.

따라서 평가 프로그램은 인간 단독의 도움 없는 추론을 측정하려는 것인지, 아니면 AI 보조 추론과 효과적인 인간-AI 협업을 측정하려는 것인지 명시적으로 정의해야 한다. 각각은 서로 다른 타당도 논증을 필요로 하기 때문이다.
"Assessment programmes must therefore explicitly define whether they intend to measure human-alone, unaided reasoning, or AI-assisted reasoning and effective human–AI collaboration, because each requires a different validity argument."

 

👩‍⚕️ 마야의 사례: 전공의 1년차가 된 마야가 GAI 임상의사결정지원 도구를 쓰면서 환자를 봐요. AI가 감별진단의 상당 부분을 만들었다면, 독립적인 진단 추론을 측정한다는 평가는 더 이상 의도한 구성개념을 끌어내지 못해요. 대신 AI 제안을 비판적으로 평가하고, 오류를 찾고, 임상 소견과 통합하고, 최종 진단에 대한 책임을 유지하는 능력을 평가할 수 있어요. 그러려면 마야에게 AI를 어떻게 썼는지, 어떤 제안을 받아들이고 거부했는지, 최종 결정의 근거가 무엇인지 설명하게 해서 상호작용을 관찰 가능하게 만들어야 해요.

② 채점: 무엇을 채점하고, 누가 채점하는가 

  • 도움 없는 답을 전제로 만든 채점 기준은 AI가 만든 완성도, 구성, 세련됨에 점수를 줄 수 있어요. AI 사용을 허용한다면 AI 정보를 검증하고, 통합하고, 정당화하는 능력을 채점 기준에 반영해야 해요.
  • AI를 자동 채점에 쓴다면 그 채점 시스템에도 별도의 타당도 논증이 필요해요.

GAI와 전문가 평가자가 수치상 비슷한 점수를 주더라도 같은 의미를 갖지 않을 수 있다. 모델과 인간 평가자가 수행의 서로 다른 특징에 주목하기 때문이다.
"Numerically similar scores from GAI and expert raters may not have the same meaning because the model and the human assessor attend to different features of the performance."

 

AI 점수는 모델, 프롬프트, 채점 절차, 제공된 맥락 정보에 따라서도 달라질 수 있어요.

③ 일반화: 모델이 바뀌면 수행도 바뀐다 

한 모델을 잘 쓰는 학습자가 다른 모델에서도 잘한다는 보장이 없어요. 모델, 버전, 인터페이스, 프롬프트, 접근 조건에 따라 수행이 달라지니까요. 또 좋은 도구에 대한 접근성과 AI 리터러시를 기를 기회의 차이는 축적된 증거가 비교 가능한 수행을 대표하는지에 의문을 던져요.

④ 외삽: 목표로 하는 진료 환경은 어떤 곳인가 

AI 없이 본 평가는 AI가 일상적으로 쓰이는 진료를 대표하지 못할 수 있고, 반대로 AI를 쓴 평가는 도구가 없거나 믿을 수 없거나 부적절한 상황을 대표하지 못할 수 있어요.

⑤ 결과: 전면 허용도, 전면 금지도 문제 

  • 무제한 사용은 기초 추론의 부족을 가리고, AI 권고를 평가하는 데 필요한 지식을 기를 기회를 줄여서 탈숙련(deskilling), 오숙련(mis-skilling), 미숙련(never-skilling) 으로 이어질 수 있어요.
  • 전면 금지는 현대 진료를 제대로 대표하지 못하고 학습자가 AI를 책임 있게 쓰지 못한 채 남게 할 수 있어요.
  • 접근의 형평성, 프라이버시, 자동화 편향(automation bias) 도 고려해야 해요.

🌱 그래도 기회는 있다

저자들은 AI가 일부 약점을 보완할 수 있다고도 봐요.

  • 인터랙티브 시뮬레이션이 최종 답만 보는 평가보다 추론 과정을 더 잘 드러낼 수 있어요.
  • 복잡한 수행을 빠르게 분석하고, 서술형 정보를 정리하고, 전문가 검토가 필요한 수행을 표시해 줄 수 있어요. 다만 중대한 판단은 책임 있는 인간의 해석에 남아야 해요.
  • 전문과, 환자 특성, 맥락, 복잡도, 진단 불확실성에 걸쳐 사례의 범위를 넓힐 수 있어요.

물론 AI가 만든 사례, 점수, 피드백, 요약은 정확성, 구성개념 정렬, 대표성, 편향, 안정성을 기존 평가 원칙에 따라 꼼꼼히 검증해야 해요.


🏗️ 5. 실행을 위한 3단계 발달적 통합 프레임워크

그럼 현장에서는 어떻게 시작할까요? 저자들은 반가운 말로 시작해요.

임상추론 평가에 프로그램식 원칙을 도입한다고 해서 기존 평가를 버릴 필요는 없다.
"Adopting programmatic principles for the assessment of clinical reasoning does not require abandoning existing assessments."

그리고 3단계 프레임워크를 제안해요.

단계 초점 할 일
1단계: 정합성과 포괄성 (coherence and coverage) 🗺️ 무엇을 주장하려는가 학습자의 임상추론에 대해 어떤 주장을 할지 정의하고, 기존 평가를 매핑해 구성개념의 폭을 대표하는지 확인. 빈틈, 중복, 불일치 찾기. 전면 재설계 대신 가장 중요한 추론부터 시작
2단계: 의도적 깊이 (intentional depth) 🔍 더 풍부한 정보 맥락과 복잡도를 바꿔 가며 평가를 반복. 비슷한 도구를 여러 환경에서 쓰되, 용도와 학습자의 발달 단계에 맞게 채점과 해석을 조정
3단계: 멀티모달, 맥락 교차, 종단적 통합 🔗 패턴 찾기 환경과 평가 유형을 넘어 증거를 종합해 시간에 따른 패턴 확인. 초기의 비작업장·시뮬레이션 평가와 실습 이후의 WBA를 통합

✅ 6. 결론: 타당도는 도구의 속성이 아니다

결론 부분의 두 문장이 이 논문의 핵심을 담고 있어요.

프로그램식 평가는 과제, 환경, 평가자, 시간에 걸쳐 상호보완적인 증거를 모으기 때문에 어떤 단일 측정보다 방어 가능하다. 하지만 그것은 본질적으로 타당한 것이 아니다. 그 강점은 명시적인 주장, 의도적인 표집, 추론 사슬 전반의 취약점에 대한 주의, 그리고 증거를 종합하고 사용하는 투명한 절차에 달려 있다.
"Programmatic assessment is more defensible than any single measure because it assembles complementary evidence across tasks, settings, assessors and time. But it is not inherently valid; its strength depends on explicit claims, deliberate sampling, attention to vulnerabilities across the inference chain, and transparent processes for synthesising and using evidence."

 

그래서 기관이 할 일은 평가를 더 늘리는 게 아니라, 주장을 명확히 하고, 평가를 그 주장에 매핑하고, 빈틈과 중복을 찾고, 종단적 통합 체계를 만드는 거라고 해요.

그렇다면 타당도는 도구의 속성이 아니라, 더 나은 학습, 결정, 환자진료를 위한 증거 구축에 대한 기관의 지속적인 헌신이다.
"Validity, then, is not a property of an instrument but an ongoing institutional commitment to evidence building for better learning, decisions and patient care."


💡 7. 읽으며 든 생각과 한국 의학교육에 주는 시사점

마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.

 

  • ① "평가를 더 하자"가 아니라 "주장을 먼저 정하자" 🗺️
    • 우리 의과대학에도 필기시험, CPX/OSCE, 임상실습 평가, 진료 후 기록 평가 등 임상추론과 관련된 평가가 이미 꽤 있어요. 그런데 이 평가들을 모았을 때 학생의 임상추론에 대해 무엇을 주장할 수 있는지 명시적으로 정해 둔 경우는 많지 않을 거예요. 1단계인 주장 정의와 평가 매핑만 해도 빈틈과 중복이 꽤 보일 것 같아요. 교육과정 개편이나 평가인증 준비와도 자연스럽게 연결될 수 있고요.
  • ② 합산 점수에 대한 경계 ➕
    • 여러 평가 점수를 가중 합산해서 등급을 매기는 방식은 흔하죠. 그런데 이 논문은 채점 근거가 약한 점수들을 합산해도 타당도는 올라가지 않으며, 오히려 의미 있는 맥락적 약점을 "평균으로 뭉개 버릴" 수 있다고 경고해요. 점수보다 패턴을 읽을 수 있는 CCC 같은 구조와 종합 절차가 필요하다는 이야기예요.
  • ③ 평가에서 AI 정책을 먼저 정하기 🤖
    • "AI를 써도 되나?"보다 먼저 "우리는 무엇을 측정하려는가?", 곧 인간 단독의 추론인지 AI 협업 능력인지를 정해야 한다는 제안은 바로 적용할 만해요. 과제마다 목적이 다르다면 AI 사용 규칙도 달라야 하고, 각각 다른 타당도 논증이 필요하다는 거죠.
  • ④ 비판적으로 읽을 지점 🤔
    • 이 논문은 경험 연구가 아니라 개념적 분석이고, 마야와 대시보드(Figure 1, 2)도 예시예요. 실제로 이런 체계를 운영한 결과는 아직 제시되지 않았어요.
    • 저자들이 가장 큰 새 위협으로 꼽은 "상충하는 증거를 어떻게 종합할 것인가" 에 대해서는 투명한 절차가 필요하다는 원칙까지만 제시하고, 구체적인 방법론은 남겨 두었어요.
    • 3단계 프레임워크, 특히 3단계의 멀티모달 종단 통합은 데이터 인프라와 인력이 많이 필요해요. 자원이 한정된 기관에서 어디까지 가능할지는 따로 고민이 필요해 보여요.
    • 저자 중 여럿이 NBME 소속이라는 점도 참고할 만해요. 이해상충은 없다고 밝혔어요.

 

  • ⑤ 앞의 글들과 이어서 보기 🔗
    • Macy 권고안은 AI가 CBME의 평가 데이터 문제를 풀 수 있다고 기대했고, Pusic·ten Cate는 분산인지를 이야기했죠. 이 논문은 그 기대가 평가의 타당도라는 관점에서 어떤 새 문제를 만드는지 보여 줘요. CBHPE 변화이론의 "실행의 실패와 이론의 실패를 구분하자" 는 메시지나, 교육 동맹 논문의 CCC와 투명한 데이터 사용 권고와도 잘 맞물려요. 결국 좋은 평가 체계는 도구, 관계, 절차가 함께 설계되어야 한다는 생각이 들어요.

📝 정리하며

  • 임상추론은 관찰하기 어렵고, 맥락에 따라 달라지고, 발달하는 역량이라 단일 평가로는 제대로 볼 수 없어요.
  • 저자들은 Kane의 논증 기반 틀로 수행, 채점, 일반화, 외삽, 결과의 다섯 추론을 검토했어요. 타당도 논증은 가장 약한 고리만큼만 강해요.
  • 프로그램식 평가는 각 추론을 강화하지만, 이질적 증거의 종합이라는 새 가정을 가져오고, 증거의 양이 착시를 만들 수도 있어요.
  • 생성형 AI는 측정 대상을 "AI와 함께하는 임상추론" 으로 바꾸고, 채점, 일반화, 외삽, 결과 모두에 새로운 위협과 기회를 만들어요. 먼저 무엇을 측정할지 정해야 해요.
  • 실행을 위해 정합성과 포괄성 ➡️ 의도적 깊이 ➡️ 종단적 통합의 3단계를 제안했어요.
  • 타당도는 도구의 속성이 아니라 기관의 지속적인 헌신이에요.

함께 읽으면 좋은 글로는 Kane 틀을 의학교육에 적용한 Cook 등(2015), "A contemporary approach to validity arguments"(Med Educ 49:560–575), 그리고 같은 문제의식을 먼저 다룬 Schuwirth & van der Vleuten(2012), "Programmatic assessment and Kane's validity perspective"(Med Educ 46:38–48) 를 추천해요. 📎


1. 서론 (Introduction) 

임상의는 환자와 만나는 동안, 흔히 불확실하고 질병 양상이 변화하는 상황에서 많은 진단 및 관리 결정을 내린다.1,2 임상추론의 오류는 진단과 관리의 실수가 환자에게 해를 줄 수 있으므로 중대한 결과를 초래할 수 있다.3–5 따라서 임상추론은 핵심 역량이자 보건의료 전문직 교육의 중심 요소로 널리 인정된다.6

 

임상추론은 임상의가 환자를 진단하고 치료하기 위해 데이터를 관찰·수집·해석하는 기술, 과정 또는 결과로 정의된다.7,8

  • 임상추론은 다면적이며, 정보 수집, 감별진단 생성, 치료의 첫 단계를 결정하는 일 등 복잡한 진단·관리 추론의 하위 과정을 포함한다.7,9
  • 임상추론의 많은 측면은 관찰할 수 없는 인지 과정이므로, 평가는 기저 추론의 근거로서 서면 답변, 구두 설명, 관찰된 행동 또는 임상 기록에 의존해야 한다.

이러한 특성은 임상추론 평가를 어렵게 한다. 어떤 단일 평가 방법, 과제, 관찰도 임상추론의 폭을 모두 나타낼 수 없다. 또한 임상추론은 내용과 맥락에 의존하므로 어떤 상황의 수행이 다른 상황의 수행을 잘 나타내지 못할 수 있다. 학습자의 임상추론은 시간이 지나면서 발달한다. 기초 의학 지식과 공식적인 추론 전략은 연습과 경험을 통해 점차 더 체계적이고 효율적으로 조직된다. 단일 평가는 특정 목적, 학습자 수준, 시점에 유용한 정보를 제공할 수 있지만 학습자의 임상추론을 견고하게 특성화할 수는 없다.

 

이러한 어려움에 대응하는 접근법으로 프로그램적 평가가 주목받고 있다.10 이는 단일 수행에서 초점을 옮겨 여러 평가 방법을 사용해 맥락과 시간에 걸친 수행의 패턴을 살핀다. 그런 다음 축적된 정보에 대한 삼각검증(triangulation)을 통해 축적된 근거의 양과 질에 비례하는 판단을 내린다. 이 접근법은 임상추론의 다차원적·상황적·발달적 특성에 잘 부합한다.10–12

 

경험적 연구는 여러 해의 코호트에 걸쳐 지역 평가 데이터를 학습자의 임상추론에 관한 교수진의 판단과 연관시키며 이 접근법을 조작화하기 시작했다.13 다른 연구자들은 평가 프로그램 안에서 발달적 진전이 이루어진다는 주장의 근거로서 역량 기반 평가에서 학습자의 점수가 시간에 따라 향상되는지를 살펴보았다.14 그러나 프로그램적 접근법이 임상추론 평가의 구체적 취약성을 왜 해결하는지 설명하는 타당도 논증에는 관심이 상대적으로 적었다.

 

생성형 인공지능(GAI)이 임상 진료와 의학교육에 빠르게 도입되면서 이미 어려운 타당도 과제는 더욱 복잡해졌다. GAI를 학습자와 임상의가 점점 더 쉽게 사용할 수 있게 됨에 따라 임상추론의 수행과 평가 방식에 영향을 미치고, 타당도 추론 사슬의 모든 연결 지점에 새로운 고려사항을 도입한다. 따라서 저자들은 핵심 틀을 확립한 다음 GAI를 횡단적인 타당도 과제로 다룬다.

 

이 논문에서는 Kane의 논증 기반 타당도 틀을 갱신한 형태로 사용하여 프로그램적 임상추론 평가의 타당도 문제를 검토한다. 타당도는 ‘이론과 근거가 제안된 검사 점수 해석과 실제로 이루어지는 점수 해석, 사용 및 결과를 지지하거나 반박하는 정도’로 정의할 수 있다.15 (p.251). 논의는 수행, 채점, 일반화, 외삽, 결과라는 다섯 추론을 중심으로 구성한다.15–19 각 추론에 대해 핵심 타당도 질문을 확인하고, 개별 평가와 평가 프로그램 모두의 수준에서 임상추론에 고유한 문제를 설명하며, 프로그램적 접근법이 단일 평가의 약점을 어떻게 줄일 수 있는지와 남아 있거나 새로 생기는 타당도 위협을 논의한다. 각 타당도 추론을 검토한 뒤에는 GAI를 횡단적인 타당도 고려사항으로 다룬다. 마지막으로 평가 프로그램이 일관성과 적용 범위를 높이고, 의도적인 깊이를 만들며, 방법·맥락·시간 전반에 걸친 근거를 통합함으로써 임상추론 평가 프로그램을 구축하도록 돕는 세 단계 발달적 통합 틀을 제안한다.

 

이러한 임상추론의 타당도 문제를 구체화하기 위해 저자들은 가상의 의대생 마야(Maya)가 학부 의학교육을 받는 과정을 따라간다. 마야는 의과대학 전반에서 서로 다른 목적을 위해 설계되고, 여러 맥락에서 이루어지며, 복잡성이 점점 높아지는 평가를 수행한다. 어느 하나의 평가도 마야의 임상추론 전체를 특성화하기 위한 것은 아니다. 대신 각 평가는 임상추론의 서로 다른 측면에 관한 고유한 근거를 제공하며, 축적된 정보는 임상적 책임이 점차 커지는 상황에 대한 마야의 준비도를 더 폭넓게 해석하고 판단하도록 뒷받침한다.

 

그림 1과 2는 임상추론의 프로그램적 평가가 실제로 어떤 모습일 수 있는지 보여준다.

  • 그림 1은 종합적 관점을 제시한다. 이는 과제와 맥락의 복잡성이 증가하는 가운데 여러 시점에서 수집된 평가 자료를 바탕으로 임상추론의 각 영역에서 학생이 어떻게 진전하는지 추적하는 대시보드이다.
  • 그림 2는 하나의 영역, 즉 감별진단을 보여준다. 임상 전 단계 학습자의 객관구조화진료시험(objective structured clinical examination, OSCE) 수행과 진료 후 기록(post-encounter notes)20에서부터 임상 수련에 들어간 이후의 구두 증례 발표21와 전자의무기록(electronic health record, EHR) 작성22에 이르기까지, 학생과 함께 구체적인 평가 자료가 어떻게 달라지는지 설명한다.

 

그림 1. 시간, 과제의 복잡성, 맥락에 걸친 여러 평가 자료에 근거한 마야의 임상추론 발달 경로 (Maya's Developmental Progression of Clinical Reasoning, Informed by Multiple Assessment Inputs over Time, Complexity and Context) 

 

 

 

  • 그림 속 표기: 가로축은 시간(Time), 세로축은 과제의 복잡성(Task Complexity)과 맥락의 복잡성(Contextual Complexity)이다. A1–A7은 여러 시점의 평가를 나타내며, 초기에는 발달 중인 기술의 평가(Assessment of Developing Skills), 이후에는 핵심 기술의 반복 평가(Iteration of Core Skills)가 이루어진다. 임상추론 대시보드(Clinical Reasoning Dashboard)의 구성요소는 정보 수집(Information Gathering), 문제 표상(Problem Representation), 감별진단(Differential Diagnosis), 작업진단(Working Diagnosis), 진단 정당화(Diagnostic Justification), 관리 및 치료(Management and Treatment)이다.

 

이 대시보드는 임상추론의 각 구성요소에 대해 마야가 역량을 어느 정도 충족하는지 보여준다. 색이 짙을수록 더 높은 수준의 역량에 도달했음을 뜻한다.

 

그림 2. 감별진단에 관한 구체적 평가 자료의 예를 세밀하게 보여주는 그림 (A Granular View of Examples of Specific Assessment Inputs about Differential Diagnosis) 

 

  • 그림 속 표기:
    • A1(임상 전 단계): 목적은 감별진단에 초점을 둔 의대 1학년 형성평가, 형식은 1학년 OSCE, 데이터는 진료 후 기록의 감별진단에 대한 사람의 점검표 또는 AI 평가, 결정은 수련 단계에 적절한 감별진단이라는 판단이다.
    • A3(임상 단계): 목적은 감별진단에 초점을 둔 임상실습 연도의 형성평가, 형식은 회진 중 구두 발표, 데이터는 추론 도구 점검표를 사용한 평가, 결정은 감별진단의 우선순위 설정에 추가 코칭이 필요하다는 판단이다.
    • A6(임상 단계): 목적은 감별진단에 초점을 둔 의대 최종 학년 형성평가, 형식은 EHR의 입원 기록, 데이터는 입원 기록에 나타난 감별진단에 대한 AI 평가, 결정은 학생이 역량 기준을 충족했다는 판단이다.

 

마야가 진전할수록 과제와 맥락의 복잡성도 높아진다. EHR은 전자의무기록, OSCE는 객관구조화진료시험을 뜻한다.

2. 임상추론의 프로그램적 평가가 필요한 이유 (The Imperative for Programmatic Assessment of Clinical Reasoning) 

프로그램적 접근법은 평가들을 상호보완적인 구성 단위로 다룬다. 그 강점은 과제, 맥락, 시간에 걸쳐 근거를 의도적으로 수집하고 통합하는 데서 나온다.10,11,23–25 이러한 프로그램의 타당도 논증을 구축하려면 먼저 평가 결과가 무엇을 의미하고 어떻게 사용될 것으로 의도되었는지 명확히 해야 한다.17,18 Kane의 논증 기반 틀은 서로 관련된 두 구성요소를 통해 이를 공식화한다.

  • 첫째인 해석 및 사용 논증(interpretation and use argument, IUA)은 평가 결과의 의도한 의미와 그것을 사용할 결정 또는 행동을 명시한다.
  • 둘째인 타당도 논증(validity argument)은 이러한 주장을 뒷받침하는 근거를 평가하여 논증이 강한 지점과 취약한 지점을 확인한다.17,18
  • IUA와 타당도 논증은 함께, 평가 과제를 학습자에 관한 행동·판단·결정과 연결하면서 제안된 평가 결과의 해석과 사용이 정당한지 판단하는 데 도움이 된다.

Kane의 틀은 학습자가 평가에서 수행하도록 요구받는 일과 그 수행의 함의를 연결하는 추론의 사슬로 구성된다. 추론은 수행, 채점, 일반화, 외삽, 결과의 다섯 가지다. 타당도 논증은 IUA의 그럴듯함(plausibility)에 달려 있고 가장 약한 연결고리만큼만 강하다. 사슬의 다섯 추론은 평가 목적에 따라 중요도가 달라질 수 있으며, 서로 다른 추론을 뒷받침하려면 서로 다른 유형의 타당도 근거가 필요할 수 있다. Kane의 틀은 검토하는 평가의 구체적 특성에 맞춰 유연하게 사용하는 것이 가장 좋다.

 

임상추론 평가 프로그램에서 IUA는 두 수준에서 동시에 작동한다.

  • 개별 평가 수준에서는 각 평가의 결과가 무엇을 의미하고 어떻게 사용될 것인지를 명시한다.
  • 프로그램 수준에서는 평가 프로그램의 구조 안에 포함된 모든 평가에서 얻은 정보를 바탕으로 할 상위의 주장과 가정을 IUA가 분명히 해야 한다. 여기에는 개별 평가의 기여와 약점, 평가 시점과 행동·결정 시점 사이의 관계가 포함된다.10,11,26
  • 프로그램적 접근법은 임상추론을 평가할 때 각 타당도 추론과 연관된 문제에 잘 대응할 수 있지만, 아래에서 논의하듯 고유한 새로운 문제도 가져온다.

3. 추론 사슬 전반의 타당도 문제 (Validity Issues Across the Inference Chain) 

3.1 수행 추론: 과제가 임상추론의 토대가 되는 지식·기술·능력을 끌어내는가? (Performance Inference: Do the Tasks Elicit the Knowledge, Skills and Abilities Underlying Clinical Reasoning?) 

  • 수행 추론(performance inference)은 평가 과제를 학습자가 산출한 수행과 연결한다. 이 추론은 과제가 평가하려는 구성개념을 정의하는 지식, 기술, 특성을 끌어낼 수 있는지 묻는다.15,17,18 임상추론 과정은 일부만 관찰할 수 있고, 같은 답변도 정보 수집, 가설 생성, 우선순위 설정, 의사결정의 서로 다른 조합에서 나올 수 있으므로 이 추론은 특히 어렵다.7 임상적으로 올바른 답변만으로는 의도한 추론의 근거가 충분하지 않을 수 있다. 과제는 목표로 한 추론 구성요소를 관찰할 수 있는 근거가 드러나도록 설계해야 한다.
  • 마야가 의대 1학년의 심혈관계 교육 단원을 공부할 때 수행 추론을 살펴볼 수 있다. 마야는 흉통 환자의 진단 추론을 평가하도록 설계된 핵심 특징 문항(key-feature questions)과 확장 연결형 문항(extended-matching questions)으로 이루어진 필기시험을 본다. 대부분의 사례에서 가장 가능성이 높은 진단을 정확히 찾아 성적이 좋다. 그러나 교수자들은 이 수행을 해석하기 전에 평가가 실제로 측정하려던 추론 과정을 끌어냈는지 판단해야 한다. 문항이 경쟁하는 진단 가설을 생성하고 우선순위를 정하도록 요구했는가, 아니면 사실을 기억해 내는 것만으로도 정답을 고를 수 있었는가? 수행 추론을 뒷받침하는 근거가 없다면 마야의 정답은 진단 추론 역량에 관한 제안된 해석을 제한적으로만 뒷받침한다.
  • 마야의 사례는 수행 추론을 평가하려면 먼저 평가가 끌어내려는 수행을 충분히 정확하게 설명해야 함을 보여준다. ‘임상추론’은 여러 관련 하위 과정을 포괄하고, 그 과정의 활용과 경계가 과제와 맥락에 따라 달라지므로 이 목적에 쓰기에는 지나치게 폭넓은 이름이다.7,27–29 많은 견고한 틀은 임상추론을 정의하고 평가를 조작화할 때 이러한 복잡성을 명시적으로 인정하고 반영한다.7,29–31
  • 타당도상의 어려움은 임상추론의 틀을 학습자에 대한 정확한 주장, 그리고 특정 평가 과제가 목표로 하는 임상추론 구성요소에 관한 주장으로 옮기기 어렵다는 데서 나온다. 목표로 삼는 요소에는 정보 수집, 감별진단, 진단 정당화, 관리 추론 등이 있다. 이러한 더 좁은 특성화는 학습자 수행에 관한 의도한 해석의 범위를 정하고, 과제가 목표로 한 과정을 끌어냈는지 평가할 토대를 제공한다.
  • 임상추론은 같은 관찰 가능한 답변이 서로 다른 인지 과정에서 산출될 수 있고, 실제 임상추론 수행은 하위 과정의 합보다 더 크기 때문에 수행 추론에 도전이 된다. 특정 과제가 의도한 추론 과정을 끌어냈는지 완전히 확신할 수는 없지만 반드시 확신해야 하는 것도 아니다. 타당도는 평가 설계, 맥락, 이용 가능한 데이터에 비추어 제안된 해석이 충분히 그럴듯해지도록 근거를 축적하는 데 달려 있다.15
  • 프로그램적 평가는 단일 평가에 의존하지 않고 여러 과제와 맥락에서 목표로 한 임상추론 구성요소를 다양한 방식으로 드러낼 기회를 제공함으로써 수행 추론에 대한 위협을 줄일 수 있다. 서로 다른 방법에서 얻은 근거는 전자의무기록 시스템에 익숙한 학생의 사례처럼 관찰된 수행이 단서 제공(cueing)이나 과제에 대한 친숙함에서 비롯되었을 가능성을 낮출 수 있다.10,11 그러나 목표로 한 임상추론 과정을 반복해서 끌어내지 못하는 평가가 낳는 공백을 프로그램적 평가가 메울 수는 없으며, 많은 관찰도 같은 구성요소만 보이게 한다면 임상추론을 충분히 대표하지 못할 수 있다.
  • 교육자들이 평가가 의도한 임상추론 과정을 끌어낼 수 있다는 점을 뒷받침하는 근거가 충분하다고 확신하면, 다음에는 평가 결과를 채점하거나 판단하는 방식이 평가 과제가 드러내도록 설계한 임상추론의 특징을 보존하는지 확인해야 한다.

3.2 채점 추론: 수행은 정당화 가능한 측정치로 전환되는가? (Scoring Inference: Are Performances Translated into Defensible Measures?) 

  • 채점 추론(scoring inference)은 관찰된 수행을 점수, 평정, 분류, 서술적 판단과 연결한다. 채점 절차가 평가에서 끌어내도록 설계한 임상추론의 측면을 포착하고, 정확하고 일관되며 공정하게 적용되는지를 보여주는 근거가 필요하다.15,17 임상추론은 여러 요소를 통합하고 반복하는 과정이므로 이 추론은 특히 까다롭다. 학습자는 진단명을 올바르게 나열하면서도 적절한 우선순위를 정하지 못할 수 있고, 일관된 문제 표상(problem representation)을 만들면서도 이를 뒤따르는 관리 결정에 연결하지 못할 수 있다. 임상추론의 각 단계는 환자의 건강 문제를 해결하려는 목적을 위한 수단이며, 목적을 향한 중간 단계다. 평가 프로그램에서 채점 추론은 개별 수행을 점수나 판단으로 전환하는 일과 이러한 결과를 학습자의 임상추론에 관한 더 폭넓은 해석으로 종합하는 일 모두에 적용된다.
  • 내과 임상실습 중 마야는 발열과 저혈압을 보이는 환자를 입원시키고 그 진료 내용을 EHR에 기록한다. 입원 기록은 문제 표상, 감별진단, 진단 정당화, 관리 계획의 질을 평가하는 구조화된 루브릭(rubric)으로 평가된다. 마야가 기록에서 정교한 추론을 보여주더라도 교육자들은 채점 과정이 그 추론의 질을 정확히 포착하는지 판단해야 한다.
    • 루브릭이 임상추론을 글쓰기 능력이나 기록 관례에 대한 친숙함과 구별하는가?
    • 서로 다른 교수진이 같은 기록에 비슷한 점수를 줄 것인가?
    • 루브릭의 기준이 의도한 임상추론 과정과 정렬되는가?
    • 적용되는 기준이 마야의 수행을 정확히 나타낼 때에만 일관된 점수가 채점 추론을 강화한다.
  • 임상추론은 분석적 점검표 루브릭(analytic checklist rubric)으로 학습자의 수행을 채점하는 경우처럼, 추론의 질을 개별 요소의 유무만으로 항상 나타낼 수 없다는 점에서 특별한 채점 과제를 제기한다.
    • 분석적 루브릭은 보고해야 할 사례의 핵심 특징에 관한 정보를 제공할 수 있지만, 이러한 요소들이 얼마나 잘 통합되고 우선순위가 정해졌는지는 충분히 나타내지 못할 수 있다.
    • 총체적 루브릭(holistic rubrics)은 마야의 추론이 지닌 일관성을 보존할 수 있지만, 이를 사용하려면 평가자의 전문성과 기대에 크게 의존한다.7,32
    • 채점 절차는 학습자들이 같은 임상 문제를 풀 때 서로 다르지만 모두 적절한 추론 접근법을 사용할 수 있다는 점을 인정해야 한다.
  • 프로그램적 평가는 하나의 채점 방법이나 판단에 대한 의존을 줄여 채점 추론의 일부 취약성에 대응한다. 반복되고 다양한 유형의 평가는 상호보완적인 정보를 제공하는 동시에 체계적인 불일치를 드러낼 수 있다. 예를 들어 마야가 구두 발표가 아닌 서면 기록으로 추론을 평가받을 때만 낮은 평정을 받는다면, 이 패턴이 추론 자체의 약점인지, 그것을 서면으로 전달하는 능력의 약점인지, 사용한 채점 절차의 문제인지 조사해야 한다는 신호다.
  • 프로그램 수준에서 채점 추론은 서로 다른 평가의 결과를 더 폭넓은 해석으로 종합하는 방식에도 관한 것이다. 다양한 평가는 학습자의 감별진단에 관한 정보를 제공할 수 있지만(예: 필기시험, OSCE 수행, 직장 기반 관찰), 이러한 수행은 서로 대체 가능하지 않을 수 있다. 프로그램은 학습자의 임상추론에 관해 알고 싶거나 말할 수 있고자 하는 바를 뒷받침하도록 서로 다른 평가의 정보를 어떻게 가장 잘 결합할지 결정해야 한다.
  • 채점 추론의 근거가 약한 여러 점수를 합산한다고 타당도 논증이 강화되는 것은 아니다.12,26 합산은 특정 과제나 환경에서만 반복되는 어려움과 같이 의미 있는 맥락적 차이를 가릴 수도 있다. 이러한 변이는 학습자의 임상추론 약점에 관한 중요한 세부 정보를 제공할 수 있으므로 전체 수행 평정으로 ‘평균화’하지 말고 조사해야 한다.33
  • 프로그램적 평가는 단일 채점 접근법에 대한 의존을 줄이지만,
    • 서로 다른 종류의 근거를 결합하는 방법,
    • 상충하는 정보를 다루는 방법,
    • 더 폭넓은 해석을 도출하는 방법에 관한 새로운 가정을 도입한다.
  • 또한 이러한 가정을 다루는 방식은 평가 목적에 따라 달라져야 할 가능성이 높다. 마지막으로 개별 수행을 정당화 가능한 점수나 판단으로 전환하더라도 그것은 평가가 이루어진 특정 사례와 맥락에 묶여 있으므로, 그 근거가 더 넓은 평가 영역을 적절히 대표하는지 고려해야 한다.

3.3 일반화 추론: 한 평가에서 보인 학습자의 수행이 평가 영역 전반의 수행을 나타내는가? (Generalisation Inference: Does a Learner's Performance on One Assessment Represent Their Performance Across the Assessment Domain?) 

  • 일반화 추론(generalisation inference)은 표집된 관찰로부터 가능한 모든 평가 조건의 모집단에 걸친 수행에 관한 결론을 뒷받침할 수 있는지에 관한 것이다.15,17,19 임상추론 수행은 내용과 맥락에 의존하므로 이 추론은 특히 어렵다. 한 임상 문제 또는 한 조건에서의 성공이 다른 문제나 조건에서의 성공을 보장하지 않는다.32–34 사례의 중증도, 환경, 이용 가능한 정보, 과제의 요구, 팀 구조의 차이는 학습자의 추론 방식을 바꿀 수 있다. 관찰들 사이의 변이를 자동으로 측정오차로 취급해서는 안 된다. 학습자의 추론이 더 효과적이거나 덜 효과적인 의미 있는 조건을 드러낼 수 있기 때문이다.33 개별 평가와 프로그램 수준 모두에서 일반화는 의도한 주장에 포함되는 임상 내용, 맥락, 평가자, 시행 시점, 복잡성의 수준을 의도적으로 표집하는 데 달려 있다. 결론은 실제로 대표된 조건의 범위 안에 두어야 한다.
  • 임상실습 연도의 후반에 마야는 여러 임상실습에서 다양한 진료과와 환경에 걸쳐 여러 지도전문의(attending physicians)에게 회진 중 환자를 발표했다. 교수진은 마야의 구두 증례 발표를 직접 관찰한 뒤 직장 기반 평가를 작성했다. 일부 평가는 매우 우수하지만 다른 평가에서는 계속 발전이 필요한 영역을 지적한다. 교육자들은 이러한 변이를 불일치로 해석하기보다 환자, 임상 환경, 지도자, 복잡성 수준에 따른 차이를 포함한 원인을 고려해야 한다.33 여러 환자와 평가자에 걸친 반복 관찰은 결론이 하나의 수행을 넘어 확장된다는 논증을 강화하여 구두 증례 발표 중 마야의 추론을 더 믿을 만하게 보여준다.
  • 여러 환자와 평가자에 걸친 관찰이 있더라도 마야의 구두 발표 수행이 모든 임상 환경에서의 추론을 반영하지는 않을 수 있다. 프로그램적 평가는 더 넓고 의도적인 관찰의 표집을 가능하게 하지만 필요한 폭은 의도한 사용에 따라 달라진다. 형성평가에서는 관찰이 주로 특정 맥락의 피드백과 학습을 안내할 수 있다. 반면 환경이나 임상 상황 전반에 일반화되는 주장을 뒷받침하려고 관찰을 사용할 때는 더 넓은 표집이 중요하다. 관찰들 사이에 나타나는 패턴을 설명하면 의미 있는 변이를 가릴 수 있는 평균에 의존하지 않고 마야가 잘 수행하는 조건이나 추가 교육이 필요한 조건을 찾는 데 도움이 된다.
  • 프로그램적 평가는 근거가 불완전하거나 일관되지 않을 때 교육자가 추가 관찰을 수집하도록 한다. 그러나 관찰이 많다고 반드시 일반화 가능성이 높아지는 것은 아니다. 특히 환자와 조건을 통제하기 어려운 직장 환경에서는 그렇다. 프로그램은 중요한 공백에 대응할 적절한 표집 절차를 확인하고, 결론을 각 평가가 실제로 끌어낸 임상추론 과정과 맥락으로 한정해야 한다. 일반화는 축적된 근거가 의도한 평가 영역을 나타내는지 다룬다. 외삽은 그 근거로 실제 임상 환경에서 학습자의 임상추론에 관해 무엇을 말할 수 있는지 묻는다.

3.4 외삽 추론: 평가 수행은 임상 진료에 관해 무엇을 말해 주는가? (Extrapolation Inference: What Does Assessment Performance Say about Clinical Practice?) 

  • 외삽 추론(extrapolation inference)은 평가 영역에서의 수행을 임상 진료라는 목표 영역(target domain)에 연결한다. 이는 평가가 나타내는 지식, 과정, 행동, 조건이 실제 진료에서 요구되는 것과 정렬되는지 다룬다.15,17 실제 진료에서의 추론은 흔히 변화하는 환자 상태, 불확실성, 경쟁하는 요구, 팀 상호작용, 임상 업무 흐름 속에서 이루어지므로 임상추론에 관한 이 추론은 어렵다.7,35 그러나 평가는 이러한 조건을 표준화하거나 일부 추론 구성요소만 분리하는 경우가 많다. 따라서 좋은 평가 수행만으로 학습자가 환자 진료 중 이러한 구성요소를 통합하고 적응적으로 활용할 수 있는지는 입증되지 않을 수 있다. 개별 평가 수준에서는 평가 설계가 끌어내는 추론 과정과 조건이 실제 임상 진료에서 요구되는 것과 얼마나 잘 일치하는지 고려해야 한다. 프로그램 수준에서는 여러 평가에 걸친 근거의 패턴이 학습자가 실제 진료에서 임상추론을 어떻게 통합하고 적용하는지에 관한 판단을 뒷받침하는지 고려해야 한다.
  • 수련 초기에 마야는 1학년 임상술기 과정에서 부담이 낮은 형성적 OSCE에 참여한다. 진행성 호흡곤란을 보이는 표준화 환자를 면담·진찰한 다음, 증례를 요약하고 감별진단을 제안하는 진료 후 기록을 작성한다. 교수진은 상세한 형성적 피드백을 제공하지만 총괄적 결정은 내리지 않는다. OSCE가 임상 진료의 많은 특징을 재현하더라도 협조적인 환자, 통제된 시간, 미리 정해진 소견이 있는 표준화된 시뮬레이션이다. 마야의 뛰어난 수행은 이러한 표준화된 조건에서 효과적으로 추론할 수 있음을 보여주지만, 실제 환자 진료에서 경쟁하는 우선순위, 불확실성, 방해, 업무 흐름의 요구 속에서 어떻게 수행할 것인지를 반드시 입증하지는 않는다.
  • 프로그램적 평가는 실제 임상 진료와 얼마나 가까운지가 서로 다른 평가들의 근거를 결합하여 이러한 한계에 대응할 수 있다.
    • 직장 밖에서 이루어지는 평가는 증례와 임상 결정의 폭넓은 표집을 가능하게 한다. OSCE는 표준화된 조건에서 일부 임상추론 과정을 관찰 가능하게 한다.
    • 직장 기반 평가는 환자 진료의 요구 속에서 임상추론이 어떻게 이루어지는지 보여줄 수 있다. 이러한 자료들이 임상추론의 상호보완적인 측면을 보이게 한다면, 자료 사이의 패턴은 단일 평가보다 외삽을 더 강하게 뒷받침한다.7
  • 임상실습 수련 동안 서로 다른 평가의 근거는 마야가 맥락과 변화하는 복잡성 수준을 가로질러 임상추론 과정을 점점 더 잘 통합하는지 보여줄 수 있다. 평가 프로그램은 마야가 OSCE에서 감별진단을 생성하는 데서 나아가 임상실습 중 그 감별진단을 수정하고 그에 따라 행동할 수 있는지 살펴볼 수 있다. 여러 방법과 환경에 걸쳐 패턴이 나타나면 이러한 종단적 근거는 마야의 임상추론에 대한 더 강한 해석을 뒷받침한다.10,23
  • 프로그램적 평가도 평가와 진료 사이의 간격을 없앨 수는 없다. 서로 다른 임상추론 구성요소를 강조하는 과제에서의 수행은 학습자가 환자 진료 중 이러한 요소를 통합할 수 있음을 반드시 보여주지 않는다. 직장 기반 평가 또한 임상 환경마다 사례, 감독, 팀 구성, 책임이 달라 불완전한 관점만 제공할 수 있다. 평가들 사이의 차이는 사례나 맥락, 학습자의 발달, 평가 자체의 한계를 반영할 수 있다. 반복 관찰은 이러한 패턴이 임상 진료에서도 지속되는지 명확히 하는 데 도움이 되지만, 결론은 평가에서 대표된 조건에 비례해야 한다.

3.5 결과 추론: 해석과 결정은 정당한가? (Consequences Inference: Are Interpretations and Decisions Justified?) 

  • 결과 추론(consequences inference)은 평가 정보를 해석하고 사용한 뒤 이어지는 결정과 행동의 의도된 결과 및 의도되지 않은 결과를 다룬다.15,17 임상추론에서는 추론이 내용과 맥락에 의존한다는 점이 잘 알려져 있어 이 추론이 특히 중요하다. 하나의 뛰어나거나 부족한 수행은 학습자만큼이나 사례 자체를 반영할 수 있으므로 결정의 무게가 이를 뒷받침하는 근거의 폭과 일관성에 비례해야 한다. 근거가 정확하거나 많이 축적되었다고 해서 모든 용도가 정당화되는 것은 아니다. 보충 교육(remediation), 진급, 졸업, 신뢰 부여(entrustment)에 관한 결정에는 일상적 형성 피드백보다 훨씬 강한 근거가 필요하다.
  • 의과대학을 마칠 때 임상역량위원회(clinical competency committee)는 필기시험, OSCE, 직장 기반 평가, EHR 기록, 서술형 의견, 그 밖에 학부 의학교육과 수련 전반에서 수집된 근거를 포함하는 마야의 종단적 평가 포트폴리오를 검토한다. 위원회는 개별 평가 결과에 집중하기보다 평가 방법, 맥락, 시간에 걸친 근거의 패턴을 고려한 뒤 임상추론 기술의 측면에서 마야가 전공의 수련으로 이행할 준비가 되었다고 결론 내린다.36 졸업은 학습자, 전공의 수련 프로그램, 환자, 사회에 중요한 결과를 가져오는 중대한 결정이다. 따라서 위원회에는 개별 평가 후 형성적 피드백을 제공할 때보다 훨씬 강한 근거가 필요하다. 위원회는 준비가 부족한 학습자를 졸업시키거나 준비된 학습자의 진전을 불필요하게 지연시키는 등 잘못된 결정의 잠재적 결과도 고려해야 한다.
  • 프로그램적 평가는 부담이 낮은 평가와 결과의 영향이 큰 결정 시점을 구분한다. 학습과 피드백의 반복적인 기회를 제공하여 학습자가 종단적 성장을 보여주도록 하고, 시간이 지나는 동안 더 큰 수행 패턴에 관한 근거를 축적하면서 부담이 낮은 결정을 내릴 기회도 자연스럽게 포함한다. 결정의 결과가 중대할수록 요구되는 근거의 강도가 커지므로 비례성이 뒷받침된다.11,23
  • 프로그램적 평가에 축적된 근거의 양은 개별 평가의 약점을 다른 평가가 보완하지 못하면 학습자의 수행을 잘못 나타낼 수 있다. 위원회의 판단 역시 인간의 판단에 따르는 의사결정 편향과 잡음(noise)에 취약하다.37 투명한 절차는 근거를 검토·통합하는 방법, 불일치와 불확실성을 다루는 방법, 최종 결정을 내리는 방법을 설명해야 한다. 결과 추론은 평가 프로그램 자체의 효과에도 주의를 요구하므로, 프로그램은 결정과 과정이 학습을 지원하고 공정성을 높이며 학습자와 환자에게 의도한 결과를 만들어내는지 평가해야 한다.38,39

마야의 사례들은 어떤 단일 평가도 임상추론 역량을 입증할 수 없음을 보여준다. 각각은 전체 타당도 논증에 기여하는 학습자 수행의 고유한 근거를 제공한다. 이러한 타당도 논증은 임상추론을 학습하고 수행하고 평가하는 방식의 변화도 고려해야 한다. GAI는 이러한 실천의 많은 부분을 재편하면서 추론 사슬 전반에 걸친 새로운 고려사항을 도입한다.

 

 



4. GAI: 횡단적인 타당도 과제 (GAI: A Cross-Cutting Validity Challenge) 

GAI는 평가와 피드백의 추가 기회를 만드는 일부터 임상 진료의 제공 방식을 바꾸는 일까지 여러 방식으로 의학교육을 변화시키고 있다.40–43 이에 따라 GAI의 사용은 추론 사슬의 모든 연결 지점에 타당도상 함의를 갖는다. 아래에서는 GAI가 추가적인 타당도 위협을 도입하는 가장 중요한 방식들을 살펴보고, 이어서 GAI를 평가 프로그램에 의도적으로 포함할 때 앞서 논의한 취약성 일부에 어떻게 대응할 수 있는지 고려한다. 저자들은 GAI가 타당도에 미치는 영향을 여기에서 가능한 것보다 더 깊이 논의할 필요가 있음을 인정한다.

  • GAI는 평가하는 구성개념과 관찰된 수행의 원천을 모두 바꿈으로써 수행 추론을 근본적으로 변화시킬 수 있다. 학습자가 GAI를 사용할 수 있으면 관찰된 수행은 ‘학습자의 임상추론’에서 ‘AI와 함께 수행하는 학습자의 임상추론’으로 이동한다. 이는 관찰된 임상추론 기술의 해석을 흐릴 수 있다. 답변은 주로 학습자가 만든 것인가, GAI가 제안한 것인가, 둘의 상호작용으로 만들어진 것인가? 따라서 평가 프로그램은 인간이 혼자 수행하는 비보조 추론을 측정하려는지, 아니면 AI의 도움을 받는 추론과 효과적인 인간–AI 협력을 측정하려는지 명시해야 한다. 각각에는 서로 다른 타당도 논증이 필요하다.44,45
  • 전공의 1년 차에 마야는 우선순위가 매겨진 감별진단과 관리 권고를 제시하는 임상의사결정 지원 도구로서 GAI를 사용하면서 환자를 평가한다. GAI가 감별진단의 상당 부분을 생성한다면 독립적인 진단 추론을 측정한다고 주장하는 평가는 더 이상 의도한 구성개념을 끌어내지 못할 수 있다. 대신 교육자들은 AI가 생성한 제안을 비판적으로 평가하고, 부정확한 점을 찾고, 권고를 임상 소견과 통합하며, 최종 진단 결정에 대한 책임을 유지하는 마야의 능력을 평가할 수 있다.45,46 따라서 평가 과제는 마야가 GAI를 어떻게 사용했는지 설명하고, 어떤 제안을 수용하거나 거부했는지 밝히고, 최종 결정을 정당화하도록 하여 그 상호작용을 더 관찰 가능하게 해야 한다.
  • GAI는 채점 추론에도 추가적인 고려사항을 만든다. 비보조 답변을 위해 설계된 기존 채점 절차는 답변의 완결성, 조직성, 정교함이 대부분 GAI에서 나왔더라도 그러한 특징에 보상을 줄 수 있다. GAI 사용이 허용된다면 채점 기준은 학습자가 AI 생성 정보를 검증·통합·정당화하는 능력을 반영해야 할 수 있다. GAI 자체를 자동 채점에 사용하는 경우 채점 시스템의 실행에는 별도의 타당도 논증이 필요하다.47,48 GAI와 전문가 평가자가 수치상 비슷한 점수를 주더라도 모델과 인간 평가자가 수행의 서로 다른 특징에 주의를 기울일 수 있으므로 그 점수의 의미가 같지는 않을 수 있다. GAI가 생성한 점수는 모델, 프롬프트, 채점 절차, 제공된 맥락 정보에 따라서도 달라질 수 있다.
  • 일반화 추론에서는 GAI 모델, 버전, 인터페이스, 프롬프트, 접근 조건에 따라 수행이 달라질 수 있다. 한 모델을 효과적으로 사용하는 학습자가 다른 정보를 제공하거나 다른 상호작용 전략이 필요한 또 다른 모델에서도 비슷하게 수행할 것이라고 할 수는 없다. 질 높은 도구에 대한 접근과 GAI 문해력을 기를 기회의 차이는 축적된 근거가 비교 가능한 수행을 나타내는지에 관한 우려도 일으킨다.
  • GAI는 의도한 목표 환경에서 임상 진료에서 AI가 맡을 역할을 명시해야 하므로 외삽 추론도 변화시킨다. 비보조 평가에서의 수행은 GAI 지원을 일상적으로 이용할 수 있는 진료를 나타내지 못할 수 있다. 반대로 GAI를 사용할 수 있는 평가에서의 수행은 도구를 이용할 수 없거나 신뢰할 수 없거나 사용하기 적절하지 않은 환경을 나타내지 못할 수 있다. 평가에 GAI를 포함하더라도 통제된 과제에서의 수행이 불확실성, 업무 흐름의 요구, 그 밖의 임상 환경 요인 속에서의 안전한 사용을 대표하지 않을 수 있다.
  • 마지막으로 GAI 사용에 관한 결정은 중요한 결과를 낳는다. 제한 없는 사용은 기초 추론의 부족을 가리거나 AI가 생성한 권고를 평가하는 데 필요한 지식을 기를 기회를 줄여, 기술을 아예 익히지 못함(never-skilling), 잘못 익힘(mis-skilling), 기존 기술을 잃음(deskilling)에 기여할 수 있다.46,49 반대로 모든 평가에서 GAI를 금지하면 현대의 진료를 충분히 나타내지 못하고 학습자가 도구를 책임 있게 사용할 준비를 갖추지 못하게 할 수 있다. 프로그램은 접근의 형평성, 개인정보 보호, 자동화 편향(automation bias), GAI 지원 평가가 학습자나 환경에 따라 서로 다른 결과를 낳는지도 고려해야 한다.

GAI가 새로운 타당도 위협을 도입하지만 앞서 논의한 일부 취약성에 대응하는 데 도움이 될 수도 있다.

  • 대화형 시뮬레이션과 새로운 평가 과제는 최종 답변만 포착하는 평가보다 임상추론 과정의 구성요소를 더 잘 관찰할 수 있게 하여 수행 추론에 더 좋은 근거를 제공할 수 있다. GAI는 복잡한 수행을 제때 분석하고, 서술형 정보를 정리하며, 전문가 검토가 필요한 수행에 표시를 할 수 있다. 다만 결과가 중대한 판단에는 책임 있는 인간의 해석이 계속 개입해야 한다.22,43,50,51
  • GAI는 전문 분야, 환자 특성, 임상 맥락, 복잡성 수준, 진단적 불확실성에 걸쳐 이용 가능한 증례의 범위를 넓히고 프로그램이 교육적 평가 기회를 목표에 맞게 제공하도록 도울 수 있다.52–54 GAI를 활용한 과제는 이러한 도구를 사용하는 진화하는 임상 환경을 더 잘 반영하고, 신속한 피드백과 부담이 낮은 연습은 근거를 중대한 결정에 사용하기 전에 학습을 지원할 수 있다.46,51,52 이러한 기회에는 세심한 품질 관리가 필요하다. 생성된 증례, 점수, 피드백, 요약은 전통적인 평가의 모범 실천에 맞춰 정확성, 구성개념과의 정렬, 대표성, 편향, 안정성을 평가해야 한다.

새롭게 나타나는 이러한 과제는 개별 평가의 타당도뿐 아니라 평가체계 전반에서 근거가 어떻게 모이고 해석되는지도 검토해야 함을 다시 강조한다. 저자들은 임상추론 평가 프로그램을 실행하기 위한 발달적 틀을 제안하며 마무리한다.

5. 임상추론 평가 프로그램의 실행 (Implementing a Programme of Assessment for Clinical Reasoning) 

임상추론 평가에 프로그램적 원칙을 채택한다고 기존 평가를 포기할 필요는 없다.25,55 기관이 임상추론 평가 프로그램을 채택하도록 돕기 위해 저자들은 세 단계 발달적 통합 틀을 제안한다.

  • 첫 단계는 일관성과 적용 범위(coherence and coverage)에 초점을 맞춘다. 프로그램은 학습자의 임상추론에 관해 제기하려는 주장을 정의하고 현재 평가들을 대응시켜, 이들이 전체적으로 구성개념의 폭을 대표하는지 확인해야 한다.12,56,57 여기에는 공백, 중복, 정렬되지 않은 영역을 확인하는 일이 포함된다.25,56,57 포괄적인 재설계를 시도하기보다 프로그램은 평가 목표에 가장 핵심적인 추론에 초점을 맞추고 그 의도한 추론과 현재 수집하는 근거 사이의 공백을 찾는 일에서 시작할 수 있다.
  • 두 번째 단계는 의도적인 깊이(intentional depth)를 강조한다. 프로그램은 여러 맥락과 복잡성 수준에서 평가를 반복하여 학습자에 관한 더 풍부한 정보를 구축한다.10,58,59 비슷한 도구라도 서로 다른 환경에서 사용할 수 있으며, 채점과 해석은 평가 정보의 의도한 사용과 학습자의 발달 단계에 맞춰 조정한다.11,23,55,59
  • 마지막 단계에는 다중양식, 맥락 간, 종단적 통합(multimodal, cross-context, longitudinal integration)이 포함된다. 시간에 따른 패턴을 확인하기 위해 환경과 평가 유형에 걸친 근거를 종합한다.10,23,24,55 이러한 종단적 관점은 초기 수련에서의 직장 밖 평가와 시뮬레이션 평가로 얻은 근거를 임상실습 및 그 이후의 직장 기반 평가와 통합하게 한다.10,59,60

6. 결론 (Conclusion) 

임상추론의 평가에는 복잡성, 맥락 의존성, 발달적 성격을 반영하는 타당도 논증이 필요하다. 프로그램적 평가는 과제, 환경, 평가자, 시간에 걸친 상호보완적 근거를 모으므로 어떤 단일 측정치보다 더 정당화 가능하다. 그러나 프로그램적 평가가 그 자체로 타당한 것은 아니다. 그 강도는 명시적인 주장, 의도적인 표집, 추론 사슬 전반의 취약성에 대한 주의, 근거의 종합과 사용에 관한 투명한 절차에 달려 있다. 기관이 해야 할 일은 평가를 더 많이 추가하는 것이 아니라 제기하려는 주장을 명확히 하고, 평가를 그 주장과 대응시키며, 공백과 중복을 확인하고, 종단적 통합을 위한 체계를 구축하는 것이다. 특히 GAI와 함께 임상 진료와 교육이 발전함에 따라, 교육자는 단일 평가가 임상추론을 측정하는지보다 평가체계가 변화하는 보건의료 환경에서 더 큰 책임을 맡을 준비도에 대해 공정하고 의미 있는 판단을 뒷받침하는지 물어야 한다. 따라서 타당도는 평가 도구의 속성이 아니라, 더 나은 학습, 의사결정, 환자 진료를 위한 근거 구축에 계속 힘쓰는 기관의 책무다.

 

 

The Educational Alliance: Essential to Implement Competency-Based Health Professions Education 

ICBHPE series

Authors
  • Karen E. Hauer, Mary Ellen J. Goldhamer,  Jonathan Amiel,  Denyse Richardson,  Alan Schwartz,  Adrian P. Marty,  Laura Molgaard,  Severin Pinilla,  Jan Breckwoldt,  As members of the International Competency-Based Health Professions Educators Collaborative

🤝 CBME를 움직이는 건 결국 "관계"다: 교육 동맹(Educational Alliance) 논문 읽기

📄 Hauer KE, Goldhamer MEJ, Amiel J, Richardson D, Schwartz A, Marty AP, Molgaard L, Pinilla S, Breckwoldt J; International Competency-Based Health Professions Educators Collaborative. The Educational Alliance: Essential to Implement Competency-Based Health Professions Education. Perspectives on Medical Education. 2026;15(1):799–813. doi:10.5334/pme.2607

 

안녕하세요! 지난번 CBHPE 성과 변화이론에 이어, 같은 ICBHPE 시리즈에서 한 편 더 소개할게요. 변화이론 논문이 CBME의 성과는 이해관계자의 행동이 기전을 작동시킬 때 나온다고 했잖아요. 오늘 논문은 그 기전 중에서도 가장 기본이 되는 것, 바로 수련생과 지도자 사이의 관계를 다뤄요.

 

UCSF의 Karen Hauer와 하버드의 Mary Ellen Goldhamer가 공동 제1저자예요. 이 논문은 경험 연구가 아니라 이론에 기반한 개념 분석(theory-informed conceptual analysis) 이에요.

 

한 줄로 줄이면 이래요. "교육 동맹은 피드백을 위한 조건일 뿐 아니라, CBME의 5대 핵심 구성요소 전체를 작동시키는 기전이다. 동맹이 없으면 CBME는 참고 견디거나 두려워하는 체크리스트가 된다."


📌 1. 교육 동맹이란?

💬 피드백 개념의 변화

피드백에 대한 생각은 그동안 많이 바뀌었어요. 예전에는 지도자가 수련생에게 정보를 일방적으로 전달하는 것으로 봤다면, 이제는 대화(dialogue) 로 봐요. 피드백의 효과는 관계, 맥락, 내용, 전달 방식, 받아들이는 방식에 따라 달라진다는 거죠.

 

그래서 수련생과 지도자 모두 피드백 리터러시(feedback literacy), 즉 피드백을 구하고, 해석하고, 실행하고, 공유하는 능력을 갖추는 게 이상적이라고 해요.

🧭 Telio의 정의와 세 가지 요소

교육 동맹 개념은 Telio 등이 제안했어요.

Telio는 교육 동맹을 효과적인 피드백의 맥락을 이루는, 수련생과 지도자 사이의 신뢰 관계로 정의했다.
"Telio defined the educational alliance as a trusting relationship between trainee and supervisor that constitutes the context for effective feedback"

교육 동맹은 세 가지 요소로 이뤄져요.

  1. 🫂 관계적 유대(relational bond): 정직한 평가와 피드백 수용에 필요한 심리적 안전감을 만드는 대인 관계
  2. 🎯 공유된 목표(shared goals): 역량, 평가 기준, 진급에 대한 기대를 명확히 하는 관계의 목표와 경계에 대한 상호 이해
  3. 🛠️ 과제에 대한 합의(agreement on tasks): 목표를 어떻게 달성할지, 즉 WBA와 진급 판단 근거를 포함한 활동에 대한 합의

논문의 Figure 1은 이걸 세 겹의 동심원으로 보여 줘요. 가운데에 상호 신뢰와 존중이라는 관계적 토대가 있고, 그 바깥에 공유된 목표와 과제, 가장 바깥에 프로그램식 평가 체계, 심리적 안전감, 기관 문화 같은 맥락 환경이 있어요. 세 층은 대화, 성찰, 조정을 통해 서로 영향을 주고받아요.

 

저자들은 CBHPE에서 이 관계가 특히 중요한 이유를 이렇게 설명해요.

평가가 지속적이고 진급 결정이 중대한 결과를 낳는 CBHPE에서, 교육 동맹의 질은 평가 정보의 신뢰성과 활용 모두를 좌우할 수 있다.
"In CBHPE, where assessment is continuous and progression decisions are consequential, the quality of the educational alliance may shape both the credibility and use of assessment information."


🛋️ 2. 치료 동맹에서 교육 동맹으로

교육 동맹은 심리치료의 치료 동맹(therapeutic alliance), 다른 말로 작업 동맹(working alliance) 에서 가져온 개념이에요. 치료 동맹은 치료 성공을 좌우하는 가장 중요한 요인 중 하나로 꼽히고, 측정 방법과 효과에 대한 경험적 연구도 많이 쌓여 있어요. 두 동맹 모두 신뢰와 권력의 공유가 핵심이에요. 하지만 결정적인 차이도 있어요.

심리치료의 치료 동맹은 대개 외부의 전문적 영향에서 벗어나 신뢰와 성찰을 키우는, 보호되고 배타적인 양자 관계다. 반면 보건의료교육의 교육 동맹은 신뢰와 안내에 기반한다는 점은 같지만, 일부 관찰과 정보가 다른 사람들에게 공개되고 공유되는 복잡한 교육 및 팀 기반 작업장 생태계 안에서 펼쳐진다.
"The therapeutic alliance is typically a protected, exclusive, and dyadic relationship that fosters trust and introspection, free from external professional influences. In contrast, the educational alliance in HPE, while also grounded in trust and guidance, unfolds within a complex educational and team-based workplace ecosystem where some observations and information are available to and shared with others."

 

임상 현장의 지도 관계는 다직종 팀, 동료 수련생, 환자와의 경험, 임상 환경의 여건과 제약에 영향을 받아요. 그래서 둘만의 관계로 닫혀 있을 수 없다는 거죠.


🧠 3. 교육 동맹을 뒷받침하는 두 이론

저자들은 수련생과 지도자 수준에서 동맹이 작동하는 기전을 가장 직접적으로 설명하는 이론으로 두 가지를 골랐어요. 사회문화 이론이나 상황학습 이론도 관련이 있다는 점은 인정하면서요.

🌱 성장 마인드셋 이론 (growth mindset theory)

능력과 지능은 고정된 게 아니라 노력, 효과적인 전략, 다른 사람의 안내로 키울 수 있다는 이론이에요. CBHPE에서 성장 마인드셋은 수련생이 형성평가 데이터를 구하고, 받아들이고, 행동에 옮기려는 의지를 높이는 기전으로 작동할 수 있어요.

지도자가 성장 마인드셋을 기르는 방법으로는 이런 것들이 제시돼요.

  • 결과보다 노력과 학습 전략, 과정을 칭찬하기
  • 도전을 받아들이도록 격려하기
  • 좌절과 실패를 정상적인 것으로 받아들이게 하기
  • 지도자 스스로 피드백을 구하고 성찰하는 모습을 보여 주기

🔁 자기조절학습 이론 (self-regulated learning theory)

수련 단계와 상관없이 학습자가 자기 학습을 능동적으로 관리한다는 이론이에요. 목표 설정, 진척 모니터링, 전략 조정이 핵심이죠. CBHPE에서 자기조절학습은 수련생이 여러 평가 정보를 해석하고 통합해서 역량에 맞는 목표를 세우고 전략을 조정하는 기전이에요. 이 과정은 직선적이지 않고 계획, 실행, 성찰, 조정의 반복 순환이에요.

 

두 이론을 묶어서 저자들은 이렇게 정리해요.

종합하면, 성장 마인드셋과 자기조절학습은 지속적인 강화가 필요한 본질적으로 취약한 구성개념이다. 교육 동맹은 수련생이 자율적인 전문가 역량을 향해 발달하도록 돕는 협력적 수련생-지도자 관계를 통해 이러한 발판을 제공한다.
"Taken together, growth mindset and self-regulated learning represent inherently fragile constructs requiring ongoing reinforcement. The educational alliance provides this scaffolding via its collaborative trainee-supervisor relationship that facilitates trainees' development toward autonomous professional competence."


⚙️ 4. 교육 동맹이 5대 핵심 구성요소를 움직이는 방식

지금까지 교육 동맹 연구는 거의 피드백에만 집중했어요. 이 논문의 새로운 점은 교육 동맹이 Van Melle의 CBHPE 5대 핵심 구성요소 전체를 지원한다고 주장한다는 거예요.

  • ① 성과 역량 (outcome-based competencies) 🎯
    • 신뢰 관계 안에서 기대가 함께 이해되고 함께 소유(co-owned) 돼요.
  • ② 순차적 진급 (sequenced progression) 📶
    • 수련생과 지도자가 진급에 대한 공유된 정신모형을 함께 만들어요. 지도자는 발달 궤적을 명확히 보여 주고, 수련생은 자기 수행이 전체 흐름에서 어디쯤인지 분석해요. 무엇보다 피드백이 처벌적 판단이 아니라 성장을 위한 것이라는 신뢰가 생겨요. 책임이 커질수록 수련생은 위험을 감수하고, 피드백을 구하고, 때로는 좌절도 겪어야 하는데, 이때 동맹이 버팀목이 돼요.
  • ③ 맞춤형 학습경험 (tailored learning experiences) 🧩
    • 두 사람이 수련생의 현재 능력과 다음 단계에 맞는 기회를 함께 만들어요. 예시로 종단통합실습(LIC), 수련 막바지에 "보호된 독립(sheltered independence)"을 주는 Promotion in Place 모델, 준비도에 따라 속도를 조절하는 간호교육 프로그램이 소개돼요.
  • ④ 역량 중심 교수 (competency-focused instruction) 🧑‍🏫
    • 지도자가 역량과 수련생의 강점, 한계를 잘 알고 있어야 가능해요.
  • ⑤ 프로그램식 평가 (programmatic assessment) 📊
    • 저는 이 부분이 핵심이라고 봐요.

하지만 수련생은 피드백을 요청하고 받을 때 정서적으로 취약하며, 피드백 과정에서 얻는 것이 있으려면 지도자의 선의를 신뢰해야 한다.
"However, trainees are emotionally vulnerable when soliciting and receiving feedback and must trust supervisors' beneficent intent to gain from the feedback process"

 

"적시에, 구체적으로, 직접 관찰에 근거해서" 같은 맥락과 분리된 피드백 규칙만으로는 부족하고, 동맹이 있어야 피드백이 신뢰할 만하고, 함께 소유되며, 목표를 지원하는 것으로 받아들여진다는 거예요.

 

그리고 이 논문에서 가장 인상적인 문장이 나와요.

동맹이 없으면 CBHPE는 참고 견디거나 두려워해야 할 체크리스트와 요건의 집합이 될 위험이 있다. 동맹이 있으면 CBHPE는 역량 발달을 진정으로 지원하는, 개인화되고 신뢰에 기반한 접근이 된다.
"Without the alliance, CBHPE risks becoming a set of checklists and requirements to be tolerated or feared; with the alliance, CBHPE becomes a personalized, trust-based approach that genuinely supports competence development."


📋 5. 수련생과 지도자는 각각 무엇을 해야 할까?

논문의 Table 1은 교육 동맹의 특징마다 수련생과 지도자의 책임을 정리하고 있어요. 핵심만 간추려 볼게요.

동맹의 특징 수련생 👩‍⚕️ 지도자 🧑‍🏫
상호 존중 (관계) 정직하고 실행 가능한 피드백 문화에 기여, 형성 피드백의 선의를 신뢰 신뢰와 심리적 안전감의 문화 조성, 문화적 겸손
공유된 목적과 목표 성과 역량에 맞는 학습목표를 함께 만들기 (공동)
상호작용 방식에 대한 합의 목표 설정, 직접 관찰, 피드백, 코칭에 시간을 쓰기로 합의 (공동)
학습 성과에 대한 상호 책임 개별 학습계획의 반복적 갱신과 현실적 일정 수립 (공동)
정직한 피드백과 지속적 개선 성찰, 피드백 요청과 수용, 수행 마인드셋이 아닌 성장 마인드셋 R2C2 코칭 등 코칭 방법 활용, 관련 교수개발 참여, 거짓 성장 마인드셋 경계
평가 방법과 기준에 대한 정렬 진급에 쓰이는 형성·총괄 기준 이해하기 수련생이 그 기준을 이해하도록 보장
성찰 참여와 자기주도성 함양 자기평가와 지도자 피드백 비교, 학습계획 갱신 구조화된 피드백 대화로 자기평가 지원

📝 6. 교육 합의서 (Educational Agreement)

이 논문의 가장 실용적인 기여는 교육 합의서예요. 교육 동맹을 키우고, 안내하고, 강화하기 위한 도구로, 동맹의 세 요소에 맞춰 구성돼 있어요. 각 항목마다 목표(Goal) 와 함께 대화를 시작할 수 있는 문장 시작어(sentence starters) 가 제시돼 있어요.

 

🫂 관계 형성에 대한 합의 

  • 상호 존중: "We (trainee and supervisor) will aim to build a relationship on a foundation of mutual respect by…"
  • 상호작용 방식: "We will ensure dedicated time for goal setting, direct observation, and feedback by…"
  • 상호 책임: "We will define how we determine if we have met our shared goals by…"
  • 정직한 피드백: "Together we will do the hard work of self-reflection and engage in feedback conversations on a [insert frequency, e.g., weekly] basis through [insert agreed upon approach e.g., 1:1 meetings/check-ins, other] …"

🎯 목표에 대한 합의 

  • "We will develop mutually agreed upon actionable goals including a timeline(s) to reach these goals by…"

🛠️ 과제에 대한 합의 

  • 학습 요구와 기회 확인: "We will dedicate time to defining our roles, goals, and an action plan to meet these goals by…."
  • 평가 방법과 기준: "We will make time to understand and review the assessment methods and criteria that contribute to a trainee's success by…"
  • 성찰과 자기주도성: "When we review work-place based assessments (or other forms of assessment e.g., Milestones, EPAs), we will engage in feedback and reflection by agreeing to …."

재미있는 건 서명에 관한 설명이에요. 계약서가 아니라는 점을 분명히 해요.

합의서에 서명하는 것은 선택 사항이다. 수련생과 지도자가 서명하기로 한다면, 여기 적힌 무언가에 반드시 동의하는 것이 아니라, 단지 이 합의서 작성에 참여했거나 사본을 받았다는 것을 나타낼 뿐이다.
"Signing the agreement is optional. If trainees and supervisors choose to sign, they are not necessarily agreeing to anything written here, rather, they are simply indicating they participated in writing this agreement and/or they received a copy."

 

합의서는 자발적이고, 함께 만들며, 현지 맥락에 맞게 바꿔 쓸 수 있는 도구예요. 오리엔테이션, 지도자 워크숍, 정기 면담에서 소개하고, 로테이션 시작, 중간, 끝 점검이나 코칭 면담에 활용할 수 있다고 해요.


🚧 7. 교육 동맹의 경계와 한계

🔒 경계

교육 동맹은 신뢰, 존중, 협력에 기반한 전문적이고 목표 지향적인 관계예요.

  • 우정이 아니에요. 수련생의 개인적, 사회적 영역까지 넓어지지 않아요.
  • 진료 관계가 아니에요. 지도자는 수련생의 의사나 치료자가 아니에요.
  • 기간과 맥락이 한정돼요. 역량과 전문직 정체성 형성에 집중해요.
  • 비밀유지가 기대되지만 한계가 있어요. 환자 안전, 기관의 책임, 정책상 필요할 때는 공개될 수 있어요.

⚠️ 동맹이 흔들리는 구조적 긴장

저자들은 교육 동맹이 잘 형성되지 않거나 깨질 수 있는 상황도 솔직하게 짚어요.

  • 코치와 심판의 이중 역할: 지도자가 코치이면서 동시에 판정자이기도 하면, 피드백이 성장을 위한 게 아니라 고부담 평가로 느껴져서 신뢰가 무너질 수 있어요.
  • 불균등한 형성: 동맹이 정체성, 소통 방식, 문화가 비슷한 사람끼리 더 쉽게 만들어지면, 소수자 수련생에게 불평등으로 이어질 수 있어요.
  • 관대화와 편향: 반대로 동맹이 너무 강하면 평가가 관대해지거나 편향될 수 있어요. 그래서 여러 평가자, 투명한 기준 같은 프로그램 차원의 안전장치가 필요해요.
  • 이중 지위: 노조에 가입한 수련생처럼 학습자이면서 피고용인인 이중 지위도 동맹을 복잡하게 만들어요.

🧭 여러 유형의 교육 동맹

이 논문은 종단적 수련생-지도자 관계를 전형으로 다루지만, 부록에서는 여러 유형의 동맹도 정리해요.

관계 맥락 목적
수련생 ↔ 직접 임상 지도자 정해진 기간 동안 매일·매주 접촉 임상 지도, 직접 관찰 기반 피드백, 환자진료 과제
수련생 ↔ 종단 코치·멘토·어드바이저 대개 배정되며 프로그램 전체 기간 지속 가능 종단적 발달 지원, 평가 데이터 검토, 목표 설정
수련생 ↔ 프로그램 책임자 프로그램 내 수련생 감독 프로그램의 무결성 (부정행위 예방, 포용 증진)
수련생 ↔ 임상역량위원회(CCC) 정기적 진척 검토 고부담 위임 결정과 그 정당화

💡 8. 교육 동맹을 강화하기 위한 8가지 권고

저자들은 이미 하고 있는 교수개발에 바로 넣을 수 있는 것부터 조금 더 지향적인(aspirational) 것까지 권고를 제시해요.

 

  • ① 공유된 정신모형 (shared mental model) 🧠
    • 교육 동맹의 세 요소에 대한 공통 이해를 만들어요. 특히 거짓 성장 마인드셋(false growth mindset), 즉 수련생이 성장 마인드셋을 가진 것처럼 보이려고만 하는 함정도 다루라고 해요.
  • ② 관계 형성 (relationship-building) 🤝
    • 지도자 개발에서 신뢰 관계를 만드는 기법, 코칭, 근거기반 피드백을 다뤄요. 대표적인 도구가 R2C2 모델이에요. 관계 형성(Relationship building), 반응 탐색(Reaction exploration), 내용 탐색(Content exploration), 변화를 위한 코칭(Coaching for change)의 네 단계예요.
    • 저자들은 교육 동맹을 멘토링, 코칭과도 구분해요. 멘토는 조언과 역할 모델을 제공하고, 코칭은 종단적이고 성장 지향적인 관계 안에서 개인 발달을 지원하는 방법이에요. 교육 동맹은 신뢰 관계 안에서 공유된 목표와 그것을 향한 계획으로 초점을 더 깊게 한다는 점이 특징이에요.
  • ③ 수련생의 주체성 (trainee agency) 🙋
    • 임상실습 오리엔테이션 같은 전환 시점에 교육 동맹 개념을 소개하고, 목표 설정, 피드백 대화, 성찰을 수련생이 주도하도록 강조해요.
  • ④ 팀 훈련 (team training) 👥
    • 교육 동맹 원칙을 다직종 팀 개발로 넓혀요. 저자들도 일부 맥락에서는 아직 지향점이라고 인정해요.
  • ⑤ 구조화된 상호작용 (structured interactions) 📅
    • 관계 초기에 목표와 책임, 성공의 모습을 정하는 구조화된 대화를 갖고, 커리큘럼 안에 정기 면담 시간을 넣어요. 저자들은 이게 비현실적으로 보일 수 있지만, 경험상 참여자들에게 충분히 가치가 있어서 실현 가능하다고 해요.
  • ⑥ 프로그램 정렬 (programmatic alignment) 🏛️
    • 코치, 어드바이저 같은 교수 역할을 명확히 하고, 교육 동맹 활동을 승진과 업적 평가에 반영하라고 해요. 그런데 여기엔 균형이 필요해요.

 

이 권고와 균형을 이뤄야 할 것은, 교수가 진정으로 관계 형성에 참여하기보다 동맹을 형성하는 것처럼 '연기'하거나 그렇게 보이도록 유인하는 것을 피할 필요성이다.
"Balanced with this recommendation is the need to avoid incentivizing faculty to 'perform' or appear to build an alliance rather than authentically engage in this relationship-building."

 

그래서 동맹 상호작용의 세부 내용을 개인 수준 데이터로 수집하지 않는 것이 한 가지 해법이 될 수 있다고 해요.

 

  • ⑦ 이해상충 (conflict of interest) ⚖️

 

예를 들어, 프로그램 책임자 역할을 겸하거나 수련생 선발, 성적, 수상 결정에 영향력이 있는 지도자는 교육 동맹과 같은 지도 관계 안에서 그러한 평가 기능을 동시에 행사해서는 안 된다.
"For example, supervisors who also hold roles as program directors or have influence over decisions related to trainee selection, grades, or awards should not concurrently exercise those evaluative functions within the same supervisory relationship as the educational alliance."

 

  • ⑧ 투명하고 윤리적인 데이터 사용 🔐
    • 지도자가 수련생 데이터에 어디까지 접근할 수 있는지, 그 데이터가 진급 결정에 어떻게 쓰이는지 정책으로 명확히 하라고 해요.

🔬 9. 앞으로의 연구 과제

저자들은 교육 동맹이 이론적으로는 탄탄하지만 경험적 근거는 더 필요하다고 인정해요. 제안한 연구 방향은 이래요.

  • 교육 동맹과 교수 동맹(teaching alliance) 을 구분하는 개념 명료화 연구
  • 동맹의 질을 측정하는 심리측정적으로 타당한 도구 개발
  • 교육 합의서에서 학습목표가 어떻게 협상되고 구성되는지 탐색
  • 성장 마인드셋 관점에서 피드백 교환과 목표 설정에 대한 수련생 인식을 보는 질적 연구
  • 대규모 데이터로 동맹의 존재와 질이 수련생과 환자 성과와 어떤 관련이 있는지 분석
  • 수련 단계에 따라 동맹이 어떻게 변하는지, 수련생과 지도자의 웰빙에 어떤 영향을 주는지 보는 종단 연구
  • 관계적 신뢰, 신뢰성, 심리적 안전감, 정체성 인정 같은 기저 인과 기전을 밝히는 비판적 실재론(critical realism) 접근

💭 10. 읽으며 든 생각과 한국 의학교육에 주는 시사점

마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.

 

  • ① 짧은 로테이션 구조에서 동맹은 가능할까? 🔄
    • 교육 동맹의 전형은 종단적 관계인데, 우리 임상실습과 전공의 수련은 짧은 로테이션으로 지도자가 자주 바뀌는 경우가 많아요. 이런 구조에서는 부록 표의 종단 코치나 어드바이저 같은 역할이 동맹의 중심을 맡아야 할 것 같아요. 직접 임상 지도자와의 짧은 관계에서는 로테이션 시작할 때 교육 합의서로 기대와 목표를 빠르게 맞추는 것이 현실적인 방법일 수 있고요.
  • ② WBA와 "코치이자 심판" 문제 ⚖️
    • WBA를 도입하면 같은 지도전문의가 피드백을 주는 코치이면서 진급 판단에 쓰이는 평가를 하는 심판이 되기 쉬워요. 이 논문의 권고, 즉 이해상충 분리, 데이터 사용 정책 명확화, 여러 평가자와 CCC 같은 안전장치는 WBA를 설계할 때 꼭 함께 고민해야 할 부분이라고 생각해요.
  • ③ 위계적 문화와 심리적 안전감 🏥
    • 교육 동맹의 핵심은 권력의 공유와 심리적 안전감이에요. 위계가 뚜렷한 수련 환경에서 수련생이 먼저 피드백을 요청하고, 목표 설정을 주도하고, 자신의 약점을 드러내기는 쉽지 않을 거예요. 합의서 같은 도구가 이런 대화를 시작하는 계기가 될 수는 있지만, 도구만으로 문화가 바뀌지는 않는다는 점도 기억할 필요가 있어요.
  • ④ 비판적으로 읽을 지점 🤔
    • 이 논문은 개념 분석이고, 저자들 스스로 경험적 근거가 아직 부족하다고 인정해요. 교육 동맹이 5대 핵심 구성요소를 모두 강화한다는 주장은 현재로서는 이론적 주장에 가까워요.
    • 교육 합의서는 자발성을 강조하지만, 현장에서 또 하나의 서류가 되어 형식화될 위험도 있어요. 저자들이 "연기하는 동맹"을 경계한 것과 같은 맥락이죠.
    • 동맹의 강도와 평가의 엄정성 사이의 긴장은 저자들이 짚기는 했지만 해법은 아직 원칙 수준이에요.
    • 참고로 저자들은 문장 흐름과 가독성 개선에 ChatGPT와 Claude를 썼다고 밝혔어요.

 

  • ⑤ 앞의 글과 이어서 보기 🔗
    • 지난번 CBHPE 성과 변화이론 논문에서 "교육자의 역량은 CBHPE 도구에 대한 절차적 순응이 아니다" 라는 문장이 있었죠. 이 논문은 그 말을 관계의 차원에서 구체화한 셈이에요. 도구와 서식을 갖추는 것만으로는 부족하고, 그 도구가 신뢰 관계 안에서 쓰일 때 비로소 CBME의 기전이 작동한다는 거예요.

📝 정리하며

  • 교육 동맹은 수련생과 지도자 사이의 신뢰 관계로, 관계적 유대, 공유된 목표, 과제에 대한 합의로 이뤄져요.
  • 심리치료의 치료 동맹에서 왔지만, 팀 기반 작업장이라는 열린 생태계 안에서 형성된다는 점이 달라요.
  • 성장 마인드셋과 자기조절학습이라는 취약한 구성개념을 교육 동맹이 발판처럼 받쳐 줘요.
  • 교육 동맹은 피드백뿐 아니라 CBHPE 5대 핵심 구성요소 전체를 작동시키는 기전이에요. 동맹이 없으면 CBME는 체크리스트가 돼요.
  • 실용 도구로 교육 합의서를 제안했어요. 자발적이고, 함께 만들고, 현지에 맞게 바꿔 쓰는 도구예요.
  • 코치-심판의 이중 역할, 불균등한 형성, 관대화 편향이라는 한계와 함께, 이해상충 분리와 투명한 데이터 사용을 권고해요.

함께 읽으면 좋은 글로는 이 개념의 출발점인 Telio 등의 교육 동맹 논문과, R2C2 피드백 모델을 개발한 Sargeant 등의 연구를 추천해요. 📎


서론 (Introduction) 

보건의료 전문직 역량기반교육(CBHPE)은 수련생이 자기조절학습, 학습을 위한 피드백의 원천으로서 평가에 참여하기, 자신의 경험과 학습 진전에 대한 성찰을 통해 스스로의 발달에 적극적으로 참여하는 것을 우선시한다. CBHPE의 성공에는 수련생의 성장에 대한 책임을 나누는 수련생과 지도자의 협력관계가 필수적이며, 수련생은 교수진의 피드백이 자신을 돕기 위한 것이고 유용하다고 신뢰해야 한다 [1]. 교육적 동맹(그림 1)은 CBHPE에서 잠재적 매개 요소(mediating element)로 확인되었으며, 학습을 위한 피드백의 질과 효과성을 근본적으로 형성한다 [2]. 피드백의 개념은 수련생(이 논문에서는 학생·전공의·펠로·학습자와 같은 뜻으로 사용한다)에게서 지도자(교사·임상교사·교수진)에게 정보를 일방적으로 전달하는 관점에서, 피드백의 효과가 관계, 맥락, 내용, 전달, 수용에 달린 대화의 관점으로 발전해 왔다 [3]. 이상적으로는 수련생과 지도자 모두 피드백 문해력(feedback literacy), 즉 피드백을 구하고, 해석하고, 실행에 옮기고, 공유하는 능력을 보여야 한다. 이는 CBHPE의 핵심인 반복적 평가, 코칭, 진전 결정(progression decisions)을 통해 수련생의 역량 기반 발달을 촉진한다 [4, 5].

 

Telio는 교육적 동맹을 효과적인 피드백의 맥락을 이루는 수련생과 지도자 사이의 신뢰 관계로 정의했다 [2]. 교육적 동맹은 관계적 유대(relational bond), 공유된 목표, 목표 달성을 위한 과업에 대한 합의로 구성된다 [2]. 교육적 동맹이 수련생과 지도자 사이의 풍부한 피드백 논의를 촉진한다고 제안되었지만, 맞춤형 피드백뿐 아니라 개인화되고 관계 중심적인 학습과 성장 마인드셋을 지원함으로써 CBHPE에 이론에 근거한 이득을 준다는 근거와 논의는 지금까지 거의 없다. 교육적 동맹은 수련생과 지도자가 서로를 신뢰하고, 역량 기반 평가체계와 그 성과에 대해서도 상호 신뢰하도록 도울 수 있다 [6].

 

이론에 근거한 개념 분석인 이 논문의 목적은 아래에 제시할 CBHPE의 핵심 구성요소를 실행하는 기제로서 교육적 동맹이 가져올 수 있는 이득을 자세히 설명하는 것이다 [7]. 저자들은 먼저 교육적 동맹의 개념적 토대, 치료적 동맹(therapeutic alliance)에서 비롯된 배경, CBHPE와의 이론적 관련성을 검토한다. 교육적 동맹이 CBHPE의 핵심 구성요소 달성을 촉진할 가능성과 동맹의 경계를 설명한 뒤, CBHPE 프로그램에서 교육적 동맹의 영향을 극대화하기 위한 권고를 제시한다. 이를 종합한 확장된 이해는 프로그램 성과를 달성하기 위해 학습 활동에 깊이 참여하고 직업 생애 내내 계속 배우는 보건의료인으로 수련생을 준비시키는 CBHPE 프로그램 안에서 교육적 동맹을 촉진하려는 노력에 도움이 될 수 있다.

 

그림 1. 역량기반교육에서 교육적 동맹의 차원 (Dimensions of the Educational Alliance in Competency-Based Education) 

 

  • 그림 속 표기:
    • 중심에는 수련생 ↔ 지도자의 대인관계(Trainee ↔ Supervisor Interpersonal relationship), 역할에 대한 합의(Agreement on roles), 신뢰·신빙성(Trust/Credibility), 문화적 민감성(Cultural sensitivity)이 있다.
    • 중간 층에는 공동으로 구성한 교육적 활동(Co-Constructed educational work), 목표와 과업에 대한 합의(Agreement on goals and tasks), 공유된 힘(Shared power), 공동 결정(Shared decisions)이 있다.
    • 바깥 층에는 학습 환경과 평가체계(Learning environment & System of assessment), 프로그램적 평가(Programmatic assessment), 심리적 안전감(Psychological safety), 문화적·제도적 요인(Cultural and institutional factors)이 있다.

 

이 그림은 서로 연결된 세 층을 보여준다.

 

  • 중심은 상호 신뢰와 존중이라는 관계적 토대이고,
  • 중간은 협력적인 교육 과정을 구조화하는 공유된 목표와 과업이며,
  • 바깥은 동맹을 형성하는 동시에 동맹의 영향을 받는 맥락 환경으로서 프로그램적 평가체계, 심리적 안전감, 제도적 문화를 포함한다.
  • 세 층은 각 층을 가로지르는 대화, 성찰, 적응적 조정(adaptive calibration)을 나타내는 상호 영향과 피드백 고리를 상징한다.

 

방법 (Methods) 

경험 많은 보건의료 전문직 교육자와 연구자를 포함한 저자들은 모두 국제 보건의료 전문직 역량기반교육 교육자 협력체(International Competency-Based Health Professions Educators Collaborators, ICBHPE)의 구성원이다. 저자들은 교육적 동맹, 치료적 동맹, 피드백 대화(feedback dialogue)와 피드백 문해력, CBHPE의 프로그램적 평가에 관한 서술적 문헌고찰(narrative literature review)에서 출발하여 이 논문을 개발했다. 하루 동안 열린 국제 대면 회의에서 저자들은 교육적 동맹과 치료적 동맹을 비교·대조하고, 피드백을 강화하는 교육적 동맹에 대한 문헌의 기대를 논의했으며, CBHPE의 여러 측면을 강화할 아직 탐구되지 않은 가능성을 상세히 검토했다. 이후 매월 온라인 회의에서 문헌과 교육자·교육 프로그램 지도자로서의 경험을 바탕으로 교육적 동맹의 이론적 토대를 탐색하고, CBHPE 프로그램 내에서 이를 강화할 권고를 도출했다. 저자들은 토론으로 의견 차이를 해소하고 교육적 동맹에 관해 알려진 것과 아직 답하지 못한 것의 경계를 서로 확인하도록 촉구했다.

교육적 동맹과 치료적 동맹의 대조 (Contrasting Educational Alliance and Therapeutic Alliance) 

교육적 동맹은 내담자(환자)와 심리치료사 사이의 치료적 동맹, 즉 작업 동맹(working alliance) 개념에서 가져왔다 [8–10]. 치료적 동맹은 치료 성공을 결정하는 가장 중요한 요인 중 하나이며 [11, 12], 경험적 연구는 환자·내담자의 결과에 긍정적인 효과를 보여주고, 이를 측정하고 이해하는 방법을 포함해 그 본질에 관한 근거를 강화해 왔다 [13–16].

 

CBHPE의 교육적 동맹이라는 두 사람의 관계(dyad)에 이러한 관계적 틀을 확장하면(표 1) 신뢰와 공유된 힘이 여전히 중심에 있다. 이 동맹은 세 가지 필수 요소에 바탕을 둔 관계다.

 

  • 첫째는 대인관계적 연결의 발달, 즉 정직한 평가와 피드백의 수용에 필요한 심리적 안전감을 가능하게 하는 대인관계적 유대다 [2, 17].
  • 둘째는 관계의 목표와 경계에 대한 상호 이해, 곧 역량, 평가 기준, 진전에 관한 기대를 명확히 하는 참여 조건(terms of engagement)이다.
  • 셋째는 관계의 목표와 방법에 대한 합의, 곧 지도자·수련생의 활동을 역량 발달, 직장 기반 평가(workplace-based assessment), 진전 결정에 사용되는 근거와 정렬하는 과업 지향(task orientation)이다. 평가가 지속적으로 이루어지고 진전 결정의 영향이 큰 CBHPE에서는 교육적 동맹의 질이 평가 정보의 신빙성과 활용 모두에 영향을 미칠 수 있다.

 

유사점 외에도 심리치료의 치료적 동맹은 교육적 동맹과 뚜렷한 차이가 있다.

 

  • 치료적 동맹은 대체로 외부 전문직의 영향에서 보호받는 배타적인 두 사람의 관계로, 신뢰와 내적 성찰을 촉진한다.
  • 반면 보건의료 전문직 교육(HPE)의 교육적 동맹도 신뢰와 지도를 토대로 하지만, 일부 관찰과 정보가 다른 이에게 제공·공유되는 복잡한 교육 및 팀 기반 직장 생태계에서 전개된다. 임상 직장의 지도 관계는 전문직 간 팀의 역동, 수련생 동료 집단, 환자와의 경험, 임상 환경이 제공하는 기회와 제약의 영향을 받는다. 수련생과 지도자는 열린 의사소통, 분명한 기대 설정, 성찰 공간의 마련을 통해 이러한 맥락적 요인에 대응하고 견고한 교육적 동맹을 구축하도록 노력할 수 있다.

 

표 1. 교육적 동맹의 주요 특징, 역량기반교육의 다섯 핵심 구성요소와의 정렬, 학습을 위한 성공적인 동맹을 촉진하는 수련생과 지도자의 책임 (Key Features of the Educational Alliance, Alignment with the Five Core Components of Competency-Based Education, and the Responsibilities of Trainees and Supervisors to Promote a Successful Alliance for Learning) 

교육적 동맹의 특징 역량기반교육 프로그램에서의 설명 및 핵심 구성요소 [7]와의 연계 수련생의 책임·행동 지도자의 책임·행동
대인관계(Interpersonal Relationship):
 상호 존중(Mutual respect) 역량의 발달적 습득을 촉진하는 맞춤형 학습 경험. 지도자가 정직하고 실행 가능한 피드백을 제공하고 수련생이 피드백 대화에 참여하도록 장려하는 문화에 기여한다. 학습과 술기 개발을 높이려는 목적의 형성적 피드백을 신뢰한다. 신뢰와 심리적 안전감의 문화를 만든다. 문화적 겸손(cultural humility)을 기른다. 전문직 정체성 형성에 주의를 기울인다.
참여의 목표(Goals of Engagement): 
공유된 목적과 목표(Shared purpose and goals) 성과 역량(outcome competencies). 공동으로: 성과 역량과 정렬된 학습 목표를 함께 만든다.
수련생과 지도자가 상호작용하는 방식에 대한 공동 합의 역량의 발달적 습득을 촉진하는 맞춤형 학습 경험. 공동으로: 목표 설정, 직접 관찰, 피드백, 코칭을 위한 시간을 할애하기로 합의한다.
학습 성과에 대한 상호 책무성 성과 역량. 공동으로: 개별화된 학습 계획을 반복적으로 갱신하고 역량 달성을 위한 현실적인 시간표를 포함해 목표를 설정한다.
정직한 피드백과 지속적인 개선에 대한 헌신 역량의 발달적 습득을 촉진하는 역량 중심 교수. 자기 성찰적 실천에 참여하고, 피드백을 구하고 수용하며, 수행 마인드셋(performance mindset)보다 성장 마인드셋을 받아들인다. 피드백·대화·성장을 촉진하는 코칭 방법(R2C2 코칭 [48])을 사용한다. 코칭 이론과 방법을 포함한 관련 교수진 개발에 참여한다. 수련생이 성장 마인드셋을 채택하도록 장려하되 거짓 성장 마인드셋(false growth mindset)은 피한다.
과업 지향: 합의한 목표를 추구하는 방법(Task Orientation): 
학습 요구와 기회의 공동 확인 성과 역량. 공동으로: 실행 계획을 포함하는 학습 목표와 개별화된 학습 계획을 함께 만든다.
피드백에 대한 공동의 집중 역량의 발달적 습득을 촉진하는 역량 중심 교수. 자기 성찰적 실천의 가치를 인식하고, 피드백을 구하고 수용하며, 수행 마인드셋보다 성장 마인드셋을 받아들인다. 피드백·대화·성장을 촉진하는 코칭 방법(R2C2 코칭)을 사용한다. 지도자로 성장하기 위해 동료 피드백과 교수진 개발 기회를 찾는다.
평가 방법과 기준의 정렬 프로그램적 평가. 역량 기반 진급을 결정하는 형성적·총괄적 기준과 평가를 이해하려고 노력한다. 수련생이 역량 기반 진급을 결정하는 형성적·총괄적 기준과 평가를 이해하도록 한다.
성찰 참여 역량의 발달적 습득을 촉진하는 맞춤형 학습 경험. 피드백과 여러 출처의 직장 기반 평가에 근거한 자기평가의 가치를 인식한다. 수련생의 자기평가를 촉진해 성장을 돕는 지도자 역할을 성찰한다. 수련생이 피드백과 여러 출처의 평가를 성찰적 실천과 함께 자기평가에 반영하도록 권한다.
자기주도성을 위한 수련생의 행위주체성 함양 역량의 발달적 습득을 촉진하는 교수 실천에 정보를 제공하는 역량 중심 교수. 자기평가와 지도자의 피드백을 비교한다. 학습 목표와 개별화된 학습 계획을 반복적으로 갱신한다. 진전에 관한 정보를 제공할 수 있도록 구조화된 피드백 대화를 통해 수련생의 자기평가를 장려한다.

교육적 동맹과 보건의료 전문직 역량기반교육에 관련된 이론 (Theories Relevant to Educational Alliance and Competency-Based Health Professions Education) 

교육적 동맹은 1950년대의 치료적 동맹 개념에 뿌리를 두지만, CBHPE를 위한 중요한 촉진 기제(facilitating mechanism)로 기능할 수 있는 방식을 밝혀 주는 더 현대적인 교육 이론과도 부합한다. 이 절에서는 특히 관련성이 높은 성장 마인드셋 이론 [18]과 자기조절학습 이론 [19]을 자세히 살펴본다. 이러한 이론적 토대를 이해하면 수련생과 지도자가 역량 기반 발달과 도전을 효과적으로 헤쳐 나가는 데 필요한 관계적 토대를 교육적 동맹이 제공하는 기제를 명시할 수 있어 CBHPE의 성공적인 실행에 도움이 된다. 저자들은 사회문화 이론(sociocultural theories)과 상황학습 이론(situated learning theories)을 비롯한 다른 이론적 관점도 더 넓은 임상 학습 환경에 교육적 동맹을 위치시키는 데 관련이 있음을 인정한다. 성장 마인드셋과 자기조절학습을 앞세운 이유는 학습자가 피드백을 활용하고 학습을 조절하며 CBHPE의 반복적 평가를 견디는 과정에서 수련생–지도자 수준의 동맹이 작동하는 기제를 가장 직접적으로 밝혀 주기 때문이다.

 

성장 마인드셋 이론은 노력, 효과적인 전략, 타인의 지도를 통해 학습 능력을 발달시킬 수 있다고 본다 [18]. 따라서 능력과 지능은 고정된 특성이 아니라 전념하는 학습으로 발전시킬 수 있다.

  • 이러한 원칙은 협력적인 목표 설정과 피드백을 강조하는 교육적 동맹과 부합한다 [2]. CBHPE에서 성장 마인드셋은 수련생이 형성평가(formative assessment) 데이터를 구하고 받아들이며 활용할 의향을 높이는 기제로 작용하여, 역량 발달과 진전을 안내하는 피드백의 활용을 강화할 수 있다.
  • 성장 마인드셋을 보이는 사람은 몰입한 목표 지향적 연습을 통해 향상될 수 있다고 믿는다. 교육적 동맹 안의 신뢰받는 지도자는 피드백을 제공하는 방식을 통해 이러한 믿음을 강화하고 성장 마인드셋을 기른다. 교육적 동맹과 CBHPE 모두 단지 교과목이나 정해진 수련 기간을 마치는 것보다 반복적인 연습, 관찰, 피드백(예: 직장 기반 평가)을 통해 역량을 달성하도록 촉진한다 [20].
  • 지도자는 노력과 학습 전략 및 과정에 주목해 칭찬하고, 도전을 받아들이도록 장려하고, 좌절과 실패를 정상적인 경험으로 받아들이게 하며, 직접 성장 마인드셋의 본보기를 보임으로써 수련생의 성장 마인드셋을 기를 수 있다. CBHPE 프로그램에서 교육자는 수련생이 역량 목표를 향해 나아가도록 지침, 피드백, 자원을 제공하며 성찰적 학습과 실천을 장려한다.
  • 스스로 성장 마인드셋을 채택하고 피드백 요청, 성찰, 평생학습의 본보기가 되는 지도자는 교육적 동맹을 뒷받침하는 심리적 안전감과 신뢰 가능성을 기른다 [20].

자기조절학습 이론은 수련 단계와 관계없이 수련생이 자신의 학습을 능동적으로 관리한다고 강조한다 [19]. 이는 CBHPE의 기초를 이루는 개념이다 [21]. 

  • 자기조절학습 기술에는 학습 목표 설정, 자신의 진전 점검, 발달을 촉진하기 위한 전략의 조정·적응이 포함된다. CBHPE에서 자기조절학습은 수련생이 여러 평가 입력을 해석·통합하고, 역량과 정렬된 목표를 설정하며, 피드백과 수행 데이터에 따라 전략을 조정하는 기제로 작동한다. 자기조절학습 과정은 선형적이지 않고, 목표를 달성하기 위해 생각과 행동을 계획·수행·성찰·조정하는 반복적 순환이 필요하다 [22].
  • 자기조절학습 기술의 발달은 독립적으로도 협력적으로도 일하고 배울 수 있으며 창의적이면서 비판적으로 사고하고 문제를 해결하는 적응적인 평생학습자를 기른다 [23]. 이 기술을 발달시키고 연습하려면 지도자는 학습상 위험을 감수하고 성공과 실패 모두에서 배울 수 있는 환경을 조성해야 한다. 확립된 교육적 동맹은 수련생이 교육과 지속적인 발달에 선제적으로 참여할 수 있도록 힘을 준다. 동시에 학습 과정 전반에서 현실적이면서도 적절히 도전적인 학습 목표를 설정하고 효과적인 계획을 세우도록 안내함으로써 자기조절학습을 촉진한다.

종합하면 성장 마인드셋과 자기조절학습은 본질적으로 쉽게 약화될 수 있어 계속 강화해야 하는 구성개념이다. 교육적 동맹은 수련생과 지도자의 협력 관계를 통해 자율적인 전문직 역량을 향한 수련생의 발달을 촉진하며 이러한 발판을 제공한다.

보건의료 전문직 역량기반교육의 핵심 구성요소를 발전시키는 교육적 동맹의 중요성 (The Importance of the Educational Alliance for Advancing the Core Components of Competency-Based Health Profession Education) 

지금까지 보건의료 전문직 교육의 교육적 동맹에 관한 문헌은 거의 전적으로 지도자와 수련생 사이의 피드백에 초점을 맞추었다 [2, 24–26]. 그러나 교육적 동맹의 개념적 이득은 CBHPE의 다섯 가지 핵심 구성요소, 즉 성과 기반 역량, 순서화된 진전, 맞춤형 학습 경험, 역량 중심 교수, 프로그램적 평가 모두에 미친다 [7](표 1).

  • CBHPE의 첫째 핵심 구성요소인 명확히 정의된 성과 역량은 신뢰하는 지도자–수련생 관계 안에서 기대를 공동으로 이해하고 함께 책임질 수 있도록 교육적 동맹을 통해 강화된다.
  • 둘째 핵심 구성요소인 역량의 점진적 순서화(progressive sequencing of competencies)는 학습 경험, 수행 기대, 평가가 순차적으로 쌓이도록 의도적으로 구조화된다는 뜻이다. 수련생은 복잡성과 책임이 증가하고 감독이 줄어드는 의도적인 연속 경로를 따라 초보자에서 역량을 갖춘 사람으로 발전한다. 교육적 동맹은 수련생과 지도자가 함께 구성한 진전에 관한 공유된 정신모형을 통해 이러한 점진적 순서화를 지원한다. 지도자는 발달 경로(developmental trajectory)를 명확히 하고, 수련생은 자신의 현재 수행이 더 큰 연속 경로의 어디에 있는지 분석을 이끌 수 있다. 동맹은 피드백이 처벌적 판단이 아니라 점진적 성장을 뒷받침한다는 신뢰를 구축한다 [4]. 책임과 기대가 커짐에 따라 수련생은 위험을 감수하고, 건설적인 피드백을 구하고, 자신의 수행을 성찰하며, 때로는 좌절을 겪어야 한다. 강한 동맹은 수련생이 자신의 준비도를 평가하고, 목표를 분명히 말하며, 역량기반교육 틀 안에서 개별화된 다음 단계를 적극적으로 요청할 수 있게 한다. 교육적 동맹의 종단적 특성(longitudinal nature)은 수련생과 지도자가 시간에 따른 수행을 함께 추적할 수 있게 하여, 수련생이 경험을 찾고 통합하며 일관되게 역량을 발전시키도록 한다 [27, 28].
  • 교육적 동맹은 두 사람이 수련생의 현재 능력과 다음 단계에 맞는 개별적 기회를 함께 만들게 함으로써 셋째 핵심 구성요소인 맞춤형 학습 경험을 촉진한다. 수련생도 자신의 다음 적절한 행동에 관한 지도자의 기대를 신뢰할 수 있다 [29].
  • 마찬가지로 지도자가 역량과 수련생의 현재 강점·한계를 이해하는 교육적 동맹은 넷째 핵심 구성요소인 역량 중심 교수에도 도움이 된다. 예를 들어 종단적 통합 임상실습(longitudinal integrated clerkship) 모형에서 학생들은 임상지도자(preceptors)가 학생의 학습 목표를 함께 공유한다고 인식하며, 임상지도자들은 일 년 내내 학생의 발달 상태에 맞추어 교수를 조정한다고 설명한다 [30, 31]. 또 다른 예로 현장 진급 수련(Promotion in Place) 모형은 자격을 갖춘 졸업생이 펠로 수련이나 감독 없는 진료로 이행하는 동안 그들의 관심과 미래의 필요에 맞춘 학습 경험을 제공하는 ‘보호된 독립성(sheltered independence)’의 기간을 허용한다 [32, 33]. 간호교육에서는 CBHPE 간호 프로그램이 준비도에 따라 일부 수련생의 진료 현장 진입을 앞당겨 인력 수요에 대응하도록 자기 속도에 맞춘 학습(self-pacing)을 가능하게 한다 [34].
  • 교육적 동맹은 다섯째 구성요소인 프로그램적 평가를 지원한다. 프로그램적 평가에는 지도자가 수련생을 평가하기 위한 잦은 관찰이 필요하고, 수련생이 평가 과정을 시작하는 경우도 많다 [35]. 피드백은 프로그램적 평가의 기본 요소이며, 각 피드백 사건(관찰, 시험, 임상적 만남)은 수련생에게 자신의 수행과 성장에 관한 정보를 제공한다. 그러나 수련생은 피드백을 요청하고 받을 때 정서적으로 취약해지므로 피드백 과정에서 이득을 얻으려면 자신에게 도움이 되려는 지도자의 의도를 신뢰해야 한다 [29]. 강한 교육적 동맹은 이러한 신뢰를 촉진하여 피드백이 전달될 뿐 아니라 적극적으로 요청되는 관계적 맥락을 만든다. 이러한 맥락은 효과적인 피드백의 맥락을 제거한 ‘규칙’, 즉 적시에, 구체적으로, 직접 관찰에 근거해, 실행 가능하게 제공해야 한다는 기준을 넘어선다. 잦고 질 높은 피드백을 신빙성 있고 함께 책임지며 목표를 뒷받침하는 것으로 인식할 수 있게 한다 [2, 36]. 따라서 교육적 동맹은 효과적인 역량기반교육 실천의 초석이 된다.

요약하면 지금까지의 문헌이 개념화한 강한 교육적 동맹은 학습, 교수, 역량 입증의 과정을 공동으로 이해하고 수련생의 단계에 맞게 맥락화하며 적극적으로 함께 만들어 가도록 보장한다. 동맹은 학습 참여를 촉진함으로써 수련생이 어려움 속에서도 자신의 발달을 주도하고 동기를 유지하게 한다 [37]. 이러한 참여는 개별 과업에 국한되지 않고 평생학습과 전문직 정체성 형성에 대한 전반적 지향으로 확장된다. 진전이 수련생의 적극적인 책임감과 평가·피드백 과정 참여에 달린 CBHPE에서 교육적 동맹은 순서화된 역량 전반에 걸쳐 동기를 유지하고 발달 경로를 지원하는 핵심 요인으로 설명되어 왔다 [38, 39]. 수련생이 교수진 코치나 지도자와 강한 동맹을 맺었다고 인식할수록 평가체계를 신뢰하고, 프로그램적 평가 데이터에 참여하며, 피드백을 건설적으로 사용할 가능성이 높다 [40–42]. 동맹이 없다면 CBHPE는 참고 견디거나 두려워하는 점검표와 요구사항의 집합이 될 위험이 있다. 동맹이 있으면 CBHPE는 역량 발달을 실질적으로 뒷받침하는 개인화되고 신뢰에 기반한 접근법이 된다. 따라서 교육적 동맹은 지속적으로 협상되는 업무 관계이며, CBHPE의 관계적 측면뿐 아니라 성공적인 역량 발달과 계속되는 학습에 필요한 수련생의 폭넓은 참여를 뒷받침한다.

교육 합의서를 통한 교육적 동맹의 안내와 강화 (An Educational Agreement May Guide and Strengthen the Educational Alliance) 

수련생과 지도자 사이의 교육적 동맹을 촉진·안내·강화하기 위해 저자들은 교육 합의서(Educational Agreement)의 도입을 제안하고, 대화를 지원하고 신뢰 관계를 증진하기 위해 작성한 도구의 예를 제시한다(Chart). 이 합의서는 지역 CBHPE의 맥락과 두 사람의 필요에 유연하게 맞출 수 있고, 생산적인 관계로 이어지는 대화를 촉진하고 풍부하게 할 수 있다. 두 사람은 합의서의 각 범주를 함께 어떻게 진행할지 공유된 이해를 발전시키도록 권장된다. 교육적 동맹의 각 특징에 대한 수련생과 지도자의 권장 역할은 표 1에 제시되어 있으며, 합의서를 작성할 때 틀이나 참고자료로 사용할 수 있다. 합의서에 제시된 ‘문장 시작 구절(sentence starters)’은 역량에 기반한 수련생의 진전을 지원하는 효과적인 교육적 동맹을 함께 구성하기 위한 수련생–지도자 대화를 촉진한다.

 

교육 합의서는 수련생 오리엔테이션, 지도자 연수, 정기 회의에서 소개할 수 있다. 프로그램 지도자는 수련·실습 순환 시작·중간·종료 점검과 코칭 회의 등 실행 제안을 포함해 지역 맥락에서의 사용에 대한 기대를 정해야 한다. 지역 지도자들은 자발적 참여와 교육적 동맹 안에서 심리적 안전감을 증진한다는 전체 목표를 강조하면서 여러 맥락·역할·환경에 걸쳐 합의서를 가장 잘 실행할 방법을 고려할 수 있다(보충 파일 1: 부록).


도표(Chart). 수련생과 지도자 사이의 교육적 동맹을 촉진하기 위한 교육 합의서 (An Educational Agreement to Foster the Educational Alliance Between Trainee and Supervisor)

  • 이 합의서는 교육적 동맹의 세 가지 주요 특징, 즉 대인관계 구축, 참여의 목표, 목표를 달성하기 위한 과업 지향을 중심으로 한다. 제안된 목표와 실행 가능한 ‘문장 시작 구절’을 함께 제시하여 수련생과 지도자로 이루어진 두 사람이 협력적인 목표 설정을 통해 관계를 개발·강화하도록 돕는다. 이 합의서는 교육자와 학습자 모두의 공동 책임이다. 지역의 필요와 맥락에 맞게 조정하도록 설계되었다. 여기서 수련생은 학생, 전공의, 펠로 또는 다른 학습자를 뜻하며, 지도자는 교사, 임상교사, 교수진 또는 이에 상응하는 역할을 뜻한다.

교육적동맹의특징 (Features of the Educational Alliance)

관계 구축에 관한 합의(Agreement on Relationship Building) 

  • 상호 존중을 보여준다(Demonstrate mutual respect).
    • 목표: 전문직 성장, 술기 개발, 역량 달성을 높이기 위한 정직하고 투명하며 실행 가능한 피드백을 촉진하도록 존중하는 관계를 기른다.
    • 실행: “우리(수련생과 지도자)는 서로 존중하는 토대 위에 관계를 구축하기 위해 … 하겠습니다.”
  • 우리(수련생과 지도자)가 어떻게 상호작용할지 합의한다(Agree on how we will interact).
    • 목표: 목표 설정, 직접 관찰, 피드백, 코칭을 위한 시간을 확보한다.
    • 실행: “우리는 목표 설정, 직접 관찰, 피드백을 위한 시간을 … 방식으로 확보하겠습니다.”
  • 학습 성과에 대한 상호 책무성(Mutual accountability for learning outcomes).
    • 목표: 협력적인 목표 설정, 개별화된 학습 계획의 공동 작성, 역량 달성에 대한 합의된 시간표.
    • 실행: “우리는 공유한 목표를 달성했는지 판단하는 방법을 … 방식으로 정의하겠습니다.”
  • 정직한 피드백을 제공하고 피드백을 구하는 데 헌신한다(Commitment to providing honest feedback and seeking feedback).
    • 목표: 자기 성찰적 실천에 참여하고 피드백을 구하고 수용하며 성장 마인드셋을 받아들인다.
    • 실행: “우리는 함께 자기 성찰이라는 어려운 일을 수행하고, [빈도 입력, 예: 매주] [합의한 접근법 입력, 예: 일대일 회의·점검 등]을 통해 피드백 대화에 참여하겠습니다….”

목표에 관한 합의(Agreement on Goals) 

  • 적절한 공동의 목적과 목표 및 목표 달성을 위한 적절한 시간표 설정(Setting appropriate shared aims and goals and an appropriate timeline to reach goals).
    • 목표: 수련생과 지도자가 실행 가능한 학습 목표를 함께 만든다.
    • 실행: “우리는 이 목표를 달성할 시간표를 포함해 상호 합의한 실행 가능한 목표를 … 방식으로 개발하겠습니다.”

과업에 관한 합의: 합의한 목표를 추구하는 방법(Agreement on Tasks: How to Pursue Agreed-Upon Goals) 

  • 학습 요구와 기회의 공동 확인(Shared identification of learning needs and opportunities).
    • 목표: 역할과 목표, 실행 가능한 학습 계획의 작성에 관한 공동 합의.
    • 실행: “우리는 역할과 목표, 그 목표를 달성하기 위한 실행 계획을 … 방식으로 정의하는 데 시간을 할애하겠습니다.”
  • 평가 방법과 기준의 정렬(Alignment on methods and criteria of assessment).
    • 목표: 수련생과 지도자가 역량 기반 진급을 결정하는 형성적(낮은 부담)·총괄적(높은 부담) 기준과 평가를 모두 이해한다.
    • 실행: “우리는 수련생의 성공에 기여하는 평가 방법과 기준을 이해하고 검토하기 위해 … 방식으로 시간을 내겠습니다.”
  • 성찰에 참여하고 수련생의 자기주도성을 기른다(Engagement in reflection and the cultivation of trainee’s self-direction).
    • 목표 1: 수련생은 피드백과 직장 기반 평가에 근거한 자기평가의 가치를 인식하고, 지도자는 외부 전문가의 관점을 제공하여 이를 지원한다.
    • 실행 1: “직장 기반 평가(또는 이정표, 위임가능 전문직무(entrustable professional activities, EPAs) 같은 다른 평가)를 검토할 때 우리는 … 하기로 합의하여 피드백과 성찰에 참여하겠습니다.”
    • 목표 2: 수련생은 자신의 자기평가를 지도자의 피드백과 비교하고 학습 목표와 개별화된 학습 계획을 반복적으로 갱신한다.
    • 실행 2: “우리는 목표와 학습 계획을 논의하기 위해 간헐적으로 만나겠습니다. [빈도 또는 일정 입력…]”

합의서에 서명할지는 선택사항이다. 수련생과 지도자가 서명을 선택하더라도 이곳에 적힌 모든 내용에 반드시 동의한다는 뜻은 아니다. 합의서 작성에 참여했거나 그 사본을 받았음을 표시하는 것일 뿐이다.

 

  • 수련생 ___________________________ 날짜 ___________________
  • 지도자 ___________________________ 날짜 ___________________

 


보건의료 전문직 교육에서 교육적 동맹의 경계와 한계 (Boundaries and Limitations of the Educational Alliance in Health Professions Education) 

교육적 동맹의 경계를 정의하고 존중하면 수련생과 지도자가 수련생의 역량과 전문직 정체성 형성에 계속 초점을 맞출 수 있다. 교육적 동맹은 신뢰, 존중, 협력에 기반한 전문적이고 목표 지향적인 관계이다.

  • 우정과는 달리 교육적 동맹은 수련생의 개인적·사회적 영역으로 확장되지 않는다.
  • 개념의 출처인 치료적 동맹과 달리 교육적 동맹은 임상 진료 관계가 아니며 교육 지도자는 수련생의 의사, 보건의료 제공자, 치료사가 아니다.
  • 이 관계는 시간과 맥락의 한계도 있으며, 더 넓은 개인적 필요를 충족시키기보다 역량과 전문직 정체성 형성의 촉진에 구체적으로 초점을 맞춘다.
  • 비밀유지가 기대되지만 환자 안전, 기관의 책임, 정책 때문에 공개가 필요할 때는 그 한계를 명시해야 한다. 따라서 교육적 동맹은 치료적 동맹과 마찬가지로 전문적 거리를 유지하면서 신뢰, 개방성, 의미 있는 역량 기반 학습에 필요한 조건을 기른다.

임상 교육에 내재한 구조적 긴장 때문에 교육적 동맹이 형성되지 못하거나 훼손될 수 있다.

  • 지도자는 코치와 판단자의 역할을 동시에 맡는 경우가 많다. 수련생이 피드백을 발달을 위한 것이 아니라 중요한 이해관계가 걸린 평가로 인식하면 이 이중 책임이 신뢰를 해칠 수 있고, 학습자가 취약함을 드러내며 진정성 있게 참여하기 어려워진다 [42].
  • 동맹은 공유된 정체성, 의사소통 방식, 문화적 일치에 따라 고르지 않게 형성될 수도 있으며, 소수화된(minoritized) 수련생에게 이후 불평등을 초래할 가능성이 있다 [41]. 반대로 강한 동맹이 평가의 편향이나 관대함을 가져올 위험도 있다. 이는 관계적 신뢰가 판단과 의사결정을 왜곡하지 않도록 프로그램 차원의 안전장치, 다수의 평가자, 투명한 기준이 필요하다는 점을 강조한다 [43].
  • 또한 동맹은 더 복잡한 학습 환경, 특히 수련생이 노동조합에 가입되어 학습자이면서 직원이라는 이중 역할을 맡는 교육 환경에서 형성될 수 있다 [44].

수련생과 지도자의 종단적 관계는 교육적 동맹의 전형이며 이 논문의 초점이다. 그러나 수련생 집단과 전체 교수진 사이의 제도적 관계를 포함해 다른 형태의 교육적 동맹도 존재한다(보충 파일 1: 부록). 모두 공유된 목표, 목표 달성 방법에 대한 합의, 관계적 유대를 포함하지만, 이 요소들은 관계의 유형에 따라 다르게 나타난다. 또한 일반적인 교수 상호작용과 교육적 동맹의 차이는 수련생이 지도자의 진정성과 학습자에 대한 헌신을 어떻게 인식하는가에 달려 있다 [24, 45].

 

Supplemental File 1: Appendix

Types of Educational Alliances within a Competency-Based Health Professions Education Program across relevant contexts, roles, and settings.

TRAINEE – SUPERVISOR RELATIONSHIP CONTEXT PURPOSE OF INTERACTIONS
Trainee and direct clinical supervisor Regular (i.e., daily, weekly monthly) contact for finite period of clinical training assignment
  • Clinical supervision
  • Feedback based on direct observation
  • Focus on patient care tasks
Trainee and longitudinal coach, mentor, advisor Often an assigned relationship that may last throughout the entire program
  • Longitudinal, developmental support
  • Review of competency-based assessments and aggregate data
  • Assessment of progress within the program
  • Goal setting to achieve program outcome goals
Trainee and program director Oversight over trainees within the training program
  • Focus on the integrity of the program (preventing malpractice, fostering inclusion)
Trainee and clinical competency committee Periodic, scheduled review of progress toward program competencies and milestones
  • Making and justifying high stakes entrustment decisions

CBHPE 프로그램에서 교육적 동맹을 강화하기 위한 권고 (Recommendations to Enhance the Educational Alliance Within CBHPE Programs) 

CBHPE를 지원하는 교육적 동맹의 중요성은 이론적으로 뒷받침된다. 이에 이 논문은 교육자, 프로그램 지도자, 수련생이 효과적인 동맹을 기르고 유지할 전략을 제안한다. 권고는 공유된 이해의 형성, 관계의 강화, 모든 이해관계자 사이의 협력 지원에 초점을 맞춘다. 기존 교수진 개발 과정에 포함할 수 있는 기초 개념부터 보다 포부가 큰 방향까지 아우른다.

공유된 정신모형 (Shared Mental Model) 

  • 교육적 동맹과 그 핵심 요소(관계적 유대, 공유된 목표, 목표 달성을 위한 과업에 대한 합의)에 관해 공유된 정신모형(shared mental model)을 구축하는 것은 기초가 된다. 지도자와 수련생을 위한 전문직 개발 프로그램은 교육적 동맹이 CBHPE를 촉진하는 중심적 역할을 강조하면서 이에 대한 공통의 이해를 확립해야 한다. 훈련 과정에서는 지도자와 수련생의 역할 및 목표를 정의하고 관련 학습 이론 [46], 수행의 동인(drivers of performance) [47], 자기평가와 피드백 요청 행동에 내재한 긴장 [48]을 탐색해야 한다. 이러한 논의에 마인드셋 이론 [18]을 포함하면 성장 마인드셋과 고정 마인드셋의 역동, 그리고 수련생이 성장 마인드셋이 있는 것처럼 보이려고 하는 ‘거짓 성장 마인드셋(false growth mindset)’의 잠재적 함정을 더 잘 이해할 수 있다 [49]. 이러한 개념의 도입은 수련생–지도자 관계와 학습 환경에서 겪는 어려움을 정상적인 것으로 받아들이게 하고, 교육적 관계에서 무엇이 잘 작동하고 무엇이 그렇지 않은지 정직하게 소통하며 상호 이해하도록 돕는다 [50].

관계 구축 (Relationship-Building) 

  • 지도자 개발 프로그램은 신뢰 관계를 구축하는 기법, 코칭 방법, 근거에 기반한 피드백 실천에 초점을 맞추어야 한다. 지도자는 교육적 동맹에서 핵심적인 역할을 하므로 훈련에는 성찰과 개선 계획에 학습자를 참여시키는 대화형 피드백을 위한 R2C2 모형(관계 구축, 반응 탐색, 내용 탐색, 변화를 위한 코칭; Relationship building, Reaction exploration, Content exploration, Coaching for change) [48, 51]과 효과적인 대화를 촉진하는 지침 및 대화 시작 구절 [52] 같은 실용적 도구를 포함해야 한다. 지도자는 동맹의 핵심 요소인 피드백의 신뢰할 만한 제공자로 자리매김할 준비도 해야 한다 [2, 26, 48]. 훈련 기회는 전체 회진(grand rounds), 워크숍, 교수진 회의의 마이크로티칭(microteaching) 등 기존의 자리 안에 포함할 수 있으며, 이를 통해 접근성을 확보하고 일상 활동에 통합할 수 있다.
  • 교육적 동맹은 효과적인 피드백의 관계적 전제조건으로서 HPE의 다른 중요한 상호작용과 닮은 점과 다른 점이 있다. 모든 지도자는 학습자와 함께 일하며, 피드백을 논의하고 신뢰를 쌓고 심리적 안전감을 기를 때 더 큰 영향을 미친다 [53].
    • 하지만 교육적 동맹은 신뢰 관계 안에서 공유된 목표와 그 목표를 향해 일할 계획을 통해 초점을 더 깊게 한다.
    • 이에 비해 멘토는 조언과 역할 모델링에 기여한다 [54].
    • 코칭은 장기간의 성장 지향적 관계 안에서 개인의 발달을 지원하는 방법이다 [42, 55].

수련생의 행위주체성 (Trainee Agency) 

  • 수련생 개발은 자기조절학습을 통한 행위주체성(agency)의 함양에 초점을 맞춰 학습의 공동 생산을 가능하게 하고 효과적인 피드백 요청 행동을 장려해야 한다. 임상실습이나 핵심 수련 순환의 오리엔테이션처럼 중요한 이행 시점에 교육적 동맹 개념을 소개하면 수련생은 협력적인 학습 관계를 구축하는 자신의 역할을 이해할 수 있다. 이러한 과정은 역량 기반 환경에서 발달을 지원하기 위해 목표 설정, 피드백 대화, 자기 성찰을 수련생이 주도하는 일의 중요성을 강조해야 한다.

팀 훈련 (Team Training) 

  • 교육적 동맹 훈련은 팀에 기반한 지도자와 수련생의 역동을 강화하기 위해 학제 간 팀으로도 확장되어야 한다. 다만 일부 맥락에서는 팀 훈련이 아직 지향해야 할 목표라는 점을 인식해야 한다. 교육적 동맹의 원칙을 팀 개발 활동에 포함하면 전문 분야 간 관계를 강화하고 초급 지도자의 교육자 역할을 지원할 수 있다. 이 접근법은 협력을 촉진하고, 지속적인 팀 개선을 통해 성장 마인드셋을 장려하고, 임상 학습 환경을 개선하며 [56], 수련생을 교사로 참여시켜 CBHPE 원칙을 더 발전시킨다.
  • 이해관계자의 다양한 필요에 맞추려면 개발 프로그램 형식에 유연성이 있어야 한다. 지도자, 수련생, 학제 간 팀 구성원이 함께하는 훈련은 집단 간 관계 구축을 촉진할 수 있다. 반면 역할이나 전문직별로 나누어 진행하는 과정은 심리적 안전감을 조성하고 집단 고유의 우려를 논의할 수 있게 한다. 교사–수련생으로 이루어진 두 사람을 시나리오 기반 연습에 짝지으면 현실 상황에 교육적 동맹 원칙을 적용해 직접 연습할 수 있어 어려움에 효과적으로 대응하도록 준비할 수 있다. 교육자 기술을 CBHPE 원칙과 정렬하여 발달시키는 교수진 개발은 이러한 노력을 보완한다 [57].

구조화된 상호작용 (Structured Interactions) 

  • CBHPE 프로그램에서 효과적인 교육적 동맹을 기르려면 구조화된 수련생–지도자 상호작용을 의도적으로 설계하는 것이 중요하다. 초기에 그리고 지속적으로 기대와 역할을 명확히 하면 신뢰를 구축하고 목표를 정렬하는 데 도움이 된다. 관계의 시작 단계에서 구조화된 대화를 나누면 목적을 정의하고 상호 책임을 확립하며 성공이 어떤 모습인지 공유된 이해를 만든다. 협력적 목표 설정은 교육적 동맹을 한층 더 실천으로 옮긴다. 수련생과 지도자는 역량 이정표 및 수련생의 관심사 모두에 맞으면서 구체적이고 측정 가능한 개인화된 학습 목표를 함께 만든다. 수련생의 발달 단계와 새롭게 나타나는 필요에 계속 맞도록 이러한 목표를 정기적으로 재검토해야 한다.
  • 교육과정이나 프로그램에 포함된 정기적인 일정의 회의는 수련생–지도자 점검을 위한 전용 시간을 제공한다. 이런 회의의 시간을 확보하는 일이 이상적인 목표처럼 보일 수 있지만, 저자들의 경험에 따르면 수련생과 지도자 모두에게 더해지는 가치 때문에 참여자에게 실행 가능하고 바람직하다. 회의에서는 목표를 향한 진전을 검토하고, 새롭게 나타나는 학습 요구를 다루며, 전략을 협력적으로 조정한다. 이러한 논의, 목표, 실행 계획을 기록하면 투명성을 높이고 동맹의 공동 구성을 강화하며 진전을 추적하는 데 도움이 된다. 수련생과 지도자 모두가 자신의 상호작용과 동맹의 전반적인 효과를 성찰하도록 장려하면 관계를 더욱 강화하고 지속적인 발달을 지원한다.

프로그램 차원의 정렬 (Programmatic Alignment) 

  • 교육 철학과 기관의 우선순위에 정렬된 프로그램 구조는 CBHPE 프로그램 안에서 교육적 동맹을 기르는 데 중요한 역할을 한다. 교육적 동맹의 발달과 유지를 명시적으로 지원하는 교수진의 역할(예: 코치, 자문자, 지도자)을 분명히 정의하는 것이 필수적이다. 프로그램은 시간이 지나며 수련생의 역량을 기를 수 있도록 교수진에게 전용 교육 시간을 배정하는 방안을 고려할 수 있다. 이러한 역할은 프로그램의 필요와 CBHPE 원칙에 맞아야 한다. 교수진의 진급과 승진을 위한 수행 기대에 교육적 동맹 관련 책임을 포함하면, 수련생과 강한 관계를 맺고, 관계 구축에 계속 참여하며, 상호 학습 목표를 협력적으로 추구하려는 노력을 인정하고 보상할 수 있다. 이 권고와 함께, 교수진이 진정성 있게 관계 구축에 참여하기보다 동맹을 구축하는 것처럼 ‘연기’하도록 유인하는 일을 피해야 한다. 학생의 교수 평가에 관한 근거는 편향, 권력 역동, 보여주기식 응답(performative responding)에 취약함을 보여준다 [58]. 동맹의 신뢰와 진정성을 훼손할 수 있는 교육적 동맹 상호작용의 미묘한 차이에 관한 개인 수준 데이터를 수집하지 않는 것이 이 문제의 한 가지 해결책이다 [59].

이해충돌 (Conflict of Interest) 

  • 교육적 동맹의 온전함을 보장하려면 신뢰를 해칠 수 있는 이해충돌을 확인하고 줄이는 것이 중요하다. 예를 들어 프로그램 책임자 역할도 맡거나 수련생 선발, 성적, 수상에 관한 결정에 영향력을 가진 지도자는 같은 지도 관계 안에서 교육적 동맹과 관련한 평가 기능을 동시에 행사하지 않아야 한다.

투명하고 윤리적인 데이터 사용 (Transparent, Ethical Data Use) 

  • 투명하고 윤리적인 데이터 사용은 교육적 동맹 안에서 신뢰를 유지하는 데 중요하다. 프로그램은 지도자가 수련생 데이터에 접근할 수 있는 범위를 명확히 정의하고, 수련생의 진전에 관한 결정에서 데이터를 어떻게 사용할 수 있는지 명시하는 정책을 수립해야 한다. 학습 환경에 관해 수련생과 지도자 모두에게서 정기적으로 피드백을 수집하면 제도적 구조가 교육적 동맹과 CBHPE 원칙을 촉진하는지 또는 방해하는지를 프로그램이 평가하는 데 도움이 된다.
  • 이러한 권고는 지도자, 수련생, 팀을 개발하는 전략을 통해 교육적 동맹을 강화하고자 한다. 프로그램은 이러한 노력을 CBHPE 원칙과 정렬하여 상호 이해, 공유된 목표, 일관된 참여를 기르고 궁극적으로 CBHPE를 발전시킬 수 있다.

CBHPE의 교육적 동맹에 관한 향후 연구 영역 (Areas for Future Research on the Educational Alliance in CBHPE) 

교육적 동맹은 이론적으로 엄밀한 개념이고 CBHPE를 강화할 가능성이 있지만, 효과를 검증하고 수련 환경에서의 실제적 함의를 탐색하려면 더 많은 경험적 연구가 필요하다.

  • 첫째, 개념을 명확히 하는 기초 연구는 Watling이 피드백과 평가를 구별한 연구 [42]처럼 교육적 동맹과 교수 동맹(teaching alliance)을 구별하여 정의의 정확성을 높이고, 동맹의 구성요소가 성공적인 교육 성과를 어떻게 이끄는지 밝혀야 한다.
  • 교육적 동맹의 질과 이것이 수련생의 역량 발달 및 웰빙에 기여하는 정도를 포착하는 심리측정학적으로 타당한 도구(psychometrically sound instrument)를 개발하면 동맹의 질이 교육 성과에 미치는 영향을 상세히 설명할 수 있다 [60].
  • 수련생과 지도자가 학습 목표를 어떻게 협상하고 구성하는지를 포함해 교육 합의서를 탐색하면 두 사람이 지속적이고 효과적인 동맹을 가장 잘 함께 구축할 방법을 밝힐 수 있다. 성장 마인드셋 이론의 관점에서 지도자와의 피드백 교환 및 목표 설정 실천에 대한 수련생의 인식을 질적으로 탐색하면 동맹 구축 행동이 학습을 형성하는 방식을 드러낼 수 있다.
  • 여러 기관의 데이터를 수집하는 국가 단위 조직의 대규모 데이터셋 등 기존 자료를 활용하면 동맹의 존재와 질, 수련생 및 환자의 성과, 더 넓은 제도적 요인 사이의 연관성을 살펴볼 수 있다. 이러한 데이터셋과 질적 접근법을 함께 사용하는 혼합방법 연구(mixed methods studies)는 교육적 동맹이 경험, 인식, 성과를 왜 그리고 어떻게 형성하는지 더 자세히 설명할 수 있다.
  • 수련 단계에 따라 동맹이 어떻게 발전하는지 추적하고 수련생과 지도자 모두의 웰빙에 미치는 영향을 조사하는 종단 연구(longitudinal studies)는 효과적이고 만족스러운 HPE의 토대가 되는 관계적 역동에 관한 핵심 통찰을 제공할 것이다.
  • 마지막으로 비판적 실재론(critical realism)은 특정 맥락적 조건에서 효과적인 피드백과 학습을 만들어내는 기저의 인과 기제(예: 관계적 신뢰, 신빙성, 심리적 안전감, 정체성 확인)를 밝히기 위해 교육적 동맹에 관해 경험적으로 관찰된 데이터와 실제 경험을 이해하는 문헌 기반의 틀이 될 수 있다 [61].

결론 (Conclusion) 

수련생과 지도자 사이의 신뢰하는 협력관계인 교육적 동맹은 성장에 도움이 되는 피드백과 자기조절학습 기술의 촉진에 함께 집중하면서, 명확히 정의된 수련 성과에 지속적으로 초점을 맞춤으로써 CBHPE의 성공적인 실행을 촉진한다. 프로그램은 공유된 정신모형을 확립하고 수련생, 지도자, 팀에게 이 중요한 구성개념에 관한 훈련을 제공하여 교육적 동맹을 증진할 수 있다. 수련생–지도자의 참여를 위한 전용 시간, 이 상호작용에 대한 구조화된 지침, 수련생의 수행 정보를 사용하기 위한 투명한 절차는 학습을 위한 교육적 동맹의 효과를 강화한다. 프로그램의 지속적인 질 개선과 연구의 일부로 교육적 동맹의 성격, 강도, 영향을 계속 점검하면 역량기반교육의 성공적인 실행에 기여할 것이다.

AI 사용 설명 (AI Statement)

저자들은 글의 흐름, 문법, 명료성, 가독성을 개선하기 위해 ChatGPT와 ClaudeAI를 사용했다. 모든 저자는 도구가 편집한 텍스트를 포함한 원고 전체를 주의 깊게 검토하고 수정했으며, 이 출판물의 최종 내용에 대해 전적인 책임을 진다.

The CBHPE Outcomes Theory of Change: An International Consensus Statement on the Mechanisms and Outcomes of Competency-Based Education in the Health Professions 

ICBHPE series

Authors
  • Aleda M. H. Chen, Denise H. Rhoney, Mary Ellen J. Goldhamer, Andem Ekpenyong, Susan Humphrey-Murto, Holly Caretta-Weyer, Linda Snell, Arvin Damodaran, Robert Englander, Andrew K. Hall, Soeren Huwendiek, Laura Molgaard, Anna Oswald, Daniel J. Schumacher, Fremen Chihchen Chou, Pedro Tanaka, Jason R. Frank, As members of the International Competency-based Education in the Health Professions Collaborators
Year: 2026

Volume: 15 Issue: 1

Page/Article: 732–747

DOI: 10.5334/pme.2553

 

 

⚙️ "CBME는 효과가 있나?"라는 질문을 다시 묻다: CBHPE 성과 변화이론(Outcomes Theory of Change) 국제 합의문 읽기

📄 Chen AMH, Rhoney DH, Goldhamer MEJ, et al.; International Competency-based Education in the Health Professions Collaborators. The CBHPE Outcomes Theory of Change: An International Consensus Statement on the Mechanisms and Outcomes of Competency-Based Education in the Health Professions. Perspectives on Medical Education. 2026;15(1):732–747. doi:10.5334/pme.2553

 

안녕하세요! 이번에는 AI에서 잠깐 벗어나 역량바탕교육(CBE)의 기본기로 돌아가 볼게요. 오늘 소개할 논문은 국제 역량바탕 보건의료교육자 협력체(ICBHPE) 가 낸 시리즈 중 하나예요. Jason Frank, Robert Englander, Andrew Hall, Daniel Schumacher, Linda Snell처럼 CBME 분야에서 익숙한 이름들이 저자로 참여했어요.

 

이 논문은 CBME 논쟁에서 늘 나오는 질문, "CBME는 정말 효과가 있나?" 를 다른 방식으로 묻자고 제안해요.

 

한 줄로 줄이면 이래요. "CBME의 효과를 제대로 평가하려면, 먼저 CBME가 '어떤 경로로' 성과를 만든다고 가정하는지 명시적인 변화이론(theory of change)으로 정리해야 한다."

 

※ 이 논문은 의학뿐 아니라 약학, 수의학까지 아우르기 때문에 CBME 대신 CBHPE(Competency-Based Health Professions Education, 역량바탕 보건의료인 교육) 라는 용어를 써요. 이 글에서도 그대로 따를게요.


📌 1. 왜 변화이론이 필요할까?

🕰️ 50년 가까이 됐는데, 아직도 논쟁 중

CBME는 1978년 세계보건기구(WHO) 가 처음 소개했어요. 그 뒤로 전 세계 의학교육자들이 시간 기반의 고정된 수련 모델에서 벗어나, 졸업생의 능력, 환자와 인구집단의 요구, 학습자 중심성을 강조하는 방향으로 교육을 바꾸려고 노력해 왔죠.

 

2019년에는 Van Melle 등이 CBHPE 5대 핵심 구성요소(Core Components) 를 합의로 발표했어요. 첫 번째 글(AAMC 기초역량)에서도 잠깐 나왔던 그 틀이에요.

  1. 성과 역량(outcome-based competencies): 환자 초점
  2. 순차적 진급(sequenced progression): 학습자 중심
  3. 맞춤형 학습경험(tailored learning experiences): 학습자 중심
  4. 역량 중심 교수(competency-focused instruction): 학습자 중심
  5. 프로그램식 평가(programmatic assessment)

그런데도 이 구성요소를 실제로 어떻게 구현해야 하는지를 두고 논쟁이 계속되고 있어요. 저자들은 연구가 부족해서가 아니라, 연구마다 목적, 설계, 맥락, 성과 선택이 제각각이어서 생기는 문제라고 봐요.

⚠️ "이름만 CBME"의 문제

저자들이 특히 문제 삼는 건 이 부분이에요.

프로그램은 CBHPE 용어를 채택하면서도 핵심 구성요소를 선택적으로만 실행할 수 있다. 이 경우 관찰된 성과가 일관되고 이론에 기반한 개혁으로서의 CBHPE를 반영하는지, 아니면 부분적이고 일관되게 지원되지 않은 실행을 반영하는지 판단하기 어렵다.
"programs may adopt CBHPE terminology while selectively enacting core components, making it difficult to determine whether observed outcomes reflect CBHPE as a coherent, theory-informed reform or partial and inconsistently supported implementation"

그래서 이런 위험이 생긴다고 해요.

명시적인 프로그램 이론이 없으면, 성과의 변동성이 잘못 해석될 위험이 있으며 실행의 실패를 이론의 실패와 혼동하게 된다.
"In the absence of explicit program theory, outcome variability risks being misinterpreted, conflating implementation failure with theory failure"

 

실행의 실패(implementation failure) 와 이론의 실패(theory failure) 를 구분하자는 것, 이 논문 전체를 관통하는 핵심 메시지예요. 어떤 프로그램에서 성과가 안 나왔을 때, 그게 CBME라는 아이디어가 틀려서인지, 아니면 CBME를 제대로 실행하지 않아서인지 구분할 수 있어야 한다는 거죠. 🎯

📐 이론이란 무엇인가

저자들은 Varpio 등(2020)의 정의를 가져와요.

이론은 "논리적으로 연결된 명제들의 집합으로, 여러 구성개념과 명제들 사이의 관계를 표현한다."
Theory, as defined by Varpio and colleagues (2020), is "a set of propositions that are logically related, expressing the relation(s) among several different constructs and propositions."

 

그리고 겸손한 단서도 달아요.

중요한 것은, 우리가 이것을 유일한 이론이 아니라 하나의 이론으로 제시한다는 점이다. 비판적 참여, 학술적 대화, 경험적 검증, 다양한 맥락에서의 적응을 통해 발전해 나갈 것으로 기대한다.
"Importantly, we present this as a theory rather than the theory, anticipating that it will evolve through critical engagement, scholarly dialogue, empirical testing, and adaptation across diverse contexts."


🛠️ 2. 어떻게 만들었나?

👥 누가

 

  • ICBHPE는 2009년에 만들어진 협력체로, 6개 대륙에서 약 90명의 CBHPE 연구자, 리더, 실행자, 평가자가 모여 있어요. 2024년에 구조화된 합의 과정으로 18개 주제를 골랐고, 2025년 2월 스탠퍼드대학교에서 50명 넘게 참석한 합의 포럼을 열었어요. 여기서 변화이론이 최우선 과제로 꼽혔고, 4개 대륙, 3개 직종(의학, 수의학, 약학)에 걸친 16명의 저자 그룹이 꾸려졌어요.

 

📚 어떤 틀로

분석 틀은 Funnell과 Rogers(2011)의 목적 지향적 프로그램 이론(purposeful program theory) 이에요. 이 틀은 두 가지를 구분해요.

  • 실행이론(theory of action): 프로그램이 무엇을 하고 어떻게 실행되는가
  • 변화이론(theory of change): 변화가 어떤 기전으로 일어날 것으로 기대되는가

저자들이 이 틀을 고른 이유는 CBHPE가 여러 구성요소가 서로 상호작용하고 맥락에 크게 좌우되는 복합 개입(complex intervention) 이기 때문이에요. 프로그램 이론이 암묵적이면 성과를 해석하기가 어렵다는 거죠.

※ 논문 속 "theory of change"는 거대이론(grand theory)이 아니라 Funnell과 Rogers가 말하는 프로그램 이론 전통의 의미로 쓰였다고 저자들이 밝혀요.

🔍 어떤 근거로

문헌 검토는 체계적 고찰이 아니라 폭넓고 설명적인 방식으로 했어요. 흥미로운 점은 보건의료 밖의 CBE 문헌도 함께 참고했다는 거예요. 고등교육이나 초중등교육 쪽이 거버넌스, 준비도, 투명성, 평가에 관해서는 더 쓸 만한 틀을 갖고 있었기 때문이래요.

  • CBE 네트워크 질 프레임워크(Competency-Based Education Network Quality Framework): 기관의 헌신, 일관된 설계, 투명성, 근거기반 개선
  • Aurora Institute/CompetencyWorks의 질 원칙: 거버넌스 정합성, 교육자 역량, 투명한 수행 기대, 형평 지향 설계
  • 미국 교육통계센터(NCES)와 NPEC의 지침: 신뢰할 수 있는 평가체계와 이해관계자 참여

물론 저자들은 이 점을 분명히 해요.

이는 CBHPE가 초중등이나 고등교육의 CBE와 서로 바꿔 쓸 수 있다는 뜻이 아니다. 오히려 더 넓은 CBE 분야가 거버넌스, 준비도, 투명성, 평가에 대해 쓸 만한 프레임워크를 만들어 낸 영역에서 개념적 완결성을 강화하려는 의도다.
"This does not imply that CBHPE is interchangeable with K–12 or postsecondary CBE; rather, it is intended to strengthen conceptual completeness in areas where the broader CBE field has produced usable frameworks for governance, readiness, transparency, and evaluation."

🔄 어떤 절차로

세 명의 핵심 저자가 초안을 쓰고, 전체 저자가 여러 차례 토론하고 수정해 합의에 이른 뒤, ICBHPE 전체 회원에게 공개해 구성원 확인(member checking) 을 거쳤어요. 포럼에 오지 못한 회원, 특히 글로벌 사우스(Global South) 와 다른 보건의료 직종 회원들의 의견도 받으려고 했다고 해요.


🧩 3. 변화이론의 11가지 구성요소 

저자들은 먼저 변화이론에 들어가는 요소들의 정의를 정리했어요(Table 1). 공통 언어를 만드는 작업이라 그대로 옮겨 볼게요.

요소 의미
핵심 구성요소 (Core Component) Van Melle의 5대 구성요소. 설계와 실행의 기준점
실행 전략 (Implementation Strategies) 핵심 구성요소로 교육과정을 바꾸는 구체적 행동이나 구조 변화 (예: 코칭 체계, 마일스톤 매핑, 피드백 기제)
변화의 동인 (Drivers of Change) 실행 전략이 해결하려는 교육적·조직적·사회적 문제 (예: 시간 기반 진급, 학습자 준비도의 편차, 불공정한 평가)
변화이론 (Theory of Change) 활동이 왜, 어떻게 원하는 성과로 이어지는지에 대한 근거. 가정(assumptions), 작용 기전(mechanisms of action), 인과 논리(causal logic) 를 포함
이론적·개념적 토대 핵심 구성요소가 어떻게 작동하는지 설명하는 학습과학 이론과 실행 모형 (예: 동기, 인지, 발달 이론, 실행과학, 변화관리 모형)
핵심 이해관계자의 행동 변화 실행을 지속하는 데 필요한 관찰 가능한 행동과 역할의 변화 (예: 피드백을 구하는 학습자, 코치 역할을 하는 교수)
실행 산출물 (Implementation Outputs, 초기 신호) 실행의 질과 진척을 보여 주는 초기의 관찰 가능한 신호
시간에 따른 성과 (Outcomes Over Time) 근위(proximal), 중간(intermediate), 원위(distal) 성과
장벽과 촉진요인 (Barriers/Enablers) 변화를 막거나 돕는 개인·문화·시스템 요인
형평성 고려 (Equity Considerations) CBE 구조가 다양한 학습자의 포용, 형평, 접근을 돕는지 방해하는지
지표 (Indicators/Metrics) 위 모든 요소에 적용할 수 있는 구체적이고 측정 가능한 변수

여기서 꼭 짚어야 할 구분이 있어요. 바로 실행 산출물과 성과는 다르다는 거예요.

실행 산출물은 성과와 구별되며, 교육, 진료, 사회의 변화를 나타내지 않는다.
"Implementation outputs are distinct from outcomes and do not represent educational, practice, or societal change."


⚙️ 4. 핵심 모형: CBHPE 성과 엔진 (CBHPE Outcomes Engine)

이 논문의 중심은 CBHPE 성과 엔진이라는 그림(Figure 2)이에요. 말로 풀면 이렇게 돼요.

① 변화의 동인 (왼쪽) ➡️

  • 사회적, 교육적, 조직적 요구가 변화를 시작하게 만들어요.

 

② 엔진의 톱니바퀴 (가운데) ⚙️

  • Van Melle의 5대 핵심 구성요소가 톱니바퀴처럼 맞물려 돌아가고, 그 한가운데 변화이론(가정과 인과 기전)이 있어요.

 

③ 맥락 조절 요인 (톱니바퀴를 둘러싼 원) 🔄

  • 실행·질 개선 전략, 촉진요인과 장벽, 형평성 고려, 이해관계자 행동이 톱니바퀴를 둘러싸고 있어요. 이 요인들이 CBHPE의 기전이 얼마나 강하고 일관되게 작동할지를 조절해요.

 

④ 실행 산출물, 곧 초기 신호 (오른쪽) ✅

  • 8가지 초기 신호가 나와요. 아래 표로 정리할게요.

 

⑤ 시간에 따른 성과 (가장 오른쪽) 📈

  • Hall의 성과 분류 타임라인에 맞춰 세 단계로 나뉘어요.
    • 근위 성과(proximal, 수련 중): 학습자 발달, 평가 활용, 피드백 질, 교수 방식의 변화
    • 중간 성과(intermediate, 진료로의 전환기): 역량의 적용, 공고화, 전이
    • 원위 성과(distal/impact, 진료 중): 지속적 수행, 인력 영향, 환자·인구집단 성과

⑥ 이해관계자 (아래) 👥

  • 직접 이해관계자: 학습자, 교수, 행정가, 임상교육자. CBHPE 설계가 의도적으로 행동 변화를 목표로 하는 사람들
  • 간접 이해관계자: 다직종 팀, 환자와 대중. CBHPE에 영향을 주고받지만 개입의 주된 대상은 아닌 사람들

⑦ 지표 (맨 아래 띠) 📏

  • 측정은 엔진 전체, 곧 맥락 조절 요인, 이해관계자 행동, 산출물, 성과 모두에 적용할 수 있어요.
  • 그림 설명에 이 모형의 핵심이 한 문장으로 담겨 있어요.

 

이 모형은 성과가 당연히 따라오는 것이 아니라는 점을 강조한다. 성과는 주어진 실행 맥락 안에서 이해관계자의 행동이 변화이론에 명시된 기전을 작동시킬 때 나타난다.
"The model emphasizes that outcomes are not assumed; they emerge when stakeholder behaviors activate the mechanisms specified in the theory of change within a given implementation context."

✅ 8가지 초기 신호 (Implementation Outputs)

신호 의미
채택 (Adoption) CBHPE 구성요소를 쓰기 시작하겠다는 결정이나 행동
충실도 (Fidelity) CBHPE가 설계대로 전달되는 정도
실현 가능성 (Feasibility) 시간, 업무량, 자원을 고려할 때 해당 현장에서 성공적으로 수행할 수 있는 정도
지속가능성 (Sustainability) 초기 도입 이후에도 유지되고 일상화되는 정도
침투도 (Penetration) 과목, 로테이션, 부서, 사이트에 걸쳐 얼마나 깊고 넓게 통합되었는가
도달 (Reach, 참여율) 의도한 이해관계자 중 실제로 참여하는 비율과 대표성 (예: 평가 완료율)
수용성 (Acceptability) 이해관계자의 만족, 인식된 가치, 참여 의향 (부담 대비 이익)
적절성 (Appropriateness) 현장, 목표, 제약에 잘 맞는다는 인식. "좋아하는 것"과는 구별되는 관련성과 적합성

이 신호들은 평가 완료율, 관찰 횟수, 평가자 간 보정 결과, 피드백까지 걸리는 시간, 사이트별 적용 범위 같은 구체적 지표로 측정한다고 해요.


👥 5. 누가, 어떻게 쓸 수 있나?

저자들은 이 변화이론을 개념 설명이 아니라 실행과 평가를 위한 작업 모형(working model) 으로 제시해요. 역할별 활용법이 꽤 구체적이에요.

  • 🏗️ 교육과정 설계자: 빠진 구성요소, 비현실적 가정, 의도한 성과와 가용 구조 사이의 불일치를 찾는 설계 점검 도구
  • 🚀 프로그램 실행자: 업무 흐름 제약, 역할 혼란, 관찰·코칭 역량 부족 같은 예측 가능한 장벽을 미리 파악
  • 🧑‍🏫 교수개발 책임자: 도구 사용법을 넘어, CBHPE에 필요한 행동과 정체성의 변화를 지원하는 교수개발 설계
  • 📊 프로그램 평가자: 원위 성과만이 아니라 실행, 산출물, 성과 전반에 걸친 균형 잡힌 지표 포트폴리오 구성
  • 🩺 현장 교육자: 매일의 교수, 코칭, 피드백을 발달적 진급과 정렬
  • 🎓 학습자: 역량, 마일스톤, 학습계획, 평가 데이터가 어떻게 연결되는지 이해하고 목표 설정, 자기 모니터링, 피드백 탐색에 더 의도적으로 참여
  • 🏛️ 인증기관, 규제기관, 보건의료기관 등: 어떤 근거가 초기에, 어떤 근거가 나중에 나와야 하는지 기대 수준을 조정하고 단일 지표에 대한 과의존 피하기
  • 🔬 연구자: 연구 간 비교 가능성을 높이는 공통 개념 틀

그중 두 대목이 특히 인상적이었어요. 먼저 교수개발에 관한 부분이에요.

이런 방식으로, 교육자의 역량은 CBHPE 도구에 대한 절차적 순응이 아니라, 학습자의 향상을 이끄는 것으로 입증된 평가와 피드백 실천의 숙련된 실행으로 개념화된다.
"In this way, educator competence is conceptualized not as procedural compliance with CBHPE tools, but as skilled implementation of assessment and feedback practices shown to drive learner improvement."

 

WBA 서식을 "채우는 것"과 제대로 "평가하고 피드백하는 것"은 다르다는 이야기죠. 📝

 

그리고 평가자에 관한 부분이에요.

이는 "CBHPE는 효과가 없다"와 "CBHPE가 필요한 조건, 정렬, 요소를 갖추고 실행되지 않았다" 사이의 결정적 구분을 뒷받침한다.
"It supports the critical distinction between 'CBHPE does not work' and 'CBHPE was not implemented with necessary conditions, alignment, or elements.'"


💬 6. 이 논문의 핵심 기여

🔀 질문을 바꾸자

저자들이 스스로 꼽은 가장 큰 기여는 질문 자체를 바꾼 것이에요.

CBHPE 성과 변화이론의 핵심 기여는 CBHPE에 대한 오랜 논쟁을 단일 개입으로서 CBHPE가 "효과가 있는가"라는 질문에서, 더 실행 가능한 질문들로 옮겨 놓는다는 점이다.
어떤 핵심 구성요소가 실행되었는가, 어떤 기전을 통해서인가, 어떤 촉진 조건 아래에서인가, 그리고 실행의 각 단계에서 어떤 형태의 근거를 합리적으로 기대할 수 있는가?

"A key contribution of the CBHPE Outcomes Theory of Change is that it reframes the longstanding debate about CBHPE away from the question of whether CBHPE 'works' as a single intervention, and toward more actionable questions: which Core Components were enacted, through what mechanisms, under which enabling conditions, and what forms of evidence should reasonably be expected at different phases of implementation?"

 

이는 Cooper와 Holmboe가 강조한 관점과도 이어져요. CBHPE는 복잡한 사회 시스템 개입(complex social systems intervention) 이고, 그 성공은 개별 도구 도입보다 역량 프레임워크, 프로그램식 평가, 교수개발, 거버넌스, 종단적 학습환경을 일관되게 통합하는 데 달려 있다는 거죠.

⚖️ 정당한 변이와 부적절한 변이 구분하기

CBHPE는 졸업생 성과의 부적절한 변이(unwarranted variation) 를 줄이는 방법으로 자주 소개돼요. 그런데 Holmboe와 Kogan은 기준, 평가, 실행 지원이 들쭉날쭉하면, 특히 CBHPE라는 말만 쓰고 일부만 실행하면 오히려 부적절한 변이가 생길 수 있다고 지적했어요. 이 변화이론은 정당한 맥락적 적응(warranted contextual adaptation) 과 부분적이거나 잘못 정렬된 실행을 구분하는 틀을 제공한다고 해요.

📈 기존 논리모형을 두 가지 면에서 확장

기존 CBME 논리모형(logic model)과 성과 분류 작업과 비교하면, 이 논문은 두 가지를 더했어요.

  1. 변화가 어떻게, 왜 일어나는지를 가정, 작용 기전, 이해관계자 행동으로 명시했어요.
  2. 이 경로를 성과 지도와 후보 지표로 구체화해서 성과 선택, 측정, 보고를 일관되게 할 수 있게 했어요.

🌱 살아 있는 문서

저자들은 이 변화이론이 살아 있는 문서(living document) 여야 한다고 강조해요.

이것은 경직되거나 고정된 이론으로 의도된 것이 아니다. 오히려 목표는 CBHPE를 둘러싼 과학을 향상시키는 것이다.
"It is not intended to be a rigid or concrete theory; instead, the goal is to enhance the science surrounding CBHPE."


⚠️ 7. 저자들이 밝힌 한계

  • 체계적 근거 종합이 아니에요. 폭넓고 설명적인 문헌 검토와 합의에 기반한 프로그램 이론이지, 등급화된 근거 종합이나 효과 추정이 아니라고 해요.
  • 범용성과 구체성은 상충해요. 여러 직종과 국가에서 쓸 수 있게 만들다 보니, 특정 프로그램에 바로 적용하기에는 구체성이 떨어질 수 있어서 현지 적응이 필수예요.
  • 글로벌 노스(Global North) 편향이 있어요. 저자들이 직접 인정한 부분이에요.

협력체와 이 논문의 저자 그룹은 글로벌 노스의 비중이 크고 글로벌 사우스의 대표성은 적다. 따라서 우리의 글로벌 노스 경험이 관점을 형성하는 동시에 글로벌 노스 편향의 위험도 있으며, 이는 글로벌 사우스 맥락에서 의미 있는 적용 가능성을 온전히 개념화하는 능력에 영향을 줄 수 있다.
"the Collaborative and the author team for this paper have a heavy Global North representation, with less Global South representation. Therefore, while our Global North experiences inform our perspective, they also risk Global North bias, which may affect our ability to fully conceptualize meaningful applicability in Global South contexts."

  • 저자들 상당수가 CBME를 직접 개발, 실행, 연구해 온 사람들이라, CBHPE에 대한 익숙함이 가정에 영향을 줄 수 있다는 점도 인정해요.

🔭 앞으로의 과제

이 변화이론이 실제로 쓸모 있는지 경험적으로 평가하고, 현지 제약에 민감한 지표를 찾고, 보고의 질을 높이는지 확인하는 것이 다음 단계예요. 저자들은 이 변화이론을 바탕으로 CBHPE 실행 보고 지침(reporting guidelines) 을 만드는 후속 논문도 함께 냈어요. 또 평가와 진급 관행이 편향을 줄이는지 키우는지 형평성 영향을 명시적으로 검증해야 한다고 강조해요.


💡 8. 읽으며 든 생각과 한국 의학교육에 주는 시사점

마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.

  • ① "성과가 없다"고 결론 내리기 전에 물어볼 것 🧐
    • 우리도 전공의 수련에 역량바탕 교육과 WBA를 도입하는 과정에 있죠. 이런 사업을 평가할 때 곧바로 "전공의 역량이 좋아졌나?", "환자 성과가 나아졌나?" 같은 원위 성과부터 물으면, 성과가 안 나왔을 때 CBME 자체를 탓하기 쉬워요. 이 논문의 틀대로라면 먼저 충실도, 도달(평가 완료율), 실현 가능성, 수용성 같은 초기 신호를 확인해야 해요. 관찰 기반 평가가 실제로 이뤄지고 있는지, 교수들이 피드백을 주고 있는지가 확인되지 않으면 원위 성과는 해석하기 어렵다는 거죠.
  • ② "이름만 CBME"를 경계하기 🏷️
    • 역량, 마일스톤, EPA라는 용어를 쓰면서도 실제로는 5대 구성요소 중 일부만 운영하는 경우가 적지 않을 거예요. 이 변화이론은 우리 프로그램이 어떤 구성요소를, 어떤 조건에서, 어느 정도로 실행하고 있는지 점검하는 체크리스트로도 쓸 수 있을 것 같아요. 평가인증 자료를 준비할 때도 참고가 될 수 있고요.
  • ③ 비판적으로 읽을 지점 🤔
    • 이 변화이론은 CBME를 지지하고 실행해 온 전문가들의 합의로 만들어졌어요. 저자들도 인정하듯 CBME의 기본 가정 자체는 전제되어 있는 셈이에요. "CBME가 옳다"는 가정을 검증하는 틀이라기보다, CBME를 제대로 실행하고 평가하는 틀로 보는 게 적절할 것 같아요.
    • 요소가 11개, 초기 신호가 8개, 성과가 3단계라서 꽤 복잡해요. 자원이 한정된 기관에서 이걸 다 측정하기는 어려울 테니, 우선순위를 정하는 가이드가 더 필요해 보여요.
    • 5대 구성요소별 구체적인 지도는 본문이 아니라 부록 1에 있어요. 실제로 적용하려면 부록을 꼭 함께 보셔야 해요.
  • ④ 앞의 글들과 이어서 보기 🔗
    • AAMC 기초역량이 "무엇을 갖출 것인가"라는 성과 역량을 정의했다면, 이 논문은 그 역량이 어떤 경로로, 어떤 조건에서 실제 성과로 이어지는지를 다뤄요. Macy 권고안과 Pusic·ten Cate 논문이 AI가 CBME의 데이터 문제를 풀 수 있다고 기대했는데, 그 기대가 현실이 되려면 결국 이런 실행과 평가의 틀이 먼저 갖춰져야 한다는 생각이 들어요.

📝 정리하며

  • ICBHPE가 국제 합의로 CBHPE 성과 변화이론(Outcomes Theory of Change) 을 제시했어요.
  • 핵심 메시지는 실행의 실패와 이론의 실패를 구분하자는 거예요.
  • 중심 모형인 CBHPE 성과 엔진은 변화의 동인에서 시작해, 5대 핵심 구성요소와 변화이론, 맥락 조절 요인, 이해관계자 행동을 거쳐 8가지 초기 신호와 근위, 중간, 원위 성과로 이어져요.
  • 실행 산출물은 성과가 아니며, 성과는 당연히 따라오는 게 아니라 이해관계자 행동이 기전을 작동시킬 때 나타나요.
  • 질문을 "CBME는 효과가 있나?"에서 "어떤 구성요소가, 어떤 기전으로, 어떤 조건에서 실행되었나?" 로 바꾸자고 제안해요.
  • 저자들은 이것을 "유일한 이론(the theory)"이 아니라 "하나의 이론(a theory)" 이자 살아 있는 문서로 제시해요.

함께 읽으면 좋은 글로는 Van Melle 등(2019)의 CBME 핵심 구성요소 프레임워크(Acad Med 94(7):1002–1009), 그리고 같은 ICBHPE 시리즈의 CBHPE 실행 보고 지침 논문을 추천해요. 📎

 


서론 (Introduction) 

보건의료 전문직 역량기반교육(CBHPE)은 보건의료인을 위한 교육과정과 교육체계를 개념화하고 설계하는 성과 기반 교육 접근법(outcomes-based education approach)이다 [1–3]. 이는 보건의료에서 교수, 학습, 평가의 질을 높이는 동시에 모든 졸업생이 자신이 봉사할 인구집단의 요구에 대응할 준비가 되었는지 확인하는 데 초점을 다시 맞추려는, 서로 정렬된 실천들의 집합이다 [1–3]. 역량기반 의학교육(competency-based medical education, CBME)은 1978년 세계보건기구(World Health Organization)가 도입했다 [4]. 지난 50년 동안 전 세계 의학교육자들은 졸업생의 능력, 환자와 인구집단의 요구, 학습자 중심성, 근거에 기반한 교육 방법을 강조하기 위해 CBE 원칙으로 수련을 변화시키고자 노력했다. CBME의 발전 배경에는 20세기 의학 수련의 상당 부분이 정해진 기간에 기반한 모형(fixed, time-based models)에 의존해 학습 경험과 결과의 편차가 생기고, 진료에서 입증된 역량과 수행보다 지식 습득을 강조했다는 우려가 있었다 [2, 5–9]. CBME는 새로운 교육과정 설계 및 평가 접근법과 함께 점진적으로 발전했고, 여러 나라의 다양한 보건의료 전문직에서 채택되거나 적극적으로 검토되고 있다 [10–20]. (이 논문에서는 이하 CBME를 포함하여 모든 보건의료 전문직의 역량기반교육을 통틀어 CBHPE라 부른다.) 그러나 CBHPE의 실행에는 여전히 공백이 있다는 지적이 있다. 그중에는 CBHPE에 무엇이 포함되는지, 그리고 핵심 구성요소(Core Components)를 실제로 어떻게 해석해야 하는지를 둘러싼 지속적인 논의가 있다 [21–24]. 따라서 이 논문은 CBHPE의 의도된 작동 방식을 명확히 하는 이론 기반 모형을 개발하여 핵심 구성요소, 실행 과정, 기대 성과를 연결함으로써 이러한 과제에 대응한다.

 

2019년 van Melle와 동료들은 CBHPE에 대한 공통의 이해를 지원하고 실행을 더 일관되게 평가할 수 있도록 전문가 합의 틀인 핵심 구성요소(Core Components)를 발표했다 [3]. 이 틀은 CBHPE가 학습자 중심이면서 환자에 초점을 둔 교육 접근법이라는 기본 원칙에서 나온다. 이 틀은 다섯 가지 핵심 구성요소를 명시한다.

  • 1) 성과 기반 역량(outcome-based competencies, 환자 중심),
  • 2) 순서화된 진전(sequenced progression, 학습자 중심),
  • 3) 맞춤형 학습 경험(tailored learning experiences, 학습자 중심),
  • 4) 역량 중심 교수(competency-focused instruction, 학습자 중심),
  • 5) 프로그램적 평가(programmatic assessment)이다.

van Melle 등은 각 핵심 구성요소의 토대가 되는 관련 개념 이론, 원칙, 실행 권고를 설명하면서, 이것이 교육과정에 단순히 무언가를 ‘추가’하는 일이 아니라 변혁적 개혁임을 강조했다 [3, 5].

 

핵심 구성요소 틀이 지침을 제공했음에도 핵심 구성요소를 어떻게 실행할 것인지를 둘러싼 논의는 계속된다. 이러한 논의의 상당 부분은 학문적 관심이나 경험적 탐구의 부족보다는 연구 목적과 설계, 실행 맥락, 성과 선택의 이질성에서 비롯된다 [21, 23, 25–27]. Brydges와 동료들의 서술적 문헌고찰(narrative review)은 CBHPE의 가정을 뒷받침하는 근거가 상당하지만, 보고 방식의 불일치, 기저 가정의 불충분한 명시, 실행과 성과의 연결이 어렵다는 과제가 남아 있음을 강조했다 [23]. 학술 문헌에서 이러한 핵심 요소를 표준화하거나 일관되게 보고하지 않으면 발표된 연구들을 종합하고 대규모 결론을 도출하기 어려워지지만 [28], 근거는 CBHPE가 의도한 성과를 달성하며 가치 있는 교육 접근법임을 시사한다 [5, 14, 15, 20, 29–32].

 

CBHPE 연구는 전체적으로 하나의 중재가 아니라 실제 사용되는 다양한 실행 전략(implementation strategies)을 연구해 왔다 [20, 32–34]. 연구들은 변화 준비도(readiness for change), 실행 충실도(implementation fidelity), 핵심 구성요소의 실행(enactment), 평가체계의 타당성, 교육 성과, 후속 영향 등 CBHPE 실행의 여러 측면을 적절하게 평가하는 데 초점을 맞추었다 [35]. 프로그램이 CBHPE를 채택하고 개선하는 여러 단계를 거치면서 평가의 초점도 시간에 따라 달라졌다 [5, 35]. 따라서 이 논문은 CBHPE의 평가 방법, 실행상의 과제에 대응한 프로그램의 발전, 명시적인 변화이론과 성과 경로(outcome pathways), 그리고 향후 노력의 일관성·해석 가능성·책무성을 높이기 위한 보고 기준을 검토한 상호보완적 연구들을 한데 모음으로써 이러한 진전을 반영한다 [28, 34–44].

 

성과 분류체계(outcomes taxonomies)와 핵심 구성요소 틀 등 공통 언어를 강화하려는 노력은 이 분야를 발전시켰지만 [3, 33, 45], CBHPE의 가정, 실행, 기대 성과를 명시적으로 연결하는 데는 여전히 공백이 있어 프로그램 간 연구 결과의 해석과 비교가 제한된다 [22]. 여기에 CBHPE 프로그램이 의도한 대로 실행되는 정도에도 차이가 있다는 점이 문제를 더한다 [15, 21]. Misra와 동료들은 핵심 구성요소 실행의 공백을 제시하고 이를 해결할 권고를 내놓았다 [22]. 하지만 프로그램은 핵심 구성요소를 선택적으로만 실행하면서 CBHPE 용어를 채택할 수 있다. 그러면 관찰된 성과가 하나의 일관된 이론 기반 개혁으로서 CBHPE를 반영하는지, 아니면 부분적이고 지원이 일관되지 않은 실행을 반영하는지 판단하기 어렵다 [3]. 명시적인 프로그램 이론이 없으면 성과의 차이를 잘못 해석하여 실행 실패(implementation failure)를 이론 실패(theory failure)와 혼동할 위험이 있다 [46, 47]. 이러한 과제들은 CBHPE가 어떤 조건에서 어떻게 작동할 것으로 예상되는지, 그리고 명시적으로 정의한 성과가 무엇인지 더 분명하게 설명할 필요를 보여준다.

 

CBHPE를 발전시키려면 설계와 실행의 토대를 놓고 이를 강화하며 의미 있는 평가를 뒷받침할 명시적인 CBHPE 프로그램 이론이 필수적이다. Varpio와 동료들(2020)의 정의에 따르면 이론은 “논리적으로 관련되어 여러 다른 구성개념과 명제 사이의 관계를 표현하는 명제들의 집합”이다. 이론은 연구의 축적에서 만들어지고, 현상 사이의 관계를 설명하며, 투입에 근거해 성과를 예측할 수 있다 [48]. 이 논문은 CBHPE가 성과를 만들어낼 것으로 기대되는 기저 가정과 경로를 명시하여 프로그램 이론 기반 모형인 CBHPE 성과 변화이론을 제시하고자 한다. 이 모형은 van Melle의 다섯 가지 핵심 구성요소 각각을 더욱 상세히 설명함으로써 [3], 프로그램이 실행 진전의 지표를 확인하고 측정할 수 있게 한다. 중요한 것은 저자들이 이를 유일한 이론(the theory)이 아니라 하나의 이론(a theory)으로 제시한다는 점이다. 저자들은 이 이론이 비판적 검토, 학술적 대화, 경험적 검증, 다양한 맥락에 맞춘 조정을 통해 발전하리라 예상한다.

방법: 합의 과정 (Methods: Consensus Process) 

변화이론의 필요성 확인 (Identifying the Need for a Theory of Change) 

이 논문의 저자들은 약 90명의 CBHPE 학자, 지도자, 실행자, 평가자로 이루어진 국제 보건의료 전문직 역량기반교육 교육자 협력체(ICBHPE)의 구성원이다. 2009년에 설립된 ICBHPE에는 6개 대륙과 다양한 전문직 배경을 대표하는 구성원들이 참여하며, 연구, 실행 지원, 국제 협력을 통해 CBHPE를 발전시킨다는 공동의 목표를 공유한다. 2024년 ICBHPE는 이 분야에서 떠오르는 우선순위를 파악하기 위한 구조화된 합의 과정을 시작했다. 그 결과 2025년 2월 스탠퍼드대학교에서 열린 합의 회의에서 논의할 18개 주제를 선정하고 다듬었으며, 회의에는 50명 넘게 참석했다. 포럼의 일부로 이 집단은 CBHPE의 현대적 해석을 토론하고 van Melle의 핵심 구성요소에 따라 CBHPE를 바라보는 관점을 재확인했다 [3].

 

작업반의 반복적인 개발과 촉진된 숙의를 통해 변화이론의 필요성이 최우선 과제로 떠올랐다. 이에 네 대륙에 걸친 16명의 저자 집단이 구성되었고, 세 저자(AC, DR, JF)가 작업을 주도했다. 구성주의적 입장(constructivist stance)을 취한 여러 나라와 전문직(의학, 수의학, 약학)의 저자들은 CBHPE의 가정, 기제, 의도한 성과를 더 명확히 해야 한다는 반복적으로 제기된 요구에 초점을 맞추었다. 논의는 2024년 10월부터 2026년 2월까지 이메일, 온라인 회의, 대면 포럼을 통해 이루어졌다. 저자들은 기존 CBHPE 문헌과 집단의 경험을 프로그램 설계·실행·평가에 도움이 되는 실용적인 지침으로 전환하고자 했다.

프로그램 이론과 CBHPE 성과 변화이론 (Program Theory and the CBHPE Outcomes Theory of Change) 

이 작업을 구조화하기 위해 저자들은 Varpio(2020)의 이론 정의를 참고하고 [48], Funnell과 Rogers의 2011년 목적 지향적 프로그램 이론(purposeful program theory)을 변화이론의 지도 틀로 사용했다. (이하 이 논문에서 ‘변화이론’은 거대 이론(grand theory)이 아니라 Funnell과 Rogers가 설명한 프로그램 이론의 전통에서 사용한다.) CBHPE는 여러 구성요소가 상호작용하고 맥락에 크게 의존하는 복합적인 교육·조직 개혁이다. 프로그램 이론이 암묵적이거나 일관되지 않게 명시되면 성과를 해석하기 어렵기 때문에 이 접근법을 선택했다 [46]. Funnell과 Rogers(2011)는 목적 지향적 프로그램 이론을 행동이론(theory of action, 즉 프로그램이 무엇을 하고 어떻게 실행되는가)과 변화이론(theory of change, 즉 변화가 일어날 것으로 예상되는 기제)을 명시하는 접근법으로 설명한다. 프로그램 이론은 그 일부로 기제, 맥락의 영향, 의도한 성과를 포함한 프로그램의 인과 논리(causal logic)를 명시하여 복합 중재에서 성과가 어떻게 그리고 왜 나타나는지 더 분명하게 해석하도록 지원한다 [46]. 또한 Funnell과 Rogers의 틀에서 실행은 기준선 상태(baseline conditions)를 의도적으로 바꾸는 프로그램 활동을 도입하는 것으로 이해할 수 있다. 이어 프로그램 활동의 평가는 기준선 상태가 유지되었을 때와 비교하여 이러한 활동이 관찰 가능한 변화와 그 기저의 기제를 어느 정도 만들어내는지에 초점을 맞춘다 [46].

 

저자들은 이 틀의 안내에 따라 CBHPE의 핵심 구성요소 [3]를 명시적인 행동이론과 변화이론에 체계적으로 대응시켰다. 이를 통해 핵심 구성요소가 교수, 학습, 평가, 역량에 영향을 미칠 것으로 예상되는 인과 경로를 명시했다. 이 과정은 주요 가정을 확인하고, 영향의 기제를 분명히 하며, 프로그램 실행, 즉 CBHPE가 관찰 가능한 성과를 어떻게 그리고 왜 만들어낼 것으로 예상되는지 더 투명하고 검증 가능한 설명을 구성하게 했다.

변화이론의 개발과 합의 과정 (Theory of Change Development and Consensus Process) 

Funnell과 Rogers(2011)는 프로그램 이론을 연구 근거, 지식, 경험으로부터 구축할 수 있다고 설명한다 [46]. 이에 따라 저자들은 근거와 합의 과정을 모두 사용하여 이 세 요소를 반영했다.

 

회의 이후의 단계는 그림 1에 자세히 제시되어 있다. 포럼의 기록을 공유했고, 회의 후 두 차례 온라인 회의를 열어 변화이론 수립이라는 구상을 논의하고 여러 접근법을 평가하며 다음 단계를 계획했다. 먼저 이 프로그램 이론을 만들고 다듬기 위해 소규모 집필팀은 광범위하고 설명적이며 여러 맥락을 아우르는 문헌고찰을 수행했다. 처음에는 주로 CBHPE 문헌을 참고했다. 보건의료 전문직 바깥에서 개념이 더 충분히 발전했거나 특정 기제, 촉진 조건(enabling conditions), 실행 전략에 관한 CBHPE 근거가 부족한 경우에는 고등교육과 초·중등교육 등 인접한 교육 맥락의 CBE 문헌을 보완적으로 사용했다. 보건의료 전문직 외 분야의 몇몇 자료는 특히 지침의 실행상 토대(operational backbone)를 강화하는 데 유용했다. 그렇다고 CBHPE를 유치원부터 고등학교까지의 교육(K–12)이나 중등 이후 교육의 CBE와 같은 것으로 보는 것은 아니다. 더 넓은 CBE 분야에서 거버넌스, 준비도, 투명성, 평가에 사용할 만한 틀을 만든 영역의 개념적 완결성을 높이려는 것이다. 예를 들어 역량기반교육 네트워크의 질 관리 틀(Competency-Based Education Network Quality Framework) [49]은 실행을 지원하는 요소와 측정상의 기대를 명시하는 실용적 질 평가 관점을 제공했다. 제도적 헌신, 일관된 설계, 투명성, 근거에 기반한 개선을 강조하는 이 틀은 촉진 조건, 이해관계자의 행동, 단계에 맞는 진전 지표에 초점을 둔 이 지침과 잘 맞았다 [49].

 

저자들은 CBHPE 보고에서 흔히 충분히 설명되지 않는, 충실도와 관련된 구성개념을 강화하기 위해 더 넓은 교육체계의 기존 CBE 연구도 활용했다. Aurora Institute/Competency Works의 질 원칙 및 관련 ‘질의 요소(elements of quality)’와 시스템의 ‘지렛대(levers)’에 관한 연구는 거버넌스의 일관성, 교육자의 역량, 투명한 수행 기대, 형평성 지향 설계를 설명할 언어와 사례를 제공했다. 이들은 모두 지침의 장벽·촉진요인 논리와 형평성 관점에 직접 대응한다 [50]. 역량 기반 사업에 관한 미국 국립교육통계센터(National Center for Education Statistics, NCES)와 국립중등후교육협력체(National Postsecondary Education Cooperative, NPEC)의 보완적 지침은 신뢰할 수 있는 평가체계와 이해관계자 참여의 중요성을 재확인했다. 이에 따라 지침에는 정당화할 수 있는 진전 결정과 해석 가능한 성과를 위한 전제조건으로 기반시설과 책무성 지원이 포함되었다 [51].

 

그림 1. 보건의료 전문직 역량기반교육(CBHPE) 성과 변화이론의 개발 과정 (Process for Developing the Competency-Based Health Professions Education (CBHPE) Outcomes Theory of Change) 

  • 그림 속 단계: 근거 수집 과정(Evidence-Gathering Process: CBHPE 및 CBE 문헌) → 소규모 집단 초안 작성(Small Group Drafting) → 대규모 집단 숙의(Large Group Deliberation: 최종 프로그램 이론)와 ICBHPE 내 구성원 확인(Member-Checking)을 반복 → CBHPE 성과 변화이론(CBHPE Outcomes Theory of Change: 최종 프로그램 이론).

이 그림은 CBHPE 성과 변화이론의 개발 과정을 개괄한다. 먼저 문헌 검색으로 근거를 수집하고 소규모 집단이 변화이론의 초안을 작성했다. 이어 대규모 집단이 초안을 수정·숙의하는 과정과 ICBHPE 구성원 확인을 병행했다. 이러한 반복 과정을 마치고 합의에 도달한 뒤 CBHPE 성과 변화이론을 확정했다.

 

소규모 집필팀의 세 저자(AC, DR, JF)는 이 정보를 반복적으로 종합하여 각 핵심 구성요소를 실행 전략, 개혁이 해결하려는 문제, 가정과 작용 기제, 개념적 토대, 주요 이해관계자의 행동·행태, 근접 산출물, 원위 성과와 연결하는 일관된 프로그램 이론으로서 CBHPE 성과 변화이론을 개발했다. 초안이 작성된 뒤 모든 저자와 변화이론을 공유했다. 대규모 집단의 숙의와 피드백을 반복하고 소규모 집필팀이 이를 반영해 수정하면서 내용을 다듬었다. 저자들이 합의에 이른 후 ICBHPE 내에서 구성원 확인을 수행했다. 논문을 ICBHPE 전체에 배포하여 공개 의견을 받았고, 참석 여부와 관계없이 포럼 전·중·후에 의견을 내도록 구성원들을 초대했다. ICBHPE 구성원 전체에 널리 배포한 덕분에 글로벌 사우스(Global South)와 다른 보건의료 전문직을 대표하는 사람들이 피드백을 제공할 수 있었다. 또한 매월 열리는 여러 ICBHPE 온라인 회의에서 변화이론을 발표하고 구성원의 피드백과 의견을 구했다. 이 과정이 모두 끝난 뒤 CBHPE 성과 변화이론을 확정한 것으로 간주했다.

결과 (Results) 

개발된 CBHPE 성과 변화이론은 van Melle의 다섯 가지 핵심 구성요소 [3] 각각을 개혁 제안 및 실행 전략과 연결한다. 이 권고는 기저 가정, 개념적 토대, 주요 이해관계자의 행동, 실행에 따른 예상 산출물과 성과를 검토하여 뒷받침된다. CBHPE 변화이론은 실행 계획, 충실도 점검, 단계에 적합한 지표와 성과의 선정을 지원하도록 설계된 통합적인 도구 모음이다. 부록 1은 CBHPE 핵심 구성요소에 CBHPE 성과 변화이론의 구조를 적용한 예를 제공한다. 이는 CBHPE 변화이론의 구조를 프로그램 설계, 실행 점검, 성과 평가에 적용하기 위한 실용적 로드맵이다. 표 1은 일관된 해석과 적용을 지원하기 위해 CBHPE 성과 변화이론 전반에서 사용하는 공통 정의를 제시한다. 여기에는 실행 전략, 해결할 문제, 가정·작용 기제·인과 논리를 포함하는 변화이론, 이해관계자의 행동·행태 변화, 실행 산출물·초기 신호, 시간에 따른 근접·중간·원위/영향 성과가 포함된다 [3, 33, 45, 52].

 

6aa00a1a30dab.pdf
0.25MB

 

표 1. CBHPE 성과 변화이론에서 사용하는 프로그램 이론 요소의 정의 (Definitions of the Elements of the Program Theory Used in the CBHPE Outcomes Theory of Change) 

프로그램 이론의 요소 정의
핵심 구성요소(Core Component) [3] Van Melle [3]가 설명한 현대 CBHPE의 다섯 가지 기초 구성요소. 순서화된 진전, 프로그램적 평가 등 설계와 실행의 기준점이 된다.
실행 전략(Implementation Strategies) [3, 22, 25, 33, 45, 49, 50, 57–60] 핵심 구성요소를 사용해 교육과정을 변화시키는 구체적 행동, 중재 또는 구조적 변화. 예: 코칭 체계, 이정표(milestone) 대응표 작성, 피드백 기제.
변화의 동인(Drivers of Change) [4, 5, 61] 실행 전략이 해결하고자 하는 교육적·조직적·사회적 문제. 예: 시간에 기반한 진전, 학습자 준비도의 차이, 불공정한 평가 관행.
변화이론(Theory of Change: 가정과 기제) [45, 46, 52] 이러한 활동이 어떻게 그리고 왜 원하는 성과로 이어지는지에 관한 근거와 가정. 예: 의도적 연습이 술기 습득을 향상하고 개인화된 피드백이 동기를 높인다는 생각. 가정(변화가 어떻게, 왜 일어날 것인지에 관한 기저 믿음), 작용 기제(mechanisms of action: 투입·활동이 성과로 이어지는 과정을 설명), 인과 논리(causal logic: 활동에서 영향까지 단계별 경로)를 포함한다.
이론적·개념적 토대(Theoretical & Conceptual Foundations) [62–80] 핵심 구성요소가 실제로 어떻게 기능하도록 의도되었는지 설명하거나 뒷받침하는 학습과학 이론, 개념 틀, 실행 모형. 동기·인지·발달과 같은 학습자 중심 이론과, 일관성·지속가능성·변화를 지원하는 실행과학 틀 및 변화관리 모형과 같은 시스템 수준의 실행 틀을 모두 포함한다.
주요 이해관계자의 행동·행태 변화(Key Stakeholder Actions/Behavior Changes) [81, 82] 실행을 지속하는 데 필요한 관련 이해관계자(학습자, 교수진, 관리자, 임상교육자)의 행동, 역할 또는 책임에서 관찰 가능한 변화. 예: 학습자의 피드백 요청, 교수진의 코치 역할 수행.
실행 산출물·초기 신호(Implementation Outputs/Early Signals) [3, 15, 26, 27, 33, 45, 49, 50, 52, 53, 57, 69, 83] CBHPE 실행의 질과 진전을 초기에 관찰할 수 있는 결과물과 신호. 핵심 구성요소, 구조, 과정, 지원이 마련되어 의도대로 기능하는지, 이해관계자가 참여하고 필요한 행동을 수행하는지를 반영한다. 산출물은 실행 충실도와 영향 발생을 위한 준비도를 나타내며, 채택, 충실도, 실행 가능성, 활용, 참여 등 초기 신호를 평가하는 구체적이고 측정 가능한 변수인 지표·측정치(indicators/metrics)로 조작화된다. 실행 산출물은 성과와 구별되며, 교육·진료·사회적 변화를 나타내지는 않는다.
시간에 따른 성과: 근접·중간·원위(Outcomes Over Time: Proximal, Intermediate, Distal) [3, 15, 26, 27, 33, 45, 49, 50, 52, 53, 57, 69, 83] 초기 실행 신호를 넘어 나타나는 CBHPE 실행에 기인한 변화. 근접, 중간, 원위/영향의 단계로 나뉘며 Hall의 시간 경로(수련 중 → 진료로 이행 → 진료 중)에 대응한다. 근접(수련 중): 학습자 발달, 평가 활용, 피드백의 질, 코칭·교수 방식의 변화처럼 CBHPE가 의도대로 기능함을 보여주는 초기 수련 단계의 변화. 중간(진료로 이행): 지도·감독 아래 또는 초기 진료로 이행하는 동안 나타나며, 진료 준비도를 향한 역량의 적용·공고화·전이를 반영하는 변화. 원위/영향(진료 중): 지속적인 수행, 인력에 대한 영향, 환자·인구집단 성과, 더 넓은 가치 등 진료와 시스템에서 나타나는 장기적 효과.
장벽·촉진요인(Barriers/Enablers) [49-51, 57, 84-91] 개인·문화·시스템 수준에서 변화를 방해하거나 촉진하는 요인. 예: 변화에 대한 저항, 교수진 개발 자원, 정책적 유인.
형평성 고려사항(Equity Considerations) [31, 92, 93] CBE 구조가 다양한 학습자와 인구집단의 포용성, 형평성, 접근성을 촉진하거나 저해할 수 있는 방식에 대한 관심. 예: 평가 편향의 해결, 공정한 진전 기회의 보장.
지표·측정치(Indicators/Metrics) [49, 50, 85] 맥락 조절요인, 이해관계자 행동, 실행의 투입·산출, 성과의 각 층을 포함해 전체 엔진에 적용할 수 있는 구체적이고 측정 가능한 변수. 정의된 지표·측정치를 사용하여 교육·전문직·사회 수준에서 실행의 질, 기제, 영향을 정량화한다.

 

 

상위 프로그램 이론 모형: CBHPE 성과 엔진과 CBHPE 변화이론 (Overarching Program Theory Model: The CBHPE Outcomes Engine and the CBHPE Theory of Change) 

CBHPE 변화이론의 토대가 되는 상위 프로그램 이론 모형은 CBHPE 성과 엔진(CBHPE Outcomes Engine)이다(그림 2). 이 이론적 모형은 CBHPE가 충실하게 실행될 때 어떻게 변화를 만들어낼 것으로 예상되는지 설명한다. 이 모형에서 사회적·교육적·조직적 ‘변화의 필요’라는 동인은 실행 전략에 정보를 제공한다. 실행 전략은 서로 정렬된 이해관계자 행동을 통해 수행될 때 van Melle의 다섯 가지 CBHPE 핵심 구성요소가 실행되도록 한다 [3]. CBHPE 성과 엔진은 핵심 구성요소들이 변화이론에 명시된 상호작용 기제를 통해 작동한다고 강조한다. 각 핵심 구성요소는 의도적으로 설계·실행되어야 하며, 촉진요인과 장벽, 형평성 고려사항, 실행·질 개선 전략을 포함하는 맥락 조절요인(contextual modifiers)의 영향을 받는다. 이러한 맥락 조절요인은 실행에 필요한 실현 가능성, 참여, 의사결정 과정에 영향을 미치고 CBHPE 기제가 활성화되는 강도와 일관성을 조절한다. 이 모형은 실행 산출물과 시간에 따른 성과를 구분한다. 후자는 CBHPE가 성숙하면서 나타나는 측정 가능한 효과로서 근접, 중간, 원위/영향 성과를 나타낸다 [45]. 실행 산출물(초기 신호)은 CBHPE가 시작되었고 충분한 질로 제공되어 이후 성과를 해석할 수 있음을 보여주는 즉각적이고 관찰 가능한 지표를 반영한다. 이 모형의 초기 신호는 다음과 같다 [53].

 

  • 채택(Adoption): CBHPE 구성요소를 사용하기 시작하기로 결정하거나 실제로 시작하는 행동. 예: 프로그램적 평가 과정의 실행, 진전 기대치의 활용, 코칭 구조의 도입.
  • 충실도(Fidelity): CBHPE가 의도한 대로 제공되는 정도. 설계된 핵심 구성요소, 과정, 기준과의 정렬을 뜻하며, 준수 여부와 제공의 질을 포함한다.
  • 실행 가능성(Feasibility): 시간, 업무량, 자원, 운영상 제약을 고려할 때 현지 환경에서 CBHPE를 성공적으로 수행할 수 있는 정도.
  • 지속가능성(Sustainability): CBHPE 과정이 시간이 지나도 유지되고 일상 업무로 정착하는 정도. 예: 처음 도입한 후에도 계속 사용하고, 거버넌스가 안정되며, 지속적인 평가 조정(calibration)과 교수진 개발이 이루어지는 것.
  • 침투도(Penetration): CBHPE가 프로그램과 그 하위체계에 통합되는 깊이와 폭. 예: 교과목·실습 순환, 부서, 장소, 이해관계자 집단 전반에 걸쳐 일상 운영에 뿌리내리는 정도.
  • 도달 범위(Reach, 참여율): 의도한 이해관계자 중 실제로 CBHPE 과정에 참여하는 사람의 비율과 대표성. 예: 근거 검토를 마친 학습자의 비율, 구조화된 피드백을 제공하는 교수진의 비율, 평가를 완료한 임상지도자의 비율(즉 평가 완료율).
  • 수용성(Acceptability): 이해관계자가 CBHPE 구성요소의 지각된 가치에 얼마나 만족하고 이에 참여할 의향이 있는지. 흔히 지각된 부담과 편익의 균형을 반영한다.
  • 적합성(Appropriateness): CBHPE가 환경, 목표, 지역적 제약에 잘 들어맞는다는 이해관계자의 인식. 단순한 ‘호감’과는 구별되는 관련성과 양립 가능성을 뜻한다.

 

이러한 신호는 의도적인 사고, 계획, 신중한 설계를 통해 나타난다. CBHPE 성과 엔진의 구성요소들은 행동을 통해 이루어지는 실행, 맥락, 초기 실행 신호를 교육·전문직·사회 수준에서 점차 의미 있게 나타나는 성과의 평가와 연결하여 CBHPE 연구 결과를 해석하는 일관된 틀을 제공한다. 이러한 모든 요인과 영향은 함께 CBHPE의 실행 충실도를 강화하고, 견고한 성과 평가와 CBHPE의 발전을 위한 토대를 마련한다.

 

그림 2. 보건의료 전문직 역량기반교육(CBHPE) 성과 엔진과 변화이론 (Competency-Based Health Professions Education (CBHPE) Outcomes Engine and the Theory of Change) 

 

  • 그림 속 주요 표기:
    • 변화의 동인(Drivers of Change: 사회적·교육적·조직적) →
    • 맥락 조절요인(Contextual Modifiers: 실행·질 개선 전략, 촉진요인과 장벽, 형평성 고려사항, 이해관계자의 행동) 속의
      • 변화이론(Theory of Change)과
      • 다섯 가지 핵심 구성요소(성과 역량, 순서화된 진전, 맞춤형 학습 경험, 역량 중심 교수, 프로그램적 평가) →
    • 실행 산출물(Implementation Outputs/Early Signals:
      • 채택, 충실도, 실행 가능성, 침투도, 도달 범위/참여율, 수용성, 적합성, 지속가능성) →
    • 시간에 따른 성과(Outcomes Over Time:
      • 근접 성과/수련 중,
      • 중간 성과/진료로 이행,
      • 원위 성과/진료 중).
    • 직접 이해관계자(Direct Stakeholders: 학습자, 교수진, 관리자, 임상교육자)와 간접 이해관계자(Indirect Stakeholders: 전문직 간 팀, 환자/대중)가 모형의 아래쪽에 표시되고, 지표·측정치(Indicators/Metrics)가 전체 엔진에 걸쳐 적용된다.

 

이 그림은 CBHPE 성과 엔진을 제시한다. 이는 CBHPE가 변화의 필요(사회적·교육적·조직적)를 측정 가능한 실행 신호와 시간에 따른 성과로 바꾸는 방식을 설명하는 이론 기반 모형이다. 이 모형은 성과가 자동으로 나타난다고 가정하지 않는다. 특정 실행 맥락에서 이해관계자의 행동이 변화이론에 명시된 기제를 활성화할 때 성과가 나타난다고 강조한다.

 

중앙의 변화이론은 행동 변화와 성과를 연결하는 주요 가정과 인과 기제를 나타낸다.

 

  • 변화이론을 중앙에 배치한 것은 직접 이해관계자가 수행하는 서로 정렬된 행동이 CBHPE의 다섯 가지 핵심 구성요소(성과 역량, 순서화된 진전, 맞춤형 학습 경험, 역량 중심 교수, 프로그램적 평가)가 어떻게 성과를 만들어내는지 설명하는 틀을 제공한다는 뜻이다.
  • 그러나 이러한 성과는 엄밀한 계획·실행·성과 검토를 통해 길러져야 한다. 직접 이해관계자(예: 학습자, 교수진, 관리자, 임상교육자/직장 교육자)는 CBHPE의 설계와 실행에서 그 행동과 행태가 의도적으로 목표가 되고 통합되는 사람들로, CBHPE가 기능하도록 하는 주요 지렛대에 해당한다.

 

핵심 구성요소를 둘러싼 맥락 조절요인은 CBHPE 기제가 활성화·유지되는지, 된다면 얼마나 효과적으로 작동하는지를 형성하는 시스템 조건이다.

 

  • 여기에는 촉진요인과 장벽, 형평성 고려사항, 실행·질 개선 전략이 포함된다. 맥락 조절요인은 실현 가능성, 참여, 의사결정 과정 등 이해관계자의 행동에 영향을 미치고 실행의 강도와 일관성을 조절하여 성과의 해석 가능성을 형성한다.

 

오른쪽의 실행 산출물(초기 신호)은

 

  • CBHPE가 시작되었으며 이후 성과를 해석할 수 있을 만큼 충분한 질로 제공되고 있음을 보여주는 즉각적이고 관찰 가능한 지표를 나타낸다. 이 모형에서 초기 신호에는 채택, 충실도, 실행 가능성, 침투도, 도달 범위, 수용성, 적합성, 지속가능성이 포함된다 [53].

 

이러한 실행 산출물은 초기 신호를 정량화하는 구체적이고 측정 가능한 변수인 지표·측정치로 조작화된다.

 

  • 예를 들면 평가 완료율, 관찰 건수, 평가자 간 조정 결과(inter-rater calibration results), 피드백까지 걸린 시간, 장소별 적용 범위, 자원 사용량이 있다. 이러한 산출물은 CBHPE가 성숙하면서 나타나는 효과인 시간에 따른 성과와 구별된다. 성과는 Hall의 성과 분류체계 시간 경로(수련 → 진료로 이행 → 진료)에 맞춰 근접(수련 중), 중간(진료로 이행), 원위/영향(진료 중) 성과로 나뉜다. 이러한 순서는 초기 실행 산출물이 해석 가능성을 확보하고 장기 성과에 선행한다고 보는 CBME 성과 문헌과 일치한다 [3, 33, 45, 52].

 

이해관계자 띠는 직접 이해관계자와 간접 이해관계자를 구분한다.

 

  • 간접 이해관계자(예: 전문직 간 팀과 환자/대중 [54])는 시스템 수준의 상호작용과 후속 효과를 통해 CBHPE의 영향을 받거나 CBHPE에 영향을 줄 수 있지만, 이들의 행동이 반드시 CBHPE 중재에 명시된 일차적 목표인 것은 아니다. 이 모형은 맥락 조절요인의 영향을 받는 행동 중심의 CBHPE 실행이 어떻게 초기 실행 신호를 만들고, 교육·전문직·사회 수준에서 점차 의미 있는 성과를 생성하는지 이해할 일관된 틀을 제공한다.

 

마지막으로 지표·측정치 띠는 맥락 조절요인, 이해관계자의 행동, 실행 산출물, 성과의 각 층을 포함한 전체 엔진에 측정을 적용할 수 있음을 나타낸다. 정의된 지표·측정치, 즉 구체적이고 측정 가능한 변수를 사용해 교육·전문직·사회 수준에서 실행의 질, 기제, 영향을 정량화한다.

실제 적용: CBHPE 성과 변화이론 모형의 활용 방법 (Practical Application: How to Use the CBHPE Outcomes Theory of Change Model) 

CBHPE 성과 변화이론을 실제로 활용하는 가장 실용적인 방법은 주요 이해관계자에게 어떻게 적용할지 생각하는 것일 수 있다(Box 1).

 

Box 1. 실제 적용: 여러 집단이 CBHPE 성과 변화이론을 활용하는 방법 (Practical Application: How Different Constituencies Can Use the CBHPE Outcomes Theory of Change) 

 

  • CBHPE 성과 변화이론은 단순한 개념적 설명이 아니라 실행과 평가를 위한 실제 활용 모형이다. 이 모형은 팀이
    • 1) CBHPE가 기능하기 위해 무엇이 갖추어져야 하는지,
    • 2) 어떤 기제가 변화를 만들어낼 것으로 예상되는지,
    • 3) 어떤 촉진 조건이 충실도와 실행 가능성을 형성하는지,
    • 4) 실행이 성숙함에 따라 초기에 기대할 지표와 나중에 기대할 지표가 무엇인지를 명시하도록 돕는다.
    • 본문에 제시된 적용 사례는 여러 집단이 이 모형을 설계, 실행, 평가, 연구의 지침으로 활용하는 방식을 보여준다.
  • 요약하면 CBHPE 성과 변화이론은 역할 전반에서 기대, 측정, 개선을 정렬하는 공유된 해석 지침으로 기능하여 더 일관된 실행, 더 해석 가능한 평가, 더 비교 가능한 연구를 지원한다.

 

교육과정 설계자는 변화이론을 사용해 CBHPE 원칙을 일관된 프로그램 구조로 옮길 수 있다.

 

  • 핵심 구성요소 대응도(Core Component maps, 부록 1)는 어떤 구성요소가 있어야 하고, 서로 어떻게 연결되며, 설계 과정에서 무엇을 우선해야 하는지 명확히 하는 데 도움이 된다. 예를 들어 발달 이정표의 순서를 정하고, 학습 경험을 역량과 정렬하며, 평가 계획이 진전을 기록할 수 있도록 해야 한다. CBHPE 변화이론을 설계 점검 도구로 사용하면 의도한 성과와 이용 가능한 구조 사이에서 빠진 구성요소, 비현실적인 가정, 불일치를 찾아낼 수 있다. 이는 정렬의 원칙과 효과성을 위한 전제조건으로 일관성과 투명성을 강조하는 더 넓은 CBE 질 관리 문헌에 부합한다.

 

프로그램 실행자는 CBHPE 성과 변화이론을 사용해 도입을 계획하고 시간에 따른 실행의 질을 점검할 수 있다.

 

  • 변화이론은 촉진 조건과 이해관계자의 행동을 명시하므로, 팀이 업무 흐름의 제약, 역할의 혼란, 관찰·코칭 역량의 부족과 같은 예측 가능한 장벽을 미리 파악하고, 교육자 개발 경로, 보호된 시간(protected time), 목적에 맞는 평가 도구, 사용하기 쉬운 데이터 시스템과 같은 지원을 겨냥하는 데 도움이 된다. 이는 CBE 전반에서 ‘시스템 지원(system supports)’을 강조하고 실행의 질이 성과 변화에 앞서는 경우가 많다고 보는 복합 중재의 통찰을 반영한다.

 

교수진 개발 책임자는 변화이론을 사용해 도구의 사용법을 넘어 CBHPE에 필요한 행동과 정체성의 변화를 지원하는 훈련을 설계할 수 있다.

 

  • 예로 관찰과 피드백, 질 높은 평가 판단, 성장 마인드셋(growth mindset), 역량에 대한 발달적 관점, 장기간에 걸친 코칭이 있다. 변화이론은 CBHPE의 핵심 구성요소를 기저 기제 및 기대 성과와 연결하여 CBHPE를 실행하는 교육자의 ‘역량’이 어떤 모습인지 정의하도록 돕는다. 예를 들면 여러 관찰에 근거해 정당화 가능한 신뢰 부여 결정(entrustment decisions)을 내리는 능력, 성과 역량과 정렬된 구체적이고 행동 가능한 피드백을 제공하는 능력, 평가 데이터를 형성적으로 활용하여 시간에 따른 학습자의 진전을 안내하는 능력이다. 이처럼 교육자 역량은 CBHPE 도구를 절차적으로 준수하는 것이 아니라 학습자 개선을 이끄는 평가와 피드백 실천을 숙련되게 실행하는 것으로 개념화된다.

 

프로그램 평가자는 CBHPE 성과 변화이론을 사용해 해당 프로그램의 변화이론과 정렬된 평가 계획을 구성할 수 있다.

 

  • 변화이론은 원위 성과만 측정하기보다 실행, 산출물, 성과에 걸친 균형 잡힌 지표 포트폴리오를 지원한다. 여기에는 결과를 적절하게 해석하고 여러 환경에서 더 의미 있게 비교하도록 해 주는 충실도와 실행의 질도 포함된다. 이 접근법은 복합 중재의 과정 평가(process evaluation)에 관한 지침과 일치한다. 또한 ‘CBHPE가 효과가 없다’와 ‘CBHPE가 필요한 조건, 정렬, 요소를 갖추어 실행되지 않았다’를 구별하는 핵심적인 판단을 뒷받침한다.

 

현장 교육자는 CBHPE 성과 변화이론을 사용해 일상적인 교수, 코칭, 피드백을 발달적 진전과 정렬할 수 있다.

 

  • 이 이론은 학습자가 무엇을 향해 나아가는지, 학습 경험이 진전을 어떻게 지원하는지, 평가 정보를 어떻게 만들어 사용해야 하는지 명확히 한다. 이러한 정렬은 평가 신호의 해석 가능성을 높이고 학습 환경 전반에서 일관된 코칭 기대를 지원한다.
  • CBHPE는 학습자 중심의 교육 접근법이다. 따라서 학습자가 CBHPE의 목표와 그것이 자신의 발달을 지원하는 방식, 실제로 어떤 진전이 나타나야 하는지를 이해하는 일이 필수적이다. CBHPE 성과 변화이론은 역량, 이정표, 학습 계획, 평가 데이터가 어떻게 정렬되는지 명확히 하여 투명성을 높인다. 이를 통해 학습자는 목표 설정, 자기 점검, 피드백 요청, 성찰에 더욱 의도적으로 참여할 수 있다. 이러한 과정은 CBHPE의 중심에 있는 형성평가 이론(formative assessment theory)과 완전학습(mastery learning) 원칙에 부합한다.

 

 

인증·규제 기관, 보건의료 시스템, 임상 협력기관, 미래 고용주, 전문직 단체, 자금 지원자, 환자, 대중 [54]을 포함하는 시스템 및 책무성 관련 협력자(system and accountability partners)는 CBHPE 성과 변화이론을 사용해 초기와 후기의 어느 시점에 어떤 근거가 나타나야 하는지, 성공에 어떤 투자가 필요한지에 관한 기대를 조정할 수 있다.

 

  • CBHPE 변화이론은 수행에 관한 주장을 해석하고, 단일 지표에 지나치게 의존하지 않으며, 충실도와 맥락을 고려할 구조화된 방식을 제공한다. 또한 의도한 성과를 달성하는 데 필요한 기반시설과 시스템 지원, 예를 들어 인력 개발, 데이터 시스템, 진료 환경을 투명하게 하여 책무성과 개선에 관한 대화를 도울 수 있다. 이는 더 넓은 CBE 질 관리 문헌이 강조하는 제도적 헌신과 형평성 지향 설계를 반영한다.

 

마지막으로 연구자는 CBHPE 성과 변화이론을 공유된 개념 틀로 사용해 연구와 환경 간 비교 가능성을 높일 수 있다.

 

  • 이 이론은 중재의 명확한 명세, 즉 어떤 핵심 구성요소 [3]와 기제, 촉진 조건을 사용했는지의 설명, 더 잘 정렬된 성과 선택, 더 해석 가능한 결과를 지원한다. 이러한 목표의 진전은 CBHPE 성과에 관한 공통 언어와 실행의 질·기제·맥락에 대한 더 충실한 보고를 요구하는 목소리와 부합한다.

 

논의 (Discussion) 

CBHPE 성과 변화이론의 개발은 CBHPE에서 지속되어 온 해석상의 과제에 대응한다. CBHPE 성과 보고가 늘고 있지만 프로그램 이론이 암묵적이고, 실행에 대한 설명이 제각각이며, 기제나 실행 단계와 명확히 연결하지 않고 성과를 선택하면 의미 있는 결론을 내리기 어렵다. 프로그램 이론 접근법에 따르면 복합 개혁은

  • 성과가 변했는지만이 아니라
  • 실행이 어떻게 전개되는지,
  • 어떤 기제가 활성화되는지,
  • 맥락이 효과를 어떻게 형성하는지를 평가해야 한다 [46, 55].

이러한 취지에서 CBHPE 성과 변화이론은 다섯 가지 핵심 구성요소 [3]가 실행의 여러 단계에 걸쳐 점검하고 해석할 수 있는 가정, 촉진 조건, 기제, 실행 산출물(초기 신호), 시간에 따른 성과와 어떻게 연결되는지 명시한다. 하지만 저자들은 이것이 맥락, 자원, 전문직에 맞추어 조정되고 시간이 지나며 논의·수정되어야 하는 살아 있는 문서(living document)임을 인정한다. CBHPE 채택자와 실행자는 변화이론을 검증하고 수정안을 제안하며 복잡계의 자연스러운 일부인 창발 현상(emergent phenomena)에 대응하고 [56], 필요에 맞게 이론을 발전시켜야 한다. 예를 들어 성공적인 실행과 지속가능성을 가장 잘 예측하는 성과에 우선순위를 두도록 성과 집합을 다듬을 수 있다. 이것은 경직되고 확정적인 이론이 아니다. 목표는 CBHPE를 둘러싼 과학을 발전시키는 것이다.

 

CBHPE 성과 변화이론의 핵심 기여 중 하나는 CBHPE가 단일 중재로서 ‘효과가 있는가’라는 오래된 논의를 더 실행 가능한 질문으로 바꾼다는 점이다.

  • 어떤 핵심 구성요소가 실행되었는가,
  • 어떤 기제를 통해 실행되었는가,
  • 어떤 촉진 조건 아래에서였는가,
  • 실행의 여러 단계에서 합리적으로 어떤 근거를 기대해야 하는가?

이는 핵심 가정이 근거의 뒷받침을 일관되게 명시하거나 무엇이 확인·반박 근거가 되는지 분명히 설명하지 않은 채 계속 사용된다는 문헌의 우려와 부합한다 [23, 26, 27]. Cooper와 Holmboe가 최근 강조했듯 CBHPE는 복잡한 사회 시스템 중재(complex social systems intervention)이다. 성공은 개별 도구의 채택보다 역량 틀, 프로그램적 평가, 교수진 개발, 거버넌스 구조, 종단적 학습 환경의 일관된 통합에 더 크게 좌우된다 [5]. CBHPE 성과 변화이론은 기제, 역할, 실행 단계를 강조함으로써 이 원칙들을 CBHPE 연구에서 실행 가능한 것으로 만들고, 어떤 성과를 언제 어떤 조건에서 관찰할 수 있는지 명확히 하여 비교 가능한 근거를 생산하도록 돕는 실용적 발판을 제공한다.

 

CBHPE 성과 변화이론은 실행 충실도와 변이의 문제를 명확히 하는 데도 목적이 있다. CBHPE는 역량, 교수, 평가, 진전 결정 사이의 정렬을 강화하여 졸업생 성과의 정당화하기 어려운 변이(unwarranted variation)를 줄이는 경로로 자주 제시된다. 그러나 Holmboe와 Kogan이 주장하듯 기준, 평가 관행, 실행 지원이 일관되지 않을 때도 정당화하기 어려운 변이가 생길 수 있다. 특히 프로그램이 CBHPE의 용어는 채택하면서 모형의 일부 요소만 실행할 때 그렇다 [21]. 이 지침은 촉진 조건, 이해관계자의 행동, 기제가 실제로 활성화되는지를 보여주는 근접 산출물을 전면에 놓음으로써, 정당한 맥락 적응과 부분적이거나 잘못 정렬된 실행을 구별하고 변이를 더 타당하게 해석할 구조를 제공한다. 또한 분야 간 자료, 즉 더 넓은 CBE 문헌을 활용함으로써 어떤 촉진 조건이 갖추어져야 하고, 양질의 실행이 실제로 어떤 모습일 수 있으며, 프로그램이 성숙함에 따라 어떤 형태의 근거를 합리적으로 기대할 수 있는지 명확해졌다. 이는 지침이 ‘양질의 CBHPE’를 실용적인 말로 조작화하는 능력을 강화했다.

 

이 논문은 이전의 역량기반 의학교육 논리모형(logic model)과 성과 분류체계 연구 [45, 52]를 토대로, 기존 논리모형 접근법을 두 가지 방식으로 확장한다.

  • 첫째, 핵심 구성요소의 실행이 시간에 따른 성과를 만들어낼 것으로 예상되는 가정, 작용 기제, 이해관계자의 행동을 명시하여 변화가 어떻게 그리고 왜 일어날 것으로 기대되는지에 관한 기저 변화이론을 분명하게 한다.
  • 둘째, 다양한 CBHPE 맥락에서 일관된 성과 선택·측정·보고를 지원하도록 이러한 경로를 실용적인 성과 대응도(outcome maps)와 후보 지표(candidate indicators)로 조작화한다.

CBHPE가 행동에 의존하는 복합적인 교육 개혁이므로 이러한 확장은 중요하다. 명시적인 인과 경로와 조건이 없으면 성과의 변이를 해석하기 어려워지고, 실행이나 맥락의 제약이 아니라 이론의 실패에 잘못 귀속시킬 수 있다 [6]. 성과의 변이는 맥락, 실행 조건, 기저 기제의 활성화 정도가 다르다는 사실을 반영한다. 이 연구는 현실주의 평가(realist evaluation)를 수행하지는 않지만, 가정과 인과 경로를 명확히 하여 성과를 더 엄밀하게 해석하도록 돕고 향후 현실주의 관점에 근거한 평가와 보고의 기회를 만든다.

한계 (Limitations) 

이 변화이론은 국제적 합의 과정과 체계적이거나 망라적인 방식보다 폭넓고 설명적인 방식을 목표로 한 근거 수집을 통해 개발되었다. 따라서 중재 효과의 추정치나 근거의 등급을 매긴 종합이 아니라 연구 문헌과 집단적 전문성을 통합한 합의에 기반한 프로그램 이론(consensus-derived program theory)으로 해석해야 한다. 또한 CBHPE 성과 변화이론은 여러 전문직과 나라에서 사용할 수 있도록 설계되었다. 이러한 폭넓음은 전이 가능성(transferability)을 높이지만 개별 프로그램에 필요한 실행상의 구체성은 줄일 수 있어 현지에 맞춘 조정이 필수적이다. 협력체에는 6개 대륙과 여러 나라의 구성원이 있지만 저자들의 실제 경험과 관점이 불가피하게 반영된다. 저자들은 학술기관, 인증 및 평가 활동, 보건의료 전문직 교육 단체에서 지도적 역할을 맡고 있고, 여러 저자는 CBME/CBHPE의 개발·실행·평가·연구에 기여했다. 하지만 협력체와 이 논문의 저자 집단에는 글로벌 노스(Global North)의 비중이 높고 글로벌 사우스(Global South)의 대표성은 낮다. 따라서 글로벌 노스에서의 경험이 저자들의 관점을 형성하는 동시에 글로벌 노스 편향을 낳을 위험이 있으며, 이는 글로벌 사우스 맥락에서의 의미 있는 적용 가능성을 충분히 개념화하는 능력에 영향을 미칠 수 있다. 저자들은 글로벌 사우스와 학술적 대화를 나누며 이 이론을 더 다듬고 조정하기를 바란다. 저자들은 CBHPE를 전통적 수련 모형의 한계에 대응해 발전하는 접근법으로 보지만, 그 개념과 기반시설에 익숙하다는 사실이 보고에 관한 가정에 영향을 줄 수도 있음을 인정한다. 이를 줄이기 위해 지침을 확립된 실행과학(implementation science), 프로그램 이론, 평가 틀에 근거하게 하고, 여러 맥락과 실행 단계에서 해석할 수 있도록 반복적이고 다학제적이며 국제적인 대화를 진행했다.

향후 방향 (Future Directions) 

CBHPE 성과 변화이론은 이론을 명시하고 검증 가능하게 하여 CBHPE에 관한 근거를 누적하는 과학의 토대를 제공한다. 다음 단계에는 이론의 유용성에 대한 경험적 평가, 지역적 제약에 대한 민감도를 유지하는 지표의 확인, 지침이 보고의 질을 높이는지에 대한 평가가 포함된다. 저자들은 변화이론을 사용해 CBHPE 실행 보고 지침을 만드는 방법을 다룬 동반 논문에서 이 방향으로 다음 단계를 밟는다 [28].

 

향후 연구는 평가와 진전 관행이 편향을 줄이거나 증폭할 수 있는 방식, 그리고 시간에 따라 공정하고 신뢰할 수 있는 결정을 뒷받침하는 데 필요한 촉진 조건을 포함해 형평성에 대한 함의를 명시적으로 검증해야 한다. 또한 앞서 언급했듯 변화이론을 일정한 간격으로 다시 검토하고 수정하여 시간이 흐르면서 나타나는 창발 현상을 반영하고 이론을 다듬어야 한다.

결론 (Conclusion) 

CBHPE가 전 세계적으로 계속 확산됨에 따라 이 분야에는 CBHPE가 어떻게 기능하도록 의도되었는지, 핵심 구성요소가 하나의 시스템으로 작동하려면 무엇이 갖추어져야 하는지, 어떤 기제가 변화를 이끌 것으로 예상되는지, 실행의 여러 단계에서 합리적으로 어떤 근거를 기대해야 하는지에 관한 더 명확하고 공유된 설명이 필요하다. 패러다임 전환을 나타내는 복합 중재는 흔히 정돈되지 않은 양상으로 전개되지만 큰 영향을 미칠 수 있다 [6]. 따라서 CBHPE 성과 변화이론은 다섯 가지 핵심 구성요소를 촉진 조건, 이해관계자의 행동, 근접 산출물, 장기 성과와 연결하는 합의에 기반하고 이론에 근거한 지도를 제공한다. 이는 더 일관된 실행과 더 해석 가능한 평가를 위한 실용적 토대가 된다. CBHPE의 프로그램 이론을 명시함으로써 이 지침은 CBHPE의 추가적인 발전을 지원하고, 프로그램·평가자·연구자가 충실도를 평가하고 단계에 맞는 지표를 선택하며 환경 간 연구 결과를 비교하고 CBHPE가 의도한 교육적·사회적 영향에 다가가도록 다듬을 수 있게 한다.

 

 

J Contin Educ Health Prof. 2026;46(3):153-159.doi: 10.1097/CEH.0000000000000656. Epub 2026 Jun 26.

Artificial Intelligence, Cognitive Abundance, and the Multi-Layered Competence of Health Professionals 

🧠 AI가 만든 "인지적 풍요"의 시대, 의사의 역량은 어떻게 달라질까? Pusic & ten Cate의 다층 역량 모델로 읽기

📄 Pusic MV, ten Cate O. Artificial Intelligence, Cognitive Abundance, and the Multi-Layered Competence of Health Professionals. Journal of Continuing Education in the Health Professions. 2026;46(3):153–159. doi:10.1097/CEH.0000000000000656 (CC BY-NC-ND 오픈 액세스)

 

안녕하세요! 앞에서 AAMC 기초역량과 Macy 재단 AI 권고안을 소개했는데, 오늘은 그 흐름을 이어서 조금 더 개념적인 논문을 하나 읽어 볼게요. 하버드의대의 Martin Pusic과 EPA 개념을 만든 위트레흐트의 Olle ten Cate가 함께 쓴 글이에요.

 

이 논문은 새로운 데이터를 제시하는 연구 논문이 아니라, 평생교육(CPD, Continuing Professional Development) 관점에서 AI가 의사의 역량 자체를 어떻게 바꾸는지 따져 보는 개념 논문이에요.

 

한 줄로 줄이면 이래요. "의사가 늘 시간과 정보에 쫓기던 '인지적 희소성'의 시대가 끝나고, AI 덕분에 '인지적 풍요'의 시대가 오고 있다. 그러면 역량의 세 층위가 모두 달라진다."


📌 1. 인지적 희소성에서 인지적 풍요로

⏳ 인지적 희소성 (cognitive scarcity)

이 용어는 행동경제학자 Mullainathan과 심리학자 Shafir가 2013년 『결핍의 경제학(Scarcity)』에서 처음 썼어요. 원래는 돈, 시간, 수면 같은 자원이 부족할 때 사람의 마음이 그 부족함에 사로잡히는 상태를 말해요.

 

저자들은 의사들이 겪는 희소성이 좀 특별하다고 봐요. 최신 연구를 따라가고, 진료를 깊이 성찰하고, 최선의 진료를 할 시간과 역량이 늘 부족하다는 거죠. 그래서 기존 CPD는 이 병목에 맞춰 설계됐어요. 정리된 업데이트, 모듈식 CME, 가끔 하는 시뮬레이션 같은 것들이요.

인지가 가용성 면에서 제한적이었기 때문에, 학습은 특정 시간과 장소로 제한될 필요가 있었다. AI의 부상은 이 지형을 근본적으로 바꾸어, CPD의 조건을 인지적 희소성을 헤쳐 나가는 것에서 풍요를 운용하는 것으로 전환시킨다.
"Learning needed to be constrained to specific times and places because cognition was limited in availability. The rise of AI changes this landscape fundamentally, shifting the conditions of CPD from those of navigating cognitive scarcity to instead marshalling abundance."

🌊 인지적 풍요 (cognitive abundance)

저자들은 이 개념이 아직 학계에서 정립된 구성개념은 아니라고 솔직하게 밝혀요. 분산인지(distributed cognition), 디지털 증강, AI 연구가 만나는 지점에서 나온 개념이라는 거예요.

 

논문의 용어집(Table 1) 정의는 이래요.

인지적 풍요란 AI 기반 시스템을 통해 분석적, 생성적, 해석적 인지 자원을 쉽게 이용할 수 있어서, 개인과 팀이 개인의 인간적 한계를 넘어 종합된 지식, 피드백, 성찰적 통찰에 접근할 수 있는 상태다.
"A condition in which analytic, generative, and interpretive cognitive resources are readily available through AI-enabled systems, enabling individuals and teams to access synthesized knowledge, feedback, and reflective insight beyond individual human limits"

 

여기서 오해하기 쉬운 점이 있어요. 정보 과부하(information overload) 와는 다르다는 거예요. 정보 과부하는 걸러지지 않은 정보가 너무 많아서 판단력이 흐려지는 상태죠. 인지적 풍요는 오히려 해석 가능하고 실행 가능한 인지적 지원이 있어서 부담을 줄여 주는 상태를 말해요.

 

그리고 저자들은 이 점도 분명히 해요.

중요한 것은, 인지적 풍요가 인지적 노력이나 판단이 없어도 된다는 뜻이 아니라는 점이다. 오히려 이는 인지가 생산되고, 공유되고, 관리되는 방식의 근본적 변화를 뜻하며, 단순한 효율성 향상을 넘어 전문가의 역량, 책임, 학습에 함의를 갖는다.
"Importantly, cognitive abundance does not imply the absence of cognitive effort or judgment; rather, it denotes a fundamental change in how cognition is produced, shared, and governed, with implications for professional competence, responsibility, and learning that extend beyond mere efficiency gains."


🧩 2. 분석 틀: ten Cate의 다층 역량 모델

저자들이 이 논문에서 던지는 핵심 질문은 이거예요.

의사가 더 이상 생의학 정보의 유일한 처리자가 아니고, 유일한 보유자는 더더욱 아니게 될 때, 역량은 어떻게 이해되고 길러져야 하는가?
"how should competence be understood and cultivated when clinicians are no longer the sole processors, let alone possessors, of biomedical information?"

 

이 질문에 답하려고 ten Cate 등이 2024년 Medical Education에 발표한 다층 역량 모델(multilayered model of competence) 을 사용해요. 세 층위로 이뤄져 있어요.

층위 내용
🏛️ 정전적 역량 (canonical competence) 확립된 기초 생의학 지식과 기술. "모두가 알아야 하는 것(that all should know)"
🏥 맥락적 역량 (contextual competence) 복잡한 임상 시스템과 다양한 맥락 안에서 그 기초를 효과적으로 적용하는 능력
🙋 개인화된 역량 (personalized competence) 개인의 가치, 개인 정체성과 통합된 전문직 정체성, 자기 발달을 결정하는 성찰 능력, 고유한 개인 스타일

※ canonical competence는 아직 합의된 번역어가 없는 것 같아서, 이 글에서는 "정전적 역량"으로 옮겼어요.

 

저자들의 기본 주장은 이래요. AI는 세 층위를 모두 강화하지만, 동시에 배우고, 추론하고, 전문가로 성장한다는 것의 의미 자체를 바꾼다. 그리고 층위마다 AI의 영향을 두 수준으로 나눠 봐요. 하나는 기존 교육을 더 잘하게 만드는 점진적 개선이고, 다른 하나는 인지적 풍요가 가져오는 근본적 전환이에요. 이 구분을 기억하면서 층위별로 볼게요.


🏛️ 3. 정전적 역량: "무엇을 아는가"에서 "지식 시스템과 어떻게 일하는가"로 

점진적 개선

AI는 기초지식과 기술을 배우는 과정을 여러모로 돕고 있어요.

  • 학습자의 오개념을 찾아내고 수행 패턴에 맞춰 내용을 조정하는 개인화 튜터링
  • 같은 개념을 비유, 단계별 추론, 관련 질환과의 대비 등 여러 방식으로 설명해 주는 LLM
  • 새 문항을 대량으로 만들어 지식 영역을 더 넓게 표집하는 적응형 평가(adaptive testing)
  • 시뮬레이션에서 손 움직임, 프로브 위치, 자세를 실시간으로 분석하는 컴퓨터 비전. 예를 들어 삽관할 때 회전이 부족하다거나 초음파 압력이 일정하지 않다는 식의 미세한 경향까지 잡아내요.

그런데 저자들은 이건 "점진적 진화(incremental evolution)" 일 뿐이라고 해요.

근본적 전환

진짜 변화는 따로 있어요. AI가 근거를 즉시 찾아서 종합하고 설명해 준다면, 숙달은 더 이상 정보를 가지고 있는 것으로 정의되지 않아요. 의사의 인식론적 역할(epistemic role) 이 탐색, 검증, 해석으로 옮겨 간다는 거예요.

따라서 인지적 풍요는 정전적 역량을 "의사가 무엇을 알아야 하는가"에서 "의사가 지식 시스템과 어떻게 일하는가"까지 포함하도록 확장한다.
"Cognitive abundance therefore expands canonical competence from 'what clinicians must know' to include 'how clinicians work with knowledge systems.'"

 

구체적으로는 AI에게 어떤 질문을 던질지, 인용의 질을 어떻게 평가할지, 대안 진단을 어떻게 캐물을지, 모델의 답을 지역 프로토콜과 어떻게 맞출지 아는 능력이에요. 저자들은 이 변화를 근거중심의학(EBM)이 처음 등장했을 때의 변화에 견주면서도, 속도와 규모는 훨씬 크다고 봐요.

 

또 하나 중요한 점이 있어요. AI가 새로운 임상시험, 진료지침, 메타분석을 자동으로 반영하면 정전적 역량의 정의 자체가 고정된 것에서 계속 갱신되는 것으로 바뀐다는 거예요.

이런 환경에서 역량은 인식론적 겸손, 즉 지식이 역동적이며 신중한 해석이 필요한 복잡한 시스템을 통해 매개된다는 인식을 수반한다.
"In this environment, competence entails epistemic humility, awareness that knowledge is dynamic, and mediated through complex systems requiring careful interpretation."

인식론적 겸손(epistemic humility), 이 논문의 핵심 키워드 중 하나예요.


🏥 4. 맥락적 역량: 암묵적인 것이 보이기 시작한다

맥락적 역량은 상황 인식, 우선순위 판단, 적응력, 의사소통, 팀워크처럼 실제 임상 현장의 복잡성 안에서 지식과 기술을 쓰는 능력이에요. 전통적으로는 회진 중에 불문율을 익히고, 응급상황에서 어떤 신호가 중요한지 체득하는 식의 경험 학습과 암묵적 문화화(tacit enculturation) 로 길러졌죠. 강력한 방식이지만 느리고, 고르지 않고, 우연한 노출에 크게 의존한다는 한계가 있었어요.

점진적 개선

  • 지역 프로토콜, 항생제 내성 현황, 인력 배치, 자원 제약을 반영한 맥락 인식 의사결정 지원
  • 활력징후나 검사 결과의 미세한 변화로 상태 악화를 조기 예측하는 분석
  • 전자의무기록에서 특정 행동을 하면 패혈증 번들이나 항응고 지침을 띄워 주는 업무 흐름 통합형 마이크로러닝
  • 해당 기관의 흔한 동반질환, 합병증, 대응 시간, 자원 제약을 반영한 지역 맞춤형 시뮬레이션

근본적 전환

인지적 풍요 속에서는 맥락적 역량이 더 이상 "우연히 본 것"이나 "몇 안 되는 지도교수의 피드백" 에 묶이지 않아요. 기록 분석으로 추론 패턴을 보고, 의사소통 분석으로 말 끊기나 망설임, 전문용어 사용을 확인하고, 팀 매핑으로 누가 논의에 참여하고 누가 체계적으로 배제되는지까지 볼 수 있다는 거예요.

 

특히 인간-AI 혼합 팀(hybrid human–AI team) 이라는 새로운 역학이 생겨요.

이는 새로운 형태의 조정을 요구한다. 누가 어떤 경보를 모니터링할지 정하고, 임상가의 판단과 모델 출력이 불일치할 때 어떻게 해결할지 명확히 하며, 팀 안에서 주의가 형평하게 배분되도록 하는 것이다. 좋은 팀원이 된다는 것은 이제 AI가 매개하거나 영향을 미치는 조정에 능숙하다는 것을 포함한다.
"This requires new forms of coordination: deciding who monitors which alerts, clarifying how disagreements between clinician judgment and model output are resolved, and ensuring equitable distribution of attention within the team. Being a good team member now includes fluency in AI-mediated/influenced coordination."

 

저자들은 이 층위의 변화를 이렇게 정리해요.

이러한 가시성은 맥락적 역량을 암묵적이고 경험적인 것에서 명시적이고 데이터 성찰적인 것으로 바꾼다. 우리는 이전에 볼 수 없었던 것을 보게 되고, 그것이 개선의 대상이 될 수 있게 된다.
"This visibility transforms contextual competence from tacit and experiential to explicit and data-reflexive. We see what we previously could not, allowing it to become a target for improvement."


🙋 5. 개인화된 역량: 좋은 의사에서 훌륭한 의사로

제가 가장 흥미롭게 읽은 부분이에요. 개인화된 역량은 가치, 대인관계 스타일, 성찰 능력, 웰빙, 정서적 안정, 전문직 정체성(professional identity) 을 포함해요. 세 층위 중에서 측정하고, 가르치고, 체계적으로 기르기가 가장 어려운 영역이죠. 그리고 무엇보다 이 층위는 전문가마다 정당하게 다를 수 있다는 특징이 있어요.

가장 중요한 것은, 이 역량이 전문가들 사이의 정당한 차이와 어떤 표준화된 평가로도 포착되지 않는 고유성을 함축한다는 점이다.
"Most importantly, it implies legitimate differences between professionals and a uniqueness that evades any standard assessment."

그리고 저자들은 이런 질문을 던져요.

AI는 어떻게 좋은 의사가 훌륭한 의사가 되도록 도울 수 있을까?
"How can AI support a good doctor to become a great doctor?"

AI가 할 수 있는 일

  • 💬 의사소통 분석: 진료 대화의 어조, 명확성, 말 끊기, 공감적 언어를 분석해요. 저자들은 이렇게 하면 대인관계 스타일이 "암묵적 특성에서 코칭 가능한 미시행동들(coachable microbehaviors)" 로 바뀐다고 봐요.
  • 📓 성찰 지원: AI 저널링, 서사의학 보조도구, 성찰 동반자(reflective companions) 가 숙련된 멘토처럼 "어떤 가정이 당신의 반응에 영향을 주었나요?" 같은 질문을 던져 줄 수 있어요. 시간 제약도 없고요.
  • 🔋 웰빙 분석: 기록 시간대, 받은편지함 부담, 미확인 결과 누적 같은 지표로 번아웃의 초기 신호를 알려 줄 수 있어요.

이런 데이터가 계속 쌓이면 정체성 형성이 가속될 수 있다고 저자들은 봐요. 어려운 대화에서 망설이는 경향이나 팀 회의에서 무심코 대화를 독점하는 습관처럼, 예전 같으면 몇 년 동안 모르고 지나갔을 모습을 발견할 수 있으니까요.

그래도 인간 멘토는 대체할 수 없다

저자들은 이 점에서는 분명한 입장이에요.

AI는 인간 멘토를 대체할 수 없다. 그들의 삶에서 우러난 지혜와 도덕적 안내는 여전히 대체 불가능하다. 하지만 AI는 24시간 피드백을 제공하고, 종단적 수행 데이터를 종합하며, 인간 관찰자가 놓칠 수 있는 강점과 기회를 찾도록 도움으로써 멘토링을 증강할 수 있다.
"AI cannot replace human mentors, whose lived wisdom and moral guidance remain irreplaceable. But AI can augment mentorship by offering 24/7 feedback, synthesizing longitudinal performance data, and helping clinicians identify strengths and opportunities that human observers might overlook."

⚠️ 윤리적 복잡성

물론 개인 데이터가 이렇게 세밀해지면 위험도 커져요. 지나친 자기비판, 알고리즘의 인정에 대한 과의존, 프라이버시 침해 같은 것들이요. 그래서 저자들은 메타기술(meta-skills) 이 필요하다고 해요. 자기 데이터와의 관계를 관리하고, 피드백을 분별력 있게 해석하고, 알고리즘의 통찰 속에서도 자율성과 인간다움을 지키는 능력이에요.

 

그리고 가장 근본적인 질문을 남겨요.

AI가 생성한 피드백은 인간 피드백에서 개인적 관계가 일으키는 왜곡을 없앨 수 있고 비공개로 유지될 수도 있지만,
중요한 윤리적 질문 하나는 이것이다. 이 믿을 수 없을 만큼 개인화된 데이터에 누가 접근하는가? 

"Although feedback produced by AI can remove distortions caused by personal relationships in human feedback, and can remain private, one important ethical question is: who has access to the incredibly personalized data?"


📊 6. 한눈에 보기: CPD 시스템은 어떻게 달라지나?

논문의 Table 4가 이 논의를 잘 정리하고 있어서 옮겨 볼게요. 저는 특히 오른쪽 "주의할 점" 칸이 이 표에서 가장 가치 있다고 생각해요.

교육 기능 인지적 희소성 인지적 풍요 ⚠️ 주의할 점
교육과정 고정된 내용, 느린 개정 AI 근거 흐름과 연동되어 계속 갱신되는 자료 저품질 종합("AI 찌꺼기(AI dross)")의 유입, 합의된 전문 기준의 약화
평가 간헐적 시험, 좁은 수행 표집 AI 시뮬레이션, 적응형 평가, 실제 수행 분석을 통한 지속 평가 대리 지표 과의존, AI 채점의 불투명성, 측정된 수행과 전문직 가치의 불일치
피드백 간헐적 지도교수 피드백 추론, 기록, 소통, 팀워크에 대한 실시간 비판단적 피드백 과잉 감시, 인지 과부하, 자동 피드백이 성찰적 판단과 인간 코칭을 밀어낼 위험
학습자 지원 멘토 접근성의 편차 확장 가능한 AI 코칭, 성찰 동반자, 멘토 매칭 인간 멘토링의 증강이 아닌 대체, 몰개인화된 안내
작업장 학습 학습이 산발적으로만 포착됨 업무 흐름, 성과, 팀 역학 패턴을 행위 중 성찰에 활용 감시 우려, 학습문화 위축, 분석 결과의 인사평가 오용
전문직 정체성 멘토링과 서사적 경험으로 천천히 형성 가치와 소통에 대한 멀티모달 통찰로 정체성 형성 가속 정체성의 파편화 또는 평준화, 모델이 선호하는 행동으로의 과최적화
발달 주기 발달상 도약 사이에 수년 빈번한 발달적 성장 공고화 없는 가속, 윤리적 성찰과 의미 형성을 위한 시간 부족

🎯 7. CPD에 주는 다섯 가지 함의

저자들은 CPD가 더 이상 주기적 업데이트, 고정된 교육과정, 간헐적 평가를 중심으로 짜여서는 안 된다고 하면서 다섯 가지 방향을 제시해요.

 

  • ① AI 리터러시(AI literacy)를 기초 전문 기술로 📚
    • LLM, 예측 알고리즘, 멀티모달 시스템이 어떻게 작동하는지, 그리고 한계, 불확실성, 실패 양상(failure modes) 까지 이해해야 해요. 모델을 효과적으로 캐묻고, 근거를 검증하고, 환각을 알아보는 능력이 여기에 들어가요.
  • ② 혼합 의사결정(hybrid decision making) 준비 🤝
    • 결정은 이제 의사 혼자의 인지가 아니라 인간의 판단, 환자 가치, 조직 제약, 모델의 통찰이 상호작용해서 나와요. 그래서 불일치 협상(disagreement negotiation), 즉 AI가 내 판단과 다를 때 어떻게 대응할지, 그리고 상위 보고 경로 같은 메타역량이 필요하다고 해요.
  • ③ AI 사용에 대한 다직종 정합성(interprofessional coherence) 🩺
    • 위험 점수나 예측 같은 AI 신호는 팀 전체가 공유하는 정보예요. 그래서 간호사, 의사, 약사 등이 AI 도구에 대해 공유된 정신모형(shared mental models) 을 갖춰야 AI가 팀을 쪼개지 않고 오히려 강화할 수 있어요.
  • ④ 개인 분석 데이터에 대한 성찰적·윤리적 태도 🪞
    • CPD는 의사가 이런 정보를 건설적으로 해석하고, 알고리즘의 판단에 과하게 의존하지 않고, 자율성과 도덕적 행위주체성(moral agency) 을 지키도록 도와야 해요. 이를 위해 구조화된 성찰, 동료 토론, 교수 멘토링은 여전히 중요하다고 해요.

 

인지적 풍요는 피드백의 풍요도 뜻한다.
"Cognitive abundance also means feedback abundance."

 

  • ⑤ CPD 시스템 자체의 재설계 🔧

 

AI는 이러한 전환을 가능하게 한다. CPD는 그것을 일관되고, 안전하며, 교육적으로 타당하게 만들어야 한다.
"AI makes these transformations possible; CPD must make them coherent, safe, and educationally sound."

 

  • 그리고 심사위원의 지적을 받아들여 이런 단서도 달았어요.

 

AI가 임상 판단에 점점 더 참여할수록, CPD는 임상가의 도덕적 행위주체성을 강화하는 데 훨씬 더 중요한 역할을 한다.
"Indeed, as AI increasingly participates in clinical judgments, CPD has an even more important role in reinforcing the moral agency of clinicians."


✅ 8. 결론: AI에 가려지지 않고, AI로 강해지는 의사

저자들은 초록에서 꽤 대담한 예측을 해요.

의사의 장기기억 내용은 일상 진료를 이끄는 데 필요한 생의학적 사실이 주를 이루던 것에서, 임상적 의사결정을 위한 정보를 찾고, 선택하고, 그 타당성을 평가하는 데 필요한 새로운 절차적 탐구 기술로 옮겨 갈 것이다.
"The contents of long-term memory of clinicians will shift from a predominance of biomedical facts needed to steer daily clinical work, to new procedural inquiry skills needed to find, select, and evaluate the validity of information for clinical decision making."

 

그리고 AI 시대 역량을 이렇게 정의해요.

궁극적으로, AI 시대의 역량은 단지 의사가 무엇을 아는지, 또는 개별 과제를 어떻게 수행하는지의 문제가 아니다. 그것은 분산된 인지 시스템 안에서 현명하게 일하는 능력이다. 풍부한 정보와 인간의 통찰을 균형 있게 다루고, 알고리즘의 예측을 맥락의 미묘함과 통합하며, 멀티모달 데이터의 지원을 받아 지속적으로 성찰하는 능력이다.
"Ultimately, competence in the era of AI is not merely a function of what clinicians know or how they perform discrete tasks. It is the capacity to work wisely within distributed cognitive systems, balancing abundant information with human insight, integrating algorithmic predictions with contextual nuance, and engaging in continuous reflection supported by multimodal data."

 

마지막 문장도 옮겨 둘게요.

전문가 역량의 미래는 이 종합에 있다. AI에 가려지지 않고 AI로 강해지는 의사, 알고리즘에 의존하지 않고 알고리즘과의 사려 깊은 협력을 통해 힘을 얻는 의사다.
"The future of professional competence lies in this synthesis: a clinician who is not overshadowed by AI, but strengthened by it; not dependent on algorithms, but empowered through thoughtful partnership with them."

 

저자들은 이런 과정이 의사를 매슬로우의 표현처럼 "미지의 것에 비교적 겁먹지 않는(relatively unfrightened by the unknown)" 성숙한 임상가로 키울 수 있다고 기대해요.


💡 9. 읽으며 든 생각과 비판적으로 읽을 지점

마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.

 

  • ① 개념 논문이라는 점을 감안하기 🧐
    • 이 논문은 경험적 연구가 아니라 방향을 제시하는 글이에요. 저자들 스스로 "인지적 풍요"가 아직 정립된 구성개념이 아니라고 밝히고 있고요. 본문에서 소개한 AI의 가능성 중 상당수, 예컨대 성찰 동반자, 웰빙 분석, 팀 매핑은 아직 효과가 충분히 검증되지 않은 전망에 가까워요. 참고로 저자들은 ChatGPT를 표 초안, 문장 다듬기, 구조 정리에 썼다고 투명하게 밝혔어요.
  • ② 장기기억이 정말 덜 중요해질까? 🤔
    • 저는 이 부분이 가장 논쟁적이라고 봐요. 전문성 연구와 인지부하 이론은 대체로 장기기억 속 조직된 지식이 있어야 새로운 정보를 판단하고 활용할 수 있다고 보거든요. AI 답의 타당성을 평가하려면 결국 탄탄한 기초지식이 필요하다는 반론이 가능하죠. 앞서 소개한 Macy 재단 권고안도 기초과학 지식과 임상추론의 유지를 따로 강조했어요. 저자들도 인식론적 겸손과 검증 능력을 강조하니 완전히 반대 입장은 아니지만, "무엇을 머리에 남겨야 하는가"는 앞으로 경험 연구가 꼭 필요한 질문 같아요.
  • ③ 개인화된 역량과 감시의 긴장 👁️
    • 개인화된 역량은 원래 "전문가마다 정당하게 다를 수 있는" 영역인데, 이걸 데이터로 계속 들여다보면 모델이 선호하는 행동으로 평준화될 위험이 있어요. 저자들도 Table 4에서 이 점을 짚었죠. 전문직 정체성 형성(PIF)을 연구하는 입장에서 보면, AI 피드백이 정체성 형성을 돕는 도구로 남으려면 데이터 접근 권한과 사용 목적에 대한 명확한 원칙이 먼저 있어야 한다고 생각해요.
  • ④ 앞의 두 글과 이어서 보기 🔗
    • AAMC 기초역량은 "무엇을 갖춰야 하나"를 목록으로 제시했고, Macy 권고안은 "기관과 제도가 무엇을 해야 하나"를 다뤘어요. 이 논문은 한 걸음 물러서서 "역량이라는 개념 자체가 어떻게 바뀌나" 를 묻고 있어요. 세 글을 함께 읽으면 역량 목록, 제도 설계, 개념적 토대를 한꺼번에 볼 수 있어서 교육과정 개편이나 평생교육 설계를 고민하는 분들께 도움이 될 것 같아요.

 


📝 정리하며

  • Pusic과 ten Cate는 AI가 CPD의 전제를 인지적 희소성에서 인지적 풍요로 바꾸고 있다고 주장해요.
  • ten Cate의 다층 역량 모델(정전적, 맥락적, 개인화된 역량)로 분석하면, AI는 세 층위를 모두 강화하면서 동시에 그 의미를 바꿔요.
    • 정전적 역량: "무엇을 아는가"에서 "지식 시스템과 어떻게 일하는가"로. 핵심은 인식론적 겸손과 검증 능력이에요.
    • 맥락적 역량: 암묵적이고 경험적인 것에서 명시적이고 데이터 성찰적인 것으로. 인간-AI 혼합 팀에서 일하는 능력이 필요해요.
    • 개인화된 역량: 코칭 가능한 미시행동과 AI 성찰 지원으로 성장이 빨라질 수 있지만, 감시, 평준화, 데이터 접근 문제가 따라와요.
  • CPD는 AI 리터러시, 혼합 의사결정, 다직종 정합성, 개인 데이터에 대한 성찰적 태도, 시스템 재설계를 준비해야 해요.

함께 읽으면 좋은 글로는 이 논문의 분석 틀인 ten Cate 등(2024), "Medical competence as a multilayered construct"(Med Educ 58:93–104) 를 추천해요. 📎

 


 

보건의료인의 전문직업적 발달은 오랫동안 인지적 희소성의 제약을 받아 왔다. 이 용어는 행동경제학자 멀레이너선(Mullainathan)과 심리학자 샤피르(Shafir)가 2013년에 처음 제시한 것으로, 삶을 개선하는 데 필요한 자원이 부족하다는 걱정에 사로잡힌 사고방식을 나타낸다.1 이러한 제약은 돈, 시간, 음식, 수면, 사회적 지지 등 여러 모습으로 나타날 수 있지만, 많은 임상의는 연구의 최신 동향을 따라가고 진료를 깊이 성찰하며 최적의 진료를 제공하는 데 필요한 개인적 시간과 능력이 제한되는, 특정한 형태의 인지적 희소성을 경험해 왔다. 계속전문직업개발(CPD)의 구조는 이러한 병목을 수용하고 해결하도록 설계되었다. 여기에는 선별·정리된 최신 정보, 모듈형 평생의학교육(continuing medical education, CME) 활동, 간헐적 시뮬레이션이 포함된다. 활용 가능한 인지 자원이 제한되어 있었으므로 학습은 특정 시간과 장소로 한정될 수밖에 없었다. AI의 부상은 이러한 지형을 근본적으로 변화시켜 CPD의 조건을 인지적 희소성을 헤쳐 나가는 데서 인지적 풍요를 조직하고 활용하는 것으로 바꾼다.

 

인지적 풍요는 아직 동료심사 문헌에서 공식적으로 정립된 구성개념(construct)은 아니지만, 분산 인지, 디지털 증강(digital augmentation), 인공지능에 관한 연구의 교차점에서 자연스럽게 등장한다(표 1). 디지털 기술을 통해 활용되지 않던 인간의 인지 능력이 해방된다는 인지적 잉여(cognitive surplus) 개념2과 보건의료 및 교육에서 AI 매개 의사결정 지원(AI-mediated decision support)에 관한 연구3,4를 토대로, 인지적 풍요는 인지 자원에 대한 접근이 더 이상 인간의 한계에 의해 엄격하게 제약되지 않는 상태를 이해하는 틀로 볼 수 있다.

 

  • 인지적 풍요가 특징인 업무 환경에서 임상의는 방대한 문헌을 즉시 종합하고, 수행 데이터에 잠재된 패턴을 드러내며, 지속적인 성찰을 지원하는 AI 시스템을 일상적으로 활용할 수 있다. 이에 따라 인지는 개인이 희소성의 제약 속에서 수행하는 활동에서, 진료와 개인적 발달 모두에 활용되는 시스템 수준의 분산된 능력으로 이동한다.5
  • 이러한 틀은 걸러지지 않은 입력이 과도하여 인간의 주의와 의사결정에 부담을 주는 정보 과부하(information overload)와 구별된다. 오히려 인지적 풍요는 해석할 수 있고 행동으로 옮길 수 있는 인지적 지원을 이용할 수 있어 인지 부담을 가중하기보다 줄일 수 있는 상태를 가리킨다.6
  • 인지적 풍요가 인지적 노력이나 판단의 부재를 뜻하는 것은 아니다. 이는 인지가 생산·공유·관리되는 방식의 근본적인 변화를 뜻하며, 단순한 효율 향상을 넘어 전문직 역량, 책임, 학습에 영향을 미친다.

 

AI가 가져온 변화는 CPD에 핵심 질문을 제기한다. 임상의가 더 이상 생의학적 정보의 유일한 처리자는 물론 유일한 보유자도 아닐 때, 역량을 어떻게 이해하고 함양해야 하는가? 저자들은 텐 카터 등이 2024년에 제안한 다층적 역량 모델(multilayered competency model)을 사용하여 가능한 함의를 논의한다.7 이 모델은 세 층으로 이루어진다.

 

  • 정전적 역량(canonical competence)은 확립된 기초 생의학 지식과 기술적 술기, 곧 ‘모두가 알아야 하는 것’을 포괄한다.
  • 맥락적 역량(contextual competence)은 임상 시스템의 복잡성과 다양한 맥락 속에서 수행하는 능력을 나타낸다.
  • 개인화된 역량(personalized competence)에는 개인의 가치, 개인적 정체성과 융합된 전문직 정체성, 개인적 발달 방향을 결정하는 성찰 능력, 개인 특유의 스타일이 포함된다.

 

AI는 각 층을 강화하면서도 학습하고 추론하며 전문직으로 성장한다는 것의 의미를 다시 빚는다.

 

이제 막 시작된 전문직 역량의 학습·유지·확장에 관한 AI 혁명은 1990년대에 시작되어 관련 정보와 교육에 대한 보편적 접근, 학습분석 정보의 수집 등을 통해 CPD를 개선했던 인터넷 혁명 위에 구축된다.8,9 온라인 지식 종합은 관련 정보에 더 효율적으로 접근하게 했지만, AI는 정보 검색의 효율성을 높이는 데 그치지 않고 임상추론 지원을 포함한 인지적 처리 기능까지 더한다.8 표 2는 이러한 사고방식의 변화가 임상 역량의 다차원적 층위에 어떤 영향을 미치는지 개괄한다.

 

표 1. 주요 용어 해설 (Glossary of Key Terms) 

용어 이 논문에서의 정의
AI: 대규모 언어 모델(large language model, LLM) 대규모 텍스트 말뭉치(corpus)로 학습하여 자연어를 생성·요약·해석하고 자연어에 관해 추론하는 인공지능 시스템의 한 부류. 설명, 종합, 문서 작성 지원, 대화형 상호작용에 흔히 사용된다.
AI: 다중양식 분석(multimodal analysis) 텍스트, 이미지, 오디오, 비디오, 생리학적 신호, 구조화된 데이터 등 여러 데이터 양식을 통합·분석하여 어느 한 양식만으로는 얻을 수 없는 통찰을 만들어내는 인공지능 접근법.
인지적 풍요(cognitive abundance) AI 기반 시스템을 통해 분석·생성·해석을 위한 인지 자원을 손쉽게 이용할 수 있어 개인과 팀이 인간 개인의 한계를 넘어 종합된 지식, 피드백, 성찰적 통찰에 접근할 수 있는 상태.
인지적 희소성(cognitive scarcity) 시간, 주의, 전문성, 피드백, 분석 지원과 같은 인지 자원에 대한 접근이 제한되어 학습·성찰·의사결정의 질이 제약되는 상태. 최근까지 임상 교육과 진료의 특징이었다.
분산 인지(distributed cognition) 인지 과정이 개인의 마음에 국한되지 않고 사람, 도구, 기술, 환경에 분산되어 있다는 이론적 관점. 임상 환경에서는 임상의, 인공물(artifacts), 의사결정 지원 시스템의 상호작용에서 추론이 나타난다.
정보 과부하(information overload) 들어오는 정보의 양이나 복잡성이 개인의 효과적인 처리 능력을 넘어서 판단 저하, 인지적 부담 증가, 최적에 못 미치는 의사결정을 초래하는 상태.
다층적 역량(multi-layered competence) 서로 의존하는 세 층으로 구성된 전문직 역량의 개념 모델. 정전적 역량(기초 지식과 기술적 술기), 맥락적 역량(특정 임상·조직·팀 맥락에서 그 토대를 효과적으로 적용하는 능력), 개인화된 역량(임상의가 자신의 역할을 고유하게 수행할 때 나타나는 가치, 전문직 정체성, 성찰 능력, 대인관계 특성)으로 이루어진다.

인지적 풍요 속의 정전적 역량 (Canonical Competence Under Cognitive Abundance) 

정전적 역량은 안전하고 효과적인 진료를 뒷받침하는 기초 지식과 기술적 술기를 뜻한다. 텐 카터 등의 다층적 모델에서 이 층은 맥락과 무관한 생의학, 생리학, 약리학, 진단 도식(diagnostic schema), 전문직업성(professionalism), 기술적 수행을 포괄한다. 역사적으로 정전적 역량은 구조화된 교육과정, 전문의 자격시험(board examinations), 술기 훈련, 개별적인 독서를 통해 주로 형성되었다. 이는 희소성으로 규정된 인지 경제를 반영하는 활동이다. 임상의는 읽을 시간이 있는 만큼만 숙달할 수 있었고, 평가는 계속 커지는 전체 지식 영역에서 점점 더 집중된 일부를 표집했으며, 술기의 발달은 인간 교육자, 증례 경험, 고정된 시뮬레이션에 크게 의존했다. 최근까지 진료 현장에 그러한 지식을 가져오는 주체는 임상의뿐이었다.

 

인공지능은 정전적 정보의 범위, 접근성, 적응성을 확대함으로써 이 지형을 변화시킨다.10,11 AI 기반 학습 환경은 핵심 기초과학의 개인별 보충 학습을 제공하고, 특정 오개념을 찾아내며, 학습자의 변화하는 수행 양상에 따라 내용을 맞춤형으로 전달할 수 있다. 대규모 언어 모델은 같은 개념을 비유, 단계별 추론, 관련 병리와의 대조 등 여러 방식으로 설명할 수 있다. 이는 인간 교사의 반응성을 닮았지만 언제든 이용할 수 있다. 평가에서는 적응형 검사 시스템(adaptive testing systems)이 새로운 문항을 대규모로 생성하여 지식 영역의 표집 범위를 넓히고 학습 결손을 더 정확하게 진단할 수 있게 한다.

 

AI는 정전적 역량의 술기 및 기술 측면도 강화한다. 시뮬레이션 실습실의 컴퓨터 비전 시스템(computer vision systems)은 손의 움직임, 탐촉자(probe)의 위치, 인체공학적 정렬(ergonomic alignment)을 실시간으로 평가하여 인간 관찰자가 신뢰성 있게 포착하기 어려운 세밀한 지표를 만든다.12,13 자동화된 오류 패턴 분석은 기관삽관 시 회전 부족이나 초음파 검사 시 일정하지 않은 압력처럼 미묘한 경향을 찾아내어 목표 지향적 연습을 안내할 수 있다. 이러한 시스템은 전문가 수준의 피드백에 대한 접근을 넓힌다.

 

그러나 이러한 개선은 정전적 역량 발달의 점진적 진화에 불과하다. 더 깊은 변화는 인지적 희소성에서 인지적 풍요로의 이동에서 나온다. AI 시스템이 생의학적 근거를 즉시 검색·종합·설명할 수 있을 때, 숙달은 더 이상 주로 정보를 소유하는 것으로 정의되지 않는다. 대신 임상의의 인식론적 역할(epistemic role)은 탐색, 검증, 해석으로 이동한다.

  • AI 모델에 어떤 질문을 할지,
  • 그 인용의 질을 어떻게 평가할지,
  • 대안적 진단을 어떻게 탐색할지,
  • 모델의 출력을 지역 진료지침과 어떻게 조화시킬지
  • ...를 아는 것이 정전적 진료의 더 중심적인 구성요소가 된다.

따라서 인지적 풍요는 정전적 역량을 ‘임상의가 무엇을 알아야 하는가’에서 ‘임상의가 지식 시스템과 어떻게 협력하는가’까지 확장한다. 임상의는 AI 도구에서 설명 가능한 추론(explainable reasoning)을 이끌어내고, 환각(hallucinations)을 발견하고, 모델과 근거의 불확실성(model/evidence uncertainty)을 이해하며, 종합된 근거를 환자별 요인과 통합하는 데 능숙해져야 한다. 이는 근거중심진료(evidence-based practice)가 처음 등장했을 때와 같은 과거 의학의 변화를 닮았지만, 훨씬 빠르고 큰 규모로 일어난다.

 

마지막으로, 정전적 역량의 정의는 정적이고 주기적으로만 갱신되는 것에서 동적이고 지속적으로 새로워지는 것으로 바뀐다. AI 시스템이 새로운 임상시험, 진료지침, 메타분석을 자동으로 통합함에 따라 지식의 지형은 실시간으로 변한다. 인지적 풍요 속에서 진료하는 임상의는 이러한 변화를 포착하고 해석하며, 그 함의를 이해하고, 이에 맞게 진료를 조정할 준비가 되어 있어야 한다. 이런 환경에서 역량에는 인식론적 겸손(epistemic humility), 지식이 역동적이라는 인식, 신중한 해석이 필요한 복잡한 시스템을 통해 지식이 매개된다는 인식이 포함된다.

 

요약하면 AI는 정밀한 개인지도(precision tutoring), 평가 범위의 확대, 술기 피드백의 향상을 통해 정전적 역량의 습득을 강화한다. 동시에 임상의의 인식론적 역할을 종합된 근거의 검증 능력과 AI가 매개한 통찰을 책임 있게 통합하는 능력으로 이동시켜 정전적 역량이라는 개념 자체를 근본적으로 바꾼다.

 

1. 과거의 기본기: "얼마나 내 머릿속에 많이 담고 있는가?" (인지적 희소성 시대) 과거에는 의사가 기초 지식과 진료 기술(정전적 역량)을 갖추려면, 정해진 교육과정을 거치며 교과서를 읽고 외우고 시험을 봐야 했습니다. 사람이 학습할 수 있는 시간과 정보량에는 한계가 있기 때문에, 의사의 능력을 평가할 때는 방대한 의학 지식 중 '얼마나 많은 정보를 머릿속에 소유하고 있는지'가 중요했습니다.

2. AI가 가져온 1차적 변화: 학습과 훈련의 고도화
AI는 의사들이 이 기본기를 배우는 과정을 훨씬 쉽게 만들어 줍니다.

  • 지식 학습: AI가 24시간 대기하는 개인 과외선생님처럼 학습자의 수준에 맞춰 지식을 설명해 주고, 부족한 부분을 찾아냅니다.
  • 실습 훈련: 시뮬레이션 실습을 할 때, AI 카메라(컴퓨터 비전)가 초음파를 쥔 손의 미세한 움직임이나 각도까지 실시간으로 분석해 사람이 잡아내기 힘든 정교한 피드백을 줍니다.
3. 가장 중요한 변화: "지식을 외우는 것에서, AI와 협력하는 것으로" (인지적 풍요 시대) 논문은 앞서 말한 교육 방식의 발전보다 더 근본적인 변화에 주목합니다. 이제는 AI가 모든 의학 지식을 즉시 검색하고 요약해 주는 '정보가 넘쳐나는 시대(인지적 풍요)'가 되었습니다. 따라서 이제 훌륭한 의사의 기준은 단순히 '지식을 많이 아는 것'이 아닙니다.

지식은 AI가 찾아주니, 의사의 역할은 '그 정보를 어떻게 다루고 검증할 것인가'로 바뀝니다.
  • AI에게 어떤 질문을 던져야 정확한 답이 나오는지 알기
  • AI가 찾아준 논문이나 근거가 믿을 만한지 평가하기
  • AI가 거짓말(환각 현상)을 하지는 않았는지 걸러내기
  • AI의 일반적인 답변을 우리 병원의 상황이나 눈앞의 환자 특성에 맞게 조정하기
4. 결론: 끊임없이 변하는 지식 앞에서의 겸손함 AI는 매일 쏟아지는 전 세계의 새로운 논문과 진료 지침을 실시간으로 업데이트합니다. 의학 지식은 고정되어 있지 않고 매일 변합니다. 따라서 앞으로의 의사는 "내가 아는 지식이 언제든 바뀔 수 있다(인식론적 겸손)"는 유연한 태도를 가져야 합니다.

결과적으로 AI 시대의 진정한 '의료 기본기'란, 지식을 무조건 암기하는 능력이 아니라 AI라는 강력한 도구를 비판적으로 검증하고 환자를 위해 책임감 있게 사용하는 능력으로 진화하고 있다는 것이 이 글의 핵심입니다.

 

표 2. 역량의 세 층에서 나타나는 인지적 희소성과 인지적 풍요의 비교 (Cognitive Scarcity vs. Cognitive Abundance Across Three Layers of Competence) 

역량의 층 기능 인지적 희소성 인지적 풍요
정전적 역량 위치(Location) 편람과 학술지 출판물. 한계를 지닌 임상의의 마음. AI를 통해 지식에 역동적으로 접근할 수 있다. 장기기억(long-term memory, LTM)에 저장하기보다 탐색, 질의, 검증, 종합을 강조한다.
처리(Processing) 일상 진료에 암기가 필수적이다. 학습은 텍스트 기반 자원에 한정되며, 근거는 대체로 당연한 것으로 받아들여지고, 갱신은 주기적으로 이루어진다. 다중양식 자료(텍스트, 오디오, 비디오, 시뮬레이션), 실시간 근거 종합, 자동화된 개인지도가 이해와 학습을 지원한다.
평가(Evaluation) 평가는 고정된 시험과 정적인 사례에 의존한다. 대규모로 생성되는 적응형 평가, 목표 지향적 보충 교육이 이루어지고, AI가 오개념을 자동으로 식별한다.
맥락적 역량 위치(Location) 숙련된 진료에 필요한 암묵지는 도제식 경험을 통해 천천히 학습된다. 임상 진료(기록, 의사결정, 의사소통, 업무 흐름)에 대한 AI 생성 피드백이 지속적으로 제공되어 숙련도 향상을 앞당긴다.
처리(Processing) 지역적 직관이 진료를 이끌며, 암묵적·명시적 수행 피드백 정보가 제공된다. 전역적·지역적 패턴 인식이 맥락에 민감한 의사결정을 뒷받침한다.
평가(Evaluation) 팀에서의 기능은 비공식적으로 평가된다. 역량위원회(competency committees)에서 데이터가 적은 평가자 간 판단으로 타당성을 뒷받침한다. 기준 미달의 진료는 흔히 신호로 드러나지 않는다. AI 기반 의사소통 및 업무 흐름 분석으로 팀 역동이 가시화된다. 전자 포트폴리오(ePortfolio) 데이터 종합은 총괄적 신뢰 부여(summative entrustment)와 진료 권한 부여(privileging)를 지원한다.
개인화된 역량 위치(Location) 자기 이해는 환자와 협력자와의 상호작용, 간헐적인 멘토링에 의존한다. 어조, 공감, 추론, 습관에 관한 다중양식 통찰을 활용한 AI 지원 성찰 실천이 발달을 촉진한다.
처리(Process) 시행착오를 통한 개인적 성장은 흔히 느리고, 경험에 의존하며, 고르지 않다. 미세행동(microbehavior)에 대한 지속적인 통찰을 얻는다. AI에 근거한 의도적 연습(deliberate practice)은 개인 경험을 넘어설 수 있다. AI는 강점을 바탕으로 개인화된 발달 경로를 제안하고 지원할 수 있다.
평가(Evaluation) 피드백은 거의 없다. 번아웃은 진행 후기에야 발견되고, 개인적 성장이 항상 식별되는 것은 아니다. 환자보고결과지표(patient-reported outcome measures)와 다른 개인화된 지표를 더 잘 포착한다. 분석을 통해 웰빙 문제를 일찍 발견하고 개인화된 회복탄력성 지원을 제공한다.

인지적 풍요 속의 맥락적 역량 (Contextual Competence Under Cognitive Abundance) 

텐 카터 등의 다층적 모델에서 두 번째 층인 맥락적 역량은 임상 환경의 현실적 복잡성 속에서 지식과 기술을 효과적으로 적용하는 임상의의 능력에 관한 것이다.7 여기에는 상황인식(situational awareness), 우선순위 설정, 적응력, 의사소통, 팀워크, 그리고 자원 가용성, 환자 인구집단의 특성, 문화적 규범, 전문직 간 역동 등 특정 환경의 제약 속에서 기능하는 능력이 포함된다. 전통적으로 맥락적 역량은 경험학습(experiential learning)과 암묵적인 문화 습득(tacit enculturation)을 통해 서서히 발달한다. 임상의는 회진에서 문서화되지 않은 규범을 흡수하고, 긴급한 상황에서 어떤 단서가 중요한지 배우며, 관찰과 피드백을 통해 팀의 기대에 적응한다. 이러한 학습은 강력하지만 역사적으로 느리고, 고르지 않으며, 우연한 경험에 크게 좌우되었다.

 

인공지능은 이전에는 암묵적이었던 업무의 측면을 보이게 함으로써 맥락적 역량을 변화시킨다.

 

  • 가장 기본적으로, 맥락 인식 의사결정 지원 시스템(context-aware decision support systems)은 지역 진료지침, 항균제 내성 양상, 인력 배치, 자원 제약을 통합한 권고를 제공한다.
  • 예측 분석(predictive analytics)은 활력징후나 검사 결과의 미세한 변화를 통해 인간의 관찰로는 놓칠 수 있는 악화의 초기 징후를 찾아낸다.14
  • 업무 흐름에 통합된 마이크로러닝(microlearning) 도구는 전자의무기록(electronic health record)에서 특정 행동을 계기로 패혈증 묶음 치료(sepsis bundles)나 항응고요법 지침을 상기시키는 등 필요한 내용을 임상의에게 실시간으로 전달할 수 있다.8
  • 이러한 도구는 함께 인지 부담을 줄이고 상황인식을 높여 임상의가 주의를 더 효과적으로 집중할 수 있게 한다.15

 

AI는 지역 환경에 맞춘 고충실도 시뮬레이션(high-fidelity simulations)을 가능하게 함으로써 맥락적 역량을 더욱 지원한다. 전통적인 시뮬레이션이 일반적인 정전적 사례에 의존했다면, AI 기반 플랫폼은 지역 데이터, 즉 흔한 동반질환, 자주 발생하는 합병증, 전형적인 대응 시간, 자원 제약에 따라 시나리오를 역동적으로 조정할 수 있다. 임상의는 드문 응급상황뿐 아니라 분절된 시스템 전반에서 진료를 조정하거나 어려운 진단적 불확실성을 전달하는 등 일상적 과제의 복잡한 시나리오도 자신의 실제 진료 환경을 닮은 곳에서 연습할 수 있다. 이러한 형태의 연습은 맥락에 민감한 기술의 습득을 앞당긴다.16

 

그러나 맥락적 역량의 가장 깊은 변화는 아마도 인지적 희소성에서 인지적 풍요로의 전환에서 나온다. 표 3은 인지적 풍요의 환경에서 임상 업무가 어떻게 달라질 수 있는지 설명한다.

 

표 3. 인지적 풍요와 변화하는 임상 업무의 성격 (Cognitive Abundance and the Changing Nature of Clinical Work) 

영역 인지적 희소성 인지적 풍요
지식 업무(Knowledge work) 독서에 기반하고, 시간 제약을 받으며, 의사 중심으로 지식을 습득한다. AI가 근거를 지속적으로 종합한다. 임상의는 역동적인 지식 흐름을 조정하고 검증한다.
의사결정(Decision making) 개인의 경험, 기억, 지역적 경험칙(heuristics)에 의존한다. 예측 모델, 맥락 인식 임상의사결정지원시스템(clinical decision support systems), 여러 출처의 패턴 인식이 지원한다.
문서화와 의사소통(Documentation & communication) 수작업으로 이루어지고 질이 일정하지 않으며, 성찰이 부족한 경우가 많다. AI 지원 문서화, 담화 분석(discourse analysis), 의사소통 코칭이 이루어진다.
팀 조정(Team coordination) 팀 규범을 암묵적이고 경험에 의존하여 이해한다. 투명한 업무 흐름 분석으로 패턴, 병목, 최적화의 기회가 드러난다.
학습과 피드백(Learning & feedback) 순환 주기가 길고 평가는 주기적으로 이루어진다. 임상 의사결정, 기록, 상호작용 전반에 대해 AI가 지속적으로 미세 피드백(microfeedback)을 제공한다.
전문직 성장(Professional growth) 제한된 멘토링 기회에 의존한다. AI 도구와의 풍부한 성찰적 협력, 다수의 ‘가상 멘토’가 가능하다.
정체성 형성(Identity formation) 경험을 통해 암묵적으로 나타난다. 행동, 의사소통, 감정, 강점에 대한 다중양식 통찰이 지원한다.

 

풍요로운 환경에서 맥락적 역량은 더 이상 임상의가 우연히 관찰한 것이나 소수의 지도자로부터 받은 피드백에 의해 제한되지 않는다. 대신 임상의는 현실의 자신의 행동에 대해 지속적이고 데이터에 근거한 통찰을 얻을 수 있다.

  • 진료기록 분석(documentation analytics)은 추론 패턴을 드러내고17, 의사소통 분석은 말 끊기, 주저함, 전문용어 사용을 파악하며, 팀 매핑 알고리즘(team-mapping algorithms)은 토론에 누가 참여하고 누가 체계적으로 배제되는지를 부각한다.
  • 또 하나의 중대한 변화는 인간–AI 혼합 팀(hybrid human–AI team)의 역동이 등장한다는 점이다. AI 시스템이 경고, 권고, 예측을 만들어냄에 따라 임상의는 이를 협업의 업무 흐름에 통합해야 한다. 이를 위해 누가 어떤 경고를 감시할지 결정하고, 임상의의 판단과 모델 출력이 다를 때 해결 방법을 명확히 하며, 팀 안에서 주의가 공평하게 배분되도록 하는 새로운 조정 방식이 필요하다. 이제 좋은 팀원이 되려면 AI가 매개하거나 영향을 미치는 조정에 능숙해야 한다.
  • 마지막으로, AI가 팀 상호작용의 패턴, 업무 흐름의 병목, 시스템의 비효율을 드러내면 맥락적 역량은 더 투명해지고 개선 가능해진다. 진료 지연이 빈번하다는 것을 알아차린 임상의는 AI가 만든 업무 흐름 지도를 활용해 근본 원인을 찾을 수 있고, 의사소통의 단절을 감지하는 모델은 목표 지향적 팀 훈련을 안내할 수 있다. 이러한 가시성은 맥락적 역량을 암묵적·경험적 성격에서 명시적이고 데이터 성찰적(data-reflexive)인 성격으로 바꾼다. 이전에는 볼 수 없던 것을 볼 수 있게 되어 개선 대상으로 삼을 수 있는 것이다.
1. 과거의 실전 능력: 어깨너머로 배우는 '실전 감각과 눈치' 병원 현장은 교과서와 다릅니다. 환자의 특성, 병원의 부족한 자원, 의료진 간의 서열이나 분위기 등 복잡한 상황이 얽혀 있습니다. 과거에는 이런 환경에서 살아남고 적응하는 능력(상황 파악, 우선순위 설정, 의사소통 등)을 선배들을 따라다니며 회진 중에 눈치껏 배우거나, 깨지면서 우연히 경험을 통해 서서히 익혀야만 했습니다.

2. AI가 가져온 변화 ①: 우리 병원에 딱 맞는 '실시간 내비게이션'
AI는 겉으로 드러나지 않던 병원의 숨은 상황과 규칙들을 눈에 보이게 짚어줍니다.

  • 실시간 조언: "이 지역은 특정 항생제 내성이 강하니 다른 약을 쓰세요"처럼 현재 병원 상황에 맞는 지침을 알려줍니다.
  • 조기 경보: 의사의 눈으로는 놓치기 쉬운 환자의 미세한 변화를 미리 감지해 경고해 줍니다.
  • 맞춤형 실습: 교과서적인 뻔한 상황이 아니라, '우리 병원에서 가장 흔하게 발생하는 위급 상황'이나 '우리 병원의 부족한 장비 상황'을 반영한 맞춤형 모의훈련(시뮬레이션)을 만들어내어 실전 적응을 돕습니다.
3. 데이터 기반의 거울: 내 진료와 소통 습관까지 분석하는 AI 정보가 풍요로워진 시대에는 의사의 '소프트 스킬(의사소통, 팀워크 등)'도 더 이상 우연한 선배의 조언에 의존하지 않습니다. AI가 의사의 실제 행동 데이터를 분석해 객관적인 피드백을 줍니다.
  • 환자와 대화할 때 내가 말을 얼마나 끊었는지, 어려운 의학 용어를 너무 많이 쓰지는 않았는지 분석해 줍니다.
  • 의료진 회의에서 특정 팀원(예: 신규 간호사)이 의견을 내지 못하고 소외되고 있지는 않은지 팀워크 패턴까지 짚어냅니다.
4. 새로운 시대의 실전 능력: "AI를 동료로 받아들이고 시스템을 고치는 것" 결과적으로 가장 큰 변화는 '팀워크의 대상'이 사람에서 AI로까지 확장된다는 것입니다. 이제 훌륭한 의사란 단순히 동료들과 잘 지내는 것을 넘어, '인간-AI 혼합 팀'에서 잘 일하는 사람입니다.
  • AI가 쏟아내는 수많은 경고 알림 중 누가 어떤 것을 확인할지 역할을 나누고, 내 판단과 AI의 의견이 다를 때 이를 어떻게 조율할지 결정해야 합니다.
  • 나아가 AI가 분석해 준 병원의 업무 지연 원인이나 소통의 문제를 바탕으로, 병원 시스템 자체를 투명하게 들여다보고 개선할 수 있어야 합니다.
요약하자면, 과거에는 실전 능력이 "선배들의 등 너머로 감(눈치)을 잡는 것"이었다면, AI 시대의 실전 능력은 "데이터와 AI의 피드백을 활용해 나 자신의 소통 방식을 객관적으로 돌아보고, AI라는 새로운 동료와 함께 병원 시스템 전체를 효율적으로 조율해 내는 능력"으로 업그레이드된다는 뜻입니다.

 

인지적 풍요 속의 개인화된 역량 (Personalized Competence Under Cognitive Abundance) 

텐 카터 등의 다층적 모델에서 세 번째 층인 개인화된 역량은 개별 임상의의 가치, 개인적·대인관계적 업무 방식, 성찰 능력, 웰빙, 정서적 안정성, 전문직 정체성을 가리킨다.3 여기에는 환자, 동료, 자기 자신과 관계를 맺을 때 드러나는 임상의의 개인적 스타일이 포함되며, 공감, 정직성, 회복탄력성, 진료를 이끄는 도덕적 헌신도 포함된다. 정전적 역량이나 맥락적 역량과 달리 개인화된 역량은 전통적으로 측정하거나 가르치거나 체계적으로 함양하기가 가장 어려웠다. 이는 개인적 경험, 멘토링, 문화, 도덕적 또는 정서적 도전에 직면한 순간에 영향을 받으며 천천히 나타난다. 무엇보다도 전문직 종사자들 사이의 정당한 차이와 표준화된 평가로는 포착하기 어려운 고유성을 함축한다. 그러나 변하지 않는 점은 임상의가 정전적·맥락적 기준을 넘어 개인적 신념과 스타일을 발전시킴으로써 전문직 수행을 발달시키고 개선한다는 것이다.

 

AI는 어떻게 좋은 의사가 훌륭한 의사로 성장하도록 도울 수 있을까?

  • AI는 대인관계 행동과 성찰적 삶의 여러 측면을 보이게 하고, 분석하고, 개선할 수 있게 하여 개인화된 역량에 새로운 발달의 지형을 연다. 의사소통 분석 도구는 임상적 만남에서 어조, 명료성, 말 끊기의 양상, 공감적 언어 사용을 살필 수 있다. 자연어 처리(natural language processing)는 임상의가 불확실성을 효과적으로 전달하는 순간, 또는 설명이 환자를 혼란스럽게 하거나 압도할 위험이 있는 순간을 찾아낼 수 있다. 이러한 통찰은 대인관계 스타일을 암묵적 특성에서 코칭 가능한 미세행동(coachable microbehaviors)의 집합으로 바꾼다.18
  • AI는 개인의 성찰 실천(reflective practice)도 강화한다. 임상의는 정서적으로 복잡한 만남을 풀어 이해하도록 돕는 AI 기반 일지 시스템(journaling systems), 서사의학 보조 도구(narrative medicine assistants), 성찰적 동반자(reflective companions)를 이용할 수 있다. 이러한 에이전트는 숙련된 인간 멘토가 던질 법한 탐색적 질문을 흉내 내며 “어떤 가정이 당신의 반응에 영향을 주었는가?” 또는 “문화적 배경이 이 상호작용을 어떻게 형성했을까?”와 같이 더 깊은 성찰을 촉구할 수 있다. 이 도구들은 시간 제약 없이 지속적으로 작동하므로 인간 코치가 현실적으로 제공할 수 있는 수준을 넘어 성찰 지원에 대한 접근을 넓힌다.
  • 웰빙 분석(wellbeing analytics)은 번아웃, 피로, 인지 과부하와 관련된 패턴을 식별하여 개인화된 역량을 더 지원한다. AI 시스템은 수면의 대리지표(sleep proxies), 기록 작성 시점, 받은 편지함의 업무량, 읽지 않은 검사 결과의 누적량이 변하는지를 추론하여 임상의에게 부담의 초기 징후를 알릴 수 있다. 이를 통해 선제적인 자기돌봄(proactive self-care)이 가능해지고, 개인화된 역량의 중요한 요소인 회복탄력성을 키울 수 있다.

인지적 풍요는 개인화된 역량을 더 깊은 수준에서 변화시킨다.

  • 임상의가 자신의 의사소통, 감정적 어조, 추론 패턴, 웰빙에 대한 다중양식 통찰에 지속적으로 접근할 수 있다면 정체성 형성이 빨라질 수 있다. 임상의는 새로운 관점에서 자신을 바라보며, 어려운 대화에서 주저하거나 팀 회의에서 의도치 않게 발언을 독점하는 등 수년간 알아차리지 못했을 수 있는 경향을 발견할 수 있다. 따라서 AI는 성찰의 자료를 꾸준히 제공함으로써 정체성 발달을 풍부하게 한다. 반면 과도한 감시(over-surveillance)와 해로운 문화 변화 같은 잠재적 위험도 있다.
  • 인간–AI 혼합 멘토링(hybrid human–AI mentorship) 또한 전문직 성장을 재편한다.19 실제 삶에서 얻은 지혜와 도덕적 지침을 제공하는 인간 멘토는 AI로 대체할 수 없다. 그러나 AI는 24시간 피드백을 제공하고, 장기간의 수행 데이터를 종합하며, 인간 관찰자가 놓칠 수 있는 강점과 기회를 임상의가 발견하도록 도와 멘토링을 보강할 수 있다. 이로써 멘토링이 희소하기보다 풍부한 학습 환경이 만들어진다.

하지만 인지적 풍요는 윤리적 복잡성도 가져온다. 개인에 관한 분석이 매우 상세해질수록 임상의는 지나친 자기비판, 알고리즘적 인정에 대한 과도한 의존, 사생활 침해 위험에 빠지지 않으면서 그것을 통합하는 법을 배워야 한다. AI가 매개하는 세계의 개인화된 역량에는 개인 데이터와 맺는 관계를 관리하고, 분별력을 갖고 피드백을 해석하며, 알고리즘의 통찰 속에서도 자율성과 인간성을 유지하는 메타기술(meta-skills)이 필요하다.20

 

궁극적으로 인지적 풍요 속의 개인화된 역량은 데이터의 지원을 받으며 자기 자신을 계속 이해하고 성장시키는 역동적인 과정이 된다. 임상의는 경험뿐 아니라 자신이 어떻게 생각하고 느끼고 의사소통하며 협력하는지를 비추어 주는 다중양식 피드백 고리(multimodal feedback loops)를 통해 발전한다. AI가 생성한 피드백은 인간 피드백에서 개인적 관계 때문에 생길 수 있는 왜곡을 줄이고 비공개로 유지할 수도 있지만, 매우 중요한 윤리적 질문 하나가 남는다. 이렇게 극도로 개인화된 데이터에는 누가 접근할 수 있는가? 

 

1. 과거의 개인 역량: 시간과 경험만이 답이었던 '의사로서의 인성' 의사의 공감 능력, 도덕성, 회복탄력성(멘탈 관리), 자신만의 진료 스타일 등은 교과서나 시험으로 배울 수 없는 영역입니다. 과거에는 수많은 환자를 만나고 훌륭한 선배 의사를 롤모델 삼아 오랜 시간 경험을 쌓아야만 서서히 길러지는, 지극히 주관적이고 추상적인 능력이었습니다.

2. AI가 가져온 변화 ①: 추상적인 '공감'을 눈에 보이는 데이터로 코칭
AI는 눈에 보이지 않던 의사의 '태도'를 구체적인 데이터로 분석해 줍니다.

  • 환자와 대화할 때 목소리 톤은 어땠는지, 공감하는 단어를 얼마나 썼는지, 환자가 혼란스러워할 만한 어려운 말을 쓰지 않았는지 AI가 분석합니다.
  • 이를 통해 막연했던 '친절함'이나 '소통 능력'이 구체적으로 교정 가능한 행동(미세 행동)으로 바뀌어, 누구나 자신의 소통 방식을 코칭받을 수 있게 됩니다.
3. AI가 가져온 변화 ②: 24시간 나를 돌아보게 하는 '가상 멘토와 번아웃 알리미' AI는 훌륭한 선배이자 심리 상담가의 역할도 일부 대신합니다.
  • 자기 성찰 돕기: 정서적으로 힘든 환자를 겪은 후, AI가 "방금 그 상황에서 왜 그런 감정을 느꼈나요?", "당신의 어떤 고정관념이 작용했을까요?"라고 질문을 던져 의사 스스로 마음을 돌아보게 도와줍니다.
  • 번아웃(탈진) 예방: 의사의 차트 작성 시간, 쌓여있는 업무량, 수면 패턴 등을 분석해 "지금 인지적 과부하가 왔으니 선제적 휴식이 필요하다"고 미리 경고해 줍니다.
4. 새로운 시대의 개인 역량: 데이터의 거울 앞에서도 주체성을 잃지 않는 단단함 AI의 객관적인 피드백 덕분에 의사는 자신의 단점(예: 어려운 대화를 회피하는 습관 등)을 빠르게 깨닫고 더 나은 의사로 훌륭하게 성장할 수 있습니다. 하지만 여기에는 치명적인 고민거리도 따릅니다.
  • AI의 평가에 너무 집착해 지나치게 자책하거나, 누군가에게 감시당하고 있다는 느낌(과도한 감시)을 받을 수 있습니다.
  • 또한, 나의 지극히 사적인 심리 상태와 업무 태도 데이터에 "과연 누가 접근할 수 있는가?"라는 거대한 윤리적/프라이버시 문제가 남습니다.
결론적으로, AI 시대에 의사 개인에게 요구되는 진정한 자질은 "인간 선배의 삶의 지혜와 AI의 24시간 객관적 피드백을 조화롭게 활용하면서도, 알고리즘의 평가에 휘둘리지 않고 의사로서의 자율성과 따뜻한 인간성을 지켜내는 것"입니다.

계속전문직업개발에 대한 함의 (Implications for Continuing Professional Development) 

역량의 세 층을 모두 가로지르는 인지적 풍요로의 전환은 CPD에 중대한 함의를 갖는다. CPD는 본래 임상의가 정보 접근의 제한, 느린 피드백 주기, 의도적 연습의 드문 기회 같은 심각한 인지적 제약을 겪던 시대를 위해 설계되었다. 이제 CPD는 주기적 최신 정보 제공, 정적인 교육과정, 간헐적 평가를 중심으로 구조화되어서는 안 된다. 그 대신 임상의가 역동적인 지식 생태계를 탐색하고, 다중양식 피드백을 해석하며, 진료의 모든 층에 걸쳐 인간–AI 혼합 역량(hybrid human–AI competence)을 함양하도록 지원해야 한다.

  • 첫째, CPD는 AI 문해력(AI literacy)을 기초적인 전문직 기술로 우선시해야 한다.12,20 임상의는 대규모 언어 모델, 예측 알고리즘, 다중양식 시스템이 어떻게 작동하는지, 그리고 각각의 한계, 불확실성, 실패 양상(failure modes)을 이해해야 한다. 여기에는 모델에 효과적으로 질문하고, AI가 생성한 근거를 검증하고, 환각을 알아차리고, 모델의 설명을 해석하는 능력이 포함된다. AI 문해력은 AI의 권고를 임상추론과 팀의 업무 흐름에 언제, 어떻게 통합할지 이해하는 것도 포함한다.
  • 둘째, CPD 프로그램은 임상의가 혼합 의사결정(hybrid decision making)을 수행하도록 준비시켜야 한다. AI로 증강된 시스템에서 의사결정은 임상의의 인지만으로 이루어지는 것이 아니라 인간의 판단, 환자의 가치, 조직의 제약, 모델이 생성한 통찰이 상호작용한 결과로 나온다. CPD는 의견 불일치의 조정(disagreement negotiation), 즉 AI가 자신의 판단에 반대할 때 임상의가 어떻게 대응하는지, 문제 상향 보고 경로(escalation pathways), 공유 디지털 도구를 활용한 협력적 의미 구성(collaborative sense-making)과 같은 메타역량(meta-competencies)의 발달을 지원해야 한다.
  • 셋째, CPD는 AI 사용을 둘러싼 전문직 간 일관성(interprofessional coherence)을 강화해야 한다. AI 시스템이 위험 점수, 예측, 기록 제안과 같은 공유 신호를 생성하므로 팀은 이러한 입력을 일관되게 통합하는 방법을 배워야 한다. CPD는 간호사, 의사, 약사, 기타 보건의료인 사이에서 AI 도구에 관한 공유된 정신모형(shared mental models)을 촉진하여 AI 지원 업무 흐름이 팀의 기능을 분절시키지 않고 향상시키도록 해야 한다.
  • 넷째, CPD는 개인 분석 자료(personal analytics)를 성찰적이고 윤리적으로 다루도록 지원해야 한다. 임상의는 자신의 의사소통 패턴, 감정적 어조, 추론 구조, 웰빙에 대한 상세한 통찰을 점점 더 자주 접하게 될 것이다. 인지적 풍요는 피드백의 풍요이기도 하다. CPD는 임상의가 이 정보를 건설적으로 해석하고, 알고리즘의 판단에 과도하게 의존하지 않으며, 자율성과 도덕적 행위주체성(moral agency)을 유지하도록 도와야 한다. 구조화된 성찰 실천, 동료 간 토론, 교수진의 멘토링은 계속해서 중요할 것이다.
  • 마지막으로 CPD 시스템 자체도 인지적 풍요의 조건에서 작동하도록 다시 설계되어야 한다. 교육과정은 역동적이어야 하고, 평가는 지속적이어야 하며, 피드백은 실시간으로 제공되고, 학습 경로는 개인화되어야 한다. AI는 이러한 변화를 가능하게 한다. CPD는 그 변화가 일관되고 안전하며 교육적으로 타당하게 이루어지도록 해야 한다.

이 논문의 심사자 중 한 사람이 지적했듯, 임상 행위에 대한 보건의료인의 최종 책임을 유념해야 한다. 실제로 AI가 임상적 판단에 점점 더 많이 관여할수록 임상의의 도덕적 행위주체성을 강화하는 CPD의 역할은 더욱 중요해진다. 표 4는 CPD의 기능이 희소성에 기반한 패러다임에서 인지적 풍요를 특징으로 하는 패러다임으로 어떻게 발전하는지 요약한다.

 

표 4. 인지적 풍요 속에서 CPD 시스템의 변화 (Transformation of CPD Systems Under Cognitive Abundance) 

교육 기능 인지적 희소성 인지적 풍요 CPD에서 AI 사용 시 유의점
교육과정(Curriculum) 고정된 내용, 느린 개정 주기, 표준화된 전달. AI가 매개한 근거 흐름과 통합되며 지속적으로 갱신되는 역동적인 학습 자료. 잘못된 정보나 저품질 종합물(‘AI 찌꺼기’, AI dross)이 교육과정에 유입될 위험. 합의된 전문직 기준의 약화.
평가(Assessment) 간헐적 시험, 제한된 시뮬레이션, 수행의 좁은 범위만 표집. AI 기반 시뮬레이션, 적응형 검사, 실제 수행 분석을 통한 지속적 평가. 대리지표(proxy metrics)에 대한 과도한 의존, AI 채점 모델의 불투명성, 측정된 수행과 전문직 가치 사이의 불일치.
피드백(Feedback) 지도자의 피드백이 간헐적이며 직접 관찰에 의존. 추론, 기록, 의사소통, 팀워크에 관한 실시간 AI 기반의 비판단적 피드백. 과도한 감시, 인지 과부하, 자동화된 피드백이 성찰적 판단이나 인간의 코칭을 밀어낼 위험.
학습자 지원(Learner Support) 멘토링에 대한 접근의 편차가 큼. 규모를 확장할 수 있는 AI 코칭 에이전트, 성찰적 동반자, 멘토 연결. 인간 멘토링의 보강이 아닌 대체, 비인격적 지침 또는 규범의 표류(normative drift).
직장 기반 학습(Workplace learning) 학습이 간헐적으로 포착되고 맥락은 체계적으로 분석되는 일이 드묾. AI가 업무 흐름, 결과, 팀 역동의 패턴을 드러내 실천 중 성찰(reflection-in-action)을 지원. 감시에 대한 우려, 학습 문화의 위축 효과(chilling effects), 성과 관리에 분석 자료가 오용될 위험.
전문직 정체성 발달(Professional identity development) 멘토링과 서사적 경험을 통해 천천히 나타남. 다중양식 AI 통찰이 가치와 의사소통을 중심으로 하는 정체성 형성을 가속. 전문직 정체성의 분절 또는 평면화, 모델이 높게 평가하는 행동을 향한 과도한 최적화와 지나친 가속.
발달의 주기(Cadence of development) 발달상의 도약 사이에 수년이 걸림. 빠르고 지속적인 통찰로 잦은 발달상의 향상이 가능. 공고화(consolidation) 없는 가속, 윤리적 성찰과 의미 구성에 필요한 시간의 부족.

결론 (Conclusion)

인공지능은 보건의료인이 직업 생애 전반에 걸쳐 학습하고 추론하고 협력하며 발달하는 방식에 중대한 변화를 가져온다. AI는 인지 환경을 희소성에서 풍요로 재구성하여 텐 카터의 다층적 틀에서 역량의 모든 층을 재편한다.

  • 정전적 역량은 생의학 지식을 머릿속에 보유하는 능력보다 AI가 매개한 근거를 탐색하고, 질문하고, 검증하는 능력에 더 가까워진다.
  • 맥락적 역량은 암묵적이고 경험에 기반한 상황인식에서 예측적 통찰, 업무 흐름 분석, 인간–AI 혼합 협력으로 풍부해진 데이터 성찰적 실천(data-reflexive practice)으로 발전한다.
  • 아마도 가장 불편하게 느껴질 변화는 한때 가장 불투명하고 측정하기 어려웠던 개인화된 역량이 의사소통, 추론, 감정, 웰빙에 대한 다중양식 데이터와 피드백을 통해 새롭게 접근 가능해진다는 점이다. 이는 에이브러햄 매슬로(Abraham Maslow)가 말한 것처럼 ‘미지의 것에 비교적 두려움을 느끼지 않는(relatively unfrightened by the unknown)’ 성숙하고 균형 잡힌 적응적인 임상의로 개인이 성장하는 데 도움이 될 수 있다.21

궁극적으로 AI 시대의 역량은 임상의가 무엇을 알고 있거나 개별 과제를 어떻게 수행하는가만의 함수가 아니다. 이는 분산된 인지 시스템(distributed cognitive systems) 안에서 현명하게 일하는 능력이다. 풍부한 정보와 인간의 통찰 사이에 균형을 맞추고, 알고리즘적 예측과 맥락의 미묘한 차이를 통합하며, 다중양식 데이터의 지원을 받아 지속적으로 성찰하는 능력이다.

 

전문직 역량의 미래는 이러한 종합에 있다. AI에 가려지는 것이 아니라 AI를 통해 더 강해지고, 알고리즘에 의존하기보다 알고리즘과의 사려 깊은 협력을 통해 역량을 발휘하는 임상의이다. 의도적인 설계를 통해 CPD는 임상의가 이러한 미래로 나아가도록 안내하고, 인지적 풍요가 수행 능력뿐 아니라 돌봄의 핵심에 있는 인간성도 높이도록 할 수 있다.

진료 실천을 위한 교훈 (Lessons for Practice) 

  • CPD 프로그램은 정전적 역량(기초 지식과 기술적 술기)의 초점을 생의학적 사실의 기억에서 효과적인 질문의 구성, AI가 생성한 근거의 검토, 임상 의사결정에 사용되는 정보의 타당성 평가로 다시 조정해야 한다.
  • CPD 활동은 임상의가 AI 도구를 인간–AI 혼합 팀워크, 적응형 업무 흐름, 전문직 간 조정에 통합할 수 있도록 준비시켜 맥락적 역량(실제 임상 환경에서의 지식 적용)을 강화해야 한다.
  • CPD는 의사소통, 추론, 웰빙에 관한 AI 기반 피드백을 활용하여 개인의 정체성 분화(personal identity differentiation)를 대체하기보다 보강함으로써 개인화된 역량(전문직 정체성, 가치, 성찰 능력)의 발달을 지원해야 한다.

 

 

Acad Med. 2025 Sep 1;100(9S Suppl 1):S4-S14. doi: 10.1097/ACM.0000000000006099. Epub 2025 May 26.

Josiah Macy Jr. Foundation Conference on Artificial Intelligence in Medical Education: Proceedings and Recommendations 

 

🤖 AI 시대, 의학교육은 무엇을 바꿔야 할까? Josiah Macy Jr. 재단 AI 컨퍼런스 권고안 읽기

📄 Josiah Macy Jr. Foundation. Josiah Macy Jr. Foundation Conference on Artificial Intelligence in Medical Education: Proceedings and Recommendations. Academic Medicine. 2025;100(9S):S4–S14. doi:10.1097/ACM.0000000000006099

 

안녕하세요! 오늘은 Josiah Macy Jr. 재단이 연 AI 컨퍼런스의 결과 보고서를 소개할게요. Macy 재단은 보건의료인 교육만 전문으로 지원하는 미국 재단이에요. 그동안 다직종 교육(IPE), 역량바탕 시간가변 교육(CBTV), 평가의 공정성 같은 주제로 컨퍼런스를 열고, 그때마다 권고안을 내서 의학교육계의 방향을 제시해 왔어요.

 

이번 주제는 의학교육에서의 인공지능(AI in Medical Education) 이에요. 2024년 11월 18~21일 미국 애틀랜타에서 AI와 의학교육 전문가 41명이 모였고, UCSF 내과 과장인 Robert Wachter가 기획위원장을 맡았어요. 결과물은 5개 권고(recommendations)와 22개 실행 단계(action steps) 예요.

 

한 줄로 줄이면 이래요. "AI는 이미 병 밖으로 나온 요정(genie)이다. 이제 의학교육은 이걸 안전하고, 형평하게, 효과적으로 쓰는 방법을 체계적으로 준비해야 한다."


📌 1. 왜 지금 이 컨퍼런스였나?

의료계는 사실 오래전부터 AI를 써 왔어요. 대부분 데이터 패턴으로 결과를 예측하는 예측 AI(predictive AI) 였죠. 그런데 2022년 11월 ChatGPT가 나오면서 판이 바뀌었어요. 사람처럼 콘텐츠를 만들어 내는 생성형 AI(generative AI) 가 전기, 컴퓨터, 인터넷처럼 범용기술(general purpose technology) 로 불리기 시작했거든요.

 

보고서가 인용한 하버드의대 교육 부학장 Bernard Chang의 말이 분위기를 잘 보여 줘요.

몇 년 안에 생성형 AI는 모든 것에 내장될 것이다.
"Within a few years, generative AI is going to be built into everything."

 

보고서는 이게 교육에 어떤 의미인지도 짚어요. 미국 의사와 간호사는 일주일에 거의 28시간을 서류 작업에 쓴다고 해요. 반복적인 서류 작업이나 단순 암기를 AI에 넘기면, 교수와 학습자 모두 인간만이 할 수 있는 활동에 시간을 더 쓸 수 있다는 거예요.

이론적으로, 반복적인 서류 작업이나 단순 암기 같은 특정 과제를 덜어내면 교수와 학습자 모두 의학에서 고유하게 인간적인 활동을 수행하고 배우는 데 더 많은 시간과 에너지를 쏟을 수 있다.
"In theory, offloading certain tasks, such as routine paperwork and rote memorization, could allow faculty and learners alike to devote more time and energy to performing—and learning—uniquely human activities in medicine."

 

여기서 말하는 "인간적인 활동"에는 비판적 사고, 적응적 학습, AI가 내놓은 감별진단이나 치료 옵션을 해석하고 검증하는 일, 신체진찰, 환자·가족과의 소통, 신뢰 관계 형성이 들어가요.


⚖️ 2. 기회와 위험, 둘 다 크다

🌱 기회: CBME와 정밀교육을 드디어 굴러가게 할 수도

 

  • 제가 가장 흥미롭게 본 부분이에요. 보고서는 AI가 역량바탕의학교육(CBME), 다직종 교육(IPE), 정밀교육(precision education) 을 앞당길 수 있다고 봐요. 이 모델들은 좋은 취지에도 불구하고 데이터와 분석 수단이 부족해서 제대로 구현하기 어려웠거든요.
  • 2021년 미국 국립의학아카데미(NAM) 보고서도 CBME가 "학습자별로 풍부한 프로그램식 평가 데이터(rich programmatic assessment data about each learner)"에 의존하다 보니, 그 데이터를 "관리하고, 시각화하고, 해석하는(managing, visualizing, and interpreting)" 일이 큰 과제라고 지적했어요. AI가 바로 이 부분을 도울 수 있다는 거죠. 실제로 자연어처리(NLP)로 서술형 피드백의 질을 평가하는 연구도 나오고 있고요.
  • 정밀교육의 정의도 옮겨 둘게요.

 

정밀교육은 "데이터와 기술을 활용해 개인, 프로그램, 조직 수준에서 개인화, 효율성, 주체성을 높임으로써 평생학습을 변화시킨다."
precision education "uses data and technology to transform lifelong learning by improving personalization, efficiency, and agency at the individual, program, and organization levels."

 

  • 실제 사례로 NYU의 DxMentor가 소개돼요. 병원 전자의무기록(EHR)과 교육자료 목록을 연결해서, 학습자가 최근 입원시킨 환자와 관련된 자료를 AI가 사람 개입 없이 골라 제공하는 적시(just-in-time) 도구예요.

 

⚠️ 위험: "수동적 실행자"가 될 수도

반대편의 우려도 꽤 무겁게 다뤄요. 저는 이 문장이 핵심이라고 봐요.

요구되는 기초의학지식의 범위와 깊이에 대한 명확하고 근거에 기반한 이해가 없다면, 미래의 의사는 AI로 증강된 환자진료의 능동적 관리자가 아니라 알고리즘 의사결정의 수동적 실행자가 될 수 있다.
"Without a clear and evidence-informed understanding of the scope and depth of foundational medical knowledge required of them, for example, future physicians may become passive implementers of algorithmic decision-making rather than active stewards of AI-augmented patient care."

 

2023년 NEJM 논평은 AI를 "판도라의 상자(Pandora's box)" 라고까지 불렀어요. 의학이 오랫동안 지켜 온 인지적 도제(cognitive apprenticeship), 노력을 들인 공부(effortful study), 의도적 연습(deliberate practice), 윤리적 규범을 흔들 수 있다는 이유였죠.

교육자들이 걱정하는 점은 이렇게 정리돼요.

  • 📝 학문적 진실성(academic integrity): 부정행위, 표절
  • 🎯 정확성과 신뢰성: 편향 재생산, 환각(hallucination)
  • 🏫 학습환경 훼손: 학습자의 과의존(overdependency), 자원 불평등 심화
  • 🔒 데이터 프라이버시와 보안: 환자(HIPAA)와 학습자(FERPA) 정보 보호

🗣️ 3. 컨퍼런스에서 나온 목소리들

🏥 병원 CEO의 시각

첫날은 사우스캐롤라이나 의대(MUSC) 병원 CEO인 Patrick Cawley의 대담으로 시작했어요. 그는 AI를 비용 절감과 의료 접근성 개선의 수단으로 보고 있었고, 의사의 업무시간 외 기록 작업을 줄여 번아웃을 완화하는 데 관심이 있다고 했어요. 교육과 관련해서는 이런 말을 남겼어요.

모두가 AI에게 질문하는 법을 배워야 한다. 매번 다른 답을 줄 수 있으니까. 거의 기술(art)에 가깝다.
"Everyone needs to learn how to query AI, because it could give you a different answer every time. There's almost an art to it."

📚 Macy 위탁 연구: AI 활용 현황 보고서

이어서 UCSF의 Christy Boscardin과 UIC의 Brian Gin이 재단 위탁 연구 결과를 발표했어요. 흥미로운 점은 이 연구 자체가 생성형 AI를 활용한 방법으로 2,000편 넘는 논문을 선별하고 정보를 추출했다는 거예요. 여기에 혁신가 인터뷰를 더했고요.

연구진은 AI 활용 사례를 5개 영역으로 정리했어요.

  1. 입학(admissions)
  2. 강의실 기반 교수·학습
  3. 작업장 기반 학습과 실무(workplace-based learning)
  4. 평가, 피드백, 인증
  5. 프로그램 평가와 연구

Boscardin은 CBME와의 관계를 이렇게 설명했어요.

역량바탕의학교육은 20년 동안 있어 왔지만, 특히 피드백, 데이터 관리, 실제적 평가를 둘러싸고 상당한 장벽과 걸림돌을 만났다. 새로운 AI 모델이 이를 해결하는 데 도움을 줄 수 있다.
"Competency-based medical education has been around for 20 years, encountering significant barriers and stumbling blocks, particularly around feedback and data management and authentic assessment, that newer AI models can help resolve."

그리고 우선순위로 의학교육 AI 역량 세트를 "시급히(urgent)" 만들어야 한다고 했어요. AI 때문에 달라지는 의사 역할을 반영해 기존 임상역량도 조정해야 하고, 윤리 기준, AI 산출물 모니터링 체계, 산업계와의 새로운 협력도 필요하다고 봤고요.

🧩 소그룹 논의와 컨퍼런스 목적 선언문

참가자들은 기초 교육과정, 경험 교육과정, 평가, 코칭과 피드백의 4개 그룹으로 나뉘어 논의했어요. 가상의 학습자가 의대부터 외과 전공의까지 AI를 만나는 종단 사례(longitudinal case study) 를 두고 토론했는데, 여기서 나온 과제 중 하나가 눈에 띄어요. AI 혁신과 상관없이 바뀌어서는 안 되는 의학교육의 핵심 요소가 무엇인지 찾자는 거예요.

최종 컨퍼런스 목적 선언문(Box 1) 은 이래요.

인공지능은 강력하고 빠르게 진화하는 기술이며, 의학교육계는 역량바탕의학교육을 최적화하고 현재와 미래의 의사가 양질의 환자중심 진료를 제공하는 고성과 팀의 일원으로 일할 수 있도록 준비시키기 위해 이를 안전하고, 형평하게, 효과적으로 활용해야 한다.
"Artificial intelligence is a powerful and rapidly evolving technology that the medical education community must harness safely, equitably, and effectively to optimize competency-based medical education and prepare current and future physicians to work as members of high-performing teams that provide high-quality, patient-centered care."

 

첫날을 마무리하며 한 참가자가 한 말도 인상적이었어요 💬

AI가 우리에게 '일어나는' 것이 아니라는 점을 기억해야 한다. AI는 우리가 늘 해 온 일, 즉 가능한 최선의 도구, 지식, 기술, 연구로 의사를 교육하는 일을 할 기회를 주고 있다. (...) 그 배당금을 어떻게 쓸지는 우리가 결정한다.
"We should keep in mind that AI is not happening to us [the medical education community]; it is presenting us with opportunities to do what we've always done, which is educate physicians using the best possible tools, knowledge, skills, and research. Incorporating AI [into medical education] is an opportunity that should pay us dividends that we decide how to spend."


🧭 4. 컨퍼런스를 관통한 네 가지 주제

① 교육·정책 프레임워크와 AI 도구 평가 역량

참가자 대부분이 AI 혁신가이자 얼리어답터였는데도 신중함을 강조했고, 무엇보다 거버넌스(governance) 를 우선순위에 두었어요.

모든 사람은 자신이 계속해서 더 많은 훈련이 필요하다는 걸 진심으로 이해할 정도까지 AI 교육을 받아야 한다.
"Everyone should be trained in AI to the point where they really understand that they will continually need more training."

 

Triola와 Rodman(2025)은 기관 차원의 안전장치(guardrails) 세 가지를 제안했어요.

 

  • ① 데이터를 보호하고 학업 상황에서 AI를 어디까지 써도 되는지 분명히 하는 정책,
  • ② 안전하고 윤리적인 AI 사용을 정의하고 감독하는 기관 내 거버넌스 기구,
  • ③ 책임 있는 AI 사용을 위한 학습자 역량과 교육과정이에요.

 

특히 흥미로운 건 Gin 등이 제안한 위임(entrustment) 개념의 적용이에요. 의학교육의 EPA 논리를 AI에게 그대로 적용해 보자는 거죠.

위임 모델은 어떤 과제를 AI가 잘 수행하리라 믿을 수 있고 어떤 과제는 그럴 수 없는지 결정하는 데 도움이 될 수 있다. 개별 수련생이 서로 다른 수준의 감독과 자율성 아래 환자진료 기능을 수행하도록 신뢰받거나 신뢰받지 못하는 것과 마찬가지로 말이다.
"The entrustment model could be used to help us decide which tasks we can rely on AI to perform well and which ones we can't, just as individual trainees are trusted or maybe not trusted to perform patient care functions with different levels of supervision and autonomy."

② 형평성, 편향 완화, 학습자와 환자 중심

 

  • 형평성 논의는 주로 접근성에 모였어요. 장애가 있거나, 영어가 능숙하지 않거나, 기술에 익숙하지 않거나, 최신 AI 모델의 구독료를 감당할 수 없는 학습자와 교육자는 소외될 수 있어요. 자원이 적은 기관도 마찬가지고요. 그래서 모든 의대생에게 제공해야 할 기본 학습경험(baseline learning experience) 을 정해야 한다고 봤어요.
  • AI가 학습한 데이터 자체가 편향돼 있을 수 있으니, 편향을 알아볼 수 있는 전문가가 검토하고 도입 후에도 지속적으로 모니터링해야 한다는 점도 강조했어요. 학습자의 미래 수행을 예측하는 도구처럼, 학습자나 환자가 동의하지 않은 데이터 2차 활용에 대한 투명성도 중요한 쟁점이었고요.
  • 재미있는 아이디어도 있었어요. 실제 환자들의 기술 활용 수준이 천차만별이니, 학습자도 AI를 전혀 안 쓰는 가상환자부터 AI에 푹 빠진 가상환자까지 다양하게 만나 봐야 한다는 제안이에요. 🧑‍💻👵

 

③ 새로운 임상가 역할과 관계

 

  • Ng 등(2023)의 틀에 따르면 미래 임상가는 AI의 소비자(consumers), 번역자(translators), 개발자(developers) 로 나눌 수 있어요.
    • 소비자는 AI 도구를 고르고 효과적으로 쓸 줄 알면 되고,
    • 번역자는 소비자이면서 어느 정도 개발도 할 수 있는 사람,
    • 개발자는 임상 전문성 위에 깊은 AI 역량을 갖춘 사람이에요.
  • 한 참가자는 AI를 인지적 도구로만 보는 시각을 넘어서자고 했어요.

 

지금까지 의학교육에서는 AI를 인지적 과제로 생각하는 경향이 있었다. 임상추론을 어떻게 발전시킬 수 있을지에 집중했다. 하지만 이건 대인 상호작용과 관계 역학의 문제이기도 하다. 임상가와 환자 사이, 그리고 진료팀 안팎의 관계 말이다. 나는 이것이 환자진료에 더 인본주의적이고 총체적인 팀 접근을 위한 여지를 만들 것이라고 생각한다.
"In medical education so far, we tend to think about AI as a cognitive exercise; we focus on how it can advance clinical reasoning. But it's also about interpersonal interaction and relationship dynamics—between clinicians and patients and within and among care teams. I think it's going to create room for a more humanistic and global team approach to patient care."

 

 

  • 이 참가자는 AI를 진료팀의 또 다른 구성원으로 생각하자고 제안했어요.
  • 또 하나 중요한 키워드가 인간 참여 감독(human-in-the-loop oversight) 이에요. AI 산출물은 당분간 불완전할 테니, 임상가가 핵심 기술을 유지하면서 안주(complacency) 와 자동화 편향(automation bias) 을 피하도록 준비시키는 게 필수라는 거예요. 참가자들은 특히 기초생물과학 지식과 그것을 임상추론에 적용하는 능력을 유지하는 게 중요하다고 입을 모았어요.
  • AI가 일부 직종을 대체할 수 있다는 우려도 나왔지만, 논의는 계속 "AI는 임상가를 보완하는 도구"라는 쪽으로 돌아왔어요. Sezgin(2023)의 표현이에요.

 

인간과 AI의 협업은 "보건의료 제공자의 인지적 강점과 AI의 분석 능력을 결합"하며, "AI 시스템이 인간 전문성에 의해 안내되고, 소통되고, 감독되도록 보장함으로써 의료서비스의 안전과 질을 유지한다."
collaboration between humans and AI "combines the cognitive strengths of health care providers with the analytical capabilities of AI" and "ensures that AI systems are guided, communicated, and supervised by human expertise, thereby maintaining safety and quality in health care services."

④ 협력, 파트너십, 연구 의제

 

  • 생성형 AI 도입은 시간이 급하고, 돈과 기술 전문성이 많이 들어요. 그래서 독립성이 강한 학술의료기관들도 이제 서로, 그리고 기술 기업과 협력해야 한다는 거예요.
  • 연구에 대해서는 꽤 비판적인 인용이 나와요.

 

AI 연구는 흔히 부실하게 보고되고, 많은 검증 연구가 결함 있는 방법론을 보이며, 마케팅은 종종 환자에 대한 AI 응용의 입증된 이점을 과장한다.
"AI research is frequently poorly reported, many validation studies exhibit flawed methodology, and marketing often overstates the evidenced benefit for AI applications for patients."

 

  • 그리고 연구자라면 누구나 공감할 고민도 있었어요 😅

 

비싼 연구비를 받아 연구를 수행하고 출판할 때쯤이면, 당신이 다룬 기술은 이미 구식이 되어 있다.
"By the time you get your very expensive research funded, conducted, and published, the technology you've focused on is already obsolete."

 

  • 보고서는 이 부분을 다시 Chang 부학장의 말로 정리해요.

 

아마 수십 년에 한 번쯤, 우리가 의대생을 가르치는 방식과 그들이 의사가 되었을 때 할 수 있기를 기대하는 것에 진정한 혁명이 일어난다. 지금이 바로 그런 때다.
"Maybe once every few decades a true revolution occurs in the way we teach medical students and what we expect them to be able to do when they become doctors. This is one of those times."


📊 5. 5개 권고와 22개 실행 단계 

이제 본론인 권고안이에요. 먼저 전체 구조를 표로 볼게요.

권고 실행 단계
1. 안전하고 효과적인 AI 도입 촉진 1.1 AI 교육과정과 역량 도입
1.2 AI 시대 의사 기초역량 재평가
1.3 인증·면허·자격 기준 수정
1.4 교육자의 AI 활용 지원
1.5 개인·조직의 적응력 강화
1.6 파트너십 구축
2. 공동생산(co-produced)한 AI 기반 교수·학습·평가 도입 2.1 AI 놀이터(AI playgrounds) 개발
2.2 기존 교수전략 개선에 AI 활용
2.3 AI 시대에 맞게 평가 프로그램 조정
3. 탄탄한 데이터 생태계(data ecosystems) 구축 3.1 데이터 시스템 통합
3.2 평가 데이터의 투명성
3.3 CBME와 정밀교육 수용
3.4 데이터 기반 인증
4. 윤리적 AI 거버넌스와 책임 있는 활용 4.1 포괄적 AI 프레임워크와 윤리 지침
4.2 전국 모범사례 네트워크 구축
5. 의학교육 AI 연구 진흥 5.1 AI 교육 효과 연구
5.2 참여적 연구
5.3 과감한 연구 지원
5.4 보고 기준
5.5 확산 개선
5.6 학제 간·산업계 협력
5.7 AI와 의학의 전략적 비전 수립

전부 설명하긴 길어서, 제가 보기에 특히 의미 있는 대목만 골라 볼게요 ✍️

🔑 권고 1: 무엇을 더하고, 무엇을 뺄 것인가

1.1에서는 AI의 형태, 기능, 능력, 한계, 사회적 함의를 다루고, 도구를 비판적으로 평가하고 환각과 편향 같은 약점을 완화하는 기술까지 가르치라고 해요. 그리고 교육과정의 효과를 학습자와 환자 성과로 평가하라고 하고요.

제가 가장 중요하다고 본 건 1.2예요. AI 시대에 맞게 의사 기초역량을 다시 보자는 건데, "무엇을 뺄지"까지 고민하라고 해요.

의사 업무 중 어떤 요소를 AI에 위임해야 하는지, 그리고 AI가 가능한 환경에서 수련생에게 더 이상 필수적이지 않을 수 있어 기존 교육과정에서 제거해야 할 요소는 무엇인지 신중하게 고려해야 한다.
"They should carefully consider which elements of physician work should be entrusted to AI and which elements of the existing curriculum should be removed because they may no longer be essential for trainees in AI-enabled environments."

그런데 바로 이어서 신중해야 한다는 단서도 달아요.

이러한 고려는 AI 도구의 가용성과 효과가 어느 정도 예측 불가능하고 진료 환경마다 균일하지 않다는 점, 그리고 가까운 미래에는 의사가 진단과 치료 같은 영역에서 고부담 AI 산출물을 감독하는 책임을 지게 될 것이라는 점을 인정해야 한다.
"These considerations should recognize that the availability and effectiveness of AI tools are both somewhat unpredictable and not uniform across care settings, and that—for the foreseeable future—physicians will be charged with overseeing high-stakes AI outputs in areas like diagnosis and therapy."

 

그 밖에 이런 제안이 있어요.

  • 1.3: 인증, 면허, 자격 기관이 AI 역량을 기준과 면허·자격 평가에 넣는 방안 검토
  • 1.4: 교수개발 지원, 컴퓨팅 인프라 제공, 문서 초안 작성이나 수작업 채점 같은 저가치 반복 업무(low-yield, routine tasks) 를 AI에 넘기기
  • 1.5: 정기적으로 모여 역량과 교육과정을 업데이트하는 AI 교육과정 검토위원회(AI curriculum review board)
  • 1.6: 학부와 졸업후 교육을 아우르는 교육 디지털혁신실(Office of Educational Digital Innovation)

🎮 권고 2: 함께 만들고, 마음껏 실험하라

권고 2의 핵심어는 공동생산(co-production) 이에요. 학습자, 교수, 다직종 팀원, 환자, AI 전문가가 함께 플랫폼을 만들자는 거죠.

2.1 AI 놀이터(AI playgrounds) 는 이름부터 재밌어요. 학습자와 교수가 실제 운영 환경의 제약 없이 AI 도구를 탐색하고 실험할 수 있는 안전한 공간이에요.

2.3 평가 부분은 꽤 과감해요.

AI 도구가 임상 실무에 스며들 것임을 인식하고, 따라서 평가 환경에도 스며들어야 한다.
"Recognize that AI tools will permeate clinical practice and, thus, should also permeate the assessment environment."

AI를 평가에서 "막아야 할 것"으로만 보지 말고, 실제 진료처럼 평가에도 들여오라는 거예요. 또 의사소통, 시스템기반 진료, 전문직업성처럼 전통적으로 측정하기 어려웠던 역량을 AI로 평가하는 방안도 검토하라고 해요.

🗄️ 권고 3: 교육 데이터와 임상 데이터를 잇자

표준화된 스키마와 공유 어휘(standardized schema and a shared vocabulary) 로 교육 데이터와 임상 데이터를 합친 데이터 생태계를 만들자는 권고예요. 양방향 데이터 통합(bidirectional data integration) 을 하면 임상 실무가 교육에 정보를 주고, 반대로 교육이 임상 성과에 어떤 영향을 주는지도 측정할 수 있어요.

 

제가 눈여겨본 건 3.2 학습자 데이터 주권이에요.

공동생산과 투명한 사용, 그리고 가능한 경우 형성평가 데이터에 대한 소유권을 통해 학습자에게 권한을 부여하고 그들의 안전과 신뢰를 우선시하라.
"Empower learners and prioritize their safety and trust through co-production and transparent use—and, where feasible, ownership—of their formative assessment data."

 

 

  • 3.3에서는 AI 평가가 교수의 관찰을 대체하는 게 아니라 함께 가야 한다고 분명히 해요.
  • 3.4에서는 인증기관에게 인증 심사 과정, 보고서, 결정에 AI를 쓴다면 그 사실을 투명하게 밝히라고 권고해요. 🔍

 

🛡️ 권고 4: 윤리적 거버넌스

AMA, AAMC, AACOM, ACGME, ABMS 같은 기관들이 협력해서 포괄적 AI 프레임워크와 윤리 지침을 만들고, 전국 모범사례 네트워크(national best practices network) 를 꾸리자는 권고예요. 이 네트워크는 검증된 AI 교육자원을 무료로, 형평하게 쓸 수 있는 중앙 저장소를 운영하고, 교육과정, 교수개발, 윤리, 평가별 워킹그룹을 두는 형태를 제안해요.

🔬 권고 5: 연구, 더 엄격하게 그리고 더 빠르게

  • 5.1: AI 기반 교육 개입을 기존 표준과 비교하는 엄격한 실험·관찰 연구. 편향과 불평등 같은 의도하지 않은 결과도 평가
  • 5.2: 학습자, 교육자, 환자, 행정가가 참여하는 참여적 연구(participatory research)
  • 5.4: AI 관련 교육연구의 보고 기준(reporting standards) 합의
  • 5.5: 더 빠르고 효율적인 연구 확산 방식
  • 5.7: AI 시대 의사의 미래 역할에 대한 전략적 비전 수립

✅ 6. 결론: 측정과 적응력

보고서의 결론은 짧아요.

AI의 빠른 진화를 고려할 때, 엄격한 측정(의도한 결과와 의도하지 않은 결과 모두)과 적응력을 갖춘 접근이 필수적일 것이다. 그래야 이 놀라운 새 도구를 활용하면서도 우리의 변함없는 목표, 즉 최첨단 기술을 활용해 인간의 건강을 증진하는 의사를 양성한다는 목표를 지킬 수 있다.
"Given the rapid evolution of AI, an approach incorporating rigorous measurement (of both intended and unintended consequences) and adaptability will be essential as we harness these remarkable new tools while preserving our enduring goal: training physicians who leverage cutting-edge technology to promote human health."


💡 7. 읽으며 든 생각과 한국 의학교육에 주는 시사점

마지막으로 제 생각을 조금 덧붙일게요. 어디까지나 제 해석이에요.

 

  • ① 읽기 전에 알아 둘 한계 🧐
    • 보고서 스스로 밝히듯, 참가자 대부분이 AI 혁신가와 얼리어답터였어요. 또 Macy 컨퍼런스 권고는 "합의이지만 모든 항목에 만장일치를 뜻하지는 않는다" 고 명시돼 있어요. 권고의 방향이 전반적으로 적극적인 건 이런 구성과도 관련이 있을 거예요. 흥미롭게도 이 보고서 자체도 참가자 동의를 받아 녹음한 논의를 AI로 요약한 자료를 활용해 작성했다고 투명하게 밝히고 있어요.
  • ② "무엇을 뺄 것인가"라는 질문 ✂️
    • 권고 1.2는 역량을 더하는 것만큼 빼는 것을 진지하게 고민하라고 해요. 그런데 동시에 기초과학 지식과 임상추론은 반드시 지켜야 한다고 강조하죠. "AI 때문에 무엇이 덜 중요해졌는가"와 "AI 때문에 무엇이 더 중요해졌는가"를 함께 따져 보는 작업이, 교육과정 개편을 준비하는 학교라면 피할 수 없는 과제일 것 같아요.
  • ③ 앞 글(AAMC 기초역량)과 이어서 보기 🔗
    • 지난번에 소개한 미국 UME 기초역량에도 "신기술을 활용해 지식에 접근한다", "신기술 사용의 위험과 이익을 평가한다"는 세부역량이 이미 들어가 있었죠. 이번 Macy 권고는 여기서 한 걸음 더 나가서 별도의 AI 역량 세트, 인증·면허 기준 반영, 평가 환경의 변화까지 요구하고 있어요. 두 문서를 함께 보면 미국 의학교육이 어느 방향으로 움직이는지 꽤 잘 보여요.
  • ④ 데이터 생태계와 거버넌스는 우리에게도 숙제 🗂️
    • CBME와 WBA를 확대하다 보면 결국 평가 데이터를 어떻게 모으고, 통합하고, 해석할 것인가의 문제에 부딪혀요. 이번 권고는 그 해법의 하나로 AI를 제시하면서도, 학습자 데이터의 투명성과 소유권, 편향 모니터링, 인증기관의 AI 사용 공개까지 함께 요구해요. 우리 기관에 AI 사용 정책이나 거버넌스 기구가 있는지, 학습자 데이터를 누가 어떻게 쓰는지부터 점검해 보면 좋겠다는 생각이 들어요.

 


📝 정리하며

  • Macy 재단이 2024년 11월 AI·의학교육 전문가 41명과 함께 5개 권고, 22개 실행 단계를 내놓았어요.
  • AI는 CBME와 정밀교육의 오랜 걸림돌(데이터, 피드백, 실제적 평가) 을 풀 수 있는 기회지만, 의사를 알고리즘의 수동적 실행자로 만들 위험도 있어요.
  • 핵심 키워드는 거버넌스, 형평성, 공동생산, 인간 참여 감독(human-in-the-loop), 데이터 생태계, 엄격한 연구예요.
  • 기초역량을 다시 보고 무엇을 AI에 맡기고 무엇을 뺄지 고민하되, 기초과학 지식과 임상추론은 지켜야 한다고 강조해요.
  • 결론은 엄격한 측정과 적응력이에요.

같은 부록에 실린 Boscardin·Gin의 Macy 혁신 보고서 Part I, II(Acad Med 2025;100(9S):S15–S29)와 Gin 등의 AI를 위한 위임과 EPA 논문(Acad Med 2025;100(3):264–272)도 함께 읽어 보시면 좋아요. 📎

덧붙여, 이 컨퍼런스를 이끈 Macy 재단 이사장 Holly J. Humphrey 박사는 보고서가 나오기 전인 2025년 4월 17일에 세상을 떠났어요. 미국 최초의 화이트코트 세리머니를 이끌었고, 학생들이 뽑은 최우수 교수상을 25번 받은 분이에요. 삼가 고인의 명복을 빕니다. 🕊️


인공지능(artificial intelligence, AI)은 의료를 포함한 사회의 모든 부문을 변화시킬 기회를 만들고 있다. 투명성(transparency), 책무성(accountability), 윤리(ethics)의 원칙에 뿌리를 두고 AI를 신중하게 도입한다면, 우리는 보건의료체계를 더 효율적이고 효과적이며 형평성 있게 만들 수 있다.1,2 이러한 성과를 달성하고 잠재적인 부정적 결과를 피하려면, 현재와 미래의 AI 기술을 활용하는 능력에 점점 더 의존하게 될 의사와 다른 보건의료 전문직의 교육·훈련도 이에 발맞추어 AI를 활용하는 방향으로 전환해야 한다.

 

의료계는 수십 년 동안 AI를 사용해 왔으며, 주로 데이터의 추세와 패턴을 분석하여 결과를 예측하는 예측형 AI(predictive AI)를 이용했다(AI 용어집은 http://links.lww.com/ACADMED/B719의 디지털 보충 부록 1 참조). 그러나 최근 방대한 데이터에서 학습한 패턴을 바탕으로 ‘인간과 유사한’ 콘텐츠를 생성하는 생성형 AI(generative AI)가 등장하면서 전 세계적으로 큰 반향을 일으켰고, 의료와 그 밖의 분야에서 AI에 대한 관심이 급격히 높아졌다. 보건의료체계 전반에서 OpenAI의 GPT, Google의 Gemini, Anthropic의 Claude와 같은 생성형 AI 도구가 행정, 임상 진료, 연구에 활용될 가능성이 탐색되고 있다. 환자들도 건강 관리를 돕기 위해 생성형 AI 도구를 사용한다. 보건의료 전문직 교육(health professions education)에서는 학부 및 대학원 단계의 입학 선발, 교수·학습, 학습자 평가(assessment), 프로그램 평가(evaluation), 연구를 향상할 잠재력을 지닌 생성형 AI 응용 프로그램을 탐색하고 도입하고 있다.3 또한 생성형 AI는 전문직 간 교육(interprofessional education), 역량바탕 의학교육(competency-based medical education), 정밀교육(precision education)을 포함한 성과 중심 교육 틀로의 전환을 가속할 것으로 기대된다.2–5 하버드 의과대학 의학교육 학장인 Bernard Chang 박사는 2024년에 “몇 년 안에 생성형 AI가 모든 것에 내장될 것”이라고 말했다.6

 

미국과 전 세계에서 이처럼 새로운 의료 환경이 펼쳐지는 가운데, 의학교육계는 계속 진화하는 AI가 교수·학습·학습자 평가·프로그램 평가에 책임 있고 윤리적인 방식으로 통합되도록 노력해야 한다. 이러한 필요성이 2024년 11월 조시아 메이시 주니어 재단(Josiah Macy Jr. Foundation)이 개최한 회의의 동기가 되었으며, 이 회의에는 AI와 의학교육 전문가 41명이 모였다. 재단 회장인 Holly J. Humphrey 박사는 “건강을 개선하기 위한 수단으로서 보건의료 전문직 교육의 향상에만 전념하는 유일한 전국적 지원 기관인 조시아 메이시 주니어 재단은 현재와 미래 학습자의 교육·훈련에 AI의 힘을 활용하려는 의학교육자들의 노력을 지원할 책임이 있다”고 설명했다. 이 보고서는 회의 경과를 개괄하고, 교수·학습에 AI를 통합하는 데 초점을 맞춘 일련의 권고안을 의학교육계에 제시한다.

회의의 배경, 개요, 목적 (Conference Background, Overview, and Purpose) 

2022년 11월 OpenAI는 무료 버전의 ChatGPT를 공개했고, 이는 곧 현대사에서 가장 빠르게 도입된 기술이 되었다.7 생성형 AI는 거의 모든 인간 활동에 영향을 미칠 잠재력 때문에 전기, 컴퓨터, 인터넷과 함께 범용 기술(general purpose technology)로 일컬어진다.8 의료 분야에서는 과거 상당한 인적 노력이 필요했던 업무를 수행하도록 생성형 AI로 강화한 도구가 개발되고 있다.9 최근 한 연구에 따르면 미국의 의사와 간호사는 환자기록 유지, 보험 서류 작성, 시술 기록 등을 포함한 서류 업무에 일주일에 거의 28시간을 쓴다.10 이론적으로 일상적인 서류 업무나 기계적인 암기와 같은 특정 과업을 AI에 맡기면 교수자와 학습자 모두 의학 고유의 인간적 활동을 수행하고 배우는 데 더 많은 시간과 에너지를 쏟을 수 있다. 여기에는 비판적 사고와 적응적 학습 능력, 감별진단이나 새로운 치료 선택지에 관한 AI 생성 응답의 해석과 검증, 신체진찰 및 기술의 도움을 받는 환자 진찰, 환자·가족과의 소통, 환자·동료와 신뢰 관계 구축이 포함될 수 있다.

의학교육에서 AI의 기회와 위험 (Opportunities and risks of AI in medical education) 

생성형 AI는 평범한 과업의 수행을 넘어, 대량의 자료(예: 환자 진료기록, 학술논문, 미디어 파일) 요약, 임상 문서 작성, 데이터 분석, 교육과정 개발, 개인화 학습, 임상 상황 시뮬레이션, 수련생 평가, 프로그램 평가, 실시간 튜터링 또는 코칭과 같은 고차원적 활동까지 AI의 능력을 빠르게 확장했다. 이러한 AI 역량은 전문직 간 교육, 역량바탕 의학교육, 정밀교육의 발전을 가속하고 있다. 이 교육 모형들은 환자와 학습자의 성과를 개선하기 위한 것이지만, 데이터와 적절한 분석 방법의 부재 때문에 부분적으로 시행하기 어려웠다.2,4,5 지난 15년 동안 메이시 재단은 연구비 지원, 회의, 권고안 보고서·단행본·학술지 특별부록 발행을 통해 의과대학과 임상 학습환경에서 전문직 간 교육과 역량바탕 교육을 발전시키려는 의학교육자들의 노력을 적극적으로 지원해 왔다.11–13 새롭게 등장한 정밀교육은 미국의사협회(American Medical Association)의 ChangeMedEd 사업에서 우선순위가 높은 중점 분야14이며, 메이시 재단의 의학교육 지원 우선순위와 목표에도 부합한다.

 

AI를 의학교육에 적용할 때 기대되는 흥미로운 가능성 중 하나는 역량바탕 의학교육의 시행을 돕는 것이다. 역량바탕 의학교육은 의미 있고 형평성 있는 평가를 우선시하며, 학습자가 양질의 환자 진료를 보장하기 위해 설정된 역량을 습득하도록 하는 데 초점을 맞춘다. 역량바탕 접근법은 세계 여러 지역의 임상 수련에서 널리 사용되지만,15 “복잡성, 표준화 부족, 제한된 경험적 근거, 잠재적인 평가 편향” 때문에 충분하고 효과적으로 시행하는 데 어려움이 있었다.16 2021년 미국국립의학한림원(National Academy of Medicine, NAM) 보고서에 따르면 역량바탕 의학교육은 “각 학습자에 관한 풍부한 프로그램 차원 평가 자료”에 의존하기 때문에 “학습에 활용할 수 있도록 그러한 자료를 관리하고 시각화하고 해석”하는 데 어려움이 있으며, AI를 사용하면 이 모두에 잠재적으로 대응할 수 있다.2 서술형 피드백(narrative feedback)의 질을 평가하기 위해 자연어처리(natural language processing)를 사용하는 등, AI를 활용하여 역량바탕 교육의 일부 요소를 개선할 수 있음을 보여 주는 유망한 연구들이 발표되었다(자연어처리 등의 AI 용어집은 http://links.lww.com/ACADMED/B719의 디지털 보충 부록 1 참조).17

 

보다 최근에는 의학교육자들이 최적화된 개인맞춤형 의학교육 모형으로 정밀교육을 채택하기 시작했다. 정밀교육은 임상의가 개별 환자에게 치료를 맞추는 정밀의학(precision medicine)의 개념과 맥을 같이하며, 형평성과 풍부한 평가를 포함하는 역량바탕 교육의 우선순위도 포괄한다. 정밀교육은 “데이터와 기술을 사용해 개인·프로그램·조직 차원의 개인화, 효율성, 주체성(agency)을 높임으로써 평생학습을 변화시킨다.”18 DxMentor가 실제 사례다. 뉴욕대학교 의학교육자들이 개발·도입한 이 도구는 병원의 전자의무기록(electronic health record) 시스템과 교육자료의 디지털 목록을 연결하여, 학습자와 지도교수에게 최근 입원시킨 환자의 건강 요구와 관련된 자료를 제공한다.19 각 학습자의 요구에 맞게 자료를 제공하는 이 적시 학습(just-in-time) 도구의 콘텐츠는 사람의 개입 없이 AI가 선별한다.

 

AI가 의학교육을 발전시킬 잠재력에 큰 기대가 쏠리지만, 의학교육자와 연구자들은 회의적인 시각도 보인다. 예를 들어 미래의 의사가 자신에게 필요한 기초 의학 지식의 범위와 깊이를 명확하고 근거에 기반하여 이해하지 못한다면, AI로 보강된 환자 진료를 능동적으로 관리하기보다 알고리즘의 의사결정을 수동적으로 실행하는 사람이 될 수 있다.

 

  • 2023년 《뉴잉글랜드 의학저널》(New England Journal of Medicine)의 논평은 AI가 인지적 도제학습(cognitive apprenticeship), 노력이 수반되는 공부, 의도적 연습(deliberate practice), 윤리적 준칙이라는 의학의 오랜 전통을 뒤흔들 수 있다는 이유로 의학교육에서의 AI를 “판도라의 상자”라고 불렀다.20
  • 마찬가지로 《가정의학》(Family Medicine)의 한 사설은 의학교육에서 AI 적용을 “고위험 활동”으로 규정하고, 도구를 널리 사용하기 전에 “안전하고 검증되었는지” 확인할 수 있도록 사람의 감독을 촉구했다.21
  • Ng와 동료들에 따르면 현재 의료 인력의 AI 지식과 기술 수준은 “낮으며”, 이 때문에 배포·시행 과정에서 부정확성과 편향, 윤리적 난제, 불명확하거나 집행되지 않는 거버넌스, 해석하거나 설명할 수 없는 모델 작동 방식과 같은 “심각한 문제”가 생길 수 있다.22

 

의학교육자들은 AI가 교육 현장에 빠르게 진입하는 데 대해 추가적인 우려도 품고 있다. 여기에는

 

  • 학문적 진실성(academic integrity)에 관한 우려(예: 학습자의 부정행위와 표절 기회),
  • AI 도구의 정확성과 신뢰성에 관한 우려(예: 편향을 영속화하거나 ‘AI 환각(AI hallucinations)’이라고 하는 조작된 결과를 포함해 부정확한 답을 생성할 가능성),
  • 복잡한 학습환경에 대한 위해 우려(예: 학습자가 AI에 지나치게 의존하거나 교수·학습의 자원 불평등을 악화할 가능성)가 포함된다.21,23
  • 데이터의 사생활 보호와 보안도 우려 대상이다. AI가 의료와 의학교육에 더욱 깊숙이 스며들고 의사결정에서 데이터 사용이 기하급수적으로 늘어나면서, 건강보험 이동성 및 책무성에 관한 법률(Health Insurance Portability and Accountability Act, HIPAA)과 가족 교육권 및 사생활 보호법(Family Educational Rights and Privacy Act, FERPA)이 요구하는 환자와 학습자의 개인정보 보호 문제도 확대된다.21

 

일부 의학교육 지도자와 기관은 AI 정책, 원칙, 역량을 제안했다.24,25 의학교육을 발전시키는 동시에 혼란을 초래할 수도 있는 AI의 막대한 잠재력, 그리고 앞으로 나아가기 위한 권고안을 함께 구상할 필요성에 따라 메이시 재단은 의학교육과 AI 분야의 저명한 전문가·혁신가들로 회의 기획위원회를 구성했다. 재단 이사회 위원이자 캘리포니아대학교 샌프란시스코(UCSF) 의과대학 내과 학과장인 Robert Wachter 박사가 이끈 이 위원회(아래의 회의 참가자·저자 명단 참조)는 2024년 11월 18~21일 조지아주 애틀랜타에서 개최된 ‘2024 메이시 재단 의학교육 AI 회의’를 설계했다.

의학교육 AI의 현재 현황과 미래 방향 (Current landscape and future directions of AI in medical education) 

회의 첫날은 의학교육에서 AI에 관한 논의를 진전시킬 동료 공동체를 모으는 데 초점을 맞췄다. 회의는 사우스캐롤라이나주 최대 학술의료체계인 사우스캐롤라이나 의과대학교(Medical University of South Carolina, MUSC) Health의 최고경영자 Patrick Cawley 박사가 학술의료센터와 의료체계의 일상 업무에 AI를 통합할 때 따르는 기회와 과제를 설명하는 것으로 시작했다. 이어 UCSF의 Christy Boscardin 박사와 일리노이대학교 시카고의 Brian Gin 박사가 메이시 재단의 의뢰로 수행한 의학교육 AI 현황 연구보고서(이 특별부록에 두 편으로 나누어 출판됨)를 발표하며 현재 상태와 미래의 기회·과제를 요약했다.26,27 첫날은 소그룹 및 전체 토론으로 마무리되었으며, 참가자들은 권고안을 작성하고 이에 대한 합의를 구축할 토대를 마련했다.

AI에 대한 의료체계 최고경영자의 관점 (A health system CEO’s view of AI) 

환자 진료, 보건의료 전문직 교육, 연구에 사명을 둔 학술의료체계와 학술의료센터는 의료 분야 AI 혁명의 중심에 서 있다. Wachter 박사의 인터뷰에서 Cawley 박사는 MUSC의 디지털 전환이 2019년에 공식적으로 시작되었고, 2022년 ChatGPT 출시 이후 더욱 가속되었다고 말했다. 그는 “[ChatGPT가 등장했을 때] 우리는 곧장 출발했습니다. [우리는] 기존의 방식을 계속할 수 없다는 것을 알았습니다”라고 말했다. Cawley 박사는 기회와 함께 경쟁상의 위협도 인식했다. 다른 의료체계가 AI를 효과적으로 통합하는 동안 MUSC가 뒤처진다면 “우리는 낙오할 것”이라고 했다.

 

Cawley 박사는 의료체계 최고경영자로서 MUSC 환자들이 우려하는 두 가지 문제, 즉 상승하는 의료비와 의료 접근의 장벽에 초점을 맞춘다고 말했다. 그는 AI가 주로 효율성을 높여 이러한 우려에 대응할 수 있다고 믿는다. 그는 “이전에 보지 못한 방식으로 비용을 유발하는 관료적 절차를 실제로 없앨 수 있습니다”라고 말했다. Cawley 박사는 비용보다 더 큰 걱정거리이지만 해결하기도 더 어려운 의료 접근성 확대 능력에 대해서도 열의를 보였다. 특히 1차의료를 비롯한 모든 전문과목에 의사가 부족하므로 그는 접근성을 높일 방안을 생각하는 데 많은 시간을 쓴다. 그는 AI 도구를 사용한 환자 차트 요약, 진료 계획의 공백 파악, 약물 최적화, 최적의 진료 장소 결정 등을 포함하여 “환자 진료 중, 특히 의학적으로 복잡한 환자를 볼 때 개선할 수 있는 일이 많다”고 말했다. AI가 가져올 효율성 향상이 역설적으로 의사에게 맡겨지는 환자 수를 늘려 업무량을 확대할 수 있다는 의사와 환자 모두의 우려에 대한 질문을 받자, Cawley 박사는 진료기록을 갱신하고 보험 서류를 작성하느라 근무시간 이후까지 일할 필요를 없애는 등 AI를 사용해 의사의 소진을 완화하고 직무 만족도를 높이는 데 관심이 있다고 말했다.

 

특히 의학교육에 AI가 미칠 영향에 관한 질문에 Cawley 박사는 의학교육이 씨름해야 할 엄청난 변화 가능성을 설명했다. 여기에는 교육과 훈련에도 통합해야 하는 임상 진료 기술의 급속한 발전이 포함된다. 그는 “어떤 AI 강화 도구를 사용하고 어떻게 사용할지 모두가 빠르게 익히도록 해야 합니다”라고 말했다. 의료체계는 잠재적인 정확성·보안 문제에 대응하고 AI 도구의 안전성을 보장해야 한다고 했으며, 특히 생성형 AI 도구에 프롬프트(prompt)를 입력하는 방법과 결과의 타당성을 평가하는 방법을 사용자에게 즉시 가르쳐야 한다고 강조했다. 그는 “모두가 AI에 질문하는 법을 배워야 합니다. 매번 다른 답을 줄 수 있기 때문입니다. 거의 일종의 기술입니다”라고 말했다.

의학교육 AI 현황 보고서 (Report on AI landscape in medical education) 

회의 전에 참가자들은 의학교육에서 현재 AI의 현황을 조사하고 미래에 대한 함의를 제시한 의뢰 연구보고서인 「의학교육 AI에 관한 메이시 재단 혁신 보고서」(The Macy Foundation Innovation Report on AI in Medical Education)를 읽었다. 이 보고서는 이 특별부록에 두 편으로 출판되었다.26,27 책임연구자인 Boscardin과 Gin도 회의에서 연구의 세부사항을 발표했다. 이들은 생성형 AI의 도움을 받아 관련 학술논문 2,000편 이상을 추려 내고, 남은 논문을 검토해 정보를 추출했으며, AI 도구가 의학교육에서 어떻게 사용될 가능성이 탐색되는지와 그 한계 및 향후 적용 가능성을 어떻게 파악했는지 설명했다.26 저자들은 의학교육과 AI 분야의 혁신가들을 인터뷰하여 현재 상황에 대한 생각과 미래의 우선순위에 관한 통찰도 얻었다.27

 

이 의뢰 연구는 의학교육의 다섯 영역, 즉 (1) 입학 선발, (2) 강의실 기반 학습·교수, (3) 일터 기반 학습·실천(workplace-based learning and practice), (4) 학습자 평가·피드백·자격인증, (5) 프로그램 평가·연구에서 현재 및 잠재적으로 AI를 활용하는 ‘모범적’ 사례를 확인했다. 이러한 활용 사례 중 다수는 장애물을 줄이고 역량바탕 및 정밀 의학교육으로의 전환을 촉진할 수 있는 방식이다. 예를 들어 실제 환자 사례에 기반하면서 수련생의 학습 요구에 맞춘 가상 튜터링과 코칭, 학습자에게 효율적인 실시간 피드백을 제공하도록 강화된 표준화 환자 모형, 개인화된 피드백을 제공하고 학습 궤적을 예측하는 데 사용할 수 있는 자동 평가가 있다. Boscardin 박사는 “역량바탕 의학교육을 실제로 운영할 상당한 잠재력을 보고 있습니다. 역량바탕 의학교육은 20년 동안 존재해 왔지만, 특히 피드백과 데이터 관리, 실제적 평가(authentic assessment)에서 큰 장벽과 난관에 부딪혀 왔습니다. 새로운 AI 모형은 이러한 문제를 해결하는 데 도움을 줄 수 있습니다”라고 말했다.

 

연구자들은 유망한 AI 응용 분야를 확인하는 것 외에도 인터뷰 참가자들에게 해결해야 할 가장 큰 AI 관련 과제를 돌아보게 했다.

 

  • 많은 AI 도구가 ‘블랙박스(black boxes)’처럼 작동한다는 점에서 그 작동 방식의 투명성 부족에 대한 우려가 제기되었다.
  • AI가 환자 진료와 의학교육 과정의 편향뿐 아니라 교육기관 내부와 기관 간의 자원 불평등을 악화할 수 있다는 우려도 있었다.
  • 데이터 보안과 학습자·환자의 사생활,
  • 사용자가 AI 도구에 지나치게 의존할 가능성,
  • AI가 의학교육과 학습자·환자 성과에 미치는 영향을 평가해야 할 필요성에 대한 우려도 추가로 제기되었다.

 

Boscardin과 Gin은 의학교육에 AI를 도입하기 위한 우선순위를 제시하며 발표를 마쳤다. 여기에는 의학교육의 AI 역량 집합을 마련해야 할 ‘시급한’ 필요성이 포함되었다. 이들은 AI가 의사의 역할과 책임을 바꾸는 방식을 반영해 임상 역량을 조정하고, AI 사용의 윤리 기준을 개발하며, AI의 결과물과 영향을 지속해서 모니터링할 도구와 절차를 마련할 것도 촉구했다. 마지막으로 연구 협력과 재원 조달 기제를 포함하여 의학교육자와 기술 산업 간의 새로운 유형의 협력이 필요하다고 말했다.

합의 권고안의 토대 (Groundwork for consensus recommendations) 

발표가 끝난 뒤 참가자들은 의학교육 안의 서로 다른 영역에 초점을 맞춘 분과 그룹으로 나뉘었다. 교수와 학습자의 경험에 직접 적용되고 의학교육에서 기본적으로 중요한 네 중점 영역은

 

  • (1) 기초 교육과정,
  • (2) 경험 교육과정,
  • (3) 학습자 평가와 프로그램 평가,
  • (4) 코칭과 피드백이었다.

 

회의 첫날, 기획위원회 구성원들이 진행을 맡은 각 그룹에는 동일한 과제가 주어졌다. 회의 목적 진술문 초안(상자 1)에 의견을 제시하고, 오늘날의 의학 학습자가 앞으로 몇 년 동안 강의실과 임상 학습환경에서 AI를 어떻게 접할 가능성이 있는지에 관한 가상이지만 현실적인 비전을 담은 종단적 사례연구(longitudinal case study, http://links.lww.com/ACADMED/B719의 디지털 보충 부록 2 참조)를 토의하는 일이었다.

 

메이시 재단은 공동 작업을 시작할 때 참가자들에게 기획위원회가 작성한 통합적인 목적 진술문에 대한 의견을 요청하곤 한다. 참가자들이 회의와 관련된 개인적 관점, 동기, 우선순위를 공유하는 이 활동은 궁극적으로 회의와 권고안의 포괄적 목적 또는 비전을 다듬고 명확히 표현하는 역할을 한다. 이번 회의의 최종 목적 진술문은 상자 1에 제시되어 있다.

 

상자 1. 회의 목적 진술문 (Box 1. Conference Purpose Statement) 

인공지능은 강력하고 빠르게 진화하는 기술이다. 의학교육계는 역량바탕 의학교육을 최적화하고, 현재와 미래의 의사가 양질의 환자중심 진료를 제공하는 고성과 팀의 일원으로 일하도록 준비시키기 위해, 이 기술을 안전하고 형평성 있으며 효과적인 방식으로 활용해야 한다.

 

이 사례연구(디지털 보충 부록 2: http://links.lww.com/ACADMED/B719)는 한 가상의 학습자가 의과대학에서 일반외과 레지던트 수련으로 나아가는 과정을 따른다. 그 과정에서 학습자는 AI로 강화된 교육과정, 임상 경험, 평가, 코칭을 접한다. 회의 목적 진술문과 종단적 사례연구에 대한 그룹 토의에서는 AI 시대의 의학교육자가 직면한 다양한 과제가 확인되었으며, 여기에는 다음의 필요성이 포함되었다.

 

  • 모든 의학 학습자와 교육자에게 지금 필요한 데이터과학(data science) 및 AI 리터러시(literacy) 기술과 역량을 결정한다.
  • AI 혁신과 관계없이 바뀌어서는 안 되는 의학교육의 핵심 또는 기초 요소를 확인한다.
  • 전문직 간 임상 진료팀에 전문 데이터 과학자를 통합할 가능성을 탐색한다.

 

회의 첫날이 끝날 무렵 한 참가자는 이후 논의의 방향을 제시했다. “AI가 우리[의학교육계]에게 일방적으로 닥쳐오는 것이 아니라는 점을 기억해야 합니다. AI는 우리가 항상 해 온 일, 즉 가능한 최고의 도구, 지식, 기술, 연구를 활용해 의사를 교육할 기회를 제공합니다. [의학교육에] AI를 도입하는 것은 그 성과를 어떻게 쓸지 우리가 결정할 수 있는 기회입니다.”

권고안을 형성한 회의의 주제 (Conference Themes Inform Recommendations) 

회의의 전체 토론, 소그룹 토론, 비공식 대화에서 여러 주제가 반복적으로 나타났다. 아래에 간략히 설명하는 이 주제들은 이 보고서 마지막 부분에 제시된 다섯 가지 합의 권고안과 이에 따른 실행 단계(상자 2)에 반영되어 있다. 완전한 투명성을 위해 밝히면, 권고안을 포함한 이 보고서의 내용은 회의 참가자들이 메이시 재단 직원들의 지원을 받아 다음 자료를 활용하여 개발했다. 메이시 재단이 의뢰한 AI와 의학교육에 관한 연구보고서 및 기타 배경자료, 회의 중 참가자들이 작성한 메모, 모든 참가자의 허락을 받아 녹음한 회의 토론의 AI 생성 요약본이다.

주제: AI 도구 평가를 위한 교육·정책 틀과 역량 구축 (Theme: Develop educational and policy frameworks and capacity to assess AI tools) 

 

  • 대부분 AI 혁신가이자 초기 수용자인 회의 참가자들은 AI가 의학교육을 발전시킬 잠재력에 기대를 표하면서도 신중할 것을 촉구했다. 참가자들은 기관 내부와 여러 체계 전반에서 AI를 안전하고 효과적이며 윤리적으로 도입·사용하도록 하는 효과적인 거버넌스 전략의 필요성을 거듭 우선시했다. 한 참가자는 “모든 사람이 AI를 충분히 교육받아 자신에게 계속 더 많은 교육이 필요하다는 사실을 제대로 이해해야 합니다”라고 말했다.
  • 연구자들은 AI 사용을 위한 안전장치를 제안해 왔다. 예를 들어 Triola와 Rodman은 개별 기관이
    • (1) 기관과 환자의 데이터를 보호하고 학업 환경에서 AI의 적절한 사용에 대해 학생에게 명확한 지침을 제공하는 정책을 만들고,
    • (2) 안전하고 윤리적인 AI 사용을 정의하며 감독하고 기술 발전을 따라갈 지역 거버넌스 기구를 설치하며,
    • (3) 학습자 역량을 정의하고 책임 있는 AI 사용을 가르칠 흥미로운 교육과정을 개발할 것을 권고했다.24
    • 이들은 AI에 관한 기본 지식, 윤리와 규제, 임상 진료에서의 활용, 도구의 질과 정확성 평가, 데이터 사생활 보호와 보안, 전문직업성을 포함하는 AI 역량 틀도 제안한다.
  • 의료와 보건의료 전문직 교육에 관련된 중요한 AI 역량은 주어진 도구의 정확성과 유용성을 비판적으로 평가하는 능력이다. 이를 위해 Gin과 동료들은 한 가지 가능한 접근법으로, 지도자가 학습자에게 특정 환자 진료 활동을 맡겨도 될 준비가 되었는지 평가하도록 하는 의학교육의 위임(entrustment) 패러다임을 채택할 것을 제안했다.28 이 연구를 설명하면서 Gin은 “위임 모형은 어떤 과업을 AI가 잘 수행한다고 믿고 맡길 수 있고 어떤 과업은 그렇지 않은지 결정하는 데 도움을 줄 수 있습니다. 이는 개별 수련생에게 서로 다른 수준의 감독과 자율성을 부여하면서 환자 진료 업무를 맡기거나 맡기지 않는 것과 같습니다”라고 말했다.

 

주제: 형평성을 높이고 편향을 완화하며 학습자와 환자를 중심에 두기 (Theme: Advance equity, mitigate bias, and center learners and patients) 

 

  • AI의 개발과 사용에서 형평성을 증진하고 편향을 완화하며 학습자와 환자를 중심에 두어야 한다는 주제는 회의 전반에 걸쳐 나타났다.
    • 형평성에 관한 대화는 주로 학습자, 프로그램과 기관, 의학교육계 전반에서 AI 도구와 기술에 형평성 있게 접근할 수 있어야 한다는 필요성에 집중되었다. 장애가 있거나 영어에 능숙하지 않은 학습자·교육자, 기술 또는 AI 도구 사용에 익숙하지 않은 사람, 인터넷이나 개인용 컴퓨터 등 지원 기술에 접근할 수 없는 사람, 최첨단 AI 모형의 구독료를 감당할 수 없는 사람은 AI 도구에 접근하기가 더 어려울 수 있다.29
    • 마찬가지로 참가자들은 재정 및 기타 자원이 적은 기관이 의학교육, 환자 진료, 연구를 포함한 여러 사명 영역의 활동에서 AI 기술을 이용·도입·배포·감독하는 데 더 큰 어려움을 겪을 수 있음을 인식했다. 따라서 모든 의대생에게 제공해야 할 최소한의 학습 경험을 정하는 데 주의를 기울여야 한다.
  • 또한 AI 알고리즘과 도구는 유해한 편향, 차별, 불평등을 악화할 수 있다는 우려를 낳는다.30,31
    • AI 도구는 학습에 사용된 데이터셋이나 개발자가 학습 데이터를 구성하고 우선순위를 정한 방식 자체에 편향이 있거나, 그 도구의 대상 인구집단을 대표하지 못하는 경우 불평등을 지속시킬 수 있다.32,33
    • 불평등의 확산을 줄이려면 편향을 알아보도록 훈련된 전문가가 AI 도구를 검토해야 하며, 기관은 도구 도입 이후 지속적으로 모니터링하는 절차를 수립해야 한다.21
    • AI의 편향과 불평등이 초래하는 위험은 학술의료체계에서 강력한 AI 거버넌스를 마련하고, 최종 사용자와 의사결정자를 대상으로 탄탄한 AI 교육·훈련을 제공해야 할 필요성을 더욱 뒷받침한다.
  • 참가자들은 데이터 투명성의 필요성과, 의학교육에서 AI 강화 도구를 개발·사용하기 위한 계획에 교육자가 학습자와 환자의 관점을 반영해야 한다는 점도 논의했다. 학습자의 향후 수행을 예측하는 데 사용될 수도 있는 도구를 포함하여, AI 제품 개발을 위한 데이터의 이차적 사용에 동의하지 않았을 수 있는 학습자와 환자 모두에게 데이터가 어떻게 사용되는지에 관한 투명성은 필수적이다.34 역사적으로 소외된 공동체의 구성원이라고 정체화하는 학습자와 환자와 함께 AI 시행계획을 공동 생산(co-production)하면 편향을 완화하고 형평성을 증진하는 데 도움이 될 수 있다. 데이터 보안과 사생활 보호 노력에도 정보를 제공할 수 있다. 나아가 참가자들은 많은 의학 학습자가 이미 기술 활용 능력을 지닌 채 의학교육에 들어오며 기술로 더욱 강화된 교육 경험을 기대한다고 지적했다. 환자에게도 기술 활용 능력이 있고, 진단과 치료 선택지를 이해하고 전반적인 건강을 관리하는 데 AI 도구를 사용한다. 한 참가자는 환자들이 임상의와 상호작용할 때 기술 전문성의 정도가 매우 다양하므로, 의학 학습자도 AI 접근성이 없거나 낮은 환자부터 AI를 생활 속에 깊이 활용하는 환자까지 마찬가지로 다양한 가상 환자와 상호작용해야 한다고 제안했다.

 

주제: 새로운 임상의 역할과 관계를 받아들이고 교육하기 (Theme: Embrace and educate around new clinician roles and relationships) 

 

  • AI 기술의 진화와 의료 분야 도입은 의사의 새로운 역할을 만들고 의료 관계의 역학을 바꾸고 있다. 의학교육은 의사들이 이러한 변화에 대비하도록 해야 한다. 한 논문은 미래의 임상의를 AI 도구의 ‘소비자(consumers), 번역자(translators), 개발자(developers)’로 개념화하는 의학교육 과정을 제안한다.22
    • AI 소비자인 임상의는 “임상 환경에서 AI 도구를 효과적으로 선택하고 사용할 충분한 지식과 기술”이 필요하다.
    • 임상의-번역자는 AI의 소비자이면서 어느 정도 개발자 역할도 할 수 있다.
    • 개발자는 임상·과학 전문성에 더해 AI에 관해 더 깊은 지식과 기술을 갖춘 사람이다.
    • 이러한 노력은 기존의 임상정보학(clinical informatics) 교육과정과 훈련 프로그램을 토대로 삼을 수 있다.35
  • AI 도구와 기술의 도입은 의료 관계도 바꾸고 있으며, 팀워크와 협력 진료의 중요성을 더욱 높이고 환자들이 AI에 더 익숙해지면서 의료제공자–환자 관계도 변화시키고 있다. 한 참가자는 이렇게 요약했다.
    • “지금까지 의학교육에서 우리는 AI를 인지적 활동으로 생각하는 경향이 있었고, 그것이 임상 추론을 어떻게 발전시킬 수 있는지에 초점을 맞췄습니다. 하지만 임상의와 환자 사이, 진료팀 내부와 팀 간의 대인관계 상호작용과 관계의 역학도 중요합니다. 저는 AI가 환자 진료에 대해 더 인간중심적이고 포괄적인 팀 접근을 위한 여지를 만들 것이라고 생각합니다.”
    • 이 참가자는 임상의가 AI를 진료팀의 또 다른 구성원으로 생각하기 시작할 것을 권했다.
  • AI 기반 도구가 의학에서 보편화되어 임상의의 승인을 기다리는 권고, 예측, 문서 초안을 제공하게 됨에 따라, 효과적인 ‘인간 참여형(human-in-the-loop)’ 감독에 필요한 역량을 면밀히 검토해야 한다.36
    • 가까운 미래에도 AI의 결과물은 불완전할 것이므로, 임상의가 안주하거나 자동화 편향(automation bias)에 빠지지 않으면서 핵심 술기를 유지하도록 준비시키는 것은 양질의 AI 활용 진료를 제공하는 데 필수적이 될 것이다.37
    • 참가자들은 임상의가 핵심 생물과학에 관한 기초 지식과 이를 임상 추론에 적용하는 능력을 유지하는 것이 특히 중요하다고 논의했다.
  • 참가자들은 AI가 임상의의 역할과 관계를 바꾸는 데 그치지 않고 일부 의료제공자 집단을 아예 대체할 수도 있다는 우려를 인정했다. 이러한 우려는 AI가 인간보다 뛰어난 진단 정확도와 치료 계획 능력을 보일 수 있다는 새롭게 등장하는 근거에 바탕을 둔다.38 논의는 AI를 임상의의 지식·기술·전문성을 보완하고 강화하는 도구로 규정하는 방향으로 자주 돌아왔다.
    • Sezgin이 설명했듯이 인간과 AI의 협력은 “보건의료 제공자의 인지적 강점과 AI의 분석 능력을 결합”하고, “인간의 전문성이 AI 체계를 이끌고 이에 관해 소통하며 감독하도록 하여 의료서비스의 안전과 질을 유지”한다.38

 

주제: 협력·파트너십과 탄탄한 AI 연구 의제 개발 (Theme: Develop collaborations, partnerships, and a robust AI research agenda) 

 

  • 참가자들은 기관과 조직 사이의 새로운 관계가 필요하다는 점도 인식했다. MUSC의 Cawley 박사는 학술의료센터와 의료체계가 독립적으로 운영되어 온 전통을 강조했다. 이들은 내부의 복잡한 부서 장벽을 넘어서는 협력에도, 다른 의료센터나 의료체계와의 외부 협력에도 익숙하지 않다. 그러나 생성형 AI 도입은 시간이 중요한 동시에 자원이 많이 드는 과제이며, 상당한 재정 투자와 폭넓은 기술 전문성이 필요하다. 의학교육계 내부와 기관 간의 파트너십 및 기술 기업과의 협력은 비용을 분담하고 효율성을 높이며 더 폭넓은 전문성과 다양한 접근법을 활용하여 더 견고한 기술 도구를 만드는 데 도움이 될 수 있다.
  • 참가자들에 따르면 협력과 파트너십은 데이터의 민주화, 모범 실무·교육과정·역량의 개발과 보급, AI 도구의 개발·시험·평가 등 여러 방식으로 AI 도입을 촉진할 수 있다. 참가자들 가운데 일부는 의학교육자를 위한 AI 연구 지침39의 개발에 참여했으며, 파트너십을 통해 추진할 수 있는 시급한 우선순위로 탄탄한 연구 의제의 개발과 지원을 꼽았다. Ng 등은 “AI 연구는 보고가 미흡한 경우가 많고, 많은 검증 연구의 방법론에 결함이 있으며, 마케팅은 환자에 대한 AI 응용의 근거로 입증된 이익을 과장하는 경우가 많다”고 지적했다.22
  • 회의 발표에서 Boscardin과 Gin도 비슷한 우려를 표했다. Boscardin 박사는 “AI 도구를 검증하고, 가장 적합한 활용 사례를 설명하며, 위험과 한계를 상세히 밝히는 연구가 훨씬 더 많이 필요합니다”라고 말했다. 여러 참가자는 전통적인 학술연구와 출판에 필요한 시간에 대한 우려를 표했다. 한 참가자는 “매우 비싼 연구에 대한 지원을 받고, 연구를 수행하고, 출판할 즈음에는 연구 대상 기술이 이미 구식이 되어 있습니다”라고 말했다. 이러한 문제는 연구 기준과 지침을 개발하고, 시의적절한 결과를 지원·생산·공유할 방법을 찾는 공동 노력을 통해 해결할 수 있다.
  • 모든 참가자는 AI라는 ‘요정’이 이미 병 밖으로 나왔고, 의학교육과 임상 진료에서 AI의 존재가 확실하다는 데 동의했다. 이제 과제는 우리가 사물을 보고 일을 하는 새로운 방식에 대해 상상하고 적응하는 능력만큼 변혁의 가능성이 커지는 기술의 힘을 활용하는 것이다. 하버드의 Chang 학장이 설명했듯이 “아마 수십 년에 한 번쯤은 의대생을 가르치는 방식과 그들이 의사가 되었을 때 기대하는 능력에 진정한 혁명이 일어납니다. 지금이 바로 그런 시기입니다.”6 다음 권고안은 의학교육자들이 생성형 AI와 미래의 AI 혁신을 도입하면서 보건의료 전문직 교육과 의료를 계속 발전시키고 개선하도록 돕기 위한 것이다.

 

권고안 (Recommendations) 

다음 합의 권고안은 AI와 의학교육에 관련된 주요 당사자들의 노력을 이끌기 위한 것으로, 대상에는 다음이 포함된다.

 

  • 의학교육 학장, 프로그램 지도자, 교육과정 책임자, 교수자, 관련 인력.
  • 학부·대학원·계속 의학교육 전 단계의 학습자.
  • 환자와 환자 옹호자.
  • 의과대학, 교육병원, 학술의료체계 및 학술의료센터의 이사회 위원, 임원, 관리자, 기타 지도자.
  • 관련 인증·면허·자격인증 기관의 대표자.
  • 의사, 전문과목, 의과대학, 레지던트 프로그램의 활동을 지원하고 발전시키는 협회와 조직의 대표자.
  • 간호 및 다른 보건의료 전문직의 지도자, 교육자, 학습자.
  • 정책 입안자와 정부 규제 담당자.
  • 교육 중심 AI 기술 기업.

 

 

상자 2. 권고안과 실행 단계 (Box 2. Recommendations and Action Steps)

1. 의학교육에서 안전하고 효과적인 AI의 도입을 촉진한다.

 

  • 1.1 AI 교육과정과 역량을 시행한다.
  • 1.2 AI 시대에 맞추어 의사의 기초 역량을 재평가한다.
  • 1.3 인증·면허·자격인증의 기준과 절차를 수정한다.
  • 1.4 학습을 촉진하기 위한 교육자의 AI 사용을 지원한다.
  • 1.5 개인과 조직의 적응력을 촉진한다.
  • 1.6 파트너십과 협력을 구축한다.

 

2. 의학교육에서 공동 생산한 AI 강화 교수·학습·학습자 평가·프로그램 평가 접근법을 시행한다.

 

  • 2.1 AI 실험 공간을 개발한다.
  • 2.2 기존 교수 전략을 개선하는 데 AI를 사용한다.
  • 2.3 AI 시대에 맞추어 평가 프로그램을 조정한다.

 

3. 의학교육에서 AI 도입을 촉진할 탄탄한 데이터 생태계를 개발하고 활용한다.

 

  • 3.1 데이터 체계를 통합한다.
  • 3.2 학습자 평가에 데이터 투명성을 내재화한다.
  • 3.3 역량바탕 및 정밀 의학교육을 수용한다.
  • 3.4 인증에서 데이터 기반의 탁월성을 촉진한다.

 

4. 의학교육에서 윤리적 AI 거버넌스 틀과 AI 도구·기술의 책임 있는 활용을 촉진한다.

 

  • 4.1 포괄적인 AI 틀과 윤리 지침을 마련한다.
  • 4.2 전국적 모범 실무 네트워크를 구축한다.

 

5. 의학교육의 AI에 관한 학술활동을 발전시킨다.

 

  • 5.1 의학교육의 AI를 연구한다.
  • 5.2 참여형 연구를 수행한다.
  • 5.3 도전적인 학술활동에 자금을 지원한다.
  • 5.4 보고 기준을 사용한다.
  • 5.5 연구 성과의 보급을 강화한다.
  • 5.6 학제 간 협력을 지원하고 산업계와의 파트너십을 모색한다.
  • 5.7 AI와 의학의 미래에 관한 전략적 비전을 구상한다.

 

권고안 1: 의학교육에서 안전하고 효과적인 AI의 도입 촉진 (Recommendation 1: Promote the implementation of safe and effective AI in medical education)

의학교육·훈련 프로그램을 후원하는 기관의 지도자는 교수, 학습, 학습자 평가, 환자 진료에서 안전하고 효과적인 AI 도구·기술의 도입을 촉진하도록 실질적인 지원과 자원을 제공해야 한다. 여기에는 의대생부터 대학원 수련생, 교수진, 진료 중인 의사에 이르는 학습자가 의료 분야에서 AI를 활용할 수 있도록 준비시키는 포괄적인 교육과정의 개발·시행이 포함된다.

 

  • 실행 단계 1.1: AI 교육과정과 역량 시행 (Action step 1.1: Implement AI curricula and competencies). 기관 지도자와 의학교육자는 현재와 미래 의사를 위한 AI 교육과정과 역량을 개발·시행해야 한다. 교육과정과 역량은 AI의 유형, 기능, 능력, 한계 등 기본 원리와 사회적 함의를 다루어야 한다. 또한 의사가 AI를 효과적으로 사용하는 데 필요한 기술, 즉 도구를 비판적으로 평가하고 환각 및 편향을 지속시킬 수 있는 능력과 같은 단점을 완화하는 방법도 가르쳐야 한다. AI 교육과정의 효과는 학습자와 환자의 성과를 측정하여 평가해야 하며, 그 결과를 교육 프로그램의 지속적인 향상에 반영해야 한다.
  • 실행 단계 1.2: AI 시대에 맞추어 의사의 기초 역량 재평가 (Action step 1.2: Reevaluate foundational physician competencies for the AI era). 주요 당사자들은 의료 분야에서 AI가 갖는 함의를 의사의 기초 역량 영역과 훈련이라는 관점에서 평가해야 한다. 여기에는 의학 지식, 비판적 사고와 임상 의사결정, 데이터 리터러시(data literacy), 팀워크, 지속적인 질 향상, 전문직업성, 의사소통 교육이 포함된다. 의사의 업무 중 어떤 요소를 AI에 맡길 수 있는지, AI가 활용되는 환경에서 수련생에게 더 이상 필수적이지 않을 수 있으므로 기존 교육과정의 어떤 요소를 제거해야 하는지 신중히 고려해야 한다. 교육과정에서 무엇을 제거할지 결정하려면 세심한 사고와 분석이 필요하며, 이용 가능한 최선의 근거와 기관 및 그 지역사회의 고유한 사명·상황에 근거해야 한다. 이때 AI 도구의 가용성과 효과가 다소 예측하기 어렵고 진료 환경마다 균일하지 않으며, 가까운 미래에도 진단과 치료처럼 중대한 AI 결과물을 감독하는 책임이 의사에게 있다는 점을 인정해야 한다.
  • 실행 단계 1.3: 인증·면허·자격인증 기준과 절차 수정 (Action step 1.3: Modify accreditation, licensing, and certification standards and processes). 의학교육 인증·면허·자격인증 기관의 지도자들은 면허 및 자격인증 과정에서 AI 역량을 평가하는 일을 포함하여, AI 역량을 의학교육과 의사 진료의 기준에 통합하는 방안을 고려해야 한다.
  • 실행 단계 1.4: 학습 촉진을 위한 교육자의 AI 사용 지원 (Action step 1.4: Support educators’ use of AI to promote learning). 기관 지도자들은 AI와 관련된 의료 역량, 도구, 방법론을 통합하도록 교육과정과 평가체계를 재설계하는 교육자를 적극적으로 지원하기 위해 자원을 배정하고 기반시설을 개발해야 한다. 구체적인 단계에는 다음이 포함되지만 이에 한정되지는 않는다.
    • AI의 기초 원칙과 의학교육에서 현재 및 잠재적인 활용에 관한 훈련을 포함하여, 교수·학습·학습자 평가·프로그램 평가에서 AI를 사용하는 교수개발을 제공하고 장려한다.
    • AI를 활용한 교수·학습(예: 가상 환자와 개별화 튜터링 시스템)을 지원하는 데 필요한 컴퓨팅 기반시설을 제공한다.
    • 교육과정에서 문서 초안 작성, 수작업 채점처럼 학습 효과가 낮고 반복적인 과업을 AI 도구에 안전하게 맡기도록 한다. 그러면 교육자는 학습자, 환자, 동료와의 인간적 상호작용에 더 집중할 수 있다.
    • 연구·재정 지원 등을 제공하여 AI 활용 의학교육의 혁신과 학술활동에 교수진이 기여하도록 장려한다.
  • 실행 단계 1.5: 개인과 조직의 적응력 촉진 (Action step 1.5: Facilitate personal and organizational adaptability). 주요 당사자들은 AI와 관련된 기술 발전과 정책 변화에 신속하게 대응할 수 있도록 의학교육·훈련 프로그램의 적응력과 민첩성을 높여야 한다. 조직 차원에서 이를 실현할 한 가지 방법은 AI 발전에 대응하고 이를 반영하여 역량과 교육과정을 갱신하기 위해 정기적으로 회의하는 AI 교육과정 검토위원회를 설치하는 것이다.
  • 실행 단계 1.6: 파트너십과 협력 구축 (Action step 1.6: Create partnerships and collaborations). 지도자들은 의학교육에서 AI의 도입을 강화·확대하기 위해 기관 내부와 외부의 전문가들과 전략적 파트너십 및 기타 협력 관계를 구축해야 한다. 예를 들어 필요에 따라 기술 전문가를 채용할 자원을 갖추고, 학부·대학원 의학교육 및 다른 보건의료 전문직 교육 프로그램을 아우르는 교육 디지털 혁신실(Office of Educational Digital Innovation)을 설립해야 할 수도 있다. 의학교육에서 AI 도입을 지역·국가·국제 수준으로 확대할 수 있도록 허브·스포크(hub-and-spoke) 방식의 협력에 참여하는 방안도 포함될 수 있다.

 

권고안 2: 의학교육에서 공동 생산한 AI 강화 교수·학습·학습자 평가·프로그램 평가 접근법 시행 (Recommendation 2: Implement coproduced, AI-enhanced teaching, learning, assessment, and evaluation approaches in medical education)

AI를 통한 학습을 장려하기 위해 의학교육자는 학습자, 교수진, 전문직 간 팀원, 환자와 함께 AI 활용 교육 실험 공간, 거꾸로 학습(flipped classrooms), 형성적 자기평가 도구(formative self-assessment tools), 가상 환자 시뮬레이션 등을 공동 생산해야 한다. AI 자체의 전문가도 참여해야 하는 이 공동 생산 모형은 학습자와 교수진이 데이터과학과 AI에 대한 이해를 깊게 하면서 AI 기술을 적극적으로 탐색하고 실험하며 그 발전에 영향을 미치게 할 것이다.

 

  • 실행 단계 2.1: AI 실험 공간 개발 (Action step 2.1: Develop AI playgrounds). 기관 지도자와 의학교육자는 기술 전문가와 협력하여 학습자와 교수진이 실제 운영 버전에 필요한 제약 없이 특정 과업에 AI 도구를 탐색·실험·적용할 수 있는 안전한 공간인 ‘AI 실험 공간(AI playgrounds)’을 만들어야 한다.
  • 실행 단계 2.2: 기존 교수 전략 개선에 AI 사용 (Action step 2.2: Use AI to improve existing instructional strategies). 의학교육자는 다음을 수행해야 한다.
    • AI 도구를 활용해 학습 경험의 상호작용성을 높이는 거꾸로 학습과 같은 AI 활용 교육 모형을 시행한다.
    • 표준화되고 통제된 학습환경에서 핵심 술기를 연습할 기회를 확장하기 위해 AI 강화 가상 환자 시뮬레이션을 시행한다.
    • 피드백 도구를 개선한다. 교육자는 기술·평가 전문가와 협력하여 모든 수준의 학습자에게 즉각적인 피드백을 제공하는 AI 강화 형성평가, 자기평가 및 기타 피드백 도구를 사용해야 한다. 이는 정밀교육에 부합하는 방식으로 학습 성과와 교육 효과를 높인다.
  • 실행 단계 2.3: AI 시대에 맞추어 평가 프로그램 조정 (Action step 2.3: Adapt assessment programs to the AI era). 의학교육자는 다음을 수행해야 한다.
    • AI 도구가 임상 진료 전반에 스며들 것이므로 평가 환경에도 스며들어야 한다는 사실을 인정한다.
    • 환자 진료에서 빠르게 진화하는 AI의 역할과 관련하여 학습자(및 교수진)에게 새롭게 요구되는 중요한 수행 기대치를 확인한다.
    • 현재의 평가 전략을 조사하여 효과를 평가하고, AI 시대의 수행 기대치에 맞추며, 개선할 부분을 파악한다. 더 이상 적절하지 않은 영역과 도구는 버린다.
    • 의사소통 술기, 체계 기반 진료(systems-based practice), 전문직업성처럼 전통적으로 측정하기 어려웠던 역량을 평가할 수 있도록 AI 도구와 기술의 사용을 고려한다.

 

권고안 3: 의학교육에서 AI 도입을 촉진할 탄탄한 데이터 생태계의 개발과 활용 (Recommendation 3: Develop and leverage robust data ecosystems to facilitate AI implementation in medical education)

의학교육기관의 지도자들은 표준화된 체계(schema)와 공유된 어휘를 사용하여 교육 데이터와 임상 데이터를 결합하는 포괄적인 데이터 생태계(data ecosystem) 구축에 투자해야 한다. 이러한 데이터 생태계에는 정보기술 전문가, 데이터 과학자, 교육자, 관리자, 질 향상 전문가를 포함한 학술의료센터 전반의 여러 주요 당사자의 의견과 협력이 필요하다. 체계가 구축되면 정밀교육, 체계 기반 교육의 개선, 평가 등 다양한 교육적 활용을 촉진해야 한다.

 

  • 실행 단계 3.1: 데이터 체계 통합 (Action step 3.1: Integrate data systems). 의학교육 및 의료체계 지도자와 다른 주요 당사자는 임상 데이터 체계와 교육 데이터 체계의 통합을 촉진하기 위해 협력해야 한다. 양방향 데이터 통합은 임상 진료가 의학교육에 정보를 제공하고, 교육 실천이 임상 성과에 미치는 영향을 측정할 수 있게 한다. 시행팀에는 교육정보학자(educational informaticians), 연구자, 프로그래머 등을 포함하여 다학제로 구성하고 AI의 안전하고 효과적이며 윤리적인 사용을 지원해야 한다.
  • 실행 단계 3.2: 학습자 평가에 데이터 투명성 내재화 (Action step 3.2: Build data transparency into assessment). 기관 지도자와 교육자는 평가 자료가 어떻게 수집되고 사용되는지에 관한 투명성을 높여야 한다. 이를 위해 다음을 수행해야 한다.
    • 형성평가 자료를 공동 생산하고 투명하게 사용하며, 실행 가능한 경우 학습자에게 자료의 소유권을 부여함으로써 학습자의 역량을 강화하고 안전과 신뢰를 우선시한다.
    • 평가 자료에서 의도하지 않은 결과와 AI가 유발한 편향을 모니터링하면서 학습자 성과를 지속적으로 평가하고, 문제가 발견되면 대응한다.
    • 데이터 분석에서 얻은 통찰이 의미 있는 프로그램 차원의 행동으로 이어지도록 시행과학(implementation science)의 원칙을 적용한다.
  • 실행 단계 3.3: 역량바탕 및 정밀 의학교육 수용 (Action step 3.3: Embrace competency-based and precision medical education). 지도자와 교육자는 다음을 수행해야 한다.
    • 역량바탕 의학교육에 따라 필요한 교수진의 학습자 상호작용·관찰 확대와 함께 AI 생성 평가를 사용한다.
    • 임상 환경에서 사용할 AI 활용 역량 평가 도구를 설계·시행한다.
    • 역량바탕 교육과 정밀교육의 실천·원칙에 맞추어, AI와 교수진이 확인한 학습자별 역량 공백에 맞춤형 학습계획으로 대응하고 AI 도구를 이용해 각 학습자에게 교육 콘텐츠를 맞춘다.
  • 실행 단계 3.4: 인증에서 데이터 기반의 탁월성 촉진 (Action step 3.4: Promote data-driven excellence in accreditation). 의학교육 인증기관의 지도자는 다음을 수행해야 한다.
    • 진료 중인 의사와 수련 중인 의사를 위해 데이터 기반, 역량바탕, 개인맞춤형 교육 경로를 촉진하고 학습자·교수진·기관이 사용할 AI 관련 자원의 적절성을 보장하도록 인증 기준을 검토·개정·조정한다.
    • 인증 심사의 절차, 보고서, 결정에서 AI를 사용하는 방식에 관해 투명하게 공개한다.

 

권고안 4: 의학교육에서 윤리적 AI 거버넌스 틀과 AI 도구·기술의 책임 있는 활용 촉진 (Recommendation 4: Facilitate ethical AI governance frameworks and responsible utilization of AI tools and technologies in medical education)

의학교육에서 AI 도구와 기술을 책임 있게 활용하도록 기관·교육·조직의 지도자와 재원 지원자는 윤리적이고 형평성 있는 AI 거버넌스 틀의 개발과 시행을 우선시해야 한다. 또한 미국의사협회(American Medical Association), 미국의과대학협회(Association of American Medical Colleges), 미국정골의과대학협회(American Association of Colleges of Osteopathic Medicine), 전공의교육인증위원회(Accreditation Council for Graduate Medical Education), 미국의학전문과목위원회(American Board of Medical Specialties) 등을 포함한 의학교육기관들은 의학교육과 임상 진료에 AI를 신중하게 도입하는 데 공동의 강한 이해관계를 갖고 있다. 이들 기관의 지도자들은 의학교육에서 AI를 공정하고 형평성 있게 도입하고 체계적으로 활용하도록 협력해야 하며, 의학교육의 AI에 관한 연구를 후원·촉진·공유해야 한다.

 

  • 실행 단계 4.1: 포괄적인 AI 틀과 윤리 지침 마련 (Action step 4.1: Create comprehensive AI frameworks and ethical guidelines). 이러한 틀과 지침은 AI 도구와 결과물의 사용·평가를 관리해야 하며, 데이터 보호와 AI가 환자 진료·교육·사생활에 미치는 함의에 초점을 맞추어 책임 있는 AI 도입을 보장해야 한다. 추가 활동에는 다음이 포함되어야 한다.
    • 교육기관, 의료체계, 산업계 간의 협력을 강화하고 종단적 데이터를 활용하여 개인의 평생학습 참여와 지원을 촉진함으로써 AI 강화 평가가 실제 임상 진료 양상에 부합하도록 한다.
    • AI에 특화된 틀과 지침은 HIPAA와 FERPA 같은 규제가 관장하는 환자 또는 학습자 데이터의 공유·사생활 보호에 관한 기존 작업을 토대로 하고 그와 연계되어야 한다. 의료·교육 데이터 생태계를 설계하거나 수정하여 학습자의 경험에 영향을 주는 경우, 교육자는 핵심 당사자로 참여해야 한다.
    • AI 강화 도구가 생성한 평가 자료에서 편향과 의도하지 않은 결과를 엄격하게 모니터링한다. 필요한 경우 형평성과 공정성을 뒷받침하도록 시정 조치를 취해야 한다.
  • 실행 단계 4.2: 전국적 모범 실무 네트워크 구축 (Action step 4.2: Build a national best practices network). 전국적인 의료 및 의학교육 기관의 지도자들은 적절한 이해관계자 대표성을 갖춘 협력 네트워크를 구성하여 모범 실무의 시행을 지원하고 다음 활동을 촉진해야 한다.
    • AI 관련 자료를 위한 중앙 저장소를 개발·유지·공유하여, 모든 의학교육자와 학습자가 검증된 양질의 교육자료에 무료로 형평성 있게 접근하도록 보장한다.
    • AI 활용 교육과정 개발, 교수진 훈련, 윤리적 고려사항, 평가 방법 등 특정 영역에서 협력할 전문 실무그룹을 만든다. 그룹 구성원은 협력과 지식 교류를 촉진하기 위해 회의·워크숍·학술대회 등의 행사도 계획하고 참여해야 한다. 임상정보학 훈련 프로그램과 네트워크는 중요한 파트너가 될 수 있다.
    • 네트워크 사업을 지원하고 장기적인 지속가능성을 보장할 재원을 확보하고 자원을 배정한다.
    • 엄격한 데이터 및 윤리 기준에 따라 도구의 개발·도입·평가를 발전시키기 위해 산업계와 파트너십을 구축한다.

 

권고안 5: 의학교육의 AI에 관한 학술활동 발전 (Recommendation 5: Advance scholarship on AI in medical education)

의학교육 지도자, 교수진, 모든 주요 당사자는 의학교육 및 더 넓은 보건의료 전문직 교육 전반에서 AI를 탐색·검증·도입하기 위한 포괄적인 연구 의제와 기타 학술활동을 수립하고 재원을 지원해야 한다. 이 의제는 의학교육과 보건의료 전문직 교육의 AI 교수 도구를 개발하고 엄격하게 평가하는 데 초점을 맞추어야 한다. 또한 미래 의사가 ‘과정에 참여하는 인간(human in the loop)’이 되도록 준비시키는 것과 같은 AI 역량을 어떻게 가르칠지도 검토해야 한다.

 

  • 실행 단계 5.1: 의학교육의 AI 연구 (Action step 5.1: Study AI in medical education). 연구자와 의학교육자는 AI 기반 교육 중재를 현재의 표준이나 관행과 비교하는 엄격한 실험연구 또는 관찰연구를 수행하여 그 효과와 영향을 연구해야 한다. AI 활용 임상체계가 교육에 미치는 영향에 관한 연구도 연구 의제에 포함되어야 한다. 이러한 연구는 편향과 불평등의 지속을 포함해 의도한 결과와 의도하지 않은 결과를 평가해야 하며, 연구 의제를 가속하도록 프로그램과 조직 간 데이터 공유를 뒷받침해야 한다.
  • 실행 단계 5.2: 참여형 연구 수행 (Action step 5.2: Conduct participatory research). 공동 생산이라는 개념을 강화하면서 연구자와 의학교육자는 학습자, 교육자, 환자, 관리자의 다양한 통찰을 수집해야 한다. 이를 통해 의학교육에서 AI에 대한 이들의 수용과 사용에 영향을 미치는 요인을 이해하고, 모든 주요 당사자의 AI 도입을 촉진하거나 저해하는 요인에 대응할 방법을 찾아야 한다.
  • 실행 단계 5.3: 도전적인 학술활동 지원 (Action step 5.3: Fund ambitious scholarship). 의학교육 연구비는 AI를 사용하여 교수, 경험학습(experiential learning), 학습자 평가, 프로그램 평가, 교육 학술활동, 교육행정 절차를 개선할 잠재력이 있는 연구와 실증 사업을 포함해 혁신적이고 영향력이 큰 학술활동에 중점을 두어야 한다.
  • 실행 단계 5.4: 보고 기준 사용 (Action step 5.4: Use reporting standards). 교육 지도자, 교수진, 주요 당사자는 충분한 엄밀성을 보장하고 보건의료 전문직 공동체의 신뢰를 높이기 위해, AI 관련 교육연구를 투명하게 보고하는 방법에 관한 합의 권고안을 개발해야 한다.
  • 실행 단계 5.5: 보급 강화 (Action step 5.5: Enhance dissemination). 교육 지도자, 교수진, 주요 당사자는 학술 성과물과 연구 결과에 재원을 지원하고 이를 보건의료 전문직 교육계에 보급하는 더 효율적이고 효과적이며 시의적절한 방법을 개발해야 한다.
  • 실행 단계 5.6: 학제 간 협력 지원과 산업계 파트너십 모색 (Action step 5.6: Support interdisciplinary collaboration and seek industry partnerships). 재원 지원자는 학술활동의 영향을 최대화하기 위해 다양한 보건의료 전문직의 학자와 데이터 과학자 및 정보학자를 포함한 학제 간 협력을 지원해야 한다. 또한 폭넓게 일반화하고 확장할 수 있는 사업을 지원하고, 이러한 협력을 뒷받침하는 과정에서 AI 기술 기업과 파트너가 되어야 한다.
  • 실행 단계 5.7: AI와 의학의 미래에 관한 전략적 비전 구상 (Action step 5.7: Engage in strategic visioning around AI and medicine). AI는 이미 의학과 의학교육을 변화시키고 있다. 의학교육 지도자들은 선견지명이 있는 사람들을 모아 AI가 주도하는 세계에서 의사와 다른 임상의가 맡게 될 미래의 역할을 파악해야 한다. 이러한 미래상을 널리 알리면 교육자들이 오늘의 학습자를 내일의 진료에 대비시킬 수 있다.

 

결론 (Conclusion) 

AI의 폭발적인 성장과 이에 대한 관심은 의료 실천과 의사 교육에 심대한 결과를 가져올 것이며, 오늘날 온전히 예측하기 어려운 방식으로 미래 의사의 역할을 거의 확실히 변화시킬 것이다. 이 보고서는 다가오는 변화에 대비하기 위해 지금 시행해야 하는 중요한 변화를 강조하고자 한다. AI가 빠르게 진화하는 만큼, 의도한 결과와 의도하지 않은 결과를 모두 엄격하게 측정하고 적응하는 접근법이 필수적이다. 이를 통해 놀라운 새 도구를 활용하면서도 최첨단 기술로 인간의 건강을 증진하는 의사를 교육한다는 우리의 변함없는 목표를 지킬 수 있다.

Holly J. Humphrey를 기리며 (Remembering Holly J. Humphrey)

  • 의학교육 분야에서 전국적으로 저명한 지도자이자 혁신가이며 조시아 메이시 주니어 재단의 회장이었던 Holly J. Humphrey, MD, MACP가 2025년 4월 17일 별세했다. Humphrey 박사는 1983년에 졸업한 시카고대학교 프리츠커 의과대학(University of Chicago Pritzker School of Medicine)에서 오랜 학술의학 경력을 쌓은 뒤 2018년에 재단을 이끌기 시작했다. 시카고대학교와 함께한 40년 동안 수석 전공의, 레지던트 프로그램 책임자, 의학 분야 Ralph W. Gerard 교수, 의학교육 학장을 지냈다. 1989년 Humphrey 박사와 시카고대학교의 한 동료는 졸업을 앞둔 의대생을 위한 미국 최초의 백의식(White Coat Ceremony)을 이끌었다. 경력 동안 셀 수 없이 많은 상과 찬사를 받았지만, 의대생들이 선정하는 ‘가장 좋아하는 교수’ 교육상을 25차례 받은 것을 가장 자랑스럽게 생각한다고 자주 말했다. 그는 미국국립의학한림원(National Academy of Medicine) 회원이기도 했으며, 카이저 퍼머넌트 버나드 J. 타이슨 의과대학(Kaiser Permanente Bernard J. Tyson School of Medicine), 학부 모교인 노스센트럴 칼리지(North Central College), 미국내과전문의위원회(American Board of Internal Medicine), 알파 오메가 알파 의학명예협회(Alpha Omega Alpha Medical Honor Society)의 이사회 의장 등 여러 전국적 지도자 직책을 맡았다. 전문성, 진실성, 연민, 관대함, 학습자의 교육 경험을 개선하려는 흔들림 없는 헌신으로 널리 인정받은 Humphrey 박사의 유산은 그가 경력에 영감을 준 수많은 뛰어난 의사 지도자를 통해 이어질 것이다. 의학교육에 대한 Humphrey 박사의 기여에 관한 자세한 내용은 메이시 재단 웹사이트의 「Holly J. Humphrey를 기리며」(Remembering Holly J. Humphrey, https://macyfoundation.org/news-and-commentary/remembering-holly-j-humphrey-md-macp)를 참조하기 바란다.

https://engage.aamc.org/UME-Competencies-AAMC-ACGME-AACOM

Foundational Competencies for Undergraduate Medical Education 

 

🩺 미국 의과대학의 "공통 졸업역량"이 나왔습니다: AAMC·AACOM·ACGME의 『Foundational Competencies for UME』 읽기

📄 AAMC, AACOM, ACGME. Foundational Competencies for Undergraduate Medical Education. 2024. (CC BY-NC 오픈 액세스)

 

  • 안녕하세요! 오늘은 2024년 말 미국에서 나온 보고서 하나를 소개할게요. 미국의과대학협회(AAMC), 미국정골의과대학협회(AACOM), 졸업후의학교육인증위원회(ACGME), 이 세 기관이 함께 만든 기본의학교육 기초역량(Foundational Competencies for Undergraduate Medical Education) 이에요.
  • 한 줄로 줄이면 이래요. "미국의 모든 의대생이 졸업할 때 갖춰야 할 공통 역량을 처음으로 합의해서 만들었다." 전공의 교육에서는 25년 넘게 써 온 6개 핵심역량(Core Competencies)을 이제 의과대학 단계에도 발달 단계에 맞는 언어로 옮겨 온 거죠. 하나씩 볼게요.

 


📌 1. 한눈에 보는 구조: 6개 역량, 45개 세부역량, 그리고 DO용 4개

프레임워크 구성은 간단해요.

  • 6개 역량(competencies):
    • 전문직업성(Professionalism),
    • 환자진료와 술기(Patient Care and Procedural Skills),
    • 의학지식(Medical Knowledge),
    • 진료기반 학습과 개선(Practice-Based Learning and Improvement),
    • 대인관계와 의사소통 기술(Interpersonal and Communication Skills),
    • 시스템기반 진료(Systems-Based Practice)
  • 45개 세부역량(subcompetencies): 모든 의대생 대상
  • 4개 추가 세부역량: 정골의학(DO, Doctor of Osteopathic Medicine) 학생만 해당

ACGME의 6개 핵심역량을 아시는 분이라면 틀이 익숙하실 거예요. 맞아요, 같은 틀이에요. 그런데 문장이 "의대생 수준"에 맞게 다시 쓰였다는 게 핵심이에요. 뒤에서 다시 볼게요.

먼저 이 보고서가 말하는 "역량(competency)"이 뭔지부터 짚고 갈게요. Frank 등(2010)의 정의를 가져와요.

역량이란 "보건의료인이 지식, 기술, 태도 같은 여러 요소를 통합해 보여 주는, 관찰 가능한 능력"이다.
"observable abilities of a health professional, integrating multiple components, such as knowledge, skills, and attitudes."

관찰 가능(observable) 하다는 게 포인트예요. 관찰할 수 있어야 평가할 수 있으니까요.


🧭 2. 왜 이제야? CBME 30년의 흐름

보고서는 역량바탕의학교육(CBME, Competency-Based Medical Education)의 역사를 짧게 정리해요. 연표로 보면 이렇게 돼요.

연도 사건
1996 캐나다 왕립의사회 CanMEDS 발표 / AAMC 의과대학 목표 프로젝트(MSOP, Medical School Objectives Project) 시작
1999 ACGME·ABMS 6개 핵심역량(Core Competencies) 발표
2001 ACGME Outcome Project 시작
2012 ACGME 차세대 인증체계(NAS, Next Accreditation System) 와 마일스톤(Milestones) 도입 / AACOM 정골의대생 핵심역량 발표
2013 AAMC 의사역량 참조세트(PCRS, Physician Competency Reference Set), 8개 역량
2014 AAMC 핵심 EPA 13개(Core EPAs for Entering Residency) / Physician Accountability 연합이 6개 핵심역량 공식 지지

그러니까 2014년에 이미 의학교육 전 과정(continuum)의 주요 기관들이 "6개 영역으로 가자"고 합의했던 거예요. 그런데 정작 의과대학 쪽에서는 공통 틀을 만들지 않은 채로 10년이 지나갔죠. 보고서도 이 점을 솔직하게 인정해요.

10년 전의 이러한 지지에도 불구하고, 의학교육계는 지금까지 기본의학교육(UME)을 위한 공통 역량 프레임워크를 함께 정의하지 않았다. 여기서 다루는 작업이 바로 그 일, 즉 미국 UME를 위한 공유된 역량 프레임워크를 만드는 일이다.
"Despite this endorsement a decade ago, the medical education community had not, until now, worked collaboratively to define a common competency framework for UME. The current work described here is to do just that: create a shared competency framework for UME in the United States."

🔗 직접적인 계기: UME-GME 전환 문제

직접적인 계기는 2021년 Physician Accountability 연합의 UME-GME 검토위원회(UGRC) 보고서, 그중에서도 권고 9번이에요.

UME와 GME 교육자는 교육 연속체 전반의 대표들과 함께, UME-GME 전환 과정의 학습자에게 적용할 공통 프레임워크와 성과(역량)를 공동으로 정의하고 실행해야 한다.
"UME and GME educators, along with representatives of the full educational continuum, should jointly define and implement a common framework and set of outcomes (competencies) to apply to learners across the UME-GME transition."

 

왜 공통 언어가 필요한지도 같은 보고서에 잘 나와 있어요. 저는 이 대목이 이 프레임워크의 존재 이유를 가장 잘 설명한다고 봐요.

역량에 대한 공유된 정신모형은 학습자의 진전을 평가하는 전략과, 평가에서 끌어낼 수 있는 추론에 대한 합의를 쉽게 해 준다. (...) 개별 학습자에게는 성과를 정의하는 것이 학습을 촉진하고 성장 마인드셋을 북돋울 수 있다. 교수에게는 수행 기대치에 맞춘 평가도구 사용과 교수개발을 가능하게 한다. 수련 프로그램에게는 전공의 선발, UME로부터의 학습자 인계, 전공의 수련, 진료 준비에 유용하다.
"A shared mental model of competence facilitates agreement on assessment strategies used to evaluate a learner's progress, and the inferences that can be drawn from assessments. (...) For individual learners, defining these outcomes will facilitate learning and may promote a growth mindset. For faculty, defining outcomes will allow for the use of assessment tools aligned with performance expectations and faculty development. For residency programs, defining outcomes will be useful for resident selection and learner handovers from UME, resident training, and resident preparation for practice."

 

공유된 정신모형(shared mental model), 이 키워드 기억해 두시면 좋아요.

📚 CBME는 전통적 교육과 뭐가 다를까?

보고서는 CBME와 전통적 접근을 네 가지로 대비해요.

  • 성과(outcomes) 중심 vs 과정(processes) 중심
  • 학습자 중심·환자 초점(learner-centered and patient-focused) vs 교수 주도(teacher-driven)
  • 시간에 걸친 다면적 형성평가(multifaceted, formative assessments) vs 드문 고부담 시험(infrequent, high-stakes tests)
  • 유연하고 시간에 얽매이지 않는 학습(flexible, time-independent learning) vs 모두에게 같은 표준 방식

더 깊이 알고 싶은 분께는 Van Melle 등(2019)의 CBME 5대 핵심 구성요소(five core components), 즉 성과 역량, 순차적 진급, 맞춤형 학습경험, 역량 중심 교수, 프로그램식 평가(programmatic assessment)를 함께 보라고 권해요.


🛠️ 3. 어떻게 만들었나: 3년, 3,000명 넘는 목소리

개발 과정이 꽤 공들인 편이라 따로 소개할 만해요. Batt 등(2021)의 보건의료 역량 프레임워크 개발 6단계 모형(six-step model) 을 따랐고, 약 3년이 걸렸어요.

 

👥 참여 구조

  • 공동리더(co-leads): 세 기관 대표
  • 자문위원회(AC, Advisory Committee): 16개 기관 24명
  • 작업그룹(WG, Working Group): 전국 공모로 뽑은 20명. 지역, 기관 규모와 미션, 전문과목, 학위 유형, 인종·민족·성별까지 고려해서 구성했어요.
  • 반응그룹(RG, Reactor Groups) 2개: 하나는 환자·보호자, 하나는 의대생

📅 진행 단계

  1. 협력적 기획 (2021.9~2022.7)
  2. 커뮤니티 논의와 현황 검토 (2022.8~2023.2): 1,000명 넘게 참여한 포럼
  3. 역량 개발 (2023.3~2024.6): 초안을 여러 차례 공개 의견수렴(1차 761건, 2차 1,189건 등 총 2,000건 이상)
  4. 최종 승인 (2024.9)과 확산

포럼에서 던진 핵심 질문은 이거였어요.

전공과 상관없이, 우리는 미래의 모든 의사가 무엇을 할 수 있고, 무엇을 알고, 무엇을 가치 있게 여기기를 기대하는가?
"What will we expect all future physicians to be able to do, know, and value, regardless of their future specialties?"

 

여기에 한 환자 옹호자(patient advocate)가 이렇게 답했어요. 인상 깊어서 옮겨 둘게요 💬

의사소통 없이 과학과 임상기술은 있을 수 없어요. (...) 번아웃도 많고 의사의 기쁨도 사라졌죠. 서로 소통하지 않는 사일로에서 일하는 것도 문제고요. 그러니까 의사소통이 팀워크와 진료 조정으로 이어지고, 서로 어려운 대화도 나눌 수 있어야 해요.
"You can't have science and clinical skills without communication. (...) There's so much burnout and lack of physician joy. It's also the struggles … working in silos that aren't communicating. So it's communication, leading to teamwork, care coordination, making sure that we can have difficult conversations with each other, pushing through that together and not being afraid of it."

 

작업 방식에서 눈에 띄는 점도 두 가지 있었어요.

  • 7개 지침 원칙(guiding principles) 을 먼저 정했어요. 첫 번째가 "속도보다 질(Choose quality over speed)"이고, 소수 전문가보다 관점의 다양성, 짧은 한 번의 의견수렴 대신 반복적 피드백을 통한 공동창조(cocreate), 그리고 CBME 작업이 관련된 사람들의 웰빙(well-being) 에 미칠 영향까지 고려하자는 원칙이 들어 있어요.
  • 공개 의견이 워낙 많다 보니 수작업 검토와 AI 기반 자동 텍스트 분석(artificial intelligence-automated text analyses) 을 함께 써서 주제를 분류했대요. 🤖

의견수렴 결과 가장 많이 고친 영역은 의학지식이었고, 의사소통, 건강시스템과학(health system science), 보건정책, 근거기반 진료, 환자중심 진료를 더 강조해 달라는 요구가 많았다고 해요.


📊 4. 6개 역량: GME 버전과 뭐가 다를까?

작업그룹이 처음 한 일은 1999년 GME용으로 만들고 2019년에 마지막으로 고친 역량 문장이 의대생에게도 맞는가 를 따지는 거였어요. 결론은 이래요.

두 역량 세트는 서로 정렬되어 있지만, UME 기초역량은 UME 학습자에게 발달적으로 적절한 언어를 반영한다.
"Although the two sets of competencies align, the Foundational Competencies for UME reflect developmentally appropriate language for the UME learner."

직접 비교해 볼게요.

역량 UME (의대생) GME (전공의)
전문직업성 (Professionalism) 모든 상호작용에서 진실성, 존중, 윤리적 추론을 보여 주고 차이의 포용(inclusion of differences) 을 증진해 환자·지역사회·인구집단의 의료를 개선한다 전문직업성에 대한 헌신과 윤리 원칙 준수를 보여 준다
환자진료와 술기 공감적이고, 효과적이며, 전인적(holistic), 근거정보기반(evidence-informed), 형평하고, 환자중심적인 진료를 보여 준다 환자·가족 중심의 진료를 제공하고, 해당 분야의 필수 술기를 모두 수행한다
의학지식 기초지식을 적용하고 통합해 환자와 인구집단의 의료를 개선한다 기존·신규 생의학, 임상, 역학, 사회행동과학 지식과 그 적용을 보여 준다
진료기반 학습과 개선 피드백, 근거, 성찰(reflection) 을 통합해 행동을 조정하고 개선을 촉진하며 평생학습을 기른다 자신의 진료를 조사·평가하고, 과학적 근거를 평가·흡수해 진료를 지속적으로 개선한다
대인관계와 의사소통 환자, 보호자, 의료팀과 효과적으로 소통하고 상호작용해 양질의 환자중심 진료에 기여한다 효과적인 정보 교환과 협업으로 이어지는 대인관계·의사소통 기술을 보여 준다
시스템기반 진료 사회적·구조적 결정요인을 포함한 더 넓은 건강의 맥락과 의료 안팎의 시스템·자원에 대한 지식을 적용한다 의료의 더 넓은 맥락과 시스템을 인식하고 대응하며, 다른 자원을 효과적으로 활용한다

차이가 보이시나요? 👀

 

  • GME는 "필수 술기를 모두 수행한다(Performs all ... procedures)", "진료를 조사·평가한다"처럼 독립적 실무자 기준으로 쓰여 있어요.
  • 반면 UME는 "적용하고 통합한다", "기여한다(contribute to)"처럼 아직 발달 중인 학습자 수준에 맞춰져 있어요. 또 포용, 전인성, 성찰, 구조적 결정요인처럼 최근 의학교육의 관심사가 UME 문장 쪽에 더 분명하게 들어가 있어요.

 


🔍 5. 45개 세부역량에서 눈여겨볼 항목들

세부역량 수는 역량별로 이렇게 나뉘어요. 괄호 안은 DO 전용 항목이에요.

  • 전문직업성 10개 (+1)
  • 환자진료와 술기 11개 (+2)
  • 의학지식 5개 (+1)
  • 진료기반 학습과 개선 5개
  • 대인관계와 의사소통 6개
  • 시스템기반 진료 8개

전부 소개하기보다, 제가 보기에 새롭거나 의미 있는 항목만 골라 볼게요 ✍️

 

🌱 자기 인식과 웰빙 (전문직업성)

  • 개인의 편향을 알아차리고 그 영향을 줄이는 전략을 찾는다 (Identifies personal biases and strategies to mitigate their effects.)
  • 전문가로서의 수행에 영향을 줄 수 있는 개인의 웰빙 요구를 인식하고 다룬다 (Recognizes and addresses personal well-being needs that may impact professional performance.)
  • 실수에 대한 책임을 지고 이를 바로잡기 위해 행동한다 (Takes ownership of mistakes and acts to address them.)

웰빙이 "개인 사정"이 아니라 전문직업성의 한 요소로 들어간 게 눈에 띄어요.

 

🤖 신기술 (의학지식, 시스템기반 진료)

  • 신기술을 포함한 적절한 자원을 활용해 임상 문제와 관련된 지식에 접근한다 (Accesses knowledge relevant to clinical problems using appropriate resources, including emerging technologies.)
  • 환자진료에서 현재 기술과 신기술을 쓸 때의 위험과 이익을 평가한다 (Evaluates the risks and benefits of using current and emerging technologies in patient care.)

"AI"라는 단어가 직접 나오지는 않아요. 그래도 신기술을 쓰는 능력과 따져 보는 능력을 모두 기본 역량에 넣었다는 점은 분명해요.

 

🔎 정보 판별 (의학지식)

  • 정보의 정확성과 임상 문제와의 관련성을 판별한다 (Discerns the accuracy of information and relevance to clinical problems.)

💬 피드백을 "주는" 능력 (대인관계와 의사소통)

  • 다른 사람에게 건설적으로 피드백을 구성하고 전달한다 (Formulates and shares feedback constructively with others.)

피드백을 구하고 반영하는 능력은 진료기반 학습과 개선에, 피드백을 주는 능력은 의사소통에 따로 배치했어요. 피드백을 양방향 역량으로 본 거죠.

 

🏥 형평과 정책 (시스템기반 진료)

  • 환자진료와 의료시스템에서 격차를 줄이고 건강형평(health equity)을 증진하는 기전을 인식한다
  • 보건정책과 의료의 재정적 맥락을 설명한다 (Describes health policy and the financial context of health care.)

🎯 6. 이걸로 뭘 할 수 있을까? 의도된 활용

보고서는 역할에 따라 활용 방식이 다르다고 해요. 예를 들어 교육과정 학장과 위원회는 현재의 교수·평가 활동에 역량을 매핑(mapping) 해서 강점과 빈틈을 찾을 수 있고, 교수 코치는 학생과 함께 학습계획을 짤 수 있어요. 그 밖에 이런 용도를 들어요.

  • 학생 자기평가와 개별 학습계획(individual learning plans)
  • 교육 경험이나 과목의 학습목표 개발
  • 프로그램식 평가(programmatic assessment) 의 빈틈 찾기
  • 평가방법 개발
  • 의학교육 연구와 학술활동

🔄 기존 프레임워크와의 관계

실무적으로 중요한 내용이 두 가지 있어요.

더 포괄적이고, 최신이며, 정렬된 프레임워크인 UME 기초역량은 2013년 AAMC PCRS를 대체할 것이다. EPA는 넓은 역량 프레임워크를 뒷받침하도록 설계되었으므로, UME 기초역량에 기반해 핵심 EPA를 재검토하는 협력 작업이 향후 계획되어 있다.
"The Foundational Competencies for UME — a more inclusive, current, and aligned framework — will replace the 2013 AAMC PCRS. Since EPAs are designed to support a broad competency framework, a future, collaborative effort is being planned to revisit the Core EPAs, based on the Foundational Competencies for UME."

 

정리하면 ① PCRS는 퇴장하고, ② Core EPAs도 이 프레임워크에 맞춰 다시 손볼 예정이라는 거예요. EPA가 역량 프레임워크 "위에" 놓인다는 관계를 분명히 했다는 점도 짚어 둘 만해요.


⚠️ 7. 연구진이 거듭 강조한 것: "모두에게 똑같이"가 아니다

보고서를 읽다 보면 연구진이 여러 번 되풀이하는 메시지가 있어요. 이 프레임워크는 최소한의 공통 기반이지 완성된 교육과정이 아니라는 거예요. 먼저, 망라적이지 않다고 분명히 말해요.

UME 기초역량은 향후 진로와 관계없이 미국의 모든 DO·MD 학생에게 적용하도록 의도되었지만, 학생이 기본의학교육 동안 성취하기를 기대하는 것을 망라하려는 것은 아니다.
"The Foundational Competencies for UME are intended to apply to all DO and MD students in the United States, regardless of their future career plans; however, regarding what students are expected to achieve during their undergraduate medical education, these competencies are not intended to be exhaustive."

 

획일화를 목표로 하지도 않았대요.

우리의 사명은 '모두에게 맞는 단일한(one-size-fits-all)' 시스템을 만드는 것이 아니었다.
"Our mission was not intended to create a 'one-size-fits-all' system."

그래서 각 학교가 할 일이 남아 있다고 해요.

모든 역량과 세부역량은 포괄적으로 쓰여 있어서, 구체적인 교수·학습·평가 방법을 위해서는 더 세분화가 필요하다. 모든 의과대학은 이 역량이 자신의 지역적 사명과 효과적인 환자진료 방식에 어떻게 적용되는지, 그리고 교수와 평가를 위해 어떻게 더 세분화할 수 있는지 고민해야 한다.
"all competencies and subcompetencies, however, are broad and will need further delineation for specific teaching, learning, and assessment methods. All medical schools should consider how the competencies apply to their local missions and approaches to effective patient care, as well as how they can be further delineated for teaching and assessments."

 

또 이 프레임워크는 한 번 만들고 끝이 아니라 주기적으로 검토하고 개정할 계획이라고 밝혔어요.


💡 8. 한국 의학교육에 주는 시사점

마지막으로 제 생각을 조금 덧붙여 볼게요. 어디까지나 제 해석이에요.

  • ① UME-GME를 잇는 "공통 언어"의 문제 🔗
    • 이 보고서의 출발점은 결국 "의대 졸업역량과 전공의 수련역량이 서로 다른 말을 쓰고 있다"는 문제의식이었어요. 우리도 기본의학교육 학습성과나 『한국의 의사상』 같은 졸업 단계 틀이 있고, 전공의 수련 쪽은 최근 역량바탕 수련과 WBA 도입이 진행되고 있죠. 두 단계가 같은 역량 틀과 용어로 연결돼 있는지, 그래서 학생 정보가 수련 프로그램으로 의미 있게 인계(handover) 될 수 있는지는 한번 따져 볼 만한 질문이라고 생각해요.
  • ② "같은 틀, 다른 수준"이라는 설계 방식 📐
    • GME 역량을 그대로 가져오지 않고 발달 단계에 맞는 언어로 다시 쓴 방식은 참고할 만해요. 연속체 전체에서 틀은 유지하면서 기대 수준만 조정하는 거죠. 마일스톤 같은 발달 단계 기술과도 자연스럽게 이어질 수 있는 구조예요.
  • ③ 개발 과정 자체의 교훈 🤝
    • 환자·보호자와 학생을 반응그룹으로 공식 참여시키고, 여러 차례 공개 의견수렴을 거친 점, 그리고 "속도보다 질"을 원칙으로 내건 점이 인상적이었어요. 역량 프레임워크의 정당성은 문장 자체만큼이나 누가 어떻게 만들었는가 에서 나온다는 걸 보여 주는 사례 같아요.
  • ④ 남는 질문들 🤔
    • 물론 한계도 있어요. 45개 세부역량은 여전히 추상적이어서, 보고서 스스로 말하듯 결국 각 학교의 세분화(delineation) 와 평가 설계가 성패를 가를 거예요. 또 역량 목록이 늘어날수록 평가 부담이 커질 수 있다는 점, EPA 재정비가 아직 "계획" 단계라는 점도 지켜봐야 할 부분이에요.

✅ 정리하며

  • 미국 AAMC·AACOM·ACGME가 모든 의대생을 위한 공통 기초역량을 처음으로 함께 만들었어요.
  • 6개 역량, 45개 세부역량, DO 전용 4개로 구성되고, ACGME 6개 핵심역량과 정렬돼 있어요.
  • GME 역량을 의대생 발달 수준에 맞는 언어로 다시 썼고, 웰빙, 편향 인식, 신기술, 건강형평이 눈에 띄게 들어갔어요.
  • PCRS를 대체하고, Core EPAs 재검토도 예고했어요.
  • 연구진은 이것이 망라적이지도, 획일적이지도 않은 공통 기반이며, 각 학교가 자기 사명에 맞게 구체화해야 한다고 거듭 강조해요.

원문은 CC BY-NC 오픈 액세스라 AAMC 홈페이지에서 무료로 받을 수 있어요. 특히 11~13쪽의 세부역량 목록은 교육과정 매핑 작업을 하실 때 옆에 두고 보시면 좋을 거예요. 📎


서론 (Introduction) 

미국의과대학협회(AAMC), 미국정골의과대학협회(AACOM), 전공의교육인증위원회(ACGME)는 미국 의과대학에서 함께 사용할 공통의 기초 역량을 마련하기 위한 사업을 공동 후원했다. 이 역량은 정골의학박사(DO) 학위 수여 대학과 의학박사(MD) 학위 수여 대학이 의료체계에 기여하는 고유한 정체성과 역할을 인정한다. 이 보고서는 그 사업의 산물인 학부 의학교육(undergraduate medical education, UME)을 위한 기초 역량, 포용적이고 반복적인 개발 과정, 그리고 역량바탕 의학교육(CBME)을 발전시키는 데 이러한 역량을 어떻게 사용하고자 하는지를 제시한다. 이 틀은 전문직업성(Professionalism), 환자 진료 및 시술 술기(Patient Care and Procedural Skills), 의학 지식(Medical Knowledge), 진료 기반 학습 및 개선(Practice-Based Learning and Improvement), 대인관계 및 의사소통 술기(Interpersonal and Communication Skills), 체계 기반 진료(Systems-Based Practice)의 6개 역량과 모든 의대생에게 적용되는 45개 세부역량, DO 학생에게만 적용되는 추가 세부역량 4개로 구성된다.

 

역량(competencies)은 “지식, 기술, 태도 등 여러 요소를 통합하는 보건의료 전문직의 관찰 가능한 능력”이다.1 학부 의학교육을 위한 기초 역량은 장래 진로와 무관하게 미국의 모든 DO 및 MD 학생에게 적용되도록 마련되었지만, 학부 의학교육 중 학생이 달성해야 할 사항을 빠짐없이 망라하려는 것은 아니다. 또한 의과대학과 교수진은 이러한 역량을 가르치는 방식이 서로 다를 것이며, 각자의 사명, 원칙, 지역사회를 더 충실하게 반영하도록 이를 확장하고자 할 것이다.

 

이 사업은 의사 책무성 연합(Coalition for Physician Accountability)의 학부 의학교육–대학원 의학교육 검토위원회 보고서2에 제시된 권고와 궤를 같이하며, 학부 의학교육(UME)에서 대학원 의학교육(graduate medical education, GME)으로의 전환을 개선하려는 보고서의 세 공동 후원 기관의 포괄적 노력에 속한다.

 

학부 의학교육을 위한 기초 역량을 개발하면서 우리는 DO와 MD 교육과정을 포함한 모든 의과대학의 기여, 고유한 정체성과 전통을 인정하고, 그 학습자에게 공통적인 성과와 서로 다른 성과를 인정하고자 했다. 우리의 목적은 ‘모든 상황에 똑같이 적용되는’ 체계를 만드는 것이 아니었다. DO 학위 수여 대학은 모든 역량 전반에 정골의학 원칙과 신조(osteopathic principles and tenets)를 계속 통합할 것이다. DO 교육에만 해당하는 세부역량은 3개 역량 영역에 포함되어 있지만, 모든 역량과 세부역량은 폭넓게 제시되어 있으므로 구체적인 교수·학습·평가 방법을 위해서는 한층 세분화해야 한다. 모든 의과대학은 이 역량이 각 기관의 사명과 효과적인 환자 진료 방식에 어떻게 적용되는지, 교수와 평가를 위해 어떻게 더 세분화할 수 있는지 고려해야 한다. 이 보고서에서 사용한 약어와 용어의 전체 목록은 용어집을 참조하기 바란다.

역량바탕 의학교육의 간략한 배경 (Brief Background on Competency-Based Medical Education) 

학부 의학교육을 위한 기초 역량의 공동 개발은 세 후원 기관과 의학교육계 전체가 수십 년 동안 이끌어 온 노력의 중요한 발전을 보여 준다.

  • 역량바탕 교육은 매우 오랜 역사를 지녔지만, 의학에서 전문직 역량에 관한 최초의 현대적 국가 수준 틀은 캐나다 왕립의사외과의사협회(Royal College of Physicians and Surgeons of Canada)가 1996년에 발표했다.3 CanMEDS 틀로 알려진 이 체계는 의사가 자신이 돌보는 사람들의 의료 요구에 효과적으로 대응하기 위해 갖추어야 하는 능력을 설명한다. 지금도 왕립협회의 캐나다 교육·진료 기준의 토대가 된다.
  • 같은 1996년에 AAMC는 MD 학위 수여 의학교육계에서 의대생이 졸업 시 갖추어야 할 특성에 대한 합의를 이루고, 그 특성에 근거한 의과대학 교육과정의 학습목표를 제시하기 위해 의과대학 교육목표 프로젝트(Medical School Objectives Project)4라는 대규모 사업에 착수했다. 이는 미국에서 성과바탕 교육(outcomes-based education)을 강조한 초기의 노력이었다.
  • 몇 년 뒤인 1999년, ACGME와 미국의학전문과목위원회(American Board of Medical Specialties)는 ACGME 인증 레지던트 과정을 마친 모든 의사에게 필요한 기초 능력을 규정하여 레지던트 교육을 설계하고 평가하기 위한 6개 핵심 역량 틀을 발표했다.5
  • 2001년에는 역량바탕 대학원 의학교육을 실현하기 위해 ACGME 성과 프로젝트(Outcome Project)가 공식적으로 출범했다.6
  • 2003년 미국정골의학협회(American Osteopathic Association)는 「핵심 역량 태스크포스 보고서」(Report of the Core Competency Task Force)7를 발표했으며, 이는 2006년 미국정골의사국가시험위원회의 초기 역량 보고서8의 토대가 되었다.
  • 2012년에는 AACOM이 「의대생을 위한 정골의학 핵심 역량」(Osteopathic Core Competencies for Medical Students)9을 출판했고, ACGME는 6개 핵심 역량을 더욱 세분화하는 마일스톤(milestones)을 통합한 차세대 인증체계(Next Accreditation System)10를 시작했다. 마일스톤은 전공의와 펠로우가 6개 핵심 역량에서 보여 주어야 할 발달 단계별 수행 수준을 설명했다.
  • 2013년 AAMC는 학부 의학교육 프로그램의 기대 성과를 종합한 8개 역량의 의사 역량 참조 집합(Physician Competency Reference Set, PCRS)11을 발표했다.

2014년에는 평가, 인증, 면허, 자격인증 활동을 통해 의학교육의 전 연속체를 대표하고 감독하는 국가 조직들의 연합체인 의사 책무성 연합12이 ACGME와 미국의학전문과목위원회의 6개 핵심 역량 틀을 지지했다.13 연합은 DO 공동체처럼 일부 구성 집단이 특정 역량을 강조할 수 있음을 인정하면서도, 모든 의사에게 필수적인 역량에 지지를 집중했다.

“연합 회원들은 전문직 역량을 위한 틀로서, 일반적이지만 필수적인 6개 역량 영역, 즉 전문직업성, 의학 지식, 환자 진료 및 시술 술기, 대인관계 및 의사소통 술기, 진료 기반 학습 및 개선, 체계 기반 진료를 포함하는 틀을 지지한다. 연합 회원 기관들은 사회와 의료전달체계의 요구가 변화하더라도 학생과 의사가 탁월한 환자 진료에 필요한 지식과 기술을 갖추도록, 역량을 지속적이고 의미 있게 평가하고 발전시키는 절차에 전념한다.”

 

10년 전에 이러한 지지가 있었지만, 의학교육계는 지금까지 학부 의학교육을 위한 공통 역량 틀을 공동으로 정의하지 못했다. 이 문서가 설명하는 현재의 작업은 바로 미국 학부 의학교육을 위한 공유 역량 틀을 만드는 일이다.

 

지난 10년간 역량바탕 의학교육을 발전시키기 위한 다른 국가적 노력도 이 간략한 역사 개관에서 언급할 만하다.

  • 2005년에 위임가능 전문직무(entrustable professional activities, EPAs)는 수련자가 충분한 역량을 갖추었을 때 감독 없이 수행하도록 맡길 수 있는 전문직 실무 단위, 과업 또는 책임으로 처음 정의되었다.14
  • 2014년 AAMC는 모든 의대생이 전공의 과정에 진입할 때 간접 감독하에 수행할 수 있어야 하는 13개 전공의 진입 핵심 위임가능 전문직무(Core EPAs)15를 발표했다. 핵심 EPA는 학생의 UME–GME 전환을 개선하기 위해 개발되고 PCRS에 맞추어졌으며 시범 시험을 거쳤다.
  • 2016년 AACOM은 「전공의 진입 핵심 위임가능 전문직무를 위한 정골의학적 고려사항」(Osteopathic Considerations for Core Entrustable Professional Activities for Entering Residency)16을 발표했고, ACGME는 마일스톤 2.0(Milestones 2.0)을 통해 GME 마일스톤을 갱신하고 개선하기 위한 노력을 시작했다.5
  • 2015년부터 2020년까지 레지던트 및 펠로십 프로그램 인증은 단일 체계로 전환되었다. ACGME는 정골의학 원칙과 실천에 대한 정규 교육을 교육과정에 통합한 레지던트 또는 펠로십 프로그램을 위해 정골의학 인정(Osteopathic Recognition)을 마련했다.17

학부 의학교육을 위한 기초 역량의 개발은 역량바탕 의학교육의 중요한 발전일 뿐 아니라, 의사 책무성 연합의 2021년 학부 의학교육–대학원 의학교육 검토위원회 보고서2의 권고에도 부응한다. 구체적으로 제9권고는 “UME와 GME 교육자들이 교육 연속체 전체의 대표자들과 함께 UME–GME 전환 과정의 학습자에게 적용할 공통 틀과 일련의 성과(역량)를 공동으로 정의하고 시행해야 한다”고 명시한다.

 

보고서는 이 권고를 다음과 같이 더 설명한다.

“역량에 관한 공유된 정신모형(shared mental model)은 학습자의 진전을 평가하는 데 사용되는 평가 전략과 평가에서 이끌어 낼 수 있는 추론에 대한 합의를 촉진한다. 성과를 표현하는 공통 언어는 환자와 대중의 신뢰를 염두에 두고 학습자의 역량에 관한 정보를 전달할 수 있다. 개별 학습자에게 이러한 성과의 정의는 학습을 돕고 성장 사고방식을 촉진할 수 있다. 교수진에게는 수행 기대치에 부합하는 평가도구의 사용과 교수개발을 가능하게 한다. 레지던트 프로그램에는 전공의 선발, UME에서의 학습자 인계, 전공의 교육, 진료 준비에 유용할 것이다.”2

 

역량바탕 의학교육과 전통적인 교수·학습 접근법을 각각 비교하면, 일부 특징은 다음과 같이 요약할 수 있다.

 

  • 과정(processes)보다 성과(outcomes)에 초점을 맞춘다.
  • 교수자 주도보다 학습자 중심·환자 중심이다.
  • 드물게 시행하는 고부담 시험보다 시간에 걸친 다면적 형성평가(formative assessment)를 요구한다.
  • 모두에게 동일한 표준 접근보다 유연하고 시간에 구애받지 않는 학습을 지원한다.

 

역량바탕 의학교육을 뒷받침하는 방대한 연구와 여러 교육 이론을 포함한 추가적인 세부사항은 이 문서의 범위를 훨씬 벗어난다. 다만 독자들이 Van Melle 등18이 설명한 다섯 가지 핵심 구성요소에 익숙해지고 학부 의학교육을 위한 기초 역량을 역량바탕 의학교육의 더 넓은 맥락 속에 놓고 이해하기를 권한다.

개발 과정 (The Development Process) 

학부 의학교육을 위한 기초 역량을 개발하는 약 3년의 과정(그림 1)은 Batt 등19이 제시한 보건의료 전문직 역량 틀 개발 모형을 참고했으며, 공동 기획, 지역사회 논의, 현황 검토(landscape review), 역량 개발, 보고, 보급을 포함했다. 세 후원 기관을 대표하는 공동 책임자들은 학술의학 전반의 전문기관 관계자로 구성된 자문위원회(advisory committee, AC)의 지원을 받았다. 전국 단위의 지원 절차를 거쳐 학부 의학교육을 위한 기초 역량 초안을 작성할 실무그룹(working group, WG)을 구성했고, 중요한 통찰을 제공하여 실무그룹의 노력을 뒷받침할 두 반응그룹(reactor groups, RGs), 즉 환자·돌봄제공자 그룹과 의대생 그룹을 만들었다. 자원 참가자들의 활동과 개발 과정에 관한 자세한 내용은 부록을 참조하기 바란다.

 

그림 1. 학부 의학교육을 위한 기초 역량 개발 일정 (Figure 1. The timeline for the development of the Foundational Competencies for Undergraduate Medical Education).

  • 2021년 9월–2022년 7월: 세 후원 기관이 역량 사업을 계획하고 자문위원회를 소집한다.
  • 2022년 8월–2023년 2월: 기초 역량과 학부 의학교육 전반에서 공통 성과를 도입하는 데 따른 함의에 관해 의료 전문가, 학습자, 환자, 돌봄제공자 1,000명 이상에게서 초기 의견을 수집한다. 전국 지원자 모집에 이어 다양한 구성원의 실무그룹을 선정한다.
  • 2023년 3월–2024년 6월: 실무그룹이 학부 의학교육을 위한 기초 역량을 개발한다. 반복 수정된 초안을 공개 검토와 의견 수렴에 부친다.
  • 2024년 말 이후: 기초 역량을 널리 배포하고, 역량바탕 의학교육을 실현하기 위한 공동 노력에 의학교육계의 참여를 요청한다.

 

지역사회 논의 단계 전반에 걸쳐 여러 포럼을 열어 의료와 의학교육에 관한 다양한 관점을 가진 1,000명 이상을 참여시켰다. 공동 책임자들은 의대생, 전공의, 펠로우, 교수, 환자, 병원 최고경영자, 의과대학 학장, 박사 학위 과학자의 관점을 들었다. 포럼에서 자주 던진 질문은 “미래 전문과목과 관계없이 모든 미래의 의사가 무엇을 할 수 있고, 무엇을 알고, 무엇을 중시하기를 기대할 것인가?”였다. 다음은 그 응답의 일부다.

  • 연민(Compassion) — “언젠가 의사와 간호사에게서 빠져 있는 그 연결고리를 표현할 수 있으리라는 것을 알고 있었어요. 그들은 삶의 마지막 시기에 관해 충분히 배우지 못합니다. … 세상에는 그 부분에서 조금 더 많은 연민이 필요합니다.” — 돌봄제공자
  • 자기돌봄(Self-Care) — “목표는 단지 어떻게 견딜 것인가가 아니라, 이상적으로는 타인의 삶에 선을 행한다는 직업의 목적과 의미를 중시하는 기준점으로 어떻게 계속 돌아올 것인가입니다.” — 교육병원 최고경영자
  • 양질의 진료(Quality Care) — “모든 환자에게 개인화된 방식으로 최고 수준의 근거바탕 진료를 제공해야 합니다. 이는 높은 수준의 성과와 과정 개선을 뒷받침하는 체계를 어떻게 만들어 개별 환자와 인구집단의 진료 질을 지속해서 높일지 이해한다는 뜻입니다.” — 교육병원 최고경영자
  • 유연성과 회복탄력성(Flexibility and Resiliency) — “현재도, 앞으로도 의료에 접근하는 길은 매우 많습니다. … 이러한 변화에 적응하면서 의료의 구조는 빠르게 바뀔 가능성이 큽니다. … 의사가 성공적인 경력을 이어가려면 유연성과 회복탄력성이 필요합니다.” — 교수
  • 의사소통(Communication) — “의사소통 없이는 과학과 임상 술기가 있을 수 없습니다. … 소진도 많고 의사로서 느끼는 기쁨도 부족합니다. 서로 의사소통하지 않는 칸막이 속에서 일하는 어려움도 있습니다. 그러니 의사소통에서 팀워크와 진료 조정으로 이어지고, 서로 어려운 대화를 나누며, 두려워하지 않고 함께 헤쳐 나갈 수 있어야 합니다.” — 환자 옹호자

우리는 또한 학부 의학교육을 위한 기초 역량의 예상되는 이점을 의학교육계에 물었다. 그들은 다음과 같이 이 작업이 유익할 수 있는 여러 방식을 제시했다.

  • 개별화된 학습 기회의 확대.
  • 의과대학에서 레지던트 과정으로의 전환 개선:
  • 전공의가 첫 근무일을 더 잘 준비한다.
  • 의과대학과 레지던트 프로그램이 공통 언어를 사용한다.
  • 레지던트 프로그램이 신입 전공의에게 무엇을 기대하고 어떻게 가장 잘 도울지 안다.
  • 환자 성과의 개선.

개발 단계에서 실무그룹은 여러 차례 초안을 만들고 수정했다. 대면 모임, 설문조사, 온라인 의견 양식을 통해 각 초안에 대해 반응그룹, 자문위원회, 의학교육계와 일반 대중의 의견을 구했다. 세 차례의 반복 초안을 검토한 뒤 총 2,000건 이상의 응답을 받았다(세 번째 초안은 자문위원회와 반응그룹에만 공유했다). 모든 의견은 최종 학부 의학교육을 위한 기초 역량, 즉 6개 역량, 45개 세부역량, DO에만 적용되는 추가 세부역량 4개를 확정하는 데 기여했다.

 

학부 의학교육을 위한 기초 역량은 주기적으로 검토·갱신될 것이다. 다양한 의학교육계의 의견을 수렴하여 새로운 역량이 미국 전역의 의과대학에서 어떻게 사용되는지 더 잘 파악하고, 후원 기관과 다른 관계자들이 그 사용과 향후 조정을 어떻게 더 잘 지원할지 판단하는 데 활용할 것이다.

중요한 고려사항 (Important Considerations) 

UME와 GME 역량의 비교 (Comparing UME and GME Competencies) 

표 1은 학부 의학교육을 위한 새로운 6개 기초 역량과 현재의 GME 역량을 비교한다.20 실무그룹의 첫 과제 중 하나는 1999년 GME를 위해 만들어지고 2019년에 마지막으로 개정된 역량 진술문이 UME 학습자에게 적절한지 검토하는 것이었다. 두 역량 집합은 서로 맞닿아 있지만, 학부 의학교육을 위한 기초 역량은 UME 학습자의 발달 단계에 적절한 언어로 표현된다.

 

표 1. 여섯 가지 역량: 학부 의학교육과 대학원 의학교육 (Table 1. Six Competencies: Undergraduate Medical Education and Graduate Medical Education) 

역량 학부 의학교육(UME) 대학원 의학교육(GME)
전문직업성(Professionalism) 환자, 지역사회, 인구집단의 의료를 개선하기 위해 모든 상호작용에서 진실성, 존중, 윤리적 추론을 보여 주고 차이에 대한 포용을 증진한다. 전문직업성에 대한 헌신과 윤리 원칙의 준수를 보여 준다.
환자 진료 및 시술 술기(Patient Care and Procedural Skills) 연민이 있고 효과적이며 전인적·근거정보 기반·형평적인 환자중심 진료를 보여 준다. 건강 문제의 치료와 건강 증진을 위해 환자·가족 중심이며 연민이 있고 형평적이며 적절하고 효과적인 환자 진료를 제공한다. 해당 진료 영역에서 필수적인 것으로 간주되는 모든 의학적·진단적·외과적 시술을 수행한다.
의학 지식(Medical Knowledge) 환자와 인구집단의 의료를 개선하기 위해 기초 지식을 적용하고 통합한다. 과학적 탐구를 포함한 확립된 생의학·임상의학·역학·사회행동과학 지식과 그 발전 양상, 그리고 이 지식을 환자 진료에 적용하는 방법을 알고 있음을 보여 준다.
진료 기반 학습 및 개선(Practice-Based Learning and Improvement) 피드백, 근거, 성찰을 통합하여 행동을 조정하고 개선을 촉진하며 평생학습을 함양한다. 자신의 환자 진료를 조사·평가하고, 과학적 근거를 비판적으로 평가·동화하며, 지속적인 자기평가와 평생학습을 바탕으로 환자 진료를 계속 개선하는 능력을 보여 준다.
대인관계 및 의사소통 술기(Interpersonal and Communication Skills) 양질의 환자중심 진료에 기여하기 위해 환자, 돌봄제공자, 의료팀과 효과적으로 소통하고 상호작용한다. 환자, 가족, 보건의료 전문직과 효과적으로 정보를 교환하고 협력하게 하는 대인관계 및 의사소통 술기를 보여 준다.
체계 기반 진료(Systems-Based Practice) 건강의 사회적·구조적 결정요인을 포함한 더 넓은 건강 맥락과 의료 안팎의 체계·자원에 관한 지식을 적용하여 환자, 지역사회, 인구집단을 위한 양질의 진료를 최적화한다. 건강의 구조적·사회적 결정요인을 포함한 더 넓은 건강 맥락과 의료체계를 인식하고 이에 대응하며, 최적의 의료를 제공하기 위해 다른 자원을 효과적으로 활용하는 능력을 보여 준다.

학부 의학교육을 위한 기초 역량의 의도된 활용 (Intended Uses of the Foundational Competencies for UME) 

학부 의학교육을 위한 기초 역량은 학술의학에서 맡은 역할에 따라 여러 용도로 활용할 수 있다. 예를 들어 교육과정 학장과 위원회는 현재의 교수 및 평가 관행에 역량을 대응시켜 강점과 잠재적 공백을 찾을 수 있다. 역량은 교수 코치가 학생과 학습계획을 공동 설계하고 교수 경험과 평가 방법을 설계하거나 조정하는 데 도움을 줄 수 있다. 그 밖의 활용에는 다음이 포함된다.

  • 학생의 자기평가와 개인 학습계획 수립.
  • 교육 경험 또는 교과목의 학습목표 개발.
  • 프로그램 차원 평가(programmatic assessment)의 공백 파악.
  • 평가 방법 개발.
  • 의학교육 연구와 학술활동의 발전.

학부 의학교육을 위한 기초 역량과 다른 틀의 관계 (How the Foundational Competencies for UME Relate to Other Frameworks) 

학부 의학교육을 위한 기초 역량은 2014년 의학계 전반에서 폭넓게 지지한 6개 광범위한 영역의 기대 성과를 제시한다(표 1).13 이러한 영역은 학위 종류나 장래 전문과목과 관계없이 모든 의대생에게 기초가 되는 역량을 나타낸다. AAMC의 「의학의 새로운·부상하는 분야 역량 시리즈」(New and Emerging Areas in Medicine Competency Series)21와 AACOM의 「농촌의학 핵심 역량」(Rural Medicine Core Competencies)22 같은 다른 역량은 새롭게 부상하는 주제 영역의 깊이를 더하고, 특히 교육과정에서 충분히 다루지 않는 영역에서 교육과정 및 전문직 개발의 길잡이가 되도록 마련되었다. 주제별 역량과 학부 의학교육을 위한 기초 역량은 모두 형성적 수행평가와 교육 연속체 간 협력을 이끌고, 궁극적으로 의료서비스와 성과를 개선하기 위한 것이다.

 

더 포용적이고 최신이며 서로 연계된 틀인 학부 의학교육을 위한 기초 역량은 2013년 AAMC PCRS를 대체할 것이다. EPA는 광범위한 역량 틀을 뒷받침하도록 설계되었으므로, 학부 의학교육을 위한 기초 역량에 근거하여 핵심 EPA15,16를 재검토하는 향후 공동 작업이 계획되고 있다.

정골의학 원칙과 신조 (Osteopathic Principles and Tenets) 

학부 의학교육을 위한 기초 역량을 개발하면서 DO 교육자들과 다른 참여자들은 정골의학 원칙과 신조의 통합에 초점을 맞추었다.23

  1. 신체는 하나의 단위이며, 사람은 몸·마음·정신의 통합체다.
  2. 신체에는 자기조절, 자가치유, 건강 유지 능력이 있다.
  3. 구조와 기능은 상호 관련된다.
  4. 합리적 치료는 신체의 통일성, 자기조절, 구조와 기능의 상호관계라는 기본 원칙에 대한 이해를 바탕으로 한다.

DO와 MD 교육과정의 고유한 정체성은 앞으로도 인정받고 존중받는다. DO 학위 수여 대학은 모든 세부역량을 구체화할 때 정골의학 원칙과 신조를 통합해야 한다. 실무그룹은 정골의학에만 적용되는 세부역량 4개를 만들기로 했지만, 이것이 정골의학의 원칙과 신조가 구현될 모든 방식을 나타내는 것은 아니다. 모든 세부역량은 의도적으로 폭넓게 설계되었으므로 구체적인 교수·학습·평가 방법을 위해서는 더 세분화해야 한다. 다시 말해, 모든 DO 및 MD 학위 수여 대학과 교수진은 학부 의학교육을 위한 기초 역량이 각 기관의 사명과 지역사회에 어떻게 적용되는지, 교수와 평가를 위해 어떻게 더 세분화할 수 있는지 고려해야 한다.

학부 의학교육을 위한 기초 역량
(Foundational Competencies for Undergraduate Medical Education)
 

전문직업성(Professionalism) 

환자, 지역사회, 인구집단의 의료를 개선하기 위해 모든 상호작용에서 진실성, 존중, 윤리적 추론을 보여 주고 차이에 대한 포용을 증진한다.

1. 환자, 돌봄제공자, 가족, 팀원에게 존중과 연민을 보여 준다.

2. 환자의 사생활, 비밀, 자율성을 보호한다.

3. 윤리 원칙과 추론을 활용해 행동을 이끈다.

4. 상황에 따라 행동과 의사소통을 조정한다.

5. 자신의 실수를 책임지고 이를 해결하기 위해 행동한다.

6. 자신의 지식과 기술의 한계를 파악하고 적절하게 도움을 구한다.

7. 자신의 편향과 그 영향을 완화할 전략을 파악한다.

8. 서로 다른 배경과 경험을 가진 사람들에게서 배우려는 겸손과 의지를 보여 준다.

9. 전문직 수행에 영향을 줄 수 있는 자신의 웰빙 요구를 인식하고 대응한다.

10. 의무와 과업을 철저하고 신뢰성 있게, 제때 완수한다.

11. DO 학생만 해당: 네 가지 신조를 증진함으로써 정골의학 철학을 보여 준다.

환자 진료 및 시술 술기(Patient Care and Procedural Skills) 

연민이 있고 효과적이며 전인적·근거정보 기반·형평적인 환자중심 진료를 보여 준다.

1. 환자와 돌봄제공자의 상황, 요구, 가치, 선호, 경험을 환자 진료에 통합한다.

2. 필요에 따라 여러 자료원에서 관련 환자 병력을 수집한다.

3. 적절한 기법과 도구를 사용하여 관련 신체진찰을 수행한다.

4. 긴급 또는 응급 진료가 필요한 환자를 파악하고, 도움을 구하며, 초기 평가와 관리 방안을 제안한다.

5. 감별진단을 구성하고 우선순위를 정한다.

6. 가설에 근거한 진단검사를 제안하고 결과를 해석한다.

7. 흔히 접하는 임상 상태에 대한 치료 관리 계획을 수립한다.

8. 환자중심 언어를 사용하여 일반적인 진단·치료 중재와 계획을 설명한다.

9. 기본적인 시술 기법을 보여 준다.

10. 건강증진과 질병예방을 환자 진료 계획에 포함한다.

11. 건강과 웰빙에 영향을 미치는 개인적·구조적 요인을 파악한다.

12. DO 학생만 해당: 정골의학 원칙, 실천, 신조를 환자 진료에 통합한다.

13. DO 학생만 해당: 정골의학적 구조 검진(osteopathic structural examination)을 수행하고, 정골의학 도수치료(osteopathic manipulative treatment, OMT)로 신체 구조계의 기능 변화 또는 체성기능장애(somatic dysfunction)를 치료한다.

의학 지식(Medical Knowledge) 

환자와 인구집단의 의료를 개선하기 위해 기초 지식을 적용하고 통합한다.

1. 임상 진료에 필요한 기초과학, 임상의학, 병태생리학, 사회과학, 보건의료체계과학(health systems sciences), 인문학 지식을 보여 준다.

2. 임상 상황에서 임상 문제해결, 진단적 추론, 의사결정에 기초 지식을 적용한다.

3. 정보의 정확성과 임상 문제와의 관련성을 판단한다.

4. 연구 설계, 해석, 임상 질문에의 적용에 관한 지식을 보여 준다.

5. 새롭게 등장하는 기술을 포함한 적절한 자원을 사용하여 임상 문제와 관련된 지식에 접근한다.

6. DO 학생만 해당: 정골의학 원칙, 실천, 신조를 환자 진료에 통합하는 방법에 관한 지식을 보여 준다.

진료 기반 학습 및 개선(Practice-Based Learning and Improvement) 

피드백, 근거, 성찰을 통합하여 행동을 조정하고 개선을 촉진하며 평생학습(lifelong learning)을 함양한다.

1. 수행을 개선하기 위해 피드백과 평가 자료를 능동적으로 구하고 반영한다.

2. 정보에 근거한 자기평가와 성찰적 실천(reflective practice)을 통해 자신의 수행에서 성장 기회를 찾는다.

3. 학습과 개선 목표를 세우고 실행하며 재평가한다.

4. 근거정보 기반의 환자중심 임상 의사결정을 뒷받침하기 위해 정보를 찾고 비판적으로 평가하며 종합한다.

5. 탐구심과 성장하고 새로운 지식을 구하는 능력을 보여 준다.

대인관계 및 의사소통 술기(Interpersonal and Communication Skills) 

양질의 환자중심 진료에 기여하기 위해 환자, 돌봄제공자, 의료팀과 효과적으로 소통하고 상호작용한다.

1. 치료적 관계(therapeutic relationship)를 강화하기 위해 환자, 돌봄제공자, 팀원과 협력한다.

2. 팀과 조직의 기능을 향상하기 위해 의료 및 행정팀 구성원과 협력한다.

3. 적극적 경청(active listening)을 보여 준다.

4. 언어, 비언어, 서면, 전자 형식으로 명확하고 정확하며 연민을 담아 소통한다.

5. 환자, 돌봄제공자, 동료, 팀원을 교육하는 기술을 보여 준다.

6. 타인에게 건설적으로 피드백을 구성하여 전달한다.

체계 기반 진료(Systems-Based Practice) 

건강의 사회적·구조적 결정요인을 포함한 더 넓은 건강 맥락과 의료 안팎의 체계·자원에 관한 지식을 적용하여 환자, 지역사회, 인구집단을 위한 양질의 진료를 최적화한다.

1. 건강의 사회적·구조적 동인(social and structural drivers of health)에 관한 지식을 적용한다.

2. 환자 진료와 의료체계에서 격차를 줄이고 건강 형평성(health equity)을 증진할 기전을 인식한다.

3. 다양한 의료팀, 의료전달 환경, 체계에 맞추어 수행을 조정한다.

4. 환자 진료의 전환과 조정에 협력한다.

5. 환자 진료에서 현재 및 신흥 기술을 사용할 때의 위험과 이익을 평가한다.

6. 환자안전 우려, 체계상 문제, 질 향상 기회를 파악한다.

7. 보건정책과 의료의 재정적 맥락을 설명한다.

8. 지역 인구집단과 지역사회의 건강 요구, 격차, 자원에 관한 지식을 적용한다.

용어집 (Glossary) 

  • AACOM: American Association of Colleges of Osteopathic Medicine(미국정골의과대학협회).
  • AAMC: Association of American Medical Colleges(미국의과대학협회).
  • ACGME: Accreditation Council for Graduate Medical Education(전공의교육인증위원회).
  • 적극적 경청(Active listening): “… 화자가 하는 말에 깊이 관여하고 주의를 기울이는 것이다. 말하는 것보다 훨씬 더 많이 듣는 것이 필요하다. 적극적으로 경청하는 사람의 [목표]는 화자의 관점을 진정으로 이해하고 … 그 이해를 화자에게 다시 전달하여 [화자가] 듣는 사람의 이해가 정확한지 확인할 수 있게 하는 것이다.”24
  • 진료 계획(Care plan): “단일 평가 과정에 따라 환자의 통합된 건강 및 사회적 돌봄 요구를 상세히 기술하는 서면의 [개인화된] 진료 계획.”25
  • 역량 상태(Competence): “특정 맥락에서 수행의 여러 영역 또는 측면에 걸친 능력[(지식, 기술, 태도)]의 총체. 역량 상태에 관한 진술에는 관련 능력, 맥락, 수련 단계를 정의하는 설명적 한정어가 필요하다. 역량 상태는 다차원적이고 역동적이다. 시간, 경험, 환경에 따라 변한다.”1
  • 개별 역량(Competency): “지식, 기술, 가치, 태도를 [통합하는 특정 활동과 관련된] 보건의료 전문직의 관찰 가능한 능력. 역량은 관찰 가능하므로 습득 여부를 확인하기 위해 측정하고 평가할 수 있다. 역량은 점진적 발달을 돕도록 건축 블록처럼 조합할 수 있다.”1
  • 역량바탕 의학교육(Competency-based medical education, CBME): “역량을 조직화 틀로 사용하여 의학교육 프로그램을 설계, 시행, 평가, 검증하는 성과바탕 접근법.”1
  • 비밀유지(Confidentiality): 특정인이 정보를 제3자와 공유하지 못하도록 하는 윤리적 의무.
  • 교육 연속체/의학교육 연속체(Educational continuum/Continuum of medical education): 학부 의학교육(의과대학)에서 대학원 의학교육(레지던트 및 펠로십), 계속 의학교육(진료를 수행하는 동안)에 이르는 의사의 교육 전 범위.
  • 효과적인 진료(Effective care): 과학적 지식에 근거한 서비스를 혜택을 받을 수 있는 모든 사람에게 제공하고, 혜택을 받을 가능성이 낮은 사람에게는 제공하지 않는 것(각각 과소이용과 오용을 피함).26
  • 형평적인 진료(Equitable care): 성별, 민족성, 지리적 위치, 사회경제적 지위 같은 개인적 특성 때문에 질이 달라지지 않는 진료를 제공하는 것.26
  • 근거정보 기반 진료(Evidence-informed care): 과학적 연구, 임상 경험과 판단, 환자의 선호와 가치에서 얻은 정보를 통합하는 진료.27
  • 역량바탕 의학교육 교육과정의 다섯 가지 핵심 구성요소(Five core components of competency-based medical education curricula): 성과 역량(outcome competencies), 순차적 진전(sequenced progression), 맞춤형 학습 경험(tailored learning experiences), 역량 중심 교수(competency-focused instruction), 프로그램 차원 평가(programmatic assessment).18
  • 건강 격차(Health disparity): 다른 집단에 비해 한 집단이 더 큰 질병, 손상, 장애 또는 사망 부담을 겪는 것을 가리킨다.28
  • 건강 형평성(Health equity): “‘건강 형평성’ 또는 ‘건강에서의 형평성’은 이상적으로 모든 사람이 자신의 건강 잠재력을 온전히 달성할 공정한 기회를 가져야 하며, 누구도 그 잠재력의 달성에서 불리한 처지에 놓여서는 안 된다는 뜻을 함축한다.”29
  • 환자중심 진료(Patient-centered care): “개별 환자의 선호, 요구, 가치를 존중하고 이에 대응하며, 환자의 가치가 모든 임상적 결정을 이끌도록 보장하는 진료.”26
  • 환자중심 언어(Patient-centered language): “환자중심 의사소통은 의사, 환자, 그리고 적절한 경우 가족이 공동으로 달성해야 하는 목표에 초점을 맞춘다. 환자중심 의사소통의 몇 가지 특징은 다음과 같다.
    • “환자의 관점(신념, 선호, 우려, 요구)을 드러낸다.
    • “환자의 건강과 웰빙에 관한 생물·심리·사회적 맥락을 탐색한다.
    • “의사–환자 관계에서 신뢰와 상호 존중을 형성하거나 강화한다.
    • “환자가 이해할 수 있는 방식으로 질병과 치료 선택지를 제시한다.
    • “의사소통과 의사결정 과정에 환자가 적극적으로 참여하도록 돕는다.
    • “문제해결과 실행계획에서 상식에 바탕을 둔다.
    • “근거에 기반하고 환자의 가치와 일치하며 실행 가능한 결정을 허용한다.”30
  • 환자안전(Patient safety): 예방 가능한 위해사건과 의료 오류의 발생을 줄이는 실천.31
  • 환자의 사생활(Patient privacy): “… 개인 공간(신체적 사생활), 개인 자료(정보적 사생활), 문화적·종교적 소속을 포함한 개인적 선택(의사결정의 사생활), 가족 및 기타 친밀한 사람들과의 개인적 관계(관계적 사생활) 등 여러 측면을 포괄한다.”32
  • 질 향상(Quality improvement): 의료서비스와 환자 성과의 측정 가능한 개선으로 이어지는 체계적이고 지속적인 실천.31
  • 성찰적 실천(Reflective practice): “… 전문직 종사자가 자신의 암묵적 지식 기반을 자각하고 경험에서 배우는 실천.”33
  • 건강의 사회적·구조적 동인(Social and structural drivers of health): 건강의 사회적 동인과 구조적 동인은 서로 교차하며 의료서비스 접근성, 이환율과 사망률, 의료의 질을 비롯한 건강의 여러 측면에 영향을 준다.
  • 건강의 사회적 동인(Social drivers of health): “건강의 사회적 동인이라는 용어와 건강의 사회적 결정요인(social determinants of health)이라는 용어는 서로 바꾸어 사용한다.”34 “[건강의 사회적 동인은] 사람들이 태어나고 성장하고 생활하고 일하고 나이 드는 지역사회 전반의 기저에 놓인 사회적·경제적·물리적 조건을 가리킨다. 이는 광범위한 건강, 기능, 삶의 질 관련 성과와 위험에 영향을 미친다. 이러한 결정요인과 사회적 지위에 따른 불평등한 분포는 인구집단 간에 예방 가능하고 부당한 건강상태의 차이를 낳는다.”35
  • 건강의 구조적 동인(Structural drivers of health): 건강의 구조적 동인과 건강의 구조적 결정요인(structural determinants of health)은 서로 바꾸어 사용한다. “건강의 구조적 동인은 사회적 불평등을 만들어 내고 따라서 건강에 영향을 주는 상위 수준의 사회적·경제적·정치적 기전을 가리킨다(예: 정부의 의료 재정 지원 정도).”36
  • 정골의학의 신조(Tenets of Osteopathic Medicine): “… 정골의학의 근간이 되는 철학을 표현하며, 미국정골의학협회(AOA) 대의원회가 정책으로 승인했다.
    • 1. “신체는 하나의 단위이며, 사람은 몸·마음·정신의 통합체다.
    • 2. “신체에는 자기조절, 자가치유, 건강 유지 능력이 있다.
    • 3. “구조와 기능은 상호 관련된다.
    • 4. “합리적 치료는 신체의 통일성, 자기조절, 구조와 기능의 상호관계라는 기본 원칙에 대한 이해를 바탕으로 한다.”23
  • 치료적 관계(Therapeutic relationship): 돌봄제공자와 환자의 관계로, 돌봄제공자가 환자를 소중히 여기고 환자에게 헌신하며, 권력의 불균형을 관리하고, 인격과 역량을 갖추는 것을 포함한다.37
  • 진료 전환(Transition of care): “… 환자가 한 진료 환경에서 다른 환경으로 이동하는 것. 진료 환경에는 병원, 외래 1차의료 진료소, 외래 전문과 진료소, 장기요양시설, 재택의료, 재활시설이 포함될 수 있다.”38

 

 

Teach Learn Med. 2026 Apr-May;38(2):236-247. doi: 10.1080/10401334.2025.2495352. Epub 2025 Apr 24.

The Historical Roots of Tiered Grading in US Medical Education 

 

 

🤔 질문 하나로 시작해 볼까요

임상실습(clerkship)이 끝나면 학생들에게 Honors, High Pass, Pass 같은 등급을 매깁니다. 너무 당연해서 아무도 묻지 않는 관행이죠. 그런데 이 등급식 평가(tiered grading)는 대체 언제, 왜, 무슨 근거로 시작된 걸까요? 

 

이 논문은 바로 그 질문을 던집니다. 그리고 저자들이 250년치 문헌을 뒤진 끝에 내놓은 답은 꽤 불편합니다. 등급식 평가는 임상역량을 재려고 만들어진 게 아니었다는 겁니다. 의과대학이 대학(university) 체제 안으로 편입되는 과정에서 그냥 딸려 들어온 것에 가깝다는 거죠.

 

저자들이 쓰는 용어를 먼저 정리하면 이렇습니다. 관찰 도구가 평가(assessment), 그 자료로 내리는 판단이 평정(evaluation), 그 판단에 따른 의사결정이 성적 부여(grading)입니다. 그리고 이 논문이 겨냥하는 건 그중에서도 규준참조(norm-referenced) 방식으로 학생을 서열화하는 등급식 평가입니다.


🏛️ 1부. 의학교육이 대학으로 들어가기까지

미국 의학교육의 출발점은 1765년 John Morgan입니다. 도제식 교육을 넘어 대학과 같은 원리 위에 의학교육을 세우자고 주장했죠. 다만 그가 평가 체계를 구체적으로 설계한 건 아니었습니다. 학위 수여 전에 제대로 된 판단이 필요하다는 정도의 신념은 있었어요.

"그렇다면 우리는 합당한 보상으로 진가를 가려내고, 진정한 공적에 마땅한 영예를 부여하는 것을 목표로 삼읍시다."

"Let us aim then to distinguish worth with adequate reward and confer due honors on real merit." (Morgan, 1765)

 

문제는 19세기입니다. 대학 밖에 영리 의과대학(proprietary medical school)이 우후죽순 생겨났는데, 입학 기준도 교육과정도 제각각이었고 졸업 요건은 마지막 시험 한 번이 전부인 경우가 많았습니다. 여기서 흥미로운 대목이 있어요. 학생이 학교를 떠나는 이유는 학업 부진보다 등록금을 못 내서인 경우가 훨씬 많았습니다. 교수 수입이 학생 등록금에서 나왔으니 낙제를 시킬 유인이 없었던 거죠.

 

그러다 1847년 미국의사협회(AMA) 설립, 1910년 Flexner Report를 거치며 의학교육은 본격적으로 대학 안으로 들어갑니다. 그리고 이때 대학의 문화와 환경이 함께 따라 들어옵니다. 평가 방식까지 통째로요.


🎓 2부. 등급제의 진짜 기원: 학문이 아니라 규율

그럼 대학은 그 등급제를 어디서 가져왔을까요? 논문은 영국, 특히 케임브리지의 수학 경시대회 Tripos를 지목합니다. 원래는 자발적 참가 경쟁이었고 학위 수여와 무관했는데, 점수화가 유럽 대학 전반으로 퍼졌고 미국까지 건너왔습니다.

 

미국 최초의 서열화는 1785년 예일대의 Ezra Stiles 총장이었습니다. 학생들을 optimi, secondary optimi, inferiors, pejores의 네 등급으로 나눴죠. 목적이 뭐였는지가 중요합니다. 성적이 낮은 학생이 느낄 수치심(humiliation)이 더 열심히 공부하게 만들 거라고 기대한 겁니다.

 

학생들 반응이요? 1786년 4월, 나흘간 폭동이 일어났습니다. 창문에 벽돌을 던지고 튜터들 집 문을 부수려 했다고 해요. (총장 관저는 무사했다고 합니다. 😅)

 

이 대목이 이 논문에서 가장 인상적인 부분이라고 생각합니다. 역사학자 David Allmendinger는 일상 과제에 점수를 매기고, 석차를 내고, 성적표를 부모에게 보내는 이 모든 것이 "규율 절차로 도입된 개혁"(reforms introduced as disciplinary procedures)이었지 학문 수준을 높이기 위한 수단이 아니었다고 정리합니다.

 

즉, 등급제는 타당한 교수학습 원리에서 나온 게 아니라 수치심과 낭패감을 통해 행동을 통제하려는 장치로 출발했다는 겁니다.

이후 흐름은 빠릅니다. Mount Holyoke가 1884년 A-F 문자 등급을 도입했고, 1930년경에는 대부분의 대학이 5단계 문자 등급을 쓰게 됩니다.


⚠️ 3부. 사실 초기부터 비판은 있었습니다

여기서 논문이 파고드는 지점이 있습니다. 등급제는 도입 직후부터 계속 비판받아 왔다는 것.

미주리대 심리학자 Max Meyer는 등급제의 신뢰도 문제를 지적하면서, 교수들끼리도 학생들끼리도 서로를 의심의 눈초리로 보게 되고 이것이 공동체 의식을 해친다고 했습니다.

1910년 미국심리학회장 J. McKeen Cattell은 하버드 교사협회 연설에서 이렇게 말했죠.

"학생들이 석차를 놓고 경쟁하도록 설득해서 학업을 향상시키려는 계획은 헛되고 다소 반도덕적입니다. 무미건조하고 소득 없는 공부를 경쟁으로 재미있게 만들려는 것은 자동차 앞에 냄새를 두는 격입니다."

"Futile and somewhat anti-moral is the plan proposed of trying to improve scholarship by trying to persuade students to compete for class rank...to try to make dull and profitless work interesting by competition puts the smell before the automobile." (Cattell, 1910)

 

더 뼈아픈 건 등급제 지지자들의 인정입니다. 교육심리학자 S.S. Colvin은 1912년에 등급제가 제대로 이해된 적도 일관되게 운영된 적도 없다고 하면서, 이렇게 덧붙입니다.

"그것을 고안한 사람들이나 운영한 사람들의 선견지명 때문이 아니라, 우연히 자라난 것이다."

"...had grown up by chance rather than because of any foresight on the part of those who devised it, or those who administered it." (Colvin, 1912)

그리고 Tripos 출신인 수학자 G.H. Hardy(하디-바인베르크 평형의 그 Hardy 맞습니다)는 1926년에 아주 직설적으로 말합니다.

"나는 Tripos를 개혁하고 싶은 것이 아니라 없애 버리고 싶다."

"I do not want to reform the Tripos but to destroy it." (Hardy, 1926)


🩺 4부. 의과대학에 옮겨붙다

18-19세기 의과대학의 평가는 학업 마지막에 치르는 비공개 시험과 학위논문(inaugural thesis) 공개 발표 정도였습니다. 교육과정 중간에 학생을 등급으로 나누고 서열화하는 일은 없었습니다.

그런데 대학 편입과 함께 상황이 바뀝니다. 1900년 노스캐롤라이나대 의학부 학장 R.H. Whitehead의 진술이 이 변화를 잘 보여줍니다.

"학문적 방식이 지배하고, 학업 수준은 높으며, 의과대학생은 다른 학생들과 동일한 일반 규율의 적용을 받는다."

"...academic methods prevail, the standard of scholarship is high, and the medical student is subject to the same rules of general discipline with his academic fellows." (Whitehead, 1900)

 

문제는 이 구조가 임상 현장에 필요한 지식과 술기를 기르는 방향으로 설계된 적이 없다는 점입니다. 오히려 암기 편중을 정당화하고 가속했습니다. 1908년 Murray Galt Motter는 요약집과 시험 대비서가 넘쳐나는 현실을 이렇게 꼬집었습니다.

"단순 암기법이 얼마나 널리 길러지고 있는지를 보여 주는 딱한 증거다."

"...are sorry evidence to the extent to which the mere memory method is being cultivated." (Motter, 1908)

 

Flexner 본인도 나중에 후회 비슷한 말을 남깁니다. 대학 환경을 그토록 밀어붙였던 사람이 1925년에 이렇게 씁니다.

"우리의 현재 족쇄는 형편없는 의과대학들이 부적격한 학생들에게 '더 나은' 교육을 제공하도록 강제하기 위해 벼려진 것이었다."

"...our present fetters were therefore forged in order to compel wretched medical schools to give unfit medical students a 'better' training." (Flexner, 1925)

 

그리고 인턴 선발도 곧 시험 점수 중심으로 굳어집니다. 1899년 시카고 카운티병원의 선발 방식을 두고 Bayard Holmes는 필기시험만으로 전문가적 능력을 재는 것은 전적으로 부적절하며, 지원자의 건강, 도덕적 자질, 이전 임상 경력이 완전히 배제된다고 지적했습니다.


📉 5부. 성적은 좋은 의사를 예측하지 못한다

1960년대에 들어 실증 연구가 나오기 시작합니다.

  • Price 등(1964): 학점으로 측정한 형식 교육에서의 수행은 의사로서의 수행과 관련된 요인들과 "거의 완전히 독립적"(almost completely independent)이라는 결론.
  • Geertsma & Chapman(1967): 문자 등급과 석차는 학생이 의사의 역할과 기능을 향해 나아가는 진전을 적절히 대변하지 못한다는 지적.

정신건강 이슈는 더 오래된 이야기입니다. 1832년 Daniel Drake는 이미 의과대학생의 소화불량, 두통, 심계항진, 무기력을 언급했고, 1864년 Samuel Chew는 시험 전 24시간 이상 잠을 못 자고 불면, 두통, 현훈, 사고 혼란, 기억력 저하를 겪는 학생을 기술했습니다. 1937년 Strecker 등은 정신과의사 4명의 분석 결과 졸업반 학생의 46% 이상이 상당한 수준의 신경증적 부담을 지고 있다고 보고했고요.

 

그런데 여기서 저자들이 짚는 지점이 날카롭습니다. 당시 대응은 학습 환경을 바꾸는 게 아니라 학생 개인에게 해결을 맡기는 쪽이었습니다. Drake는 절제된 생활과 야외 운동을, Chew는 무리한 노력을 삼가라고 권했죠. 90년이 지난 지금도 구조를 문제 삼기보다 학생의 회복탄력성을 주문하는 방식, 어딘가 익숙하지 않으신가요?


📌 6부. 그래서 지금은

현재 미국 의과대학 155곳 중 약 84%가 필수 임상실습에서 어떤 형태로든 등급식 평가를 사용하고 있고, 이 비율은 오히려 늘고 있습니다.

 

저자들은 두 가지 해석을 제시합니다.

 

  • 하나는 USMLE Step 1의 pass/fail 전환 이후 변별 수단이 사라지면서 다른 대안(WBA, EPA, holistic review, programmatic assessment)을 쓰기 어려워 등급제로 회귀했다는 해석.
  • 다른 하나는 애초에 등급제의 기원이 이렇게 허술하다는 사실 자체가 인식되지 않았기 때문이라는 해석입니다.

 

 

이 논문에서 가장 핵심적인 한 문장을 꼽으라면 저는 이걸 고르겠습니다.

"등급식 평가는 향후 훈련과 진료에서의 성공에 요구되는 준비도, 신뢰가능성, 숙련도에 잘 맞지 않는 대리지표다."

"Tiered grading is an ill-fitting proxy for the readiness, trustworthiness, and mastery" required for success in future training and practice. (Smith & Piemonte, 2026)


🔭 7부. 저자들이 제안하는 다음 단계

정리하면 이렇습니다.

  1. 필기시험 자체를 없애자는 게 아닙니다. 필기시험은 학생이 자신의 성취와 진전을 확인하는 도구이고, 그 자체로 학습 경험이 될 수 있습니다. 문제는 필기시험 결과에 근거한 등급식 서열화입니다.
  2. WBA는 새로운 아이디어가 아닙니다. 1911년 존스홉킨스의 Lewellys Barker는 학생들이 소그룹으로 병동에서 일하고 선임 의사가 직접 관찰해야 한다고 했습니다. 그 의사들은 학생 및 전공의와 긴밀히 접촉하며 "통제하고, 비판하고, 검토하고, 제안하고, 격려해야"(controlling, criticizing, reviewing, suggesting, encouraging) 한다고요. WBA의 핵심 요소가 100년 전에 이미 서술돼 있었던 셈입니다.
  3. 인증평가 기구를 지렛대로. LCME가 USMLE 합격률로 교육과정 효과성을 측정하는 방식은 결국 시험 점수 중심 문화를 재생산합니다. 저자들은 일차의료 진출 졸업생 수, 의료취약지 근무 졸업생 수 같은 지표를 대안으로 제안합니다.
  4. Programmatic assessment로의 전환. 잦은 피드백, 다양한 평가 방법의 통합, 코칭, 그리고 비례성(고부담 결정은 충분한 근거로 뒷받침되어야 한다는 원칙). 저자들은 이것이 오히려 도제교육 시절 스승이 직접 관찰하며 임상추론을 길러 주던 역사적 뿌리로 돌아가는 길이라고 봅니다.
  5. 그리고 저자들의 바람 하나. "기말고사(final exam)"라는 용어를 의학교육에서 은퇴시키자는 것입니다. 의사의 경력에서 학습이 "최종"인 시점은 없으니까요.
  6. 마지막으로, 교수들에게 전하는 안심의 메시지가 있습니다. 등급제에서 벗어나는 것은 학생 평가의 발전 과정에서 극단적인 단절이 아니라, 애초에 등급제가 제대로 검증된 적이 없었다는 사실을 인정하는 일이라는 겁니다.

💭 읽고 나서 든 생각

이 논문은 실증 연구가 아니라 Observations 형식의 역사적 논평입니다. 그래서 "등급제를 없애면 이렇게 된다"는 인과적 근거를 기대하면 아쉬울 수 있습니다. 미국 맥락 중심이라는 한계도 분명하고요.

 

그럼에도 이 논문이 유용한 이유는 논쟁의 프레임을 바꾸기 때문입니다. 보통 우리는 "등급제를 없앨 만큼 충분한 근거가 있느냐"고 묻습니다. 그런데 이 논문은 방향을 뒤집습니다. 애초에 등급제를 도입할 만한 근거가 있었느냐고요. 기본값(default)이 무엇인지, 입증 책임이 어느 쪽에 있는지가 달라지는 질문입니다.

 

Kuper 등의 표현대로 역사는 "의학교육의 많은 부분이 구성된 것이고 따라서 변경 가능하다는 점을 보여 주는 효과적인 방법"입니다. 익숙한 것이 곧 타당한 것은 아니라는 얘기죠.

 

우리 맥락에서도 생각해 볼 지점이 있습니다. 임상실습 성적을 상대평가로 산출하는 관행, 전공의 선발에서의 성적 활용, 그리고 최근의 pass/fail 논의까지. 우리는 이 관행들을 언제, 왜, 어떤 근거로 도입했는지 스스로에게 물어본 적이 있을까요. 아마 대부분은 미국과 일본을 거쳐 들어온 대학 관행의 유산일 가능성이 큽니다. 그렇다면 우리도 같은 질문을 던져야 할 것 같습니다.


서론 (Introduction) 

학술의학의 복잡한 쟁점들 가운데 학생 사정(student assessment)과 평가(student evaluation)를 적절히 사용하고, 그 형식을 정하며, 적용하는 일은 특히 어렵다. 이는 사정과 평가가 의료교육자에게, 환자 진료, 자기 돌봄, 전문직 발달에 평생 헌신하는 데 필요한 기술, 추진력, 끈기를 갖춘 다양하고 협력적이며 회복탄력적인 의사 인력을 길러내고 있다는 확신을 주어야 하기 때문에 더욱 그러하다. 사정과 평가는 의과대학생의 학습, 역량 보장(competency assurance), 대중의 신뢰(public trust)에 필요하다는 점이 널리 받아들여지고 있다.1 사정과 평가는 끊임없이 변화하는 보건의료 환경에서도 타당하고 신뢰할 수 있어야 하며, 의과대학생이 장차 봉사하게 될 대중에게도 의미가 있어야 한다. 의학교육을 위해 개발되고 사용되는 사정도구(assessment instruments)와 이에 근거한 후속 평가가 잠재적으로 서로 경합하는 이러한 요구를 충족하지 못하는 정도는, 의과대학생의 사정과 평가가 어떤 형식을 취해야 하며 어떻게 적용되어야 하는지를 둘러싼 논쟁의 토대가 되어 왔다. 이 점에서 단계형 성적평가는 전형적인 논쟁 사례라고 할 수 있다.2

 

이러한 복잡성과 어려움을 더하는 요인에는 ‘사정(assessment)’, ‘평가(evaluation)’, ‘성적평가(grading)’라는 용어의 다양한 사용방식과 해석이 있다.3 이 논의에서 우리는 

 

  • ‘사정’을 학습자의 숙달도(proficiency)에 대한 관찰을 뜻하는 용어로 사용한다. 이는 대개 필기시험이나 선다형 문항시험(multiple-choice question examinations), 또는 관찰 가능한 술기의 성공적 수행을 기술한 체크리스트 등의 도구를 사용하는 것과 관련된다.
  • ‘평가’는 사정자료에 근거해 학습자에 관하여 내리는 해석과 판단을 뜻한다. 이는 대개 안전하고 효과적인 의료실무에 필요한 임상지식, 의사소통기술, 프로페셔널리즘(professionalism) 등의 영역에서 역량을 판정하는 것으로 나타난다. 평가는 규준참조 패러다임(norm-referenced paradigm)으로 더 확장될 수 있다. 이 평가 패러다임에서는 학습자가 역량을 범주적으로 입증하는 데 그치지 않고, 동료들의 수행과 비교되어 추가로 분류된다.
  • ‘성적평가’라는 용어는 학습자에 대한 사정과 평가를 토대로 의사결정을 내리는 행위를 가리킨다. 성적평가는 일반적으로 의학교육과정의 더 높은 단계로 진급하는 결과로 이어진다. 이 글에서는 단계형 성적평가에 초점을 맞추며, 이를 규준참조 사정과 평가에 근거하여 학생을 평정(rating), 순위화(ranking), 또는 분류(sorting)하는 행위로 간주한다.

 

대부분의 학술의료기관에서 학생 사정과 평가는 여전히 학생끼리 규준참조 패러다임에 따라 비교하는 전통적 학문 지향성을 유지하고 있다. 다시 말해 수행 수준을 구별하기 위해 학생을 여러 범주로 순위화한다. 이 범주는 다양한 형식으로 표현되며, 문자등급(letter grades), 숫자점수(numeric scores), 그리고/또는 ‘통과(pass)’, ‘우수통과(high pass)’, ‘최우수(honors)’ 같은 질적 기술어(qualitative descriptors)를 포함할 수 있다. 이는 임상실습(clerkship) 학년에서 가장 두드러진다.4 학생의 단계형 성적평가는 기본의학교육(undergraduate medical education, UME)에서 졸업후의학교육(graduate medical education, GME)으로 이행하기 위한 전공의 선발(residency selection) 과정의 필수 구성요소로 설명되어 왔다.5 또한 의과대학생의 학습과 수행을 촉진하는 동기요인으로도 제시되어 왔다.6,7 그러나 이러한 규정은 단계형 성적평가가 학생의 스트레스와 불안, 번아웃, 집단 응집성 저하, 경쟁 심화, 과소대표 소수집단(under-represented minority) 학생의 불리함과 연결된다는 근거를 부차화하거나 심지어 무시한다.8–11 따라서 기관들이 단계형 성적평가를 넘어 다른 형태의 사정과 평가로 전환하기를 주저하는 것은 당혹스럽고 우려스럽다.

 

성적평가가 기반을 두는 사정 및 평가 관행을 포함하여 의과대학생 성적평가의 역사적 발달을 탐색하면 이러한 쟁점을 더 잘 이해할 수 있다. 역사적 관점은 현재의 쟁점과 논쟁을 그것이 출현하고 발달한 맥락 속에서 바라볼 수 있게 한다. 더욱이 역사적 관점은 “의학교육의 많은 부분이 구성된 것이며, 따라서 변화할 수 있다는 본질을 보여주는 효과적인 방법”이 될 수 있다.12 (p.e850) 의학교육 개선에 대한 고려의 폭을 넓히는 일은 전문직적 겸손(professional humility)과 지속적 변화에 대한 개방성을 촉진할 수 있다.13

 

초기 및 현대 미국 의학교육의 역사를 학술적으로 개괄한 문헌이 존재한다.14–16 이 문헌들은 사용된 사정방법을 언급하지만, 의과대학생 성적평가의 역사적 발달과 진화를 구체적으로 탐색하지는 않는다. 사실 역사적 서술은 단계형 성적평가를 의과대학생 교육에서 당연히 전제되고 필요한 특성으로 취급하면서, 이 평가형식이나 다른 사정·평가 형식의 실제 기원을 거의 고려하지 않는 것으로 보인다. 학부교육(baccalaureate education) 과정에서 대학생 성적평가의 역사적 경향을 요약한 문헌고찰17–19도 존재하지만, 의과대학생이나 다른 대학원 수준 학생의 사정을 탐색하지는 않는다. 의학 학습자 사정의 최근 경향20,21은 문헌에 기술되어 있지만, 이 연구들도 단계형 성적평가의 역사적 출현을 구체적으로 탐색하지 않는다. 의과대학생을 사정하는 가장 효과적인 방법을 둘러싼 현재의 논의에 기여하고자, 우리는 미국 의과대학생 사정과 평가의 역사를 간략히 검토했던 이전 연구2를 확장하고자 한다. 이 ‘관찰(Observations)’ 논문에서 우리는 미국 의학교육에서 단계형 성적평가의 뿌리와, 그 뿌리가 오늘날 의학교육에서 우리가 마주한 가장 시급한 쟁점 가운데 일부를 어떻게 계속 지탱하고 형성하는지를 구체적으로 탐색한다.

미국의 초기 의학교육 (Early medical education in the US) 

미국 의학교육의 발달은 잘 기록되어 있다.14–16 초기 도제식 교육(apprenticeship-based education)에서 공식적인 대학 기반 교육(university-based education)으로의 전환은 특정한 시점을 경계로 일어난 것이 아니라, 지리적 여건, 영리 사립 의학교육(proprietary medical education)의 흥망, 의료실무의 질에 대한 대중의 불만, 19세기와 20세기를 특징짓는 과학지식 기반의 급속한 확대 등 국가적·지역적 영향에 의해 형성되었다. 현대 의학교육의 역사적 발달을 심층적으로 검토하는 것은 이 논문의 범위를 벗어나지만, 의과대학생이 과거와 현재에 언제, 어떻게, 왜 사정되고 평가되었는지에 관한 논의에 정보를 제공하기 위해 몇 가지 주요 지점을 아래에 개괄한다.

 

의학 도제교육, 군 의료 경험, 유럽에서의 수련을 모두 거친 John Morgan은 1765년 아메리카의 영국 식민지에 이상적인 의학교육 형태를 제시한 중요한 논문을 출판했다.22 그는 의학교육이 도제교육을 넘어 공식화되고 대학 교육과 동일한 원리에 기초해야 한다고 주장했다.23 Morgan은 자신이 제안한 의과대학에 구체적인 사정·평가 체계를 명시하지는 않았지만, 학위 수여 전 엄정한 판단이 적어도 가치 있으며 어쩌면 필수적이라고 분명히 생각했다. “그러므로 합당한 보상으로 가치를 구별하고 진정한 공로에는 마땅한 영예를 수여하도록 힘쓰자. 이는 교육기관을 완전하게[원문 표기: compleat] 만들고 학생들에게 가능한 모든 격려를 제공할 것이다.”22 (p. 36) Morgan의 선견지명 있는 구상은 당시 어느 정도 회의적인 반응을 받았지만, 여러 유력 대학은 해당 교육기관의 학문 원리와 행정구조에 기초한 의학부를 설립했다.24 대학 입장에서 의학부의 존재는 학문적 명성을 높이고 학생에게 매력적인 전문직 진로를 추가했다. 또한 대학 교수진을 이루기 시작한 신흥 학술 과학자들에게 자연스럽고 실용적인 초점을 제공했다.

 

19세기에는 대학 기반 의학부와 별개인 독립적 영리 사립 의과대학이 미국에 출현하면서 의심스러운 형태의 학생 사정과 평가도 함께 등장했다.25,26 이 학교들은 의문스러운 입학 기준, 임의적인 교육과정, 제각기 다른 수학기간, 흔히 교육과정 말미의 단 한 차례 시험만을 포함하는 모호한 졸업요건을 특징으로 했다.15 신규 졸업생이 이후에 얻게 되는 직업적 평판이 그 역량을 충분히 입증하는 것으로 여겨졌으며, ‘상류사회’ 고객군을 확보하는 것은 전문직적 성취의 증거가 되었다.15 학업 실패는 드물었고, 교수진의 단순 과반수 투표로 졸업이 결정되었다. 의학교수들은 의과대학생의 등록금 수입에 의존했고 교수라는 지위로 직업적·사회적 평판이 높아졌으므로, 학생이 학교를 떠나는 이유는 학업성취 부족보다 등록금을 내지 못해서인 경우가 훨씬 많았다.27 교육자들이 의과대학생을 낙제시키면 수입을 잃을 뿐 아니라, 의학학위를 가장 쉽고 저렴하고 빠르게 취득할 방법을 찾는 예비 학생의 반감을 살 수 있었으므로 당연히 낙제시키기를 꺼렸다. 대학과 관계를 유지한 의과대학조차 엄격한 학문적 기준을 보장하지는 못했다. 실제로 일부 대학 기반 의학부는 명목상으로만 모체 대학과 연계되어 있었다.28 이처럼 미약한 대학과의 연계는 “교육학적 의미에서 거의 가치가 없는 것”으로 평가되었다.27 (p. 764)

 

1847년 미국의사협회(American Medical Association)가 학문적 기준을 강화함으로써 의료인의 대중적 인식, 사회적 지위, 전문직적 위상을 높이라는 최초의 과업을 부여받으면서 영리 사립 의과대학의 폐지가 주요 목표가 되었다.29 대학 기반 의학교육과 Morgan의 원래 구상이 우세해진 것은 기존 의과대학이 대학과 공식적으로 연계되거나 대학이 자체 의학교육 부서를 설립한 결과였다.28 1910년 Abraham Flexner가 카네기 교육진흥재단(Carnegie Foundation for the Advancement of Teaching)에 제출한 보고서(‘Flexner 보고서’)30는 의학교육이 대학의 환경, 문화, 영향권으로 전환되는 과정을 가속한 현대적 변곡점으로 널리 인정된다.15 이는 의학 수학과정 이수 후 주 면허요건(state licensure requirements)이 만들어진 시기와 일치했다.31 이는 안전하고 효과적인 진료를 제공할 수 없는, 제대로 사정되지 않았고 자격이 부족하며 무능한 의료인이 과잉 배출된 데 대한 대중의 자연스러운 대응이었다.

 

의학교육이 비구조화된 도제교육에서 대학의 공식적 환경으로 전환되면서, 의과대학생의 사정과 평가는 아마도 당연하게 대학 학습자를 평가하는 특성을 띠게 되었다. 미국 의과대학에서 단계형 성적평가가 출현한 과정을 이해하려면, 미국의 학사과정 대학에서 그것이 언제, 어떻게, 왜 발달했는지를 검토하는 것이 유용하다. 대학과 의과대학의 사정 및 평가에 관한 전반적인 연대기를 ‘한눈에’ 볼 수 있도록 표 1에 제시했다.

초기 미국 대학의 학생 사정
(Student assessment in early US colleges and universities)
 

처음에는 학사과정 학생이 ‘졸업시험(leaving exam)’ 또는 ‘학위시험(degree exam)’을 성공적으로 치러 학위를 받는 것으로 학업성취를 표시했다.17 Harvard와 Yale 같은 대학은 졸업 전에 졸업시험을 시행하고 척도체계(scale system)에 따라 졸업생 대표(valedictorian)와 차석 졸업생(salutatorian)을 선발했다.17 그러나 학생의 수학과정 말미에 단 한 번 치르는 이 시험은 시험관의 편향이 개입하기 쉬웠다. 시험관은 주로 대학의 튜터(하급 교수), 교수, 이사회 구성원이었다.17 이들은 식민지와 초기 미국 사회의 계급 구분을 영속시키기 위해 학생 가문의 세습 귀족성과 저명 동문의 배경을 의식했을 가능성이 크다.31 이러한 엘리트 배경의 학생은 자연스럽게 특권의식을 느끼고 수행이나 출석과 관계없이 학위를 받을 것으로 기대했으며, 일부는 최종 사정 자체를 완전히 피하기도 했다.32 대학이라는 협소한 울타리 밖의 시험관을 추가하고 시험관 수를 늘린 것은 학생 수행에 대한 최종 평가에서 교수진 편향을 줄이려 한 초기 시도의 사례였다.17

표 1. 미국 의학교육 사정 및 평가의 연대기 (Timeline of assessments and evaluations in U.S. medical education) 

시기 사건
1600–1800 도제식 의학교육(apprenticeship medical education)
1650–1800 수학과정 말미에 대학 ‘졸업시험(leaving exams)’ 시행
1765 John Morgan이 엄정한 학생 사정을 포함한 공식적 의학교육을 기술
1700–1800 Cambridge의 Tripos 경연이 유럽 대학과 미국의 단계형 성적평가를 촉진
1785 Yale University가 학사학위 후보자의 수행 순위를 도입
1750–1850 의학학위 수여 전 유일한 평가로서 의학 수학과정 말미에 ‘취임논문(inaugural thesis)’이 등장
1800–1900 모호한 졸업요건을 가진 영리 사립 의과대학의 증가
1847 의학교육 기준 강화를 위해 미국의사협회 설립
1884 Mt. Holyoke College가 문자등급 체계를 도입
1910 Flexner 보고서가 의학교육의 대학 환경 편입을 가속
1900 의학교육에서 단계형 성적평가의 역할에 관한 우려가 등장
1900–1920 미국 대학 대부분이 문자등급을 채택
1900–1930 대학에서 단계형 성적평가에 대한 초기 유보가 등장
1960–1970 성적과 의사 수행 간 상관관계가 부족하다는 초기 우려가 의학교육계에서 등장
현재 미국 의과대학 155개교 중 약 84%가 필수 임상실습에서 어떤 형태로든 단계형 성적평가를 사용하며, 그 비율은 증가 추세임

 

이 표는 중요한 시기와 사건을 대표하여 제시한 것이며, 망라하려는 것이 아니다.

 

단계형 성적평가는 학계 인사들이 유럽, 특히 영국 대학을 방문하며 경험한 교육모형을 따라 미국에 유입되었을 가능성이 크다.33 18세기 Cambridge University에서는 Tripos라는 수학 경연이 만들어졌으며, 그 상에는 안정적인 학문직과 연금을 통한 경제적 안정이 포함되었다.33,34 Tripos는 수상자를 가장 정확하고 공정하게 가려낼 수 있도록 채점되었다. 일반적으로 점수체계는 수행을 장려하고 경쟁을 자극하며 탁월한 성취를 인정하는 것으로 여겨졌다.33,35–37 중요한 점은 Tripos가 처음에는 자발적으로 참여하는 경쟁대회였고 그 점수가 학위 수여 결정에 반영되지 않았다는 것이다. 그럼에도 이러한 점수화는 결국 유럽 대학 환경 전반으로 확장되었고, 단계형 성적평가가 유럽 대학에서 확대되면서 미국 교육체계에도 편입되었다.37,38 단계형 성적평가는 대학의 학문환경과 동의어가 되었고, 의무교육(compulsory schooling)의 등장과 함께 결국 초등·중등·고등교육 전반으로 확산되었다.39

 

미국 대학에서 최초로 학생을 단계별로 순위화한 사례는 18세기 후반 Yale College에서 나타난 것으로 보인다.17 Yale 총장이던 Ezra Stiles는 1785년과 1786년에 학생들이 시험을 치르기 전에 대학을 떠나면서도 학위를 받을 것으로 기대하는 현실에 주목하고, 학생 규율과 학문적 엄격성을 높이고자 했다.32 Stiles는 학생들이 떠나기 전에 시험을 치를 수 있도록 1785년 봄 최종시험 일정을 앞당겼다. 또한 학생을 학업성취에 따라 optimi, secondary optimi, inferiors, pejores의 네 범주로 순위화했다.17,33,38 이 네 범주 체계는 벨기에 Louvain University에서 개발된 유사 체계(rigorosi, transibilies, gratiosi, 그리고 명칭이 없는 네 번째 하위 성취 집단)17와 영국의 체계(Honor Men, Pass Men, Charity Passes, 그리고 “이름이 공표되지 않았기 때문에 익살스럽게 ‘언급할 수 없는 자들[Unmentionables]’이라고 부를 법한” 집단17 (p. 108))를 모방했다. Yale 학생을 순위화한 데 어느 정도 교육학적 근거가 있었을 수 있으나, 다른 미국 학교에서는 이전에 이런 일이 없었다. Stiles는 성취가 낮은 학생이 자신의 상대적으로 낮은 수행을 알게 되었을 때 경험하는 굴욕감이 이후 시험을 앞두고 더 열심히 공부하도록 자극하기를 기대했다.32 주목할 점은 Yale 학사과정 학생들이 이 새로운 시험일정과 수행 순위화의 대상이 되리라는 사실을 깨닫자, 1786년 4월 나흘 동안 폭동을 일으켜 창문에 벽돌을 던지고 튜터의 집 문을 부수려 했다는 것이다. Stiles의 집은 피해를 면한 것으로 보인다.32

 

학생에 대한 평정과 순위화는 다른 대학기관으로 확대되었는데, 특히 사회·경제적으로 더욱 다양해진 학생 집단으로 인해 학생 상호 간, 학생과 교수진 간, 학생과 지역주민 간 긴장과 폭력이 발생하던 북동부에서 그러했다. 이러한 학문적 환경에서 단계형 성적평가는 학생의 학업행동에 영향을 미치고, 중요하게는 사회적 행동을 통제하기 위한 방법으로 출현했다. 역사가 David F. Allmendinger는 다음과 같이 서술했다.

 

  • 일상 학업에 점수를 부여하고, 교과 수행에 따라 학생의 순위를 정하고, 우수자 명부를 만들고, 부모에게 정기적으로 보고하는 개혁은 규율 절차로 도입된 것이지, 미국에서 학문의 수준을 높이기 위한 수단만으로 도입된 것이 결코 아니었다.40 (p. 82)

 

학업성취에 근거해 학생을 평정하고 순위화하는 것은 강건하고 타당한 교육학적 원리라기보다 굴욕과 수치심을 통해 행동규율을 심어주는 방법으로 출현했다.41 Harvard를 포함한 여러 대학은 학생 순위를 정할 때 처음에는 100점 척도를 사용했다. Mount Holyoke는 ‘A’에서 ‘E’까지 각 문자가 백분율 점수를 나타내고 ‘E’가 낙제를 뜻하는 문자등급 체계를 최초로 채택한 대학으로 알려져 있다.33 1884년에는 처음 다섯 문자와 연계된 백분율을 조정하면서 ‘F’가 이 성적체계에 추가되었다.17 ‘E’는 시험을 다시 치를 수 있는 낙제등급이었고, ‘F’는 과목을 재이수해야 하는 낙제등급이었다. 문자등급을 사용하는 단계형 체계가 학업성취를 층화하는 더 효율적이고 정확한 방법이라는 인식과 함께,33 1930년 무렵에는 대부분의 대학이 5단계 문자등급을 사용했으며 ‘E’는 사라졌다.17

 

미국 교육체계가 단계형 성적평가를 비교적 빠르게 채택했음에도, 그 한계와 신뢰할 수 없음은 일찍부터 인식되었다. 이는 초등·중등교육뿐 아니라 대학에서도 지적되었다.39,40,42 대학에서 단계형 성적평가를 둘러싼 초기의 곤란한 경험과 관찰된 부정적 영향은 오늘날 의학교육에서 나타나는 어려움을 예고했다.

대학 수준에서 단계형 성적평가에 대한 유보
(Reservations about tiered grading at the collegiate level)
 

대학 내·대학 간 단계형 성적평가의 일관성과 표준화가 부족해 학생과 교수진 사이에 경쟁, 혼란, 심지어 적대감까지 생겼다. University of Missouri 최초의 심리학 교수였던 Max Meyer는 단계형 성적평가의 신뢰도 부족을 일찍부터 비판했다. 그는 다음과 같이 지적했다. “그 결과 교수진과 학생 모두가 서로를 의심의 눈초리로 바라본다. 이러한 태도가 일체감에 해롭다는 사실은…아무리 피상적으로 관찰하는 사람에게도 분명하다.”43 (p. 661) 단계형 성적평가는 초등·중등교육 수준에서도 의심스럽지만 고착된 교육의 특성으로 등장했고, 주관적이고 신뢰할 수 없으며 불공정하다는 지적을 받았다.39 이러한 한계는 때때로 교수(teaching)의 도덕적 차원으로 표현되었다. 미국심리학회 제4대 회장 J. McKeen Cattell은 1910년 Harvard Teachers’ Association 연설에서 다음과 같이 말했다. “학생들에게 석차 경쟁을 하도록 설득하여 학업을 향상하려는 제안은 무익하고 어느 정도 비도덕적이다…경쟁을 통해 따분하고 보람 없는 학업을 흥미롭게 만들려는 것은 자동차 앞에 냄새를 두는 격이다.”44 (p. 379)

 

역설적이게도, 학업 수행을 장려하는 수단으로 단계형 성적평가를 일찍부터 지지한 사람들도 그것이 미국 교육에서 허술하게 출현했다는 점을 인정했다. 교육심리학자 S. S. Colvin이 1912년에 기술했듯, 단계형 성적평가의 근거 자체는 “…지적으로 이해된 적도, 일관되게 운영된 적도 없었고…”, “…그것을 고안하거나 운영한 사람들의 선견지명 때문이 아니라 우연히 생겨났다.”35 (p. 561)

 

단계형 성적평가의 영감 가운데 하나였을 것으로 추정되는 Cambridge Mathematical Tripos의 학생 수행 층화조차,33,34 1926년 수학자 Godfrey Harold Hardy(‘Hardy-Weinberg’ 법칙의 Hardy)의 도전을 받았다. Hardy 자신도 Cambridge 학생 시절 Tripos에 참가했지만, 이후 수학경연과 다른 학문분야에서 대학생의 순위를 매기는 것이 초래할 수 있는 해악을 깨달았다.

 

  • …나는 [Tripos] 체계가 원리상 해롭고, 그 해악은 흔히 개혁이라 부르는 것으로 해결하기에는 너무 근본적이라는 견해를 고수한다…나는 Tripos를 개혁하려는 것이 아니라 없애려 한다. 그리고 Tripos가 특수한 사례인지, 아니면 내가 말한 내용이 다른 모든 고등 우등시험(high-grade honours examinations)에도 적용되는지 묻는다면, 내가 아는 한 그렇다고 답할 수밖에 없다.45 (p. 144)

 

성인학습(adult learning)에 관한 새로운 원리가 출현하면서 대학의 정통적 관행이 지닌 한계는 더욱 분명해졌다. 현대 성인교육학(adult pedagogy)의 가장 초기 주창자로 볼 수 있는 Eduard Lindeman은 1926년에 “성인학습자란 권위적이고 관습적인 교육기관의 경직되고 타협 없는 요구에 의해 지적 열망이 촉발될 가능성이 가장 낮은 바로 그 사람들”이라고 지적했다.46 (p. 28) 그럼에도 대학 기반 의학교육이 발전하면서 대학 문화, 환경, 학생 사정·평가의 속성이 의학교육과정에 적용되었다.47,48

의과대학 학생 사정 및 평가의 전환
(The transition of student assessment and evaluation in medical schools)
 

대학이 의과대학·의학교·의학부를 흡수하거나 설립하면서, 대학 학사과정 학생에게 사용하던 사정방법과 단계형 성적평가 패러다임은 의과대학생의 사정과 평가를 크게 형성했다. 역설적이게도 의학교육 개혁을 위한 전문직적 추진력이 강했고 Flexner 보고서 이후에는 대중의 관심도 높았지만, 단계형 성적평가가 의과대학생 사정과 평가의 지배적 형식으로 전환된 과정은 다소 은밀하게 진행되었다. 18세기와 19세기의 여러 의과대학에서 의과대학생 숙달도에 대한 유일한 사정과 평가는 학업 말미에 이루어졌으며, 의과대학 교수진이 실시하는 비공개시험과 학생이 자신의 ‘취임논문(inaugural thesis)’을 발표하고 방어하는 후속 공개시험으로 구성되었다.14,49 때로는 최고의 논문을 쓴 학생에게 상금이나 특별 표창을 주었지만, 논문의 질을 순위화한 것은 졸업 시점이었고 수학과정 중에는 아니었다. 따라서 교육과정 중 학생을 공식적으로 순위화하거나 평정하거나 분류하지 않았다.

 

의학의 실무에 필요한 능력, 술기, 전문직 속성을 판단하기 위해 의도적으로 고안된 교육학적으로 타당한 접근법이 아니라, 의학계의 단계형 성적평가는 대학 환경에 적응하는 과정에서 출현했다. 당시 University of North Carolina 의학부 학장이던 R. H. Whitehead는 1900년에 “…학문적 방법이 지배하고, 학문의 기준이 높으며, 의과대학생은 대학의 동료 학생들과 마찬가지로 일반 규율의 적용을 받는다”고 기술했다.47 (p. 523) 1920년대 중반이 되자 의학교육은 대학의 학문환경에 확고히 자리 잡았고, 대학 총장들은 의학교육의 그 위치를 강하게 옹호했다.50 미국 의과대학에서 단계형 성적평가에 대한 유보가 곧 나타났다.

의과대학의 단계형 성적평가에 대한 유보 (Reservations about tiered grading in medical school) 

Flexner 자신도 의학교육에서 대학 학문환경이 잠재적으로 억압적인 역할을 할 수 있음을 인식했다. 그는 영리 사립 의과대학을 없애기 위해 이러한 학문환경을 열렬히 장려했던 인물이기도 했다.51 최초 보고서가 나온 지 약 15년이 지난 1925년, Flexner는 의학교육의 상태를 성찰하며 “…따라서 현재 우리를 옭아매는 족쇄는 형편없는 의과대학이 부적합한 의과대학생에게 ‘더 나은’ 수련을 제공하도록 강제하기 위해 만들어진 것”이라고 지적했다.51 (p. 142) Flexner는 단계형 성적평가를 포함한 대학 환경이 의과대학생에게 미칠 해로운 영향을 예견했을지도 모른다. “…대학의 ‘학급정신(class spirit)’이 대학 의과대학에 침투했다…유능하게 지도를 받는 성숙한 학생은 ‘학교에서 바지를 입기 시작한 어린 학동’처럼 감시받을 필요가 없다.”30 (p. 76)

 

Flexner가 말한 ‘감시(policing)’는 제한적이고 일률적으로 고정된(lock-step) 의과대학 교육과정의 형식뿐 아니라, 단계형 성적평가, 암기를 강조하는 시험, 의과대학생의 학업행동 사이의 관계를 인정한 표현이었을 수 있다. Flexner 보고서가 배포되기 전인 1908년에도 Murray Galt Motter는 American Academy of Medicine 회의에서 발표한 논문에서 “퀴즈 요약집, 개요서, 시험 대비자료 등이 매우 많고 훨씬 더 큰 인기를 끄는 현실은 단순 암기법이 얼마나 조장되고 있는지를 보여주는 유감스러운 증거”라고 지적했다.52 (pp. 18–19)

 

이러한 비판에도 불구하고 단계형 성적평가는 일반적으로 의과대학생의 진전을 신뢰할 수 있게 ‘내부적으로’ 사정하고, 학생이 한 학교에서 다른 학교로 옮길 때 역량을 ‘외부적으로’ 전달할 수 있게 한다고 여겨졌다.33,53 또한 성적은 학생의 성취를 인정하고 좋은 수행을 유도하는 ‘당근’이라는 유인책(그 연장선에서 ‘채찍’이라는 억제책)을 제공하려는 것이었는데, 이는 대학 환경에서 보편화된 관행이었다.47 단계형 성적평가는 의과대학생의 학업 수행을 장려하여 의학의 전문직적 위상을 향상하는 방법으로 찬양되거나 적어도 용인되었다.

 

따라서 의과대학생은 규율과 학문 양 측면에서 당시 대학 학계에 지배적이던 철학을 위해 개발된 구인(construct)에 의해 평가되었다. 이 구인은 의과대학생이 장차 몸담을 임상실무 환경에 필요한 지식과 술기의 발달을 촉진하는 토대 위에서 개발된 것이 아니었다. 불행히도 이는 선망받는 병원 인턴십에 들어갈 의학 졸업생을 정할 때 총체적 선발과정(holistic selection process)보다 등급이 매겨진 시험점수를 더 중시하는 관행이 일찍부터 확대되는 데 기여했다.54 1899년 Chicago County Hospital의 인턴 선발과정을 논평하면서 의학교육자이자 외과의사·세균학자였던 Bayard Holmes는 다음과 같이 지적했다. “…전문직 능력의 검증 수단으로서 필기시험 체계는 전적으로 부적절하다…지원자의 건강, 도덕적 자질, 이전의 의학 관련 업무는 전혀 고려되지 않는다.”54 (p. 927)

 

의과대학 성적과 의사 수행 간 상관관계가 없음을 보여주는 의학교육 연구가 출현하면서 단계형 성적평가의 적절성에 대한 초기 의구심은 더욱 강해졌다.

 

  • 예를 들어 Price와 동료들은 1964년 의과대학 성적의 타당성에 대한 사정 결과를 보고하며, “…평균평점(grade-point average)으로 측정한 공식교육에서의 수행은 의사로서의 수행과 관련된 모든 요인으로부터 거의 완전히 독립된 요인으로 나타난다”고 지적했다.55 (p. 208)
  • 마찬가지로 University of Kansas의 Geertsma와 Chapman은 1967년에 “…전통적인 문자등급과 학급 내 숫자 순위는 의사의 전문직적 역할과 기능을 향해 의과대학에서 이루는 진전을 적절히 나타내지 못한다”고 지적했다.56 (p. 938)

 

더불어 의학교육의 스트레스와 그것이 의과대학생의 웰빙에 미치는 영향은 미국 의학교육의 초기부터 인식되었다.

 

  • Medical College of Ohio 교수였던 Daniel Drake는 1832년에 의과대학생이 “소화불량, 두통…심계항진, 건강염려증, 권태[무기력], 동요증[쉼 없는 신체 움직임], 안절부절못함, 그 밖의 신경과민 형태”에 취약하다고 언급했다.57 (p. 56) 그는 절제된 생활방식과 야외운동으로 이를 예방할 수 있다고 제안했다.
  • 1863년에 사망하기 전 University of Maryland 교수 Samuel Chew는 의과대학의 정서적 스트레스와 시험과정 사이의 연관성을 지적했다. 그는 “…불면, 두통, 현기증, 사고의 혼란, 기억력 감퇴, 그리고 신경계의 심각한 장애를 시사하는 여러 다른 증상”58 (p. 55)을 겪는 의과대학생을 묘사했다. 이 학생은 최종시험에서의 수행을 반복적으로 걱정했으며, 시험 전에 24시간 넘게 잠을 자지 않는 일이 흔했다. Chew는 그 학생에게 “지나치거나 조절되지 않은 노력”을 삼가라고 제안했다.58 (p. 56)

 

시험을 포함한 의과대학의 학문환경과 학생 정신건강 사이의 더 광범위한 연관성은 거의 90년 전에도 분명히 인식되었다.59,60 1937년 Strecker 등은 시험불안의 기여를 지적하며 “…네 명의 정신과 의사가 면밀히 분석한 결과, 한 대표적인 의과대학 최종학년 학생의 46%를 약간 넘는 수가 중대한 성격의 신경증적 장애를 겪는 것으로 나타났다면, 의과대학에 심각한 정신위생 문제가 존재하는 것”이라고 했다.60 (pp. 1228–9) 그러나 그들은 이에 기여했을 수 있는 교육환경의 속성을 다루기보다, 학생과 교수진의 긴밀한 관계가 불안과 스트레스를 완화할 수 있다고 제안했다.59 역사적으로 의과대학생의 웰빙과 정신건강에 대한 위협은 학문환경과 연결되어 있었다. 그러나 해결의 책임은 고통에 기여하는 학문환경의 속성을 비판적으로 검토하는 대신 학생 자신에게 부과되었다. 놀랍지 않게도 불안, 우울, 번아웃을 포함한 중대한 정서·정신적 고통의 위험은 오늘날 의과대학생에게도 지속되고 있다.8

역사적 관점의 현대적 관련성 (Contemporary relevance of historical perspectives) 

임상실습 학년에서 단계형 성적평가가 널리 사용된다는 사실은 그것이 현대 의학교육에 확고히 자리 잡았음을 보여준다. 현재 미국 의과대학 155개교의 약 84%가 필수 임상실습에서 어떤 형태로든 단계형 성적평가를 사용하며, 그 비율은 증가하고 있다.4 이처럼 두드러진 위상은 환자와 환자집단의 요구를 충족할 수 있는 의사 인력을 양성하는 데 단계형 성적평가가 효과적이고 타당하다는 견고한 역사적 토대가 있음을 시사할 법하다. 그러나 그러한 역사적 토대는 존재하지 않는 것으로 보인다. 임상실습 학년에서 단계형 성적평가 사용이 증가하는 추세는 직무현장 기반 사정(workplace-based assessments, WBAs), 위임가능 전문직업무(entrustable professional activities),61,62 지원자의 고유한 속성에 대한 총체적 검토(holistic review),63,64 프로그램화 평가(programmatic assessment)65 등 졸업후의학교육 지원자를 선발하는 다른 패러다임적 접근법이 사라졌거나 효과적으로 사용하기 어려워진 데 대한 대응일 수 있다. 또는 이러한 추세는 애초에 의과대학생을 위한 타당한 사정·평가도구로서 단계형 성적평가가 지닌 역사적 맥락과 의심스러운 기원을 인식하지 못한 결과일 수 있다. 오늘날 단계형 성적평가를 통한 의과대학생 평가는 의료실무의 다양한 차원에 대한 타당도에 초점을 맞추고 있지만, 의과대학생과 미래의 환자를 더 잘 섬기려면 우선 의학교육에서 단계형 성적평가의 역사적 토대 자체가 타당한지에 주목하는 편이 나을 수 있다. 단계형 성적평가는 향후 수련과 실무에서의 성공에 필요한 준비도(readiness), 신뢰가능성(trustworthiness), 숙달(mastery)을 제대로 대변하지 못하는 부적합한 대리지표(proxy)이다.

 

단계형 성적평가는 현대 의학교육을 여전히 괴롭히는 과학적 사실의 암기와 회상에 대한 과도한 의존을 정당화했으며—가속했다고 볼 수도 있다. 시험 수행 향상을 목표로 하는 학습보조자료와 시험 코칭이 교육과정에 넘쳐나면서 학습자의 탐구심은 효율성이라는 명분 아래 희생된다. 이에 대한 문제의식이 일찍부터(Flexner에게서조차) 있었음에도, 미국에서 대안적인 사정·평가 패러다임을 진지하게 고려하고 실행하려 하면 흔히 저항에 부딪힌다. 이는 학생 동기, 기관의 평판, 전공의 선발과정에 부정적 영향을 줄 것이라는 두려움 때문일 수 있다. 그러나 미국 의과대학 대다수의 임상실습에서 숙달학습(mastery learning)을 단계형 성적보다 계속 부차적으로 취급하면, 숙달학습의 달성 여부와 관계없이 시험 수행과 학급 순위에 지향된 학문적 사고방식이 영속된다. 그 결과 내재적 동기, 집단 응집성, 의사 인력의 다양성을 포함하여 의료실무에 중요한 다른 속성들은 과거에도 부정적 영향을 받았고 지금도 그러하다.

 

마지막으로 20세기 초 단계형 성적평가가 고착되면서 학생 사정과 학생 정신건강 사이의 연관성도 인식되었다. 그러나 이러한 인식은 의과대학생 사정과 평가의 목표와 올바른 형식을 비판적으로 검토하도록 촉진하기에 충분하지 않았다. 단계형 성적평가가 의과대학생의 스트레스와 불안, 번아웃, 집단 응집성 저하, 경쟁 심화, 의학계에서 과소대표된 학생의 불리함과 연관된다는 문헌이 발전하고 있음에도, 이러한 비판적 검토의 부재가 놀랍게도 계속되고 있다.8–11

미래에 정보를 제공하기 위한 과거의 탐색 (Exploring the past to inform the future) 

단계형 성적평가의 본래 의도 가운데 하나였던 학생의 사회적·학업적 행동에 영향을 미치는 수단으로서의 단계형 성적평가를 넘어서려면, 실제로 숙달학습과 더 나은 환자 결과(patient outcomes)로 이어지는 선택지를 탐색해야 한다. 이는 필기시험이 중요한 사정도구로 남아서는 안 된다는 뜻이 아니다. 필기시험은 의학교육에서 역사적으로나 현재에도 토대가 되는 역할을 한다. 사정의 한 형태로서 필기시험—가장 흔하게는 선다형 시험문항—은 학생이 의과대학 교육과정에서 자신이 이룬 성취와 진전을 파악할 수 있게 한다. 필기시험은 효율적인 지식 사정도구일 뿐 아니라 그 자체가 잠재적인 학습경험이기도 하다.66 비판적으로 검토해야 할 것은 주로 필기시험 결과에 근거한 단계형 성적평가이다.

 

직무현장 기반 사정(WBA)은 더 나은 환자 결과로 이어지는 임상역량을 사정하는 논리적인 방법이며, 실제로 100여 년 전에도 권장되었다. 1911년 Johns Hopkins Hospital의 내과부장이었던 Lewellys F. Barker는 학생이 병동에서 소집단으로 일해야 하며, 고참 의사가 학생의 전문직적 진전을 직접 관찰해야 한다고 지적했다. 그 고참 의사는 “직접 학생 및 하급 직원과 긴밀한 접촉을 유지하면서—통제하고, 비평하고, 검토하고, 제안하고, 격려해야 한다.”67 (p. 618) 표면적으로는 명령조인 이 역사적 서술은 임상환경에서 교수와 학습자 사이의 능동적이고 실질적인 관계를 묘사하며, 이는 WBA의 초석이다. 또한 이 서술은 현대의 ‘서브인턴십(subinternship)’을 예견한다. 이는 WBA에 적합할 수 있고 전공의 프로그램 책임자가 선발 목적으로 사용할 수 있는 교육적·임상적으로 의미 있는 경험이다.68

 

WBA와 더불어 전공의 지원자에 대한 총체적 검토는 지원자의 인품이나 기관 사명과의 적합성(mission fit)을 시사하는 속성을 사정하는 데 도움이 될 수 있다.63,64 그러나 전공의 선발에서 총체적 검토를 시행하려면 교수자, 학습자, 행정 인력의 시간과 자원이 더 많이 필요하며, 이러한 자원을 확보하기 어렵다는 점은 오래전부터 인식되어 왔다. Holmes는 1899년 전공의 선발에서 필기시험 결과만 강조하는 현실을 개탄하면서, 의학 졸업생에 대한 의무진의 더 총체적인 검토가 지닌 어려움도 인정했다.

  • “…[의무진은] 전적으로 필기시험만을 근거로 인턴을 선발하기로 했다. 지원자의 적합성과 능력을 검증하는 다른 모든 방법은 생각해보지 않았거나, 적용이 어렵다고 여겨져 제쳐두었거나, 비인격적인 방식으로 적용할 수 없다는 이유로 배제되었다.”54 (p. 927)

총체적 검토의 부담에도 불구하고 의과대학과 전공의 지원자 선발에서 그 사용은 증가하고 있다.63 그러나 일부 기관에서는 미국 의사면허시험(United States Medical Licensing Examination, USMLE)의 ‘절단점(cut-off)’ 같은 특정 지표를 충족한 뒤에야 총체적 검토가 이루어진다.63 USMLE Step 1이 범주형 합격-불합격 지표(categorical pass-fail metric)로 바뀌면서 학급 순위와 USMLE Step 2 점수 같은, 대안적이면서도 편의적인 선별·선발 기준을 찾으려는 움직임이 심화되었다. USMLE는 전공의 선발과정에서 지원자를 변별하기 위한 도구로 설계되지 않았으며 현재도 그러한 용도를 의도하지 않는다.69 그러나 전공의 수련프로그램 책임자는 여전히 USMLE Step 2 점수, 단계형 성적평가, 학급 순위 등의 지표를 사용해 전공의를 선발하며, 그 결과 기본의학교육 교육과정에서 이러한 지표에 대한 강조와 그로 인한 해로운 영향이 영속된다.70,71

 

기본의학교육에서 졸업후의학교육으로 이행할 때 단계형 성적평가와 학급 순위를 사용하는 것은, 모든 전문과목의 전공의 수련을 위해 총체적으로 교육받고 회복탄력적이며 다양한 지원자 풀을 강화할 수 있는 대안적 교육과정 설계를 의과대학이 탐색할 역량도 제한한다. 단계형 성적평가를 중단하고 준거기반(criterion-based) ‘합격-불합격’ 평가 패러다임을 확립한 곳에서는 학생들이 긍정적으로 반응했으며,72 교수진은 교육자이자 평가자로서 변화하는 자신의 역할에 호기심과 낙관을 보였다.73 단계형 성적평가를 사용하는 의과대학 출신 전공의를 프로그램 책임자가 더 선호하지는 않는다는 관찰은, 전공의 선발과정에 미칠 영향에 관한 우려를 어느 정도 완화한다.74

 

약 150년 전 잘 훈련된 의사를 보장하기 위해 면허요건과 의사면허시험 같은 주 법률의 개입이 등장했던 것과 유사하게,31 오늘날 의학교육합동위원회(Liaison Committee on Medical Education, LCME)와 졸업후의학교육인증위원회(Accreditation Council for Graduate Medical Education, ACGME) 같은 인증기구가 교육혁신을 촉진하고 기본의학교육에서 졸업후의학교육으로 이행할 때 시험점수, 학급 순위, 단계형 성적평가에 과도하게 의존하지 않도록 의미 있는 효율성을 창출하는 기준을 마련할 수 있을 것이다. 주 면허요건은 의학 ‘학위공장(diploma mills)’이 결국 사라지고 기본의학교육의 전반적 기준이 높아지는 과정을 가속했다.31 마찬가지로 인증을 통한 감독은 기본의학교육과 졸업후의학교육의 교육환경에 영향을 줄 수 있고 실제로 영향을 주며,75–77 기본의학교육에서 졸업후의학교육으로의 이행에 의미 있는 개혁을 일으키도록 활용할 수 있다.

  • 예를 들어 ACGME는 전공의·전임의 프로그램 졸업자의 전문의 인증시험(board certification) 합격률로 프로그램 효과성을 평가한다.78 따라서 프로그램 책임자는 이러한 시험에 불합격할 가능성이 가장 낮은 지원자를 선발하려 한다. USMLE 점수와, 그보다 정도는 덜하지만, 의과대학 성적이 전문의 인증시험 성공을 예측하는 데 도움이 되므로 프로그램 책임자는 전공의 선발과정에서 자연스럽게 이러한 지표에 초점을 맞춘다.
  • 마찬가지로 LCME가 의과대학 인증에서 USMLE 합격률을 교육과정 효과성의 측정치로 사용하면79 시험점수와 그 밖의 정량적 성공지표에 대한 과도한 의존이 영속된다. 

그러므로 ACGME와 LCME는 의과대학생과 수련생의 교육환경에 영향을 미치기 위해 교육효과성에 관한 대안적 측정치를 강조할 수 있다. 어쩌면 일차진료 전공의 수련에 진입하는 의과대학 졸업생의 수와, 의료취약 농촌 및 도시 지역에서 진료를 시작하는 전공의 프로그램 졸업생의 수에 주목하고 이를 강조하는 것이 학술의료체계가 봉사하는 인구집단에 더 의미 있는 대안적 효과성 지표가 될 수 있다.

 

이러한 역사적·현대적 쟁점을 모두 고려하여 우리는 몇 가지 ‘다음 단계(next steps)’를 제안한다.

  • 첫째, 학술의료센터와 교수진은 교육과정의 발전과 개혁을 고려할 때 미국 학생 사정과 평가의 역사적 뿌리를 참작해야 한다. 단계형 성적평가에서 벗어나는 전환은 학생 평가의 발전 과정에서 발생하는 극단적인 단절이 아니라, 의과대학생의 단계형 성적평가가 애초에 적절히 검증되지 않았음을 인정하는 것이라는 점에서 안심해도 된다. 이는 지역·권역·전국 수준의 발표와 기관 내·기관 간 대화를 통해 이루어질 수 있다.
  • 둘째, 현재 미국 전역의 의과대학에서 고려하거나 시행 중인 사정·평가 패러다임 가운데 프로그램화 평가(programmatic assessment)—필수 역량과 술기를 발달시키는 학습자의 진전을 포괄적·종단적으로 조망하기 위해 전체 교육프로그램에 걸쳐 여러 출처의 자료를 수집하고 분석하여 학생 학습을 평가하는 접근법—는 이 논문에서 제기한 여러 역사적 우려를 다루는 것으로 보인다.65 빈번한 피드백, 여러 사정방법의 통합, 코칭, 비례성(proportionality: ‘고부담’ 평가를 그에 비례하는 탄탄한 사정으로 뒷받침하는 것)을 포함한 프로그램화 평가의 특성은 임상추론(clinical reasoning)을 촉진하는 데 적합해 보인다. 역사적으로 의사 도제의 임상추론 능력은 의사 멘토의 지도와 직접관찰을 통해 촉진되고 평가되었다. 학생-교수 간 충분한 접촉을 갖춘 프로그램화 평가는 초기 미국 의사교육의 역사적 뿌리를 상기시키는 접근법이다. 이 접근법에는 더 많은 교수자의 시간과 노력뿐 아니라, 의과대학생에게 시의적절하고 진정성 있으며 의미 있고 효과적인 사정과 피드백을 제공하는 역량을 강화하기 위한 상당한 교수개발(faculty development)이 필요하다.65,73 임상실습 경험 말미의 평가는 여러 사정방법에 근거해야 하며, 모든 의학 전문과목에 공통으로 필요한 기본 임상술기를 개선할 기회를 포함해야 한다. 우리는 하나의 지향점으로서 의학교육에서 ‘최종시험(final exam)’이라는 용어와, 그러한 시험의 수행 결과에 따른 학생의 단계형 성적평가를 퇴장시키고자 한다. 의사 경력의 어느 단계에서도 학습은 결코 ‘최종’이 아니라고 믿기 때문이다. 프로그램화 평가를 향한 패러다임 전환은 의학교육 사정과 평가의 역사적 뿌리를 인정하는 것이며, 긍정적인 전진이다.

결론 (Conclusion) 

지난 250년 동안 의과대학생 수행에 대한 단계형 성적평가가 언제, 어떻게, 왜 진화했는지를 성찰하면, 학생과 그들이 돌보게 될 환자 및 지역사회를 가장 잘 지원하는 사정·평가 패러다임을 결정하는 데 따르는 어려움을 더 잘 이해하게 된다. 강력한 교육학적 토대의 부재, 숙달학습보다 암기에 몰두해 온 관행, 의과대학생의 역량·진전·성공을 확실히 판정할 수 없다는 초기의 인식, 고부담시험과 의과대학생 정신건강 사이의 연관성에 대한 초기 발견은 단계형 성적평가가 흔히 초래하는 해로운 영향에 관한 현재의 논의에 정보를 제공해야 한다. 사정과 평가를 둘러싼 지속적인 논쟁에 대한 우리의 집단적 대응은 의학교육에서 단계형 성적평가가 지닌 역사적 합리성과 지속적인 결과를 모두 고려해야 한다.

+ Recent posts