Validity in the Era of Competency-Based Health Professions Education: Tensions and Potential Solutions

역량바탕교육 시대의 평가 타당도: 세 가지 긴장과 해법 (Ryan et al., 2026)
Ryan MS, Touchie C, Frank JR, Chen HC, Kinnear B, as members of the International Competency-Based Health Professions Education Collaborators. Validity in the Era of Competency-Based Health Professions Education: Tensions and Potential Solutions. Perspectives on Medical Education. 2026;15(1):959–969. https://doi.org/10.5334/pme.2593
📌 한눈에 보기
- 역량바탕 보건의료인교육(competency-based health professions education, CBHPE)으로 오면서 평가 방식만 바뀐 게 아니에요. 평가 결과를 믿을 수 있는지 따지는 방식, 즉 타당도(validity) 를 논증하는 방식도 다시 생각해야 해요.
- 저자들은 세 가지 긴장(tension)을 짚어요.
- ① 어떤 패러다임(paradigm) 으로 평가를 볼 것인가,
- ② 개별 도구와 평가 시스템 중 어느 수준(level) 에서 타당화할 것인가,
- ③ 무엇을 역량의 기준점(reference for competence) 으로 삼을 것인가.
- 세 긴장 모두에 대한 저자들의 답은 비슷해요. 한쪽을 고르지 말고, 평가 목적에 맞게 균형(balance) 과 정렬(alignment) 을 찾자는 거예요.
🧐 왜 지금 타당도를 다시 이야기할까요?
지난 100년 동안 보건의료인 교육(health professions education, HPE)의 평가는 크게 변해 왔어요. 고부담 선다형 시험과 표준화가 지배하던 측정의 시대(measurement era) 가 있었고, 이후 사람의 판단이 가진 가치를 인정하면서 작업장 기반 평가(workplace-based assessment, WBA) 와 시뮬레이션이 널리 쓰이게 됐어요. 최근에는 여러 평가 방법을 의도적으로 하나의 프로그램으로 묶는 프로그램식 평가(programmatic assessment) 까지 왔고요.
그렇다고 옛 방식이 사라진 건 아니에요. 저자들은 이렇게 말해요.
측정은 사라지지 않았고, 판단도 마찬가지다.
"Measurement is not extinct, nor is judgment."
타당도 개념도 함께 발전했어요. Messick과 Kane의 작업에 기반해서, 요즘은 타당도를 "평가 데이터의 해석과 사용에 관한 논증"으로 보는 논증 기반 접근(argument-based approach) 이 널리 쓰여요. 문제는 CBHPE가 이 논증에 새로운 숙제를 던진다는 점이에요.
CBHPE는 단일 평가만을 겨냥한 논증을 만드는 대신, 평가 시스템의 통합과 성장 및 역량 성취의 측정을 지지하며, 이를 통해 수련 중 지속적인 발달에 정보를 제공하고자 한다. 이제 타당도 논증은 전문가 집단(즉, 역량위원회)이 내리는 역량(또는 역량 미달) 판정처럼 복잡한 의사결정까지 설명해야 한다.
"Instead of making arguments aimed only at single assessments, CBHPE endorses the integration of assessment systems and the measurement of growth and competency attainment to inform continued development during training. Validity arguments must now account for complex decision-making, such as claims of competence (or incompetence) made by a group of experts (i.e., a competence committee)."
시험 하나가 타당한지만 보면 되던 시절과 달리, 이제는 여러 평가 데이터를 모아 위원회가 내리는 판정까지 타당한지 따져야 한다는 거죠. 그럼 세 가지 긴장을 하나씩 볼게요.
🧭 긴장 1. 평가의 패러다임: 객관성과 주관성 사이
여기서 말하는 패러다임은 인식론적 입장(epistemological stance)이에요. 지식이란 무엇이고, 그걸 어떻게 측정하는 게 가장 좋은지에 대한 믿음 체계죠. 저자들은 CBHPE와 관련이 깊은 세 패러다임을 비교해요.
| 패러다임 | 핵심 가정 | 선호하는 데이터 | 근거의 예 | CBHPE에서의 쓰임 |
| 후기실증주의 (post-positivism) | 특정 역량 영역에서 학습자의 능력을 반영하는 "진점수(true score)"가 있다 | 객관적·수치적·표준화된 데이터 | 고전검사이론, 문항반응이론, 평가자 간 신뢰도 | 선다형 시험, OSCE 같은 표준화 평가 |
| 구성주의 (constructivism) | 진점수는 없다. 역량의 정의는 사회적으로 구성된다 | 주관적·질적·비표준화 데이터 | 주제분석, 일반화가능도 이론* | 작업장 기반 평가 |
| 실용주의 (pragmatism) | 역량은 집단 간 상호 이해와 "작동 가능성(workability)"을 통해 형성된다 | 질적 데이터와 양적 데이터의 결합 | 효과적인 집단 과정 | 집단 의사결정 (역량위원회) |
원문 Table 1을 옮겼어요. 일반화가능도 이론은 분산의 출처(평가자인지 학습자인지)는 알려주지만, 그 출처 안에서 의미 있는 평가자 차이와 구인무관분산(construct-irrelevant variance)을 구분하지는 못해요.
후기실증주의: 100년 넘게 이어진 주류
1800년대 중후반부터 HPE 평가는 후기실증주의가 이끌었어요. 의료인의 역량에 대한 사회적 우려가 커지면서 면허·인증 시험, 객관성, 표준화, 공정성, 신뢰도가 강조됐죠. 이 심리측정의 시대(psychometric era) 에는 주관성은 피해야 할 것이었고, 실제 현장에서의 수행 관찰은 불공정하다고 여겨졌어요. 고전검사이론(classical test theory)에 따라 학습자에게는 진점수가 있고, 평가의 목표는 데이터에 섞인 오차(noise)가 얼마인지 알아내는 것이었고요.
구성주의: '공유된 주관성'
구성주의는 지난 수십 년 동안 CBHPE 전문가들이 역량 판정에 내재한 공유된 주관성(shared subjectivity) 과 작업장 측정의 비표준성에 주목하면서 등장했어요. 이 관점에서는 의미 형성(sense-making), 맥락, 사회적 과정이 타당도의 중심이 돼요. 그래서 개별 평가자의 신뢰도보다 역량위원회(competency committee, CC) 수준에서 내려지는 판정의 신뢰도를 보자고 해요. 역량위원회는 누적된 평가 데이터를 모아 총괄적 판정을 내리는 집단이에요.
실용주의: 결과와 작동 가능성
실용주의는 Morgan의 정리대로 "작동 가능성(workability)"과 공유된 의미 형성, 상호 이해, 협력을 중시해요. 타당도 측면에서는 평가와 그에 따른 결정이 낳는 이득과 해악, 즉 결과 근거(consequences evidence) 를 앞세우죠. 집단 의사결정 과정의 질이나 위원회 간 판정의 일치도 같은 것이 근거가 될 수 있어요. 양적·질적 자료를 모두 쓰는 통합적 입장이에요.
각 패러다임의 한계 ⚠️
후기실증주의에 대한 비판은 그 역사만큼이나 오래됐어요. 저자들은 Valentine 등의 말을 인용해요.
평가에서의 객관성은 "선형적 인과에 대한 순진한 신뢰로 이어질 수 있다."
"[objectivity in assessment] can lead to naive trust in linear causality"
측정이 불가능한 경우에도 복잡한 전문 과업을 측정 가능한 것으로만 줄여 버리는 오류라는 거예요. 모든 측정에는 편향이 끼기 때문에 객관성은 도달할 수 없고, 의도와 무관하게 형평성 문제를 키울 수도 있다는 주장도 있어요. 작업장 평가는 그 시점, 그 맥락에서 평가자가 본 것과 학습자의 수행에 달려 있으니 원래 주관적이고요.
Gingerich 등은 평가자가 "의미 있게 개별적(meaningfully idiosyncratic)" 일 수 있다고 했어요. 평가자마다 한 측면만 보고, 그 관점들을 합칠 때 학습자의 모습이 가장 정확하게 드러난다는 뜻이에요. 그래서 저자들은 WBA에서 어느 정도의 불일치, 즉 낮은 신뢰도는 예상해야 한다고 말해요.
그렇다고 구성주의와 실용주의가 문제가 없는 건 아니에요. 역량은 사회적 구성물이라 관습과 규범에 따라 정의가 달라져요. 그러니 위원회 수준의 신뢰도라는 게 정말 가능한지, 아니면 이론적으로만 그럴듯한 개념인지 의문이 생기죠. 실제 연구를 보면 많은 역량위원회가 일화에 기대고, 정식 훈련을 받지 않았고, 규준참조에 의존하면서 역량바탕 틀의 취지를 무시하거나 오해하는 경우가 많았어요. 이때 평가자 간 불일치는 의미 있는 관점 차이가 아니라 타당도와 신뢰도에 대한 실제 위협(예: 응답 과정 근거의 부족)일 가능성이 커요.
신중하게 완화하지 않으면, 선의에서 출발한 주관적·집단 기반 의사결정은 자의적이고 편향되며 일화에 의존하는 의사결정이 될 수 있다.
"If not carefully mitigated, well-intentioned subjective, group-based decision-making can become arbitrary, biased, and anecdotal decision-making."
어떻게 관리할까? 💡
저자들은 이 긴장이 쉽게 풀리지 않는다는 걸 인정하면서 몇 가지 질문을 던져요.
유용한 주관성(즉, 전문가들의 공유된 주관성)과 자의적이거나 일화에 기댄 의사결정 사이에서 어떻게 효과적으로 길을 찾을 것인가?
"How does one effectively negotiate between useful subjectivity (i.e., shared subjectivity of experts) and arbitrary or anecdotal decision-making?"
이 밖에도 위원회 수준의 신뢰도가 확보되면 개별 평가 수준의 신뢰도는 필요 없는지 같은 질문이 이어져요. 저자들의 답은 Tavares 등의 양립성 원칙(compatibility principle), 즉 패러다임·평가·타당도 사이의 양립성을 추구하자는 주장에서 출발해요.
하나의 패러다임이 다른 것보다 낫다고 주장하기보다, 우리는 패러다임과 데이터 출처 사이의 신중하고 숙고된 정렬을 통해 이 긴장을 관리할 수 있다고 제안한다.
"Rather than arguing for one paradigm over another, we suggest that the tensions may be managed through careful, considered alignment between paradigms and data sources."
정리하면 이래요.
- 표준화가 중요한 평가(인증시험, OSCE)에서는 문항반응이론, 평가자 간 신뢰도 같은 전통적 심리측정이 여전히 큰 가치가 있어요.
- 개인의 판단이 들어가는 평가(WBA)에서는 구성주의가 필요해요. 이때도 심리측정은 쓸모가 있어요. 일반화가능도 이론(generalizability theory)으로 점수 변동이 평가자 때문인지 학습자 때문인지 나눠 볼 수 있으니까요. 다만 평가자 차이가 의미 있는 개별성인지 구인무관 요인인지는 알려주지 못해서, 작업장 판단에서는 여전히 주관적 의사결정이 빠질 수 없어요.
- 집단 의사결정(역량위원회)처럼 상위 추론이 필요한 곳에서는 실용주의가 유용해요. 저자들은 효과적인 집단 과정(effective group process)을 이런 결정의 틀이자 실용주의와 잘 맞는 방법으로 봐요.
그러면서 양 극단을 모두 경계해요.
복잡한 사회적 장(場)을 순수하게 수치적이고 정량화 가능한 측정으로 환원할 수 있다는 생각은 비현실적이며 이론적 근거가 없다. 그러므로 우리는 그와 반대되는 요구가 있음에도, 진급, 역량 판정, 전공의 선발을 뒷받침하는 데 표준화 시험에만 의존하는 것에 반대한다. 마찬가지로, 순수하게 주관적인 의사결정에 의존하는 것 역시 다양한 편향의 위험과 불충분한 공유 정신모형 때문에 문제가 있음을 인정한다.
"the notion that one can distill a complex social field into purely numerical and quantifiable measurements is unrealistic and theoretically unfounded. We would therefore advocate against exclusive reliance on standardized tests to support advancement, competency decisions, or residency selection, despite demands to the contrary. Similarly, though, we acknowledge that the reliance on purely subjective decision-making is problematic due to risk of numerous biases and inadequate shared mental models."
결국 평가 목적, 패러다임, 타당도 근거 수집 사이의 정렬을 추구하는 균형 잡힌 접근을 권한다는 게 첫 번째 긴장에 대한 결론이에요.
🏗️ 긴장 2. 타당화의 수준: 부분과 전체 사이
개별 도구에서 평가 시스템으로
20세기에는 후기실증주의 문화 속에서 타당도를 주로 개별 도구(individual instrument) 단위로 따졌어요. 도구마다 근거가 충분한지 평가했고, 부담이 클수록 더 많은 근거가 필요했죠. 특정 시점에 학습자를 판단하는 인증시험이라면 이 방식이 맞아요.
하지만 지금 HPE 프로그램은 WBA, OSCE 점수, 필기시험 점수에 더해 전자의무기록(electronic health record) 데이터, 앰비언트 AI(ambient artificial intelligence) 데이터까지 활용하기 시작했어요. 이 데이터들은 하나의 평가 시스템(system of assessment) 으로 묶이고, 역량위원회가 이를 종합해 진급이나 졸업·자격 같은 고부담 결정을 내려요. 그러니 개별 평가뿐 아니라 평가 프로그램 전체의 타당도도 따져야 하는 상황이 된 거예요.
분해와 총체
여기서 교육학의 오래된 논쟁이 등장해요. 분해(decomposition) 와 총체(holism) 의 긴장이에요.
- 분해 관점은 역량을 측정 가능한 단위로 나누고, 그 단위들을 더해 역량을 판정해요. 개별 구성요소가 타당하면 최종 판정도 타당하다고 가정하죠.
- 총체 관점은 구성요소를 더하는 것만으로는 역량 판단의 복잡성을 담을 수 없으니 전체적인 판단이 필요하다고 봐요.
이 논쟁은 모든 수준에서 나타나요. 개별 평가 도구도 총체적일 수 있고(예: 위임-감독 척도 entrustment-supervision rating), 단위로 쪼개질 수도 있어요(예: 하위역량 평정 subcompetency rating). 역량위원회의 결정도 마찬가지예요. 게다가 하나의 역량을 여러 평가가 다루고, 하나의 평가가 여러 역량을 측정하기도 하죠. 그래서 저자들은 타당도를 이렇게 보자고 해요.
타당도는 여러 근거 조각이 바로 그 하나의 역량 성취를 얼마나 말해 주는가의 정도로 보는 편이 더 나을 수 있다.
"validity may be better viewed as the degree to which pieces of evidence speak to achievement of that one competency."
해법: "둘 중 하나"가 아니라 "둘 다" 🔧
저자들은 양자택일(either/or) 대신 양자병행(both/and) 을 제안하면서 건물 짓기를 예로 들어요.
부품(철골, 리벳, 콘크리트)이 고품질이고 믿을 만하다는 근거는 건물이 튼튼한 재료로 지어졌음을 보장해 줄 것이다. 그러나 공학적 결정이 적절했고, 부품들이 제대로 맞물렸으며, 그 결과 건물이 구조적으로 견고하다는 근거 또한 필요하다.
"Evidence that the parts (steel, rivets, concrete) are high-quality and reliable would ensure the building is made of solid materials. However, evidence is also needed that the engineering decisions were appropriate, the pieces fit together properly, and the resulting building is structurally sound."
WBA와 역량위원회를 예로 들면 이런 근거를 모을 수 있어요.
| 수준 | 질문 | 근거 유형 |
| 개별 WBA | 평가자가 평정하는 것을 실제로 관찰하고, 평가 과제를 이해하는가? | 응답 과정 (response process) |
| 개별 WBA | 관찰 중에 중요한 기술이 평가되는가? | 내용 (content) |
| 개별 WBA | 수집된 데이터가 학습자 성장에 유용한 피드백이 되는가? | 결과 (consequences) |
| 역량위원회 | 고부담 결정을 내릴 만큼 관찰 횟수가 충분했는가? | 내적 구조 (internal structure) |
| 역량위원회 | 위원들이 의사결정 과정과 자신이 해석하는 데이터를 이해하는가? | 응답 과정 (response process) |
저자들은 이 모든 과정에서 정의 지향적 관점(justice-oriented lens) 을 지켜야 한다고 강조해요. 지배적인 의사 원형(dominant physician archetype)을 위해, 또는 그들이 만든 평가 프로그램 때문에 모든 학습자, 특히 소수자 배경(minoritized backgrounds)의 학습자가 불리해지지 않도록 각별히 주의하라는 거예요.
현실의 벽: 자원 💸
모든 수준에서 타당도 근거를 모으는 건 비용과 인력이 많이 드는 일이에요. 저자들도 이 점을 솔직하게 인정해요.
그러므로 이 긴장은 이론적이라기보다 실용적인 것일지도 모른다. 교육자와 프로그램은 모든 수준에서 타당도 근거를 모으고, 그 근거를 최종 결정을 위한 일관된 논증으로 연결할 역량을 갖추고 있는가?
"Thus, the tension is perhaps more pragmatic than theoretical: do educators and programs have the capacity to collect validity evidence at all levels and then connect the evidence into a coherent argument for ultimate decisions?"
여기에 프로그램식 평가가 지닌 이중 목적(dual purpose), 즉 학습을 위한 형성평가이면서 의사결정을 위한 총괄평가라는 문제까지 더해져요. 이 부분은 같은 특집호에 실린 Ryan 등의 다른 논문에서 따로 다뤘다고 해요.
그래서 저자들의 제안은 이래요.
타당도 근거를 수집하는 일은 장기적이고, 반복적이며, 협력적인 과정, 그리고 그 자체로 하나의 학술 프로그램이 될 수 있는 과정으로 보아야 한다.
"the opportunity to collect validity evidence must therefore be viewed as a longitudinal, iterative, and collaborative process that can be its own program of scholarship."
시작점을 고르는 방법도 구체적이에요. WBA가 평가 시스템에서 가장 큰 비중을 차지한다면 WBA부터, 역량위원회가 데이터를 종합하는 과정이 걱정된다면 거기부터 시작하라는 거예요. 비슷한 맥락에서 이미 타당도 근거가 충분히 쌓인 도구는 새로 타당화하지 않아도 되고요.
그리고 두 방향 모두 필요하다는 점을 분명히 해요.
평가 시스템의 구성요소를 뒷받침하는 타당도 근거가 없다면, 프로그램 수준의 결정에 쓰이는 데이터는 의심스러울 수 있다. 반대로 타당화가 개별 도구에만 집중된다면, 프로그램 전체는 응집성과 방어 가능성에 대한 근거가 부족할 수 있다.
"Without evidence of validity supporting the component parts of an assessment system, the data informing program-level decisions may be questionable. Conversely, if validation focuses only on individual instruments, the program as a whole may lack evidence of cohesion and defensibility"
저자들 표현으로는 구성요소를 '확대해서 보기(zooming in)' 와 프로그램 전체를 '축소해서 보기(zooming out)' 사이의 긴장이에요.
📏 긴장 3. 역량의 기준점: 무엇과 비교할 것인가
마지막 긴장은 "이 학습자는 역량이 있다"고 판단할 때의 기준(standard) 이에요. 진급, 수련 수료, 인증, 면허를 결정하려면 역량 성취 수준이 정해져 있어야 하죠. 저자들은 명확한 성과 기준이 사회적 책무성(social accountability) 에 뿌리를 두고 있다고 말해요. 선택지는 세 가지예요.
① 규준참조 기준 (norm-reference standard)
전통적인 타당도 논증은 개인 간 성취 차이, 즉 피험자 간 분산(between-subject variance) 으로 역량의 기준선을 정해 왔어요. 크론바흐 알파(Cronbach's alpha)나 일반화가능도 이론 같은 신뢰도 측정도 사람마다 점수가 달라야 성립하죠. 본질적으로 집단 안에서 비교하는 규준참조 방식이에요.
② 준거참조 기준 (criterion-reference standard)
그런데 이게 CBHPE와 정면으로 부딪혀요.
피험자 간 분산이 필요하다는 요건은 CBHPE의 근본 전제에 반한다. CBHPE는 정의상 결과 중심의 교육·수련 접근이며, 따라서 이 패러다임의 관심은 학습자가 역량 기준선에 도달하는지 '여부'가 아니라 '언제' 도달하는지에 있다.
"The requirement for between-subject variance is contrary to the underlying premise of CBHPE. By definition, CBHPE is an outcomes-based approach to education and training, and, as such, the paradigm is concerned with when, not if, a learner achieves a threshold of competence to demonstrate accountability to the public."
임상 현장에서는 분산 자체가 작을 수도 있어요. 모든 학습자가 정해진 성과에 도달해서 차이가 거의 없어지는 고원 효과(plateau effect) 때문이에요. 이럴 때 피험자 간 분산만으로 기준선을 정하면 결국 정해진 준거가 아니라 동료와의 비교로 역량을 판단하게 되고, 편향도 끼어들어요. 그래서 CBHPE 지지자들은 준거참조 방식을 주장하고, 지금은 고부담 시험에서도 흔히 쓰여요. 전문가 합의와 평가 데이터를 결합해 기준을 정하는 표준 설정(standard setting) 이 대표적이죠.
③ 종단적 성장 기준 (longitudinal growth standard) 📈
세 번째는 피험자 내 분산(within-subject variance), 즉 한 사람이 수련 기간과 경력 전반에 걸쳐 얼마나 성장하는지를 보는 거예요. 사람마다 기술을 익히는 속도가 다르니, 성장을 추적하는 건 형평성 측면에서도, 역량바탕 측면에서도 이론적으로 타당해 보여요. 정해진 성과를 향한 개인의 성장을 재고, 그 과정에서 필요한 개입을 할 수 있으니까요.
실제 연구도 있어요. Park 등은 가정의학과 전공의의 성장 곡선에서 역량 기준 도달을 예측하는 패턴과 보충교육(remediation)이 필요한 패턴을 찾아냈어요. Bok 등은 수의대생을 대상으로 세 가지 평가 도구에서 무선계수 모형(random coefficient modeling)으로 개인 성장을 측정했고, 다른 연구들은 잠재계층 성장곡선 모형(latent class growth curve model)으로 학습 궤적을 모델링했어요. 성장은 공식 수련에서 끝나지도 않아요. 평생학습(lifelong learning)은 보건의료 전문직의 특징이니까요.
그런데, 질문은 남아요 🤔
저자들은 성장 기준이 매력적이지만 생각만큼 단순하지 않다고 지적해요. 준거참조 방식도 완전히 자유롭지 않아요. Hofstee나 Angoff 같은 방법도 기준을 만들 때 학습자 데이터를 일부 쓰니 여전히 규준참조의 영향을 받거든요. 성장 기준에 대해서는 이런 질문을 던져요.
- 기대되는 성장 궤적이라는 게 있을까? 있다면 어느 정도 벗어나야 정상 발달 범위 밖일까?
- 개인의 성장이 진짜 향상인지, 구인무관분산인지 어떻게 알 수 있을까?
- 이미 정해진 역량 수준에 도달했는데 성장 곡선이 평평한 학습자는 어떻게 해석해야 할까?
- 시간이 지나면서 역량이 줄어드는 건 어떻게 반영할까?
결국 성장은 측정할 수 있지만, 저자들 말대로 "분명히 더 복잡하다(admittedly more complex)"는 거예요.
해법: 세 기준의 균형 ⚖️
그러나 성장의 측정은 대중에 대한 우리의 책무와 균형을 이루어야 한다. 성장은 중요하지만, 학습자가 궁극적으로 유능한 진료의 기준선을 충족하는 한에서만 그렇다.
"However, the measurement of growth must be balanced against our accountability to the public; growth is important, but only to the extent that the learner ultimately meets the threshold for competent practice."
그래서 최소 역량 기준을 정하는 일과 그 기준을 향한 진전을 측정하는 일이 둘 다 필요하다고 해요. 규준참조와 준거참조 사이의 균형, 그리고 종단적 성장 추적이 함께 있어야 어려움을 겪는 학습자에게 피드백과 보충교육을 제공하고, 모든 학습자가 진급·졸업·자격 취득의 최소 기준을 충족하도록 도울 수 있다는 거예요.
✍️ 저자들의 결론
저자들은 세 긴장을 철학의 충돌이면서 동시에 기회로 봐요.
이 긴장 지점들은 철학의 충돌을 나타내지만, 동시에 옛 접근과 새 접근 사이에서 균형을 잡을 기회를 주며, 그럼으로써 CBHPE를 더 깊이 실현하도록 돕는다.
"Though these tension points represent a clash of philosophies, they also present an opportunity to strike a balance between old and new approaches, thus promoting a deeper realization of CBHPE."
앞으로의 평가가 갖춰야 할 모습은 이렇게 제시해요.
앞으로 21세기 보건의료인 평가는 프로그램식이어야 하고, 타당도 논증을 구성하도록 설계되어야 하며, 실제적인 WBA, 여러 유형의 평가에서 오는 정보, 그리고 역량에 대한 발달적 관점과 관련된 긴장을 고려해야 한다.
"Moving forward, 21st-century assessment of health professionals should be programmatic, designed to construct a validity argument, and take into account tensions related to authentic WBA, input from multiple types of assessments, and a developmental view of competence."
💬 덧붙이는 생각
이 논문은 어느 한쪽 편을 들지 않아요. "심리측정은 낡았다"거나 "주관적 판단이 답이다" 같은 결론 대신, 평가 목적에 맞춰 패러다임과 근거를 정렬하라고 말하죠. 새로운 이론을 제시하는 글은 아니지만, 역량바탕 평가를 설계하는 사람이 자주 부딪히는 문제를 세 갈래로 정리해 준다는 점에서 쓸모가 커요.
국내에서도 전공의 수련에 WBA와 역량 판정 체계를 도입하려는 논의가 이어지고 있는데요, 실무에서 바로 생각해 볼 만한 질문을 몇 가지 뽑아 봤어요.
- 우리 프로그램의 역량 판정 회의는 근거에 기반한 집단 과정인가요, 아니면 "그 전공의 괜찮던데" 같은 일화가 오가는 자리인가요?
- WBA 평가자들이 무엇을 관찰하고 어떤 기준으로 평정하는지 이해하고 있다는 근거(응답 과정 근거)를 갖고 있나요?
- 판정 기준이 동료와의 비교(규준참조)로 흘러가고 있지는 않나요?
- 모든 걸 한꺼번에 타당화할 수 없다면, 우리 프로그램에서 가장 비중이 크거나 가장 걱정되는 부분은 어디인가요?
타당화를 "한 번 하고 끝내는 연구"가 아니라 "장기적인 학술 프로그램"으로 보자는 저자들의 제안은 자원이 넉넉하지 않은 현장에 특히 현실적인 조언이라고 생각해요. 🙂
서론 (INTRODUCTION)
지난 100년 동안 보건의료전문직 교육(health professions education, HPE)의 평가는 발전해 왔다. 측정의 시대(measurement era)에는 고부담 선다형 시험(high-stakes multiple choice question examinations)과 표준화(standardization)가 평가 영역을 지배했다 [1]. 그러나 평가 전문가들이 인간의 판단(human judgement)이 갖는 가치를 인식하면서, 다른 접근들, 예를 들어 일터기반 평가(workplace-based assessment, WBA)와 시뮬레이션(simulation) 등이 점차 수용되고 널리 활용되었다 [2–4]. 더 최근에는 평가를 시스템 관점(systems lens)에서 개념화하여, 여러 방법을 하나의 프로그램에 의도적으로 통합하게 되었다 [5]. 측정(measurement)이 사라진 것도 아니고, 판단(judgment)이 사라진 것도 아니다. 그러나 평가 포트폴리오(assessment portfolios)의 다양성 확대부터 프로그램적 평가(programmatic assessment)에 대한 강조에 이르기까지 [6, 7], 이러한 현대적 고려사항들은 복잡성(complexity), 불확실성(uncertainty), 방법론적 다양성(methodological diversity)을 한층 더 증가시켰다.
평가의 변화와 더불어 HPE에서는 평가 타당도(assessment validity)에 관한 사고도 발전해 왔다. 다른 분야 학자들의 연구 [8, 9]를 토대로, 타당도를 평가자료(assessment data)의 해석(interpretations)과 활용(uses)에 관한 논증(argument)으로 개념화하는 방식이 점점 더 널리 사용되고 있다 [10]. 논증기반 접근(argument-based approach)은 어떤 근거(evidence)를 얼마나 많이 찾을 것인지에 유연성을 제공하는 동시에, 그러한 근거를 찾는 데 방법론적으로 다양한 접근을 허용한다 [11]. 타당도를 논증으로 보는 개념이 여전히 널리 받아들여지고 있지만 [12], 역량기반 보건의료전문직 교육(competency-based health professions education, CBHPE)으로의 전환은 타당도 논증을 어떻게 개발하는지 검토할 것을 요구한다. CBHPE는 개별 평가만을 대상으로 논증을 만드는 대신, 수련 중 지속적인 발달(continued development)에 정보를 제공하기 위해 평가체계(assessment systems)의 통합과 성장(growth) 및 역량 달성(competency attainment)의 측정을 지지한다. 이제 타당도 논증은 전문가 집단, 즉 역량위원회(competence committee)가 내리는 역량을 갖추었다는, 또는 갖추지 못했다는 주장과 같은 복잡한 의사결정(complex decision-making)을 설명해야 한다. 따라서 CBHPE는 타당도에 관한 HPE의 관점이 전환되고 있음을 나타낸다.
이 논문에서는 CBHPE의 타당도 논증과 관련된 세 가지 긴장, 즉 평가의 패러다임(paradigms of assessment), 타당화의 수준(level of validation), 역량의 참조 기준(reference for competence)을 탐색한다. 이러한 긴장을 검토함으로써, CBHPE가 현재의 타당도 개념화에 제기하는 과제를 상세히 설명하고, 가능한 경우 이러한 긴장을 관리할 잠재적 해결 방안(potential solutions)을 제시하고자 한다. 긴장을 요약한 내용은 그림 1에 제시되어 있다.
긴장 #1: 평가의 패러다임 (TENSION #1: THE PARADIGM OF ASSESSMENT)
이 절에서는 개인의 패러다임적 지향(paradigmatic orientation)이 타당도의 개념화에 미치는 영향을 탐색한다. 여기서 패러다임(paradigm)은 인식론적 입장(epistemological stance), 즉 개인의 관점에 영향을 미치는 신념체계(belief system)를 뜻하는 용어로 정의한다. 여기에는 지식의 본질(nature of knowledge), 지식을 측정하는 최선의 접근 등이 포함된다 [13]. HPE에는 다른 패러다임들도 존재하지만, 여기서는 CBHPE와 관련된 세 가지 지향, 즉 후기실증주의(post-positivism), 구성주의(constructivism), 실용주의(pragmatism)에 초점을 맞춘다.
후기실증주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A POST-POSITIVIST PARADIGM)
1800년대 중·후반부터 후기실증주의 패러다임(post-positivist paradigm)은 HPE 평가를 지배해 왔다 [1, 14]. 후기실증주의 접근에 대한 강조는 상당 부분 보건의료전문직 종사자(health care professionals)의 역량에 대한 우려에서 비롯되었다. 이에 대응하여 서구 사회에서는 공식 평가위원회(assessment boards)와 인증기관(accrediting bodies)을 점차 도입했으며, 대중에 대한 책무성(accountability to the public)을 높이기 위해 고부담 면허시험 및/또는 자격인증시험(high-stakes licensure and/or certification examinations), 객관성(objectivity), 표준화(standardization), 공정성(fairness), 신뢰도(reliability)에 노력을 집중했다 [15, 16]. 이 심리측정의 시대(psychometric era)에는 주관성(subjectivity)은 바람직하지 않고, 실제 현장에서 수행을 관찰하는 것은 불공정하며, 좋은 평가는 표준화되어 있어 편향(bias)으로부터 자유로운 평가라고 주장했다 [4]. 고전검사이론(classical test theory)을 토대로 하는 이 패러다임의 암묵적 가정은, 특정 영역에서 학습자가 일관되게 보이는 능력을 반영하는 ‘진점수(true score)’가 실제로 존재한다는 것이다. 따라서 목표는 평가자료에 오차(error), 즉 잡음(noise)이 얼마나 포함되어 있는지를 확인하는 데 있다 [17].
구성주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A CONSTRUCTIVIST PARADIGM)
후기실증주의 패러다임의 한 대안은 타당도에 대한 구성주의적/주관주의적 지향(constructivist/subjectivist orientation)이다. 이러한 접근은 지난 수십 년 동안 CBHPE 전문가들이 역량에 관한 결정(competency decisions)에 내재한 ‘공유된 주관성(shared subjectivity)’ [18]과 일터기반 측정(workplace-based measurement)의 표준화 부족 [19]을 강조하면서 등장했다. 이에 따라 구성주의자들은 주관주의적/구성주의적 지향에서 공통적으로 중시하는 의미 형성(sense-making), 맥락(context), 사회적 과정(social processes)을 중심으로 타당도를 다루어야 한다고 주장한다 [4, 19]. 개별 평가자의 신뢰도(individual rater reliability)를 고려하기보다는, 역량위원회(competency committee, CC) 수준에서 역량 또는 준비도(readiness)에 관한 결정의 신뢰도를 검토해야 한다 [20]. 역량위원회는 집계된 평가자료(aggregate assessment data)를 활용하여 총괄적 판정(summative determination)을 내리는 사람들의 집단이다 [21]. 양적 방법(quantitative methods)이 일부 상황, 즉 위원회들 간 CC 결정의 신뢰도를 측정하는 데 유용할 수 있지만, 이 구성주의 패러다임에서는 근거에 더 많은 질적 요소(qualitative components)가 포함될 수 있다.
실용주의 패러다임에서의 타당도 근거 (VALIDITY EVIDENCE IN A PRAGMATIC PARADIGM)
마지막으로 타당도에 대한 실용주의적 지향(pragmatic orientation)을 살펴본다. Morgan이 요약한 바와 같이, 실용주의(pragmatism)는 주로 ‘작동 가능성(workability)’에 관심을 두며, 당사자들 사이의 공유된 의미 형성(shared meaning-making), 상호 이해(mutual understanding), 협력(collaboration)을 강조한다 [13]. 타당도와 역량에 관한 의사결정(competency-decision-making)의 맥락에서, 이는 평가와 그에 뒤따르는 결정이 미치는 영향, 즉 이익과 해악(benefits and harms)에 관한 결과 근거(consequences evidence)를 우선시한다는 뜻이다 [22]. 이 패러다임의 타당도 근거에는 집단 의사결정 과정(group decision-making process)의 질 [23]과 위원회 간 의사결정의 신뢰도가 포함될 수 있다. 후기실증주의나 구성주의와 대조적으로, 실용주의는 타당도에 대해 더 통합적인 지향을 나타낸다. 즉 양적 측정과 질적 측정(quantitative and qualitative measures)을 모두 활용한다 [13].
그림 1. 역량기반 보건의료전문직 교육 시대의 타당도에 내재한 긴장 (Figure 1. Inherent tensions to validity in the era of competency-based health professions education.)

- 그림 내 제목: 역량기반 보건의료전문직 교육 시대의 타당도: 세 가지 긴장 (Validity in the era of Competency-Based Health Professions Education: Three Tensions)
| 긴장 1: 평가의 패러다임 (Tension 1: The paradigm of assessment) | 긴장 2: 타당화의 수준 (Tension 2: Level of validation) | 긴장 3: 역량의 참조 기준 (Tension 3: Reference for competence) |
| 후기실증주의(Post-positivism) 구성주의(Constructivism) 실용주의(Pragmatism) |
개별 평가(Individual assessments) 평가체계(Systems of assessment) |
규준참조(Norm-reference) 준거참조(Criterion-reference) 종단적 성장(Longitudinal growth) |
각 패러다임의 과제 (THE CHALLENGES IN EACH PARADIGM)
객관성의 추구(pursuit of objectivity) [24]는 100년 넘게 널리 이어져 왔지만, 후기실증주의 접근에 대한 우려 역시 거의 그만큼 오래 제기되어 왔다 [4, 24, 25]. Valentine과 동료들이 명료하게 지적하듯, ‘[평가에서의 객관성(objectivity in assessment)]은 선형적 인과관계(linear causality)에 대한 순진한 신뢰를 초래할 수 있다.’ 이는 복잡한 전문직 업무(complex professional tasks)의 평가를 측정 가능한 것들로만 축소하는 오류이며, 심지어 그러한 측정이 불가능한 경우에도 그렇게 한다 [24]. 이론적 관점에서 저자들은 모든 측정이 편향의 영향을 받으므로 객관성은 달성할 수 없으며, 객관성은 의도적으로 또는 의도치 않게 형평성(equity)에 관한 문제를 심화시킬 수 있다고 주장해 왔다 [4, 26]. 또한 일터에서의 평가는 평가자인 인간의 인식(perceptions)과 해당 시점, 해당 맥락에서 수련생(trainee)이 보이는 수행에 의존하기 때문에 본질적으로 주관적이며 표준화되어 있지 않다 [17]. 마지막으로 Gingerich와 동료들이 설명하듯, 평가자(assessors)는 ‘의미 있는 고유성을 지닐 수 있다(meaningfully idiosyncratic)’ [27]. 이는 각 평가자가 한 가지 측면만을 볼 수 있으며, 그러한 관점들을 결합하면 학습자의 모습을 가장 진실하게 파악할 수 있다는 뜻이다 [27]. 따라서 인식, 경험 또는 맥락에서 나타나는 실제적이고, 심지어 의미 있는 차이 때문에 WBA에서는 어느 정도의 비일관성(inconsistency), 즉 낮은 신뢰도(low reliability)가 나타날 수 있음을 예상해야 한다 [4, 24, 27].
그러나 구성주의 패러다임과 실용주의 패러다임에도 과제가 있다. 역량(competence)은 사회적 구인(social construct)이므로, 이를 어떻게 정의하는지는 본질적으로 관습(customs), 규범(norms), 사회적 기대(social expectations)에 의존한다 [28, 29]. 이는 예상할 수 있는 일이지만, 위원회 수준의 신뢰도라는 개념이 과연 달성 가능한 것인지, 아니면 단지 이론적으로 매력적인 개념에 불과한지라는 질문을 제기한다 [30]. 또한 이 패러다임들에는 신중하게 관리해야 하는 내재적 위험이 있다. 예를 들어 CC 의사결정에 관한 문헌의 근거는 많은 CC가 일화(anecdotes)에 기대고, 공식적인 훈련(formal training)이 부족하며, 규준참조(norm-referencing)에 의존하면서 결정을 내릴 때 역량기반 프레임워크(competency-based frameworks)의 취지를 무시하거나 오해하는 경우가 많음을 시사한다 [31–33]. 따라서 평가자들 사이의 일부 비일관성은 반드시 인식, 수행 또는 맥락의 실제 차이 때문이라고 볼 수 없으며, 오히려 타당도와 신뢰도에 대한 실질적인 위협, 즉 반응과정 타당도(response-process validity)를 뒷받침하는 근거의 부족 때문일 가능성이 있다 [34]. 이를 신중하게 완화하지 않으면, 선의에서 출발한 주관적 집단 의사결정(subjective, group-based decision-making)이 자의적이고 편향되며 일화에 의존하는 의사결정으로 변할 수 있다.
긴장의 관리 (MANAGING THE TENSION)
앞서 제시한 이유들 때문에 CBHPE 시대의 패러다임적 지향 사이의 긴장은 해소하기 어렵다.
- 유용한 주관성(useful subjectivity), 즉 전문가들의 공유된 주관성과, 자의적이거나 일화에 의존하는 의사결정 사이에서 어떻게 효과적으로 조율할 수 있는가?
- 더 형평성 있는 평가체계에 대한 헌신을 훼손하지 않으면서 역량평가(competency assessment)에 내재한 주관성을 어떻게 다룰 수 있는가?
- 역량이 맥락에, 그리고 어쩌면 위원회에도 의존한다면 위원회 평정(committee ratings)의 신뢰도를 어떻게 검토할 수 있는가?
- CC 수준의 신뢰도가 확보되면 개별 평가 수준에서 신뢰할 수 있는 자료가 필요하지 않게 되는가?
Tavares 등의 논의처럼 [35], 패러다임(paradigm), 평가(assessment), 타당도(validity) 사이의 양립 가능성(compatibility)을 추구해야 한다. 특정 패러다임이 다른 패러다임보다 우월하다고 주장하기보다는, 패러다임과 자료원을 신중하고 사려 깊게 정렬(alignment)함으로써 긴장을 관리할 수 있다고 제안한다(표 1).
- 후기실증주의 패러다임은 표준화와 객관성이 무엇보다 중요한 상황에서 가치가 있다 [14]. 여기에는 선다형 검사(multiple-choice tests), 예를 들어 자격인증시험(certification examinations)과, 객관구조화임상시험(objective structured clinical examinations)처럼 표준화를 추구하는 임상평가(clinical assessments)가 포함된다. 이러한 상황에서는 전통적 심리측정학(traditional psychometrics), 예를 들어 문항반응이론(item-response theory)과 평가자 간 신뢰도(inter-rater reliability)가 여전히 매우 유용하다.
- 마찬가지로 구성주의는 특히 평가에 개인의 판단이 포함되는 경우 중요한 역할을 한다. 대표적인 예는 본질적으로 평가자와 그 맥락에 의존하는 WBA이다 [19]. 중요한 점은 구성주의 패러다임에서도 심리측정학이 여전히 역할을 할 수 있다는 것이다. 예를 들어 일반화가능도이론(generalizability theory)은 분산의 원천(sources of variance)을 구분하여, 점수 변동(score variation)이 평가자, 학습자 또는 다른 요인들에 얼마나 기인하는지 판단할 수 있다 [36, 37]. 다만 일반화가능도이론은 평가자 간 차이의 원천, 즉 의미 있는 고유성(meaningful idiosyncrasies) [27]과 구인무관 영향(construct-irrelevant influences)을 더 세부적으로 구분할 수 없다는 점이 중요하다 [38]. 따라서 주관적 의사결정은 여전히 일터기반 판단(workplace-based judgments)의 필수 요소이다.
- 마지막으로 실용주의 패러다임은 역량위원회의 판정에 요구되는 것처럼 집단 의사결정과 관련된 고차 추론(higher-order inferences)을 고려하는 데 매우 유용하다. 효과적인 집단 과정(effective group process)은 그러한 결정을 내리기 위한 프레임워크이며 [23], 실용주의 패러다임과 부합하는 방법이다.
요약하면, 복잡한 사회적 영역을 순전히 수치적이고 정량화 가능한 측정으로 환원할 수 있다는 생각은 비현실적이며 이론적 근거가 없다 [4, 18]. 따라서 이에 반대되는 요구가 있더라도 [39, 40], 진급(advancement), 역량에 관한 결정(competency decisions), 전공의 선발(residency selection)을 뒷받침하기 위해 표준화 검사(standardized tests)에만 의존하는 것에 반대한다. 한편 순전히 주관적인 의사결정에 의존하는 것 역시 수많은 편향의 위험 [41]과 불충분한 공유 정신모형(shared mental models) [31] 때문에 문제가 있다는 점을 인정한다. 이러한 이유로 평가의 목적(purpose of assessment), 패러다임적 지향(paradigmatic orientation), 타당도 근거의 수집(collection of validity evidence) 사이의 정렬을 촉진하는 균형 잡힌 접근을 권고한다.
표 1. 평가의 패러다임과 역량기반 보건의료전문직 교육에서의 타당도 적용 (Table 1. Paradigms of assessment and application to validity in competency-based health professions education.)
| 패러다임적 지향 (PARADIGMATIC ORIENTATION) | 정의 (DEFINITION) | 선호하는 자료 유형 (TYPES OF DATA FAVORED) | 근거의 예 (EXAMPLES OF EVIDENCE) | 역량기반 보건의료전문직 교육에서의 활용 (USE IN COMPETENCY-BASED HEALTH PROFESSIONS EDUCATION) |
| 후기실증주의(Post-positivism) | 특정 역량 영역(competency domain)에서 학습자의 능력을 반영하는 ‘진점수(true score)’가 존재한다. | 객관적·수치적·표준화된 자료(objective, numerical, standardized data) | 고전검사이론(Classical test theory) 문항반응이론(Item-response theory) 평가자 간 신뢰도(Inter-rater reliability) |
표준화된 검사 상황(standardized test settings): 예를 들어 선다형 문항 검사(multiple-choice item tests), 객관구조화임상시험(objective structured clinical examinations) 등 |
| 구성주의(Constructivism) | ‘진점수(true score)’는 존재하지 않으며, 역량의 정의는 사회적으로 구성된다(socially constructed). | 주관적·질적·비표준화된 자료(subjective, qualitative, non-standardized data) | 주제분석(Thematic analysis) 일반화가능도이론(Generalizability theory)* |
일터기반 평가(Workplace-based assessments) |
| 실용주의(Pragmatism) | 역량은 집단 간 상호 이해(mutual understanding)와 ‘작동 가능성(workability)’을 통해 발달한다. | 질적 자료와 양적 자료의 결합(combination of qualitative and quantitative data)을 지지한다. | 효과적인 집단 과정(Effective group process) | 집단 의사결정(Group decision-making), 즉 역량위원회(competency committees) |
- *일반화가능도이론(generalizability theory)은 분산의 원천, 즉 평가자와 학습자를 구분해 제시할 수 있지만, 각 원천 내부를 더 세부적으로 구분할 수는 없다. 예를 들어 의미 있는 평가자 간 차이(meaningful rater differences)와 구인무관 분산(construct-irrelevant variance)을 구분할 수 없다.

긴장 #2: 타당화의 수준 (TENSION #2: LEVEL OF VALIDATION)
두 번째 긴장은 타당도 논증을 평가 프로그램(assessment program)의 개별 구성요소(individual components)에 집중할 것인지, 아니면 더 총체적으로(holistically) 고려할 것인지에 관한 것이다. 이 논의를 시작하기 위해 현대적 타당도 실천(modern validity practices)의 기원과 개별 도구(individual instruments)에 대한 근거에 초점을 맞추어 온 경향을 살펴본다.
현대 타당도 이론과 개별 도구의 ‘타당화’ (MODERN VALIDITY THEORY AND THE ‘VALIDATION’ OF INDIVIDUAL INSTRUMENTS)
20세기 평가문화(assessment culture)의 후기실증주의적 초점과 맞물려, HPE 프로그램은 개별 도구 수준에서 평가의 타당도를 검토하는 경우가 많았다 [8, 9]. 각 도구에 대해서는 결과의 해석을 지지하거나 반박하는 근거가 상대적으로 얼마나 충분한지를 판단했다. 의사결정의 중요도가 높을수록 더 많은 근거가 요구되었다 [38]. 흔히 사용되는 프레임워크는 도구 간 비교를 허용했지만, 예를 들어 Messick의 다른 변인과의 관계에 관한 근거(relations to other variable evidence) [8]나 Kane의 외삽(extrapolation) [42] 등이 그러했지만, 이러한 비교는 해당 도구를 다른 유사하거나 상이한 측정치에 비추어 검토하도록 설계되어 있었다.
이러한 접근은 고부담 양적 평가(high-stakes quantitative assessments), 예를 들어 자격인증시험에 적용할 때 논리적이다. 특정 시점에서 수련생을 판단하는 것이 목표이므로 단일 평가(single assessment)의 타당도가 무엇보다 중요하기 때문이다. 그러나 최근 수십 년 동안 HPE 프로그램에서 사용하는 평가의 수와 다양성이 증가해 왔다. 더욱이 평가와 CBHPE 전문가들은 개별 평가뿐 아니라 복잡한 평가체계(complex systems of assessment)도 고려해야 한다고 주장해 왔다 [5]. 따라서 CBHPE에서는 개별 평가의 타당도뿐 아니라 전체 평가 프로그램의 타당도도 이해해야 한다. 이에 따라 평가 실천(assessment practices)에 새로운 접근이 필요해졌으며, 이는 타당화 실천(validation practices)에도 영향을 미쳤다.
프로그램적 평가 접근의 중요성 (The importance of a programmatic assessment approach)
프로그램적 평가(programmatic assessment)는 형성적 목적(formative purposes)을 위해 서로 다른 맥락에 걸쳐 여러 자료원에서 매우 다양한 자료를 의도적으로 수집하고, 이를 나중의 총괄적 결정(summative decisions)을 위해 취합하는 것으로 정의된다 [1]. 흔히 수집하는 자료의 예에는 WBA, 객관구조화임상시험 점수, 필기시험 점수(written examination scores)가 포함된다. 더 최근에는 교육 분야의 리더들이 전자의무기록(electronic health record)과 앰비언트 인공지능(ambient artificial intelligence)에서 생성된 자료 등 임상자료(clinical data)의 활용을 개척해 왔다 [49–51].
이러한 다양한 평가들은 도구와 과정(instruments and processes)이 통합된 생태계(integrated ecosystem)로 작동하는 평가체계로 결합되며, 의사결정은 여러 수준에서 이루어진다 [5]. 프로그램적 평가에서는 이러한 현장자료(frontline data)를 집계하고 종합하여 역량위원회가 검토하도록 하고, 수련 단계의 진급이나 졸업/자격 부여(graduation/credentialing)에 대한 준비도에 관해 더 고부담인 결정을 내린다 [6, 7]. 이론적으로, 체계의 여러 부분에서 나온 평가자료를 종합하는 집단 과정(group process)은 학습자의 수행을 가장 다각적이고 완전하게 보여 주며, 따라서 역량을 향한 진전(progress toward competence)을 명확하게 파악하도록 한다.
체계 수준에서 타당도 확보하기: 총체적 결정인가, 분해인가 (Obtaining validity at a systems level: holistic decisions or decomposition)
CBHPE에서 사용하는 다면적 평가체계(multifaceted systems of assessment)는 중요한 질문을 제기한다.
- 전체 평가체계에 대한 타당도 논증을 어떻게 개발할 것인가?
- 역량을 순전히 총체적 판단(holistic judgment)으로 보아야 하는가, 아니면 최종 판단을 가산적(additive)인 것으로 보고, 개별적으로 타당화된 평가들에서 나온 여러 자료점(data points)의 합산에 근거한 것으로 보아야 하는가?
의학교육 이외의 교육환경에서는 이를 흔히 분해(decomposition), 즉 역량을 측정 가능한 단위로 분해하는 것과, 총체주의(holism), 즉 역량을 총체적 판단으로 보는 것 사이의 긴장이라고 한다 [43].
- 분해 관점(decomposition view)은 개별 단위를 합산하여 역량에 관한 판정을 내리고자 한다. 이 관점의 가정은 개별 구성요소가 타당하면 최종 총괄적 결정(final summative decision)도 타당할 것이라는 것이다.
- 총체적 관점(holistic view)은 전체 결정(overall decision)에 더 명시적으로 초점을 맞춘다. 이 관점의 가정은 개별 구성요소를 합산하는 것만으로는 전체 역량 판단(overall competency judgment)의 복잡성을 충분히 포착할 수 없으므로, 총체적 판정(holistic determination)이 필요하다는 것이다 [43].
이 긴장을 다룰 수 있는가? (Can we navigate the tension?)
분해와 총체주의 사이의 논쟁은 모든 수준에서 전개될 수 있으므로 이 긴장은 단순하지 않다. 개별 평가도구(individual assessment instruments)는 총체적일 수도 있고, 예를 들어 위임-감독 평정(entrustment-supervision ratings)이 그러하며, 단위로 분해될 수도 있는데, 예를 들어 하위역량 평정(subcompetency ratings)이 그러하다. 역량위원회의 결정도 마찬가지이다. 더욱이 여러 평가가 하나의 역량에 관한 정보를 제공할 수 있고, 각 평가는 둘 이상의 역량을 측정할 수 있다 [44, 45]. 이런 점에서 타당도는 여러 근거가 해당 역량 하나의 달성에 관해 어느 정도로 정보를 제공하는지로 이해하는 편이 더 적절할 수 있다.
이 긴장을 다룰 수 있는 한 가지 잠재적 전략은, 더 큰 평가체계를 고려하는 이점과 개별 평가에 관한 타당도 근거를 수집하는 이점을 인정함으로써, 양자택일(either/or)이 아닌 양쪽을 모두 취하는 접근(both/and)을 사용하는 것이다. 건물의 건축이 유용한 비유가 될 수 있다. 부품과 재료, 즉 강철(steel), 리벳(rivets), 콘크리트(concrete)가 고품질이고 신뢰할 만하다는 근거는 건물이 견고한 재료로 지어졌음을 보장한다. 그러나 공학적 결정(engineering decisions)이 적절했는지, 각 부분이 제대로 맞물리는지, 완성된 건물이 구조적으로 안전한지에 관한 근거도 필요하다.
마찬가지로 각 평가에 대해서는 그로부터 생성된 자료를 뒷받침할 타당도 근거를 수집할 수 있다.
- WBA를 예로 들면,
- 평가자들이 자신이 평정하는 것을 실제로 관찰하고 평가 과제(assessment task)를 이해하는지를 확인하기 위한 근거, 즉 반응과정 근거(response process evidence)를 수집할 수 있다.
- 다른 근거에는 관찰 과정에서 중요한 기술(skills)이 평가되는지에 관한 내용 근거(content evidence)나,
- 수집된 자료가 학습자의 성장에 정보를 제공하는 유용한 피드백(feedback)을 제공하는지에 관한 결과 근거(consequences evidence)가 포함될 수 있다 [8].
- 그러나 이후 이루어지는 역량위원회 결정(downstream competency committee decisions)의 타당도 근거 역시 찾아야 할 수 있다 [20].
- 더 고부담인 결정에 정보를 제공하기에 충분한 수의 관찰이 이루어졌다는 근거, 즉 내적 구조(internal structure)에 관한 근거나,
- CC 위원들이 의사결정 과정과 자신들이 해석하는 평가자료를 이해한다는 근거, 즉 반응과정(response process)에 관한 근거는 전체 평가체계를 뒷받침하는 타당도 논증에 의미가 있을 것이다.
이 과정 전반에서 평가를 정의 지향적 관점(justice-oriented lens)으로 바라보는 것이 매우 중요하다 [46, 47]. 지배적인 의사 전형(dominant physician archetype)을 위해, 그리고 그러한 전형에 해당하는 사람들이 만든 평가 프로그램으로 인해 모든 학습자, 특히 소수자화된 배경(minoritized backgrounds)의 학습자들이 불이익을 받지 않도록 극도로 주의를 기울여야 한다.
평가체계 내부의 모든 수준과 체계 자체를 뒷받침하는 타당도 근거를 수집하는 일에는 많은 자원이 필요하다(resource-intensive endeavor). 따라서 이 긴장은 이론적이라기보다 실무적(pragmatic)일 수 있다. 교육자와 프로그램은 모든 수준에서 타당도 근거를 수집하고, 그 근거들을 궁극적 결정을 위한 일관된 논증(coherent argument)으로 연결할 역량(capacity)이 있는가? 일부 환경에서는 필요한 자원이 비용과 인력 측면에서 모두 감당하기 어려울 수 있다. 또한 프로그램적 평가 접근을 채택한다면, 평가가 수행하는 이중 목적(dual purpose), 즉 학습을 위한 형성평가(formative assessment for learning)와 의사결정을 위한 총괄평가(summative assessment for decision-making)를 어떻게 다룰 것인가 [48]?
이러한 우려 때문에 타당도 근거를 수집할 기회는 그 자체로 하나의 학술활동 프로그램(program of scholarship)이 될 수 있는 종단적(longitudinal), 반복적(iterative), 협력적(collaborative) 과정으로 보아야 한다. 교육자들은 초기 노력에서 가장 중요하거나 가장 면밀한 검토를 받는 영역에 우선순위를 둘 수 있다. 예를 들어 WBA가 평가체계의 가장 큰 부분을 차지한다면 타당화 노력(validation efforts)은 거기서 시작할 수 있다. 마찬가지로 역량위원회가 평가자료를 총괄적 결정으로 종합하는 과정에 우려가 있다면, 그 부분이 초기 노력을 집중하기에 가장 좋은 지점일 수 있다. 마지막으로 평가 전문가들은 자신의 맥락에서 어떤 평가가 실제로 타당화를 필요로 하는지, 어떤 도구가 유사한 맥락에서 이미 충분한 타당도 근거를 갖추고 있는지에 따라 우선순위를 정할 수 있다.
그러면 전체 타당도 논증(overall validity argument)은 건축 비유에서의 건물처럼 서로 맞물릴 수 있다. 체계의 구성 부분들이 타당도 근거로 뒷받침되면 체계의 전체 구조도 강화된다. 건물이 형태를 갖추어 가면서 최종 형태에 관한 타당도 논증을 만들 수 있다.
- 평가체계의 구성 부분들을 뒷받침하는 타당도 근거가 없다면, 프로그램 수준의 결정(program-level decisions)에 정보를 제공하는 자료에 의문이 제기될 수 있다.
- 반대로 타당화가 개별 도구에만 집중된다면, 특히 평가와 프로그램 수준의 결정 사이의 정렬에 주의를 기울이지 않을 경우, 프로그램 전체는 응집성(cohesion)과 정당화 가능성(defensibility)에 관한 근거가 부족할 수 있다.
교육자들은 타당도 논증을 구축할 때 구성 부분들을 ‘확대해서 보기(zooming in)’, 즉 분해(decomposition)하는 것과, 전체 평가 프로그램을 ‘축소해서 보기(zooming out)’, 즉 총체적 판정(holistic determination)을 하는 것 사이의 긴장에 직면한다 [43]. 또한 교육자들이 CBHPE 패러다임 안에서 평가의 이중 목적을 관리할 전략을 고려할 것을 제안한다. 이 특별호에 함께 실린 Ryan과 동료들의 논문에는 도움이 되는 여러 제안이 제시되어 있다 [48].
긴장 #3: 역량의 참조 기준 (TENSION #3: REFERENCE FOR COMPETENCE)
마지막으로 살펴볼 긴장은 역량을 판정할 때 사용하는 기준(standard)에 관한 것이다. 수련 단계의 진급이나 수련 완료, 자격인증(certification), 면허 취득(licensure)과 같은 자격 부여(credentialing)에 대한 준비도를 판단하려면, 역량 달성의 수준(level of competency attainment)이 정의되어 있어야 한다. 명확한 성과 기준(outcomes standards)은 사회적 책무성(social accountability)에 뿌리를 두며 [49], 모든 수련생이 특정 기준에 도달했음을 보장하는 데 필요하다. 고려할 수 있는 일반적인 접근은 세 가지, 즉 규준참조(norm-reference), 준거참조(criterion-reference), 종단적 성장(longitudinal growth)이다. 이 절에서는 각각의 접근을 탐색한다.
규준참조 기준 (A NORM-REFERENCE STANDARD)
타당도에 대한 전통적 접근에서는 개인 간 성취의 차이, 즉 개체 간 분산(between-subject variance)을 흔히 역량의 문턱값(thresholds for competence)을 설정하는 데 사용한다 [50]. 개체 간 분산이라는 개념은 전통적 타당도 논증의 토대이다. 신뢰도 측정(measurement of reliability), 예를 들어 크론바흐 알파(Cronbach’s alpha)와 일반화가능도이론(generalizability theory)은 개인별 분산(individual variance)에 의존하며, 개인의 성취가 사람마다 달라야 한다는 요건을 전제로 한다 [17, 50]. 이러한 접근은 본질적으로 규준참조적(norm-referenced)이며, 모집단(population) 내부의 비교 측정(comparative measures)을 사용하여 달성 수준을 평가한다.
준거참조 기준 (A CRITERION-REFERENCE STANDARD)
개체 간 분산이 필요하다는 요건은 CBHPE의 근본 전제와 상충한다. 정의상 CBHPE는 교육과 수련에 대한 성과기반 접근(outcomes-based approach)이다 [51]. 따라서 이 패러다임의 관심은 대중에 대한 책무성을 입증하기 위해 학습자가 역량의 문턱값에 도달하는지 여부(if)가 아니라 언제(when) 도달하는가에 있다. 더욱이 특히 임상환경(clinical environment)에서는 분산이 작을 수 있다. 고원효과(plateau effect)는 모든 학습자가 정의된 성과(defined outcome)에 도달하여 학습자 간 차이가 미미해지는 이러한 현상을 설명한다 [52]. 이러한 상황에서 개체 간 분산만으로 역량의 문턱값을 결정하면 규준참조와 편향으로 되돌아갈 위험이 있다. 즉 확립된 준거(established criteria)가 아니라 동료들과 수련생을 비교하여 역량에 관한 결정을 내리게 된다 [53]. 따라서 CBHPE 지지자들은 준거기반 접근(criterion-based approaches)을 주장하며 [53], 그중 많은 접근은 이제 여러 고부담 시험에서 흔히 사용되고 있다. 예를 들어 기준설정 절차(standard-setting procedures)는 전문가 합의(expert consensus)와 평가자료를 결합하여 수용 가능한 성취 문턱값(acceptable achievement threshold)을 설정한다 [54].
종단적 성장 기준 (A LONGITUDINAL GROWTH STANDARD)
매력적인 세 번째 선택지는 개체 내 분산(within-subject variance), 다시 말해 보건의료전문직 종사자가 수련 전 과정과 경력 전반에 걸쳐 보이는 성장이다. 보건의료전문직 종사자들은 서로 다른 속도로 기술(skills)을 습득하므로, 성장을 모니터링하는 것은 형평성 관점과 역량기반 관점(equity- and competency-based lens) 모두에서 실행 가능하고 이론적으로 타당해 보인다 [52, 55, 56]. 정의된 성과를 향한 개인의 성장이나 학습을 측정하고, 그 과정에서 표적화된 개입(targeted interventions)을 제공할 수 있다. 예를 들어 Park과 동료들은 최근 가정의학과 전공의(family medicine residents)의 성장곡선(growth curves)을 기술하여, 역량의 문턱값에 도달할 것을 예측하는 양상과 보완교육(remediation)이 필요한 양상을 확인했다 [57]. 중요한 점은 성장이 정규 수련(formal training)에 국한되지 않는다는 것이다. 보건의료전문직의 특징 중 하나는 역량의 유지(maintenance of competence)와, 적절한 경우 새로운 역량의 습득(acquisition of new competencies)을 보장하기 위한 평생학습(lifelong learning)에 대한 헌신이다 [58].
이 긴장을 어떻게 다룰 수 있는가? (HOW CAN WE NAVIGATE THE TENSION?)
역량 달성에 대한 규준참조 접근에 반대하는 중요한 개념적 논거(conceptual arguments)가 있다 [51, 53]. 그러나 많은 준거기반 접근, 예를 들어 Hofstee 방법과 Angoff 방법(Hofstee and Angoff methods) [59]은 준거를 생성하기 위해 여전히 어느 정도 학습자 수준의 자료(learner-level data)를 포함하므로 규준참조로 기울기 쉽다 [60]. 달성(attainment)에만 집중하기보다 성장에 노력을 집중하는 것은 매력적이고 비교적 단순하게 들린다.
- 그러나 기대되는 성장궤적(expected growth trajectory)이 존재하는가?
- 존재한다면 그 궤적에서 벗어나는 정도 중 어디까지가 전형적인 발달(typical development)의 범위에 속하고, 어디부터가 기대 범위를 벗어나는가?
- 개인의 성장이 구인무관 분산(construct-irrelevant variance)이 아니라 실제 향상(true improvement)을 반영한다는 것을 어떻게 알 수 있는가?
- 사전에 정해진 역량 수준(predetermined level of competency)에 도달했지만 성장곡선이 평평한 학습자는 어떻게 해석해야 하는가?
- 시간이 흐르면서 역량이 상실되는 것은 어떻게 설명할 것인가?
Bok 등 [61]은 역량기반 접근을 적용한 수의학 학생(veterinary students) 대상 프로그램적 평가 전략에서 세 가지 서로 다른 평가도구와 무선계수 모형화(random coefficient modeling)을 사용하여, 시간에 따른 개인의 성장을 측정할 수 있음을 보여 주었다. 다른 연구들에서는 잠재계층 성장곡선모형(latent class growth curve models)을 사용하여 종단적 학습궤적(longitudinal learning trajectories)을 모형화했으며, 상승하는 성장 양상을 확인했다 [57, 62]. 이러한 연구들은 성장의 측정이 더 복잡하다는 점은 인정하면서도, 그것이 가능함을 보여 준다.
그러나 성장의 측정은 대중에 대한 책무성과 균형을 이루어야 한다. 성장은 중요하지만, 학습자가 궁극적으로 역량 있는 실무 수행(competent practice)에 필요한 문턱값에 도달하는 범위에서만 중요하다. 이러한 이유로 최소 역량 기준(minimum competency standards)을 정의하는 것과 그 기준을 향한 진전(progress)을 측정하는 것 모두가 필요할 가능성이 높다. 종단적 성장 추적(longitudinal growth tracking)과 더불어 규준참조 기준과 준거참조 기준 사이에서 이러한 균형을 이루면, 어려움을 겪는 학습자들에게 피드백과 보완교육을 제공하여 모든 학습자가 진급(promotion), 졸업(graduation) 또는 자격 부여(credentialing)에 필요한 최소 기준(minimum standards)에 도달하도록 보장할 수 있다.
결론 (CONCLUSIONS)
보건의료전문직의 평가는 근본적인 변화를 겪고 있다. CBHPE 운동은 보건의료 교육 프로그램 전반에 걸친 교육철학(educational philosophy)의 근본적 전환을 나타낸다. 이러한 변화는 프로그램 목표(program objectives)와 교육과정 내용(curricular content)의 개혁뿐 아니라, 평가자료에 근거한 타당도 논증을 어떻게 구성하는지에 대한 재고를 의미한다. CBHPE 시대의 타당도를 다시 생각할 때 적어도 세 가지 주요 긴장 지점이 존재한다. 이러한 긴장 지점들은 철학의 충돌(clash of philosophies)을 나타내지만, 동시에 기존 접근과 새로운 접근 사이에서 균형을 이루어 CBHPE를 더욱 깊이 구현할 기회도 제공한다. 앞으로 21세기 보건의료전문직 평가는 프로그램적(programmatic)이어야 하고, 타당도 논증을 구축하도록 설계되어야 하며, 실제성을 갖춘 일터기반 평가(authentic WBA), 여러 유형의 평가에서 얻는 정보(input), 역량에 대한 발달적 관점(developmental view of competence)과 관련된 긴장을 고려해야 한다.

















































