The Problematic Persistence of Tiered Grading in Medical School

🏷️ 의대 성적 "우수·양호·통과", 왜 아직도 계속될까? 등급제 성적(Tiered Grading)의 문제적 지속성
📄 Smith JF Jr, Piemonte NM. The Problematic Persistence of Tiered Grading in Medical School. Teaching and Learning in Medicine. 2023;35(4):467–476. doi:10.1080/10401334.2022.2074423
안녕하세요! 지난번에 임상추론의 프로그램식 평가와 타당도를 다뤘는데요. 그 논문의 결과 추론(consequences) 이야기를 기억하시나요? 평가 결과를 어떻게 쓰느냐가 낳는 의도하지 않은 결과까지 타당도의 문제라는 거였죠. 오늘 소개할 논문은 바로 그 질문을 의대 성적 체계에 던져요.
미국 크레이턴대학교(Creighton University)의 의학교육학자 James F. Smith Jr. 와 의료인문학자 Nicole M. Piemonte가 쓴 관찰(Observation) 논문이에요. 새로운 데이터를 제시하는 연구가 아니라, 역사, 심리측정, 심리사회, 도덕의 네 측면에서 문헌을 검토하고 주장을 펴는 글이에요. 2023년에 나온 논문이라 앞에서 다룬 글들보다 조금 이르지만, 주제가 잘 이어져서 함께 읽어 볼게요.
한 줄로 줄이면 이래요. "의대의 등급제 성적은 교육적 근거가 빈약한 대학의 관행에서 왔고, 학생의 정신건강, 협력, 다양성을 해친다는 증거가 쌓이고 있다. 등급제를 유지하려는 학교는 그 이유를 스스로 입증해야 한다."
📌 1. 등급제 성적이란?
저자들은 의대 평가를 크게 두 가지로 나눠요.
- ✅ 비등급제(non-tiered): 정해진 기준을 충족했는지만 보는 합격/불합격(pass/fail)
- 🏷️ 등급제(tiered): 수행 수준을 여러 범주로 나누는 방식. 석차, 학점(A, B, C), 점수, 그리고 "우수(honors)", "준우수(high pass)", "통과(pass)", "낙제(fail)" 같은 서술어
등급은 다시 두 가지 기준으로 나눌 수 있어요.
- 규준참조(norm-based): 학생들을 서로 비교해서 등급을 매김
- 준거참조(standards-based): 동료 집단의 수행과 상관없이 미리 정한 성취 수준을 기준으로 함
저자들이 주로 문제 삼는 건 학생을 서로 비교해서 줄 세우는 규준참조식 등급제예요.
🏛️ 2. 역사: 등급제는 어디서 왔나?
저자들은 먼저 등급제가 어떻게 의학교육에 들어왔는지 추적해요. 그 과정을 보면 교육적 근거가 생각보다 빈약하다는 거예요.
- ① 도제식 교육 시대 🧑⚕️
- 초기 미국 의사들은 한 명의 개업의 밑에서 몇 년 동안 도제식으로 배웠어요. 의술은 일종의 "기예(craft)" 였고, 역량의 증거는 이후 평판과 상류층 환자 명단이었어요.
- ② 강의실 교육과 사설 의학교의 난립 🏫
- 18세기 말에서 19세기로 오면서 강의 중심 교육이 늘었어요. 일부는 대학의 학과로 시작해서 대학 학부의 평가 방식, 곧 등급제를 그대로 따랐고요. 반면 우후죽순 생긴 사설 의학교(proprietary medical schools) 는 입학 기준도 느슨하고 평가도 엉성했어요. 학생을 낙제시키면 등록금 수입이 줄어드니 낙제는 거의 없었고요.
- ③ 플렉스너 보고서(1910)와 대학 모델의 정착 📜
- 1910년 플렉스너 보고서(Flexner Report) 가 미국 의학교육의 낮은 수준을 알리면서 사설 의학교가 몰락하고 대학 기반 의학교육이 자리 잡았어요. 그러면서 대학 학부의 행정, 재정, 교육 철학이 의학교육의 기본 틀이 됐죠.
암묵적으로, 등급제는 대학 환경에서 의대생 평가의 패러다임으로 받아들여졌다.
"Tacitly, tiered grading was accepted as the paradigm for medical student assessment in the university environment."
- ④ 비판도 오래됐다 🗣️
- 20세기 초부터 대학의 학문 환경을 의학교육에 그대로 들이는 것에 대한 비판이 있었고, 50여 년 전에도 이미 등급, 평점(GPA), 석차가 졸업 후 의사로서의 수행과 별 관계가 없다는 지적이 나왔어요.
저자들은 역사 검토를 이렇게 정리해요.
현재 의대생들은 미국 대학의 18~19세기 지배적인 학문 철학 안에서, 그리고 그 철학을 위해 개발된 구성물로 평가받고 있으며, 그것은 의대생들이 결국 몸담게 될 임상 실무를 위해 만들어진 것이 아니다.
"currently, medical students are assessed by a construct that was developed in and intended for the prevailing academic philosophies of the American universities of the 18th and 19th centuries, not the clinical practices in which medical students will eventually find themselves."
📊 3. 현황: 임상실습에서는 오히려 등급제가 늘고 있다
미국에는 의대생 평가에 대한 국가 표준이 없어서 학교마다 다른 체계를 써요. 그런데 흥미로운 흐름이 있어요. 최근 5년 동안 임상실습 전(pre-clerkship) 에는 합격/불합격이 늘고, 임상실습(clerkship) 에서는 등급제가 늘었다는 거예요.
2020년 AAMC 자료를 보면 차이가 뚜렷해요.
| 단계 | 합격/불합격 | 등급제 |
| 임상실습 전 | 125개교 | 42개교 |
| 필수 임상실습 | 11개교 | 141개교 |
임상실습에서 가장 흔한 방식은 "우수, 준우수, 통과, 낙제" 의 4단계예요.
🎈 등급 인플레이션 문제
등급제가 제 역할을 못 하는 이유 중 하나는 등급 인플레이션(grade inflation) 이에요.
- 같은 학교 안에서도 과마다, 학교마다 기준이 달라요.
- 임상실습 책임자의 40% 이상이 등급 인플레이션이 학생들이 더 좋은 수련병원에 가는 데 도움이 된다고 생각하고, 60% 는 합격/불합격 방식에 반대해요.
- 20% 넘는 학교가 등급 분포를 정해 두지 않아요. 아이러니하게도 등급 분포를 정하지 않은 것이 최고 등급 비율을 높이는 유일한 유의미한 요인이었어요.
- 등급을 더 세분화해도 인플레이션은 줄지 않고 오히려 늘 수 있어요.
또 하나의 문제는 타이밍이에요. 임상실습 등급은 대개 실습이 끝난 뒤 총괄평가로 나와요. 그러니 학생이 실습 중에 등급을 보고 기술을 보완하는 건 사실상 불가능하죠. 등급이 피드백으로 기능하지 못한다는 거예요.
⚖️ 4. 등급제를 유지하는 논리, 하나씩 따져 보기
등급제를 지지하는 전통적인 논리는 크게 두 가지예요. 학생의 노력을 자극한다는 것, 그리고 수련 프로그램이 전공의를 선발하는 데 도움이 된다는 것. 저자들은 둘 다 근거가 약하다고 봐요.
① "등급이 있어야 공부한다"?
실제로, 의대생이 등급제 같은 외적 요인으로 동기부여되어야 한다는 전제 자체가, 평생에 걸친 내재적 동기의 학습이라는 전문직의 근본적 요청을 위협한다.
"Indeed, even the premise that medical students must be motivated by extrinsic factors, such as tiered grading, threatens the underlying professional imperative of life-long, and intrinsically motivated, learning."
근거를 보면 이래요.
- 등급제는 단기적으로 외적 동기를 높일 수 있지만, 외적 동기 요인(등급)을 없애면 전체 동기가 원래보다 낮아질 수 있어요.
- 학생들의 공부 습관이나 독서량은 등급제의 영향을 받지 않았고, 국가 표준화 시험 성적도 마찬가지였어요.
- 등급 대신 서술형 피드백을 주면 스트레스와 불안을 줄이면서 학업 동기를 높일 수 있다는 연구도 있어요.
그리고 저자들은 의학교육 개혁에서 동기 이론이 제대로 반영되지 않았다고 지적해요.
② "전공의 선발에 필요하다"?
- 수련 프로그램 책임자 상당수는 성적을 "지금 그대로" 유지하길 원해요. 그런데 임상실습 등급으로 전공의 수행을 예측하는 연구 결과는 거의 50년 동안 일관되지 않았어요. 양의 상관을 보인 연구도 있고, 그렇지 않은 연구도 있죠.
- 저자들은 여기서 날카로운 지적을 해요. "합격/불합격은 비판적으로 검증되지 않았으니 등급제를 유지해야 한다"는 주장이 있는데, 정작 등급제 자체도 비판적 검증 없이 역사적으로 들어왔다는 점은 무시한다는 거예요. 🤔
③ "스트레스도 수련의 일부"?
평가로 인한 스트레스를 실제 진료의 스트레스에 대비해 학생을 단련하는 과정으로 보는 시각도 있어요. 저자들은 이걸 강하게 비판해요.
등급제를 의례적이고, 불안을 유발하며, 의대생 형성에 필요한 것으로 규정하는 것은 신고식(hazing)의 여러 요소를 불러낸다.
"Framing tiered grading as ritualistic, angst-provoking, and necessary in the formation of medical students invokes many of the elements of hazing."
그리고 이렇게 이어가요.
숙달이 회상을 평가하는 표준화 시험으로 측정될 때, 공감, 연민, 참여, 결속, 판단처럼 의료 실무의 숙달에 필요하고 현대 의학에서 성공하는 데 더 중요하다고 할 수 있는 속성들은 덜 평가되고, 따라서 덜 가치 있게 여겨질 것이다.
"When 'mastery' is measured by standardized tests assessing recall, then those attributes of mastery in the practice of medicine that require compassion, empathy, engagement, cohesiveness, and judgment—arguably more important for success in modern medicine—will be under-evaluated, and thus undervalued."
"측정되는 것이 가치 있게 여겨진다" 는 오래된 격언이 떠오르는 대목이에요.
😰 5. 심리사회적 맥락: 스트레스, 숨은 교육과정, 불평등
💔 가장 강력한 교육과정 스트레스 요인
실제로, 등급제는 현대 의학교육 환경에서 스트레스, 번아웃, 정서적 소진의 가장 강력한 교육과정 요인 중 하나이거나, 어쩌면 가장 강력한 요인으로 보인다.
"Indeed, tiered grading appears to be one of the strongest, if not the strongest, curricular source of stress, burnout, and emotional exhaustion in the contemporary medical educational environment."
등급제는 경쟁을 높이고 집단 결속을 낮춰요. 반대로 등급제를 없앤 곳에서는 이런 변화가 보고됐어요.
- 😌 우울, 불안, 격차 감소
- 🤝 협력, 집단 결속, 전문직 정체성 증가
- 🏥 임상실습에서 필기시험 공부하느라 병동을 비우는 대신 임상 몰입, 환자·교수와의 접촉, 임상추론 능력 향상 가능성
- ⚖️ 학생들의 공정성 인식 향상
🎭 숨은 교육과정과 등급제
저자들은 등급제가 숨은 교육과정(hidden curriculum) 을 강화한다고 봐요. 교수들은 "좋은 의사가 되는 데는 성적보다 훨씬 많은 것이 필요하다"고 말하지만, 학생들이 보기엔 현실이 다르다는 거예요.
"의사가 되는 데는 좋은 성적을 받는 것보다 훨씬 더 많은 것이 있다"는 격언은, 자신의 가까운 미래와 진로가 주로 성적, 국가면허시험 점수, 임상실습 전후의 평가로 결정된다는 것이 의대생들에게 분명해지는 순간 회의, 불신, 무시에 부딪힌다.
"The adage, 'There is much more to becoming a doctor than getting good grades' is met with skepticism, distrust, and dismissiveness when it becomes apparent to medical students that their immediate future and career path will be determined primarily by their grades, national licensure exam scores, and evaluations in the pre-clerkship and clerkship years of medical education."
결국 등급제는 의도했든 아니든 학생들의 진로 선택 자격을 자의적으로 층화하면서, 무엇이 정말 중요한지에 대한 암묵적 메시지를 전한다는 거예요.
⚖️ 인종적 불평등
저자들이 "가장 중요하다" 고 강조한 부분이에요.
아마 가장 중요한 것은, 등급제가 인종적 불평등과 관련된 것으로 보인다는 점이다. 인지적 수행 같은 변수를 통제해도 과소대표 소수자(URM)가 더 낮은 평가를 받는다.
"Perhaps most importantly, tiered grading appears to be associated with racial inequalities, in which URM receive lower evaluations even when variables such as cognitive performance are controlled."
이런 차이는 명예학회 가입, 수련 기회, 전공 선택으로 이어져서 다양한 의사 인력을 만드는 데 걸림돌이 돼요.
🧭 6. 도덕적 맥락: 교육자의 딜레마와 도덕 발달
⚖️ 판단하지 않으면서 판단해야 하는 교육자
교육자와 학생 사이에는 권력 불균형이 있고, 등급을 매기는 건 결국 교수의 몫이에요. 게다가 교육자는 분명한 이해상충에 놓여 있어요.
의학교육자이자 멘토는 학생과 안전하고 지지적이며 형성적인 관계를 맺기 위해 비판단적이어야 한다. 하지만 의학교육자는 학생의 역량을 비판적이고 정직하게 평가하는 데 있어서는 판단적이어야 하기도 하다.
"The medical educator/mentor must remain non-judgmental to form a safe, supportive, and formative relationship with the student/protégé. However, the medical educator must also be judgmental in critical and honest assessment of the competencies of students."
지난번 교육 동맹 논문에서 본 "코치이자 심판" 문제와 똑같은 이야기죠. 여기에 교수들도 학생에게 강의평가를 받으니, 박한 평가를 주면 자기 평가가 나빠질 수 있다는 부담까지 있어요. 이게 임상실습에서 교수들이 낮은 평가를 주길 꺼리는 이유 중 하나일 수 있다고 해요.
🧒 도덕 발달의 정체
저자들은 콜버그(Kohlberg)의 도덕 발달 이론을 끌어와서 꽤 과감한 주장을 해요.
낮은 석차의 수치심을 피하고, 인정을 얻고, 임상실습 전후 교수들에게 충성을 보이려는, 등급제가 만든 학업적 유인은 전인습적 및 인습적 도덕 단계의 특징이다. 이러한 도덕 단계는 대개 아동기와 청소년기와 연관된다.
"Academic incentives established by tiered grading to avoid the shame of low ranking, gain approval, and demonstrate loyalty to pre-clerkship and clerkship faculty characterize the preconventional and conventional moral stages. These moral stages are typically associated with childhood and adolescence."
부적절한 학업 유인이 인간의 존엄과 권리를 원칙으로 삼는 후인습적(post-conventional) 단계로 나아가는 걸 막을 수 있다는 거예요. 그래서 교수와 기관은 학생의 도덕 발달을 위협하는 요소를 적극적으로 없애야 한다고 말해요.
🌱 7. 등급제를 넘어서: 대안은?
🎯 기준을 낮추자는 게 아니다
저자들은 오해를 막으려고 분명히 해요.
분명히 하자면, 우리는 학생들이 높은 기준을 적용받지 않아야 한다고 제안하는 것도, 높은 기준이 충족되는지 확인하기 위해 학생들을 더 이상 시험 보지 않아야 한다고 주장하는 것도 아니다.
"To be clear, we are not suggesting that students ought not be held to high standards, nor are we arguing that students should no longer be tested in order to assure high standards are being met."
오히려 시험 강화 학습(test-enhanced learning) 은 엄격한 시험을 학습 도구로 계속 써야 하는 강력한 근거라고 봐요. 다만 평가는 학생을 줄 세우고, 등급 매기고, 분류하는 데 쓰일 게 아니라, 다양하고 전인적으로 훈련된 의사 인력을 만든다는 기관의 헌신 속에서 쓰여야 한다는 거예요.
📐 타당도는 "결과"까지 포함한다
지난번 Runyon 논문과 직접 이어지는 부분이에요. 저자들은 타당도는 도구의 속성이 아니라 결과의 해석과 추론의 속성이라는 점을 상기시키면서, Cook 등의 말을 인용해요.
"평가의 의도한 결과나 의도하지 않은 결과를 평가하면 이전에 알아차리지 못한 비타당성의 원천이 드러날 수 있다."
"evaluating intended or unintended consequences of an assessment can reveal previously unnoticed sources of invalidity."
예를 들어 번아웃 감소, 경쟁 완화, 집단 결속이 의학교육의 중요한 성과라면, 이 영역에서 등급제가 낳는 부정적 결과는 등급제의 타당도 자체를 위협한다는 거예요. 특정 소수자 집단이 일관되게 낮은 점수를 받는다면 그것도 마찬가지고요.
🏥 작업장 기반 평가와 서술형 평가
- 작업장 기반 평가(WBA) 가 복잡하고 변화하는 실제 진료 환경의 평가와 더 잘 맞는다고 봐요.
- 서술형 평가는 객관성 중심 평가보다 실행 가능한 피드백을 주고, 임상 진료를 위임하는 결정에도 도움이 될 수 있어요.
그런데 저자들은 대안에도 한계가 있다는 걸 솔직히 인정해요.
하지만 합격/불합격과 서술 중심의 평가 과정도 완벽하지 않으며, 편향이나 과소대표 소수자 학생에게 불리한 평가에서 자유롭지 않다는 점을 말해 두어야 한다.
"It should be said, however, that a pass/fail, narrative-driven assessment process is not infallible and is not immune to bias or disfavoring URM students."
그래서 어떤 평가든 의도하지 않은 결과를 계속 검토해야 하고, 타당도 평가는 지속적인 과정이어야 한다고 해요.
🎓 학점(credit) 기반 체계와 낙제시킬 용기
저자들은 필수 경로와 개별화된 경로에서 역량을 입증하면 "학점(credits)" 을 주는 체계도 제안해요. 합격/불합격과 결합하면 스트레스를 줄이고, 웰빙을 높이고, 평생학습에 맞는 숙달 지향 학습을 도울 수 있다는 거예요.
그리고 합격/불합격 체계에서는 교수에게 용기가 필요하다고 강조해요.
의학교육자는 학생들을 최선을 다해 의료 실무에 준비시켜야 하며, 동시에 역량 기준을 충족할 수 없는 학생들을 낙제시킬 준비가 되어 있어야 한다.
"Medical educators must prepare students as best they can for the practice of medicine, and at the same time be prepared to fail those students incapable of meeting competency standards."
임상실습에서 낙제는 역사적으로 아주 드문 일이었기 때문에, 이건 의도적인 노력이 필요하다고 해요.
✅ 8. 결론: 입증 책임을 뒤집자
저자들은 이상적인 평가를 이렇게 정의해요. 안전하고 효과적인 진료에 필요한 모든 기술의 진척을 비판적으로 평가하면서, 동시에 미래 의사 인력의 개인적 관심, 기여, 다양성을 증진하는 평가. 그리고 짧지만 분명한 한 문장을 덧붙여요.
그것은 의대생을 개인적으로도 집단적으로도 해쳐서는 안 된다.
"It must not harm medical students personally or collectively."
마지막 문단은 입증 책임을 뒤집자는 제안이에요.
적어도, 등급제를 유지하는 학교는 등급제와 연관된 해로운 효과를 고려할 때 그러한 모델의 사용을 옹호하도록 요구받아야 한다. 이러한 부정적 효과를 해결하지 않고 두는 것은 그것이 용인될 수 있다는 인식을 주며, 의학교육에서 등급제의 문제적 지속을 암묵적으로 지지하는 것이다.
"At the very least, those schools that retain tiered grading systems must be called to defend their use of such models, given the deleterious effects with which tiered grading has been associated. Leaving these negative effects unaddressed gives the perception that they are acceptable and tacitly supports the problematic persistence of tiered grading in medical education."
💡 9. 읽으며 든 생각과 한국 의학교육에 주는 시사점
마지막으로 제 생각을 덧붙일게요. 어디까지나 제 해석이에요.
- ① 우리 의대의 성적 체계를 다시 보기 🔍
- 우리 의과대학도 대부분 학점제와 석차를 쓰고, 이 성적이 인턴이나 전공의 선발에 반영되는 경우가 많은 것으로 알고 있어요. 이 논문의 질문을 우리에게 적용해 보면 이래요. 우리 성적 체계는 무엇을 위해 존재하나? 학습을 돕기 위해서인가, 선발을 위한 분류 도구인가? 만약 후자라면, 그 분류가 실제로 이후 수행을 예측하는지, 그리고 그 과정에서 어떤 대가를 치르고 있는지 따져 볼 필요가 있을 것 같아요.
- ② 임상실습 평가의 "타이밍" 문제 ⏰
- 실습이 끝난 뒤에 등급만 통보되면 피드백으로서의 가치가 거의 없다는 지적은 바로 적용할 만해요. 등급제를 유지하든 아니든, 실습 도중에 형성 피드백이 이뤄지는 구조가 먼저 필요하다는 이야기죠.
- ③ 앞의 글들과 이어서 보기 🔗
- Runyon 등의 타당도 논문: 등급제의 해로운 결과는 결과 추론의 문제이고, 여러 점수를 합산해 등급을 매기는 방식은 합산의 함정과도 연결돼요.
- 교육 동맹 논문: 교육자가 코치이면서 심판이어야 하는 긴장이 두 논문에서 똑같이 등장해요.
- AAMC 기초역량과 CBHPE: 역량바탕교육은 학생들을 서로 비교하기보다 기준 대비 성취를 보는 방향이라, 규준참조식 등급제와는 기본 철학이 잘 맞지 않아요.
- ④ 비판적으로 읽을 지점 🤔
- 이 글은 관찰(Observation) 논문이라 체계적 문헌고찰이 아니에요. 등급제에 불리한 근거를 중심으로 논지를 펴는 주장 글이라는 점을 감안해서 읽어야 해요.
- 인용된 근거 중에는 오래된 연구나 관찰 연구가 적지 않아요. 등급제가 정신건강 문제나 인종적 격차의 원인이라는 인과적 결론을 내리기에는 조심스러운 부분이 있어요.
- 콜버그 이론을 들어 등급제가 도덕 발달을 정체시킨다는 주장은 흥미롭지만, 경험적 근거보다는 이론적 추론에 가까워요.
- 선발의 문제는 여전히 남아요. 등급을 없애면 수련 프로그램은 무엇으로 지원자를 구별할까요? 미국에서 USMLE Step 1이 합격/불합격으로 바뀐 뒤 경쟁이 다른 지표로 옮겨 갔다는 지적도 있는데, 이 논문은 이 질문에 대한 답은 충분히 다루지 않았어요.
- 미국 맥락의 논의라서 URM의 범주나 수련 선발 구조가 우리와 다르다는 점도 염두에 둘 필요가 있어요.
📝 정리하며
- 의대의 등급제 성적은 교육적 근거보다는 18~19세기 대학 학부의 관행에서 왔어요.
- 미국에서는 임상실습 전에는 합격/불합격이 늘었지만, 임상실습에서는 오히려 등급제가 대세예요. 등급 인플레이션과 학교별 편차로 정확성도 떨어져요.
- "동기를 자극한다", "선발에 필요하다", "스트레스도 수련이다"라는 유지 논리는 근거가 약하거나 신고식의 논리와 닮았다고 비판해요.
- 등급제는 스트레스와 번아웃, 경쟁, 숨은 교육과정, 인종적 불평등과 관련이 있다는 증거가 쌓이고 있어요.
- 교육자는 판단하지 않으면서 판단해야 하는 딜레마에 놓이고, 등급제의 유인은 도덕 발달을 방해할 수 있어요.
- 대안은 기준을 낮추는 게 아니라 합격/불합격, WBA, 서술형 평가, 학점 기반 체계와 낙제시킬 용기예요. 다만 대안도 편향에서 자유롭지 않으니 결과를 계속 검토해야 해요.
- 결론은 입증 책임의 전환이에요. 등급제를 유지하려는 학교가 그 이유를 스스로 입증해야 한다는 거죠.
함께 읽으면 좋은 글로는 Hauer & Lucey(2019), "Core clerkship grading: the illusion of objectivity"(Acad Med 94:469–472), 그리고 Lucey 등(2020), "Medical Education's Wicked Problem: Achieving Equity in Assessment for Medical Learners"(Acad Med 95(12S):S98–S108) 를 추천해요. 📎
매년 미국의 의학박사 학위 수여 의과대학(allopathic medical schools)에서는 약 2만 명의 학생이 졸업한다.1 이들은 의과대학에 재학하는 동안 엄격한 교육과정과 중요하고 복잡하며 논쟁적인 평가 과정을 거친다. 최근 이 과정에 관심이 집중되었음에도 현재 인가를 받은 미국의 의학박사 학위 수여 의과대학 155곳에는 통일된 평가 체계가 없다.1 많은 학교가 역량(competencies)에 초점을 맞추지만, 역량을 성공적으로 습득하고 입증했는지를 분류하는 방식은 다양하다.
- 가장 기본적인 수준에서는 의과대학생이 진급에 필요한 인지적·기술적 능력을 습득하고 입증했는지에 따라 ‘합격(pass)’ 또는 ‘불합격(fail)’으로 판정하며, 성취도를 더 세분하지 않는다.
- 그러나 문자 성적(letter grades), 숫자 점수(numeric scores), 석차(class ranking), ‘최우수(honors)’, ‘우수(superior)’, ‘상위 합격(high-pass)’, ‘최우수 근접(near-honors)’, ‘만족(satisfactory)’, ‘하위 합격(low-pass)’ 같은 기술어(descriptors)를 사용하는 추가적인 등급 범주 체계도 존재하며, 각 학교는 자체 기준에 따라 이를 다양하게 적용한다.2–5
의학교육에서 등급별 성적평가 체계가 형성·발전한 역사적 토대를 살펴보면 그 발전의 바탕이 된 원칙이 명확해지고 오늘날의 적용 방식도 더 잘 이해할 수 있으리라 기대할 수 있다. 그러나 우리의 검토에 따르면, 의과대학 성적평가 체계는 인지적·심리사회적 기술의 습득, 전문직 정체성 형성(professional identity formation), 의료행위에 필요한 판단력을 돕는 원칙보다는 취약한 교육학적 전제와 학생의 등급별 성적이나 서열을 통한 경쟁적 평가를 강조하는 대학 환경의 학문적 통념에 기반해 왔다.6–9 또한 우리의 검토는 의학교육에서 등급별 성적평가의 사용과 효과가 적절한 평가 방식인지에 관해 한 세기 넘게 의문이 제기되어 왔음을 보여준다.6–10 이러한 성적평가 체계가 의학교육에서 계속 사용되는 상황에는 학생의 안녕(well-being)11,12과 다양성13–15에 미치는 해로운 영향, 표준화된 의사면허시험(standardized licensing examination)16,17 또는 역사적으로는 성공적인 의료행위9와 유의한 상관관계가 없다는 점을 보여주는 문헌의 축적이 맞물려 있다. 우리는 이 관찰 논문(Observations article)에서 이러한 문제를 다루고자 한다.
의학교육과 학생 평가의 역사적 관점 (Historic perspective of medical education and student assessment)
역사적으로 미국 초기 의사의 교육과 수련은 학생 한 명이 개업의 한 명의 지도를 받는 도제식 경험(apprenticeship-based experience)으로 이루어졌다.18,19 이러한 ‘교육’은 식민지 주민과 신생 미국 시민의 필요를 충족했지만, 실용성에 기반했고 의료행위를 하나의 ‘기술(craft)’로 규정했다.19,20 수련생은 개업의와 함께 여러 해를 일했고, 결국 독립적으로 진료하는 것이 성공적인 성장의 표지였다. 이후 의사가 얻은 평판은 역량의 증거였으며, 상류층 고객을 확보한 것은 전문직으로서 성취했다는 증거로 여겨졌다.18
18세기 말과 19세기에 미국 의학교육이 발전하면서 강의실 기반 의학교육(classroom-based medical education)의 효율성이 분명해졌다.19 학생들은 주로 현직 의사로 구성된 소수 교수진의 강의를 통해 집단으로 교육받았다.19 이 방식은 학생에게 더 짧은 교육기간을, 교수진에게 사회적 명성과 경제적 유인을 제공했다. 일부 의과대학은 대학 내 학과로 출발했지만,21 학문 지향적인 이들 학과의 발전 속도는 독립적인 영리 의과대학(proprietary medical schools)의 증가세를 따라가지 못했다.19
- 대학 소속 의학과의 학생 평가는 당시 대학 학부생에게 적용하던 평가 방식에 따랐으며,22 여기에는 등급별 성적평가도 포함되었다.8,23
- 반면 영리 의과대학은 느슨한 입학 기준, 체계 없는 교육과정, 의심스러운 학생 평가를 갖고 있었다.20 영리 의과대학에서 낙제하는 일은 드물었다. 낙제는 교수진의 등록금 수입 감소로 이어졌고, 가장 저렴하고 빠르게 의료행위에 진입할 길을 찾는 지원자들의 외면을 받을 위험도 있었기 때문이다.20
의학교육이 도제식에서 공식적인 대학 기반 교육으로 옮겨가기 시작한 기원은 1847년 미국의사협회(American Medical Association)의 설립으로 거슬러 올라간다.20 그러나 미국 의학교육의 열악한 수준을 일반 국민에게 알린 것은 1910년 에이브러햄 플렉스너(Abraham Flexner)가 카네기재단(Carnegie Foundation)에 제출한 보고서였다.20,24 이 보고서는 영리 의과대학의 쇠퇴를 가속하고 대학 기반 의학교육의 중심적 지위를 확고히 했다. 그 결과 대학 학부 교육과정의 지배적인 행정적·재정적 철학, 그리고 무엇보다 교육학적 철학이 의학교육의 기본 틀로 자리 잡았고 대학 총장들은 이를 강하게 옹호했다.25 대학 환경에서 등급별 성적평가는 묵시적으로 의과대학생 평가의 전형으로 받아들여졌다.
그러나 20세기 초에는 대학의 학문적 환경이 의학교육에 강요된다는 비판이 나타났고,26 대학 학부과정의 등급별 성적평가와 석차에 대한 일반적인 비판도 등장했다.27–30 의과대학에서 학생 평가의 적절한 형태와 역할을 둘러싼 최근 논쟁은 50년도 더 전에 이미 뚜렷한 뿌리를 두고 있었다. 당시에도 의과대학생의 등급별 성적, 평점 평균(grade-point averages), 석차는 졸업 후 의사로서의 궁극적인 수행과 거의 관련이 없다는 사실이 인식되었다.9,31
따라서 미국 의과대학생 평가의 역사에 대한 이 짧은 검토는, 현재의 의과대학생이 장차 일하게 될 임상현장이 아니라 18·19세기 미국 대학의 지배적인 학문적 철학 속에서 개발되고 그것을 위해 설계된 체계로 평가받고 있음을 시사한다.
현재의 평가 모형과 추세 (Current assessment models and trends)
오늘날 의과대학생 평가 모형은 성격, 규준(normative standards), 적용, 활용 면에서 다양하다.32–35 그러나 모든 의과대학 졸업생은 재학 기간 내내 어떤 형태로든 평가를 받았다. 크게 보면 이러한 평가 방식은 인지적 또는 기술적 역량을 입증하기 위한 정해진 기준을 포함하는 비등급별 방식(합격/불합격)과, 수행 수준의 범주를 구별하기 위해 층화(stratification)를 설정하는 등급별 방식으로 나뉜다. 후자에는 석차, 문자 성적, 숫자 점수, ‘최우수(honors)’, ‘상위 합격(high pass)’, ‘합격(pass)’, ‘불합격(fail)’ 등 등급을 구분하는 질적 기술어가 포함된다. 구분하는 등급 범주는 학생을 서로(또는 다른 코호트를 집합적으로) 비교하는 규준 기반 자료(normative data)에 근거할 수도 있고, 코호트의 수행과 독립적으로 사전에 성취 또는 역량 수준을 명시한 기준 기반(standards-based)일 수도 있다.
지난 5년 동안 임상실습 전 교육과정(pre-clerkship years)에서는 합격/불합격 성적평가의 사용이 해마다 늘었고, 임상실습 교육과정(clerkship years)에서는 등급별 성적평가의 사용이 해마다 늘었다.33,34 2020년에 끝난 학년도에는 의과대학 125곳이 임상실습 전 교육에서 합격/불합격 체계를 사용했고, 42곳은 어떤 형태로든 등급별 성적평가 체계를 사용했다.34 반면 필수 임상실습(required clerkships)에서 합격/불합격 평가 체계를 사용한 의과대학은 11곳뿐이었고, 141곳은 등급별 체계를 사용했다.34 가장 흔한 임상실습 평가는 ‘최우수(honors)’, ‘상위 합격(high pass)’, ‘합격(pass)’, ‘불합격(fail)’의 네 범주로 이루어졌다. 한 학교 안에서 서로 다른 평가 체계를 사용하는 경우, 필수·선택 여부와 관계없이 임상실습 전 과목과 임상실습 과목을 경계로 나뉘는 경우가 가장 흔해 보인다.
의과대학생 평가에 관한 국가적 표준은 없으며, 각 학교가 사용할 평가 체계를 결정한다.
- 의과대학은 흔히 임상실습 전 과목(예: 기초과학 또는 장기계통 과목)에 한 체계를 쓰고, 임상실습이나 임상 과목에는 다른 체계를 쓴다.34
- 의과대학 안팎의 성적평가 방식이 다양하므로 학생들이 이를 주관적이고, 많은 경우 불공정하다고 느끼는 것은 이해할 만하다.36–39
- 등급별 성적평가 체계의 효과성과 적절성에 관해 과거부터 현재까지 의견이 다양한 것도 놀랍지 않다.40–44
개별 의과대학이 임상실습 전 교육과 임상실습 교육 사이에서 평가 방식을 바꾸는 구체적인 이유는 여러 요인이 복합적으로 작용하기 때문일 것이다. 그럼에도 이러한 변화는 흔하다.34 등급별 성적평가는 졸업후의학교육(graduate medical education, GME) 프로그램 지원자의 임상 능력과 판단력(clinical ability and acumen)을 가려내려는 전공의 수련 프로그램에 도움이 될 수 있다.35,41,45,46 이는 역량을 평가할 뿐 아니라 수행 수준을 층화함으로써 이루어진다고 한다.42 임상 수행에 대한 등급별 성적평가는 학생이 졸업 후 전공의 수련을 준비하면서 임상 기술을 향상할 기회를 찾는 데 도움이 될 수 있다. 그러나 등급별 성적은 흔히 총괄평가(summative assessment) 결과이며, 학생이 임상실습을 마친 뒤에야 공개된다. 이 때문에 임상실습 중 등급별 성적을 바탕으로 특정 전문과목에 필요한 기술을 높이는 일은 어렵거나 불가능하다. 이러한 체계에서 학생들은 일반적으로 임상실습 중이 아니라 종료 후에 총괄평가로서 등급별 성적의 형태로 피드백을 받는다.
임상 판단력에 대한 평가로서 임상실습의 등급별 성적평가는 학생이 전공의 지원 과정을 거칠 때 유리한 모습으로 보이게 하는 경향이 있다.14 의과대학 임상실습 학년에서 부여되는 성적의 기준은 한 학교 안의 임상실습끼리도, 학교 사이에서도 다르다.2,5,12,32 또한 임상실습 성적은 현재에도, 역사적으로도 성적 인플레이션(grade inflation)이 특징이다.2,31,32,35,44 이는 등급별 성적평가의 전반적인 정확성과 활용 가능성을 떨어뜨린다. 그런데도 임상실습 책임자의 40% 이상은 성적 인플레이션이 학생이 더 선호하는 전공의 수련 자리를 얻는 데 도움이 된다고 생각하고, 60%는 ‘합격/불합격’ 체계의 사용에 반대한다.35 대부분의 의과대학이 임상 교육과정에서 등급별 성적의 전체 분포를 명시하지만, 20% 이상은 명시하지 않는다. 따라서 이들 학교 지원자의 ‘최상위 성적(top grade)’이 다른 지원자에 비해 얼마나 두드러진 성취인지 불분명하다. 역설적으로, 성적 분포를 명시하지 않는 것은 ‘최상위 성적’ 부여 비율이 더 높은 것과 유의하게 관련된 유일한 요인으로 확인되었다. 이는 성적 인플레이션을 부추기고 실제 성취도를 해석하기 어렵게 한다.35 성적평가 체계에 등급을 더 많이 추가해도 이에 수반되는 성적 인플레이션이 줄어들지 않으며, 오히려 증가할 수 있다.35
현상 유지로서의 등급별 성적평가 (Tiered grading as a status quo)
등급별 성적평가를 지지하는 전통적인 주장에는 이것이 학생의 노력을 촉진하고47,48 졸업후의학교육(GME)에서 프로그램 책임자가 전공의를 선발하는 데 도움이 된다는 점이 있다.16,40–42,45–47 이러한 장점으로 인식되는 속성들은 해로운 영향에도 불구하고 의학교육에서 등급별 성적평가가 지속되는 것을 충분히 정당화하는 근거로 제시되어 왔다. 이 주장들은 타당도(validity), 신뢰도(reliability), 효율성, 졸업후의학교육 성취에 대한 예측 가치(predictive value)와 같은 평가의 특성에 초점을 맞춘다. 일부는 등급별 성적평가 자체가 의과대학생 사이에 해로운 경쟁을 만들지 않으며 학생 자신에게 책임이 있다는 주장을 반박했다.49 그러나 등급별 성적평가가 의료행위에 적합하거나 효과적인 학업 동기 요인이라는 근거는 부족하다.11,12 실제로 의과대학생에게 등급별 성적평가 같은 외재적 요인(extrinsic factors)으로 동기를 부여해야 한다는 전제 자체가, 평생 지속되는 내재적으로 동기화된 학습(intrinsically motivated learning)이라는 전문직의 근본적 책무를 위협한다.50
동기 이론(motivation theories)은 의학교육과정 개혁에서 충분히 반영되지 않았다.51 존재하는 근거에 따르면 등급별 성적평가는 단기적으로 외재적 동기를 높일 수 있지만, 외부 동기 요인인 등급별 성적을 제거하면 전반적인 동기 수준이 초기보다 낮아진다.52 또한 독서를 포함한 학생의 학습 습관은 등급별 성적평가의 영향을 받지 않으며,52 전국 표준화 시험의 성적 역시 영향을 받지 않는다.17 등급별 성적평가를 대신하는 서면 또는 구두의 서술형 피드백(narrative feedback)은 학업 동기를 높이면서 스트레스와 불안을 줄일 수 있다.53
그럼에도 많은 전공의 수련 프로그램 책임자와 일부 의과대학생은 성적평가를 ‘현재대로(as is)’ 유지하기를 원한다고 밝혀 왔다. 이는 등급별 성적이나 숫자 점수가 이후 임상 수행의 중요한 예측 인자로 남아 있다는 제한적인 근거 때문일 수 있다.41,42,45,46,54 졸업후의학교육 수행을 예측하기 위해 임상실습의 등급별 성적을 사용하는 데에는 일관성이 없으며, 이러한 문제는 거의 50년 동안 지적되어 왔다.40 비교적 최근의 일부 연구는 등급별 성적과 전공의 수행 사이에 양의 상관관계가 있다고 시사하지만45,46 다른 연구는 그렇지 않다.18,55–57 역설적으로, 합격/불합격 평가가 비판적으로 검토되지 않았으므로 등급별 성적평가를 유지해야 한다는 주장42은, 자체의 근거가 의심스러운 등급별 성적평가가 미국 의학교육에 역사적으로 도입된 사실을 비판 없이 수용하고 의존해 온 것은 도외시하는 듯하다. 석차, 성적, 우등생 학회(honor societies) 가입, 전국 표준화 시험 점수에 초점을 맞추는 것은 균형 잡힌 전인적 의학교육(holistic medical education)의 표지가 되어야 할 개인적 성장과 전문직 정체성 형성보다 측정된 수행에 관심이 쏠려 있음을 보여준다. 또한 의과대학의 평가 유발 스트레스(assessment-induced stress)를, 임상실무의 스트레스에 대비해 의과대학생을 단련하거나 길들이는 수단으로 치부해 왔다. 과거 의학교육의 어려움에 고전하는 학생에게 권했던 ‘스스로 자신을 호되게 다그치기(self-kick in the seat of the pants)’58는 당시에도 적절해 보이지 않았고,59 의과대학생과 그들이 돌보게 될 환자의 필요에 가장 잘 부응하는 오늘날의 전인적 교육 환경에도 맞지 않는다. 등급별 성적평가를 의과대학생의 형성에 필요한, 의례적이고 불안을 유발하는 과정으로 규정하는 것은 신고식 괴롭힘(hazing)의 여러 요소를 떠올리게 한다.60 이런 상황에서 수치심은 학생 간 연대(solidarity)를 약화하고, 의학교육의 집단 응집력과 임상실무의 팀 기반 진료(team-based care)라는 이상을 훼손한다. ‘숙달(mastery)’을 기억해낸 내용을 평가하는 표준화 시험으로 측정한다면, 연민(compassion), 공감(empathy), 참여(engagement), 응집력(cohesiveness), 판단력처럼 현대 의학에서 성공하는 데 더 중요하다고 주장할 수 있는 의료행위상의 숙달 속성은 충분히 평가받지 못하고, 따라서 저평가될 것이다. 등급별 성적평가에 의존하는 것은 인지적 수행과 포괄적인 현대 의료서비스 제공에 가장 중요한 의사 발달의 속성 사이의 거리를 더 벌린다.3
의과대학의 심리사회적 맥락에서 본 등급별 성적평가 (Tiered grading in the psychosocial context of medical school)
의과대학의 학업 환경과 의과대학생의 스트레스·불안 사이의 연관성은 80년도 더 전에 분명히 인식되었다.61,62 의과대학생에게 심각한 정신건강 문제가 발생할 위험은 오늘날에도 지속된다.43 합격/불합격이라는 평가 범주를 넘어서는 등급별 성적평가가 학생의 불안, 우울, 번아웃에 기여한다는 설득력 있는 근거가 있다.38,39,43,63,64 실제로 등급별 성적평가는 오늘날 의학교육 환경에서 스트레스, 번아웃, 정서적 소진(emotional exhaustion)을 일으키는 교육과정상의 가장 강력한 원인 중 하나, 어쩌면 가장 강력한 원인으로 보인다.65 등급별 성적평가는 학생 간 경쟁 심화와 집단 응집력 저하와 관련된다.12,66,67 의과대학생 평가 과정에서 등급별 성적평가를 제거한 곳에서는 우울, 불안, 격차(disparities)가 줄고, 협력, 집단 응집력, 전문직 정체성이 높아진다.68,69 임상실습에서 등급별 성적을 평가 결과로 사용하지 않으면, 표준화 시험이나 총괄 서면시험을 준비하려고 학생이 임상현장에서 빠져나갈 유인이 없어져 임상 몰입(clinical immersion), 환자 및 교수진과의 접촉, 임상추론 능력(clinical reasoning skills)이 향상될 수 있다.70 이는 의과대학생의 공정성 인식 향상과도 관련된다.71
오늘날 의학교육의 지배적인 문화와 학업 환경이 학생의 안녕과 전문직 발달에 가할 수 있는 위협은 여전히 비판적 검토를 피해 가고 있다.72 학업 환경 자체는 ‘환경적 위해(environmental hazard)’에 비유되었으며,72 이는 산업보건과 안전(occupational health and safety)의 설득력 있는 관점을 불러온다. 학문의학(academic medicine)의 문화는 상당 부분 숨은 교육과정(hidden curriculum)에 의해 형성되며, 여기에는 지도전문의(attending physicians), 전공의, 동료와의 대인관계적 경험과 상호작용이 포함된다.73 전문직 정체성의 발달과 의학교육 중 실제로 중요한 것이 무엇인지에 대한 학생의 인식에 영향을 미치는 것은 바로 이 숨은 교육과정이다. 이는 60여 년 전 ‘하위문화(subculture)’로 불리기도 했다.74 실제로 의과대학생과 전공의·교수 교육자 사이의 이러한 상호작용이 ‘의학 전문직업성(professionalism)에 대한 학생의 이해에 가장 강력한 영향을 미친다’.75 (p16) ‘의사가 되는 데에는 좋은 성적을 받는 것보다 훨씬 더 많은 것이 필요하다’라는 격언도, 의과대학생의 가까운 미래와 진로가 주로 성적, 전국 의사면허시험 점수, 임상실습 전 및 임상실습 교육과정에서의 평가에 따라 결정된다는 사실이 분명해지면 회의와 불신, 일축으로 받아들여진다. 이론적 지식, 중요한 결과가 걸린 시험(high-stakes exams)의 수행, 임상환경에 대한 순응을 강조하는 숨은 교육과정은 의사가 어떤 사람이 되어야 하는지에 대한 도덕적 성찰의 여지를 거의 남기지 않는다. 이러한 사회화의 목적은 직업적 가치, 윤리, 규범을 ‘집단 또는 개인 수준의 성찰에 의한 검토를 거치기보다는 미묘하고 점진적인 방식’으로 정상적이고 일상적인 것으로 만드는 데 있다.76 (p59) 따라서 의과대학생의 인격적 형성과 의료문화로의 사회화 과정은 암묵적으로 전달되는 것에 크게 좌우된다. 여기에는, 그렇게 인식되든 아니든 의과대학생이 원하는 전문과목이나 수련 지역에 들어갈 자격을 자의적으로 층화함으로써 숨은 교육과정을 강화하는 등급별 성적평가 체계를 만들고 유지하는 일이 전달하는 메시지도 포함된다.
등급별 성적평가가 초래할 수 있는 스트레스와 불안뿐 아니라, 이러한 평가 체계는 소수화된 집단(minoritized groups)에 속한 학생들의 학업 수행에서 부당한 격차를 지속시킬 수도 있다. 최근의 사회·정치 운동은 매우 다원적인 미국 인구의 보건의료 요구를 충족하고, 우리 의과대학에 입학하고 졸업하는 과소대표 소수집단(under-represented minorities, URM)의 격차를 해소할 수 있는 다양한 의사 인력을 배출하는 데 의학교육 체계가 보여온 일부 실패에 주목하게 했다.13,77 아마 가장 중요한 점은, 인지적 수행 등의 변수를 통제해도 과소대표 소수집단 학생이 더 낮은 평가를 받는 인종적 불평등과 등급별 성적평가가 관련되어 보인다는 것이다.13,15,78 이는 다시 과소대표 소수집단 학생의 우등생 학회 가입, 전공의 수련 선택지, 전문과목 선택에 영향을 준다. 의과대학생 평가를 둘러싼 수많은 교육학적·사회적·과학적·임상적 쟁점과 의사의 전문직 정체성 형성에 기여하는 학업 과정은 평가 과정의 복잡성과 논쟁성을 더한다.5
의과대학생 성적평가의 도덕적 맥락 (The moral context of medical student grading)
의학교육의 도덕적 맥락에서는 교육과 멘토링 모두 중요하다. 이는 상당 부분 교육자와 학생 사이의 권력 불균형 때문이다. 등급별 성적, 석차 또는 다른 형태의 학생 층화를 결정하는 궁극적인 책임이 교수에게 있으므로, 학업 환경 자체가 이러한 권력 불균형을 지속시킬 가능성이 있다. 또한 의학교육의 교수·평가 과정은 교육자를 이해상충(conflict of interest)이 분명한 위치에 놓는다. 효과적인 교사는 학생이 성공하기를 바라면서 동시에 성공했는지도 판단해야 한다. 의학교육자이자 멘토는 학생이자 피지도자(protégé)와 안전하고 지지적이며 형성적인 관계를 맺기 위해 비판단적인 태도를 유지해야 한다. 그러나 의학교육자는 학생의 역량을 비판적이고 정직하게 평가할 때에는 판단도 내려야 한다.79 의학교육자는 흔히 자신의 교수 효과성(teaching effectiveness)에 대해 의과대학생의 평가를 받는다. 학생 수행을 비판적으로 평가하면 학생에게서 좋지 않은 교수평가를 받을 수 있다.80 이러한 갈등은 교사가 임상실습 학년의 학생 수행을 부정적으로 비평하기를 주저하는 이유를 어느 정도 설명할 수 있다.31,32
역량 평가를 개선한다는 목적으로 의과대학생의 서열을 매기는 수학적 접근법을 개발·정교화·적용하고 강조하면, 성공적인 의료행위의 심리사회적 차원을 간과할 위험이 있으며9,12 궁극적으로 의과대학생과 교육기관 사이의 신뢰도 위협할 수 있다.81,82 의과대학생을 서열화하는 체계에 의존하면, 의학교육자와 학생 관계의 도덕적 토대가 학사 운영상의 편의에 종속될 수 있다. 교사와 학생 양쪽의 도덕적 발달은 교육과정의 다른 속성만큼 관심을 받지 못했다. 의료교육을, 인간적이고 지지적인 교육 과정을 통해 역량 있고 다양한 의사 인력을 배출한다는 궁극적 목표보다 교육 과정의 효과성과 효율성에 초점을 둔 기술적 사업으로 규정하면, 아마도 ‘…도덕적 기준과 같은 다른 기준은 대체로 부차적인 중요성만 갖거나 전혀 고려되지 않는다’.83 (p156) 등급별 성적평가로 특징지어지는 학업 환경은 다양하고 전인적으로 준비된 의사 인력의 양성보다 성적평가 패러다임의 작동 방식을 강조하고 중시한다. 또한 이러한 학업 환경은 의과대학생의 도덕적 발달을 멈추게 하거나, 더 나쁘게는 퇴행시킬 수 있다.84,85 낮은 석차의 수치심을 피하고, 인정을 얻고, 임상실습 전 및 임상실습 교수진에 대한 충성심을 보여주도록 등급별 성적평가가 설정한 학업 유인은 전인습적·인습적 도덕 단계(preconventional and conventional moral stages)의 특징을 보인다.84 이러한 도덕 단계는 보통 아동기와 청소년기에 연관된다.84 부적절한 학업 유인은 의과대학생이 후인습적 도덕 단계(post-conventional moral stage)로 나아가는 것을 막을 수 있다. 이 단계에서는 전문직이나 사회의 규범과 독립적으로 ‘…인간의 존엄성과 인권의 원칙이 인격에 완전히 통합되고 개인 행동의 토대를 형성한다’.84 (p504) 의과대학 교수진과 의학교육기관은 학생의 도덕적 발달을 높이기 위해 노력하고, 이를 위협하는 요소를 적극적으로 제거해야 한다.85
등급별 성적평가를 넘어서 (Beyond tiered grading)
등급별 성적평가를 없애면 의과대학생 평가를 개선할 수 있는가? 우리는 그것이 가능할 뿐 아니라 반드시 필요하다고 믿는다. 분명히 해두자면, 학생에게 높은 기준을 요구하지 말자는 뜻도, 높은 기준이 충족되는지 확인하기 위한 시험을 더 이상 치르지 말자는 뜻도 아니다. 실제로 시험 강화 학습(test-enhanced learning)은, 우리의 견해로는 의과대학생에 대한 엄격한 시험을 학습 도구로 계속 시행해야 한다는 강력한 논거다.86 다만 이상적인 의과대학생 평가의 형태와 방법은 학생을 서열화·등급화·분류하는 데 쓰여서는 안 되며,87 다양하고 전인적으로 수련받았으며 효과적이고 회복탄력적(resilient)이며 유연한(agile) 의사 인력을 배출하려는 교육기관의 책무 속에서 학생을 평가하는 데 쓰여야 한다. 사용하는 평가 도구는 성공적인 의학교육에서 바라는 이러한 속성을 평가하는 데 초점을 맞추어야 한다.
평가 도구는 또한 평가한다고 주장하는 대상을 평가하는 데 충분한 타당도(validity)를 보여야 한다. 타당도는 평가 도구 자체의 속성이 아니라 그 도구가 산출한 결과에 대한 해석과 추론(interpretations and inferences)의 속성임을 기억하는 것이 중요하다.88 어떤 형태의 등급별 성적평가든, 다양하고 전인적으로 수련받았으며 효과적이고 회복탄력적이고 유연한 의사 인력을 공급하는 데 미치는 전반적 결과를 고려하지 않은 채 학생을 학문적 인정이나 전공의 선발을 위한 범주로 나누는 데 사용한다면, 그 성적평가의 해석과 추론, 그리고 타당도를 재평가해야 한다. 결과는 중요하며, ‘평가의 의도된 또는 의도되지 않은 결과를 평가하면 이전에는 눈에 띄지 않았던 타당도 결여의 원천을 밝혀낼 수 있다’.88(p166.e10) 예를 들어 번아웃과 경쟁의 감소, 집단 응집력의 향상을 의학교육의 중요한 성과로 여긴다면, 이 영역에서 등급별 성적평가가 낳는 부정적 결과는 평가 도구로서의 등급별 성적평가의 타당도를 위협한다. 또는 등급별 성적평가를 분석한 결과 어떤 소수집단의 점수나 평정이 일관되게 낮다면, 이는 모든 전문과목에서 다양한 의사 인력을 배출하는 데 있어 등급별 성적평가의 타당도를 위협한다.88 이러한 이유로 능동적인 비판적 교육학(critical pedagogy)은 매우 중요하다. 그것은 ‘…상황에 대한 인식을 높일 수 있으며, 이는 불평등을 줄이기 위한 변화를 만드는 전 단계’이기 때문이다.89(p351)
또한 임상환경에서 학습과 역량을 평가할 때 타당도는 환자군의 일상적 변동, 평가할 수 있는 교수자의 판단력 차이 등 여러 요인에 취약하다. 그러나 의료행위에 필요한 학습과 역량에 대한 가장 중요한 평가는 아마도 바로 임상환경에서 이루어져야 한다. 여기서는 학습, 수행, 수행 평가의 역동이 진료와 학습이 일어나는 복잡한 임상환경 속에서 모두 융합된다.90 따라서 직무 기반 평가(work-based assessments, WBA)는 의과대학생이 장차 활동하게 될 다양하고 복잡하며 끊임없이 변하는 보건의료 환경과 진료 현장에서의 의료행위 평가에 더 충실하게 부합한다. 사용하는 평가 도구의 해석과 추론에는 평가가 이루어지는 보건의료 환경과 현장이 반영되어야 한다. 이러한 환경과 현장은 사회적·지리적·시간적으로 각기 고유하며, 학생이 장차 실제로 진료할 환경이나 상황을 반영하지 않을 수도 있다. 따라서 ‘…평가 관행의 양적 평가와 관련된 전통적인 신뢰도·타당도 개념은 맥락에 놓인 수행(situated performance)에 대한 해석을 평가하는 데 유용성이 제한적이다’.90 (p1171) 평생학습 기술, 동기, 미래의 진료에 대한 적응력의 평가에서도 그 맥락에 맞는 타당도를 확보해야 한다. 중요한 것은 ‘…평가의 목적이 학습 성과를 ‘객관적으로’ ‘정확하게’ 수량화하는 것이 아니라, 수련생과 의사가 무엇을, 어떻게, 왜 배우는지를 이해하는 것임을 뜻한다’는 점이다.90 (p1169)
이상적인 평가는 또한 모호하지 않고, 도덕에 기반하며, 공정해야 한다. 임상실습에서 등급별 성적평가를 중단하고 합격/불합격 체계로 전환하면 공정성에 대한 인식이 개선된다.71 교육 평가에서 공정성에 대한 전통적인 접근은 신뢰도와 타당도에 초점을 맞추어 왔지만, 심리측정학(psychometrics)에 대한 객관적이고 제한적인 초점은 ‘…복잡한 직무 현장의 역량, 수행, 평가에 관한 핵심 문제를 무시할 수 있다’.91 (p714)
새롭게 축적되는 문헌은 특히 의학교육의 임상실습 학년에서 서술형 평가(narrative) 같은 주관적 평가를 적절하게 사용하고 해석하는 데 정보를 제공할 수 있다.91 객관성 중심 평가와 비교할 때 서술형 내용이 풍부한 평가(narrative-rich assessment)는 학습자에게 더 실행 가능한 피드백을 제공하고, 학습자에게 임상 진료를 위임할지에 관해 지도 임상 교수진이 내리는 결정에도 가치를 더할 수 있다.92 그러나 합격/불합격의 서술형 평가 과정도 완벽하지 않으며, 편향이나 과소대표 소수집단 학생에게 불리한 평가에서 자유롭지 않다는 점을 말해야 한다. 따라서 모든 평가의 결과를 신중하고 지속적으로 검토할 때 의도하지 않은 결과까지 고려해야 한다. 타당도 평가는 계속되는 과정이어야 한다.88
필수 학습 경로와 개별화된 학습 경로 모두에서 역량을 입증하면 ‘학점(credits)’을 부여하는 평가 체계가, 장차 임상의가 돌볼 인구집단이 기대하는 기준을 유지하면서도 의과대학생 집단의 개별화와 다양성을 더 잘 촉진할 수 있을지 모른다. 이러한 학점 기반 체계가 합격/불합격 평가로 구성된다면 의과대학생의 스트레스를 줄이고,93 안녕감을 높이며,94 평생학습에 더 잘 부합하는 숙달 지향 학습(mastery-oriented learning)을 촉진할 수 있다.71 평가의 초점이 다른 수행 평가의 세부사항(예: 미국 의사면허시험 1단계[United States Medical Licensing Exam Step 1]의 숫자 성적평가95)에서 의학 학습자의 개인적·전문직적 발달로 옮겨가면, 그러한 전환이 촉진되거나 새로운 관점에서 검토될 수 있다.
심리측정학적 객관성과 외부 동기에 지향된 전통적인 등급별 성적평가 체계에서, 학습을 위한 평가(assessment for learning), 학습에 대한 평가(assessment of learning), 학습으로서의 평가(assessment as learning)를 강조하는 합격/불합격 체계로 전환하는 것은 어느 교육기관에서나 어려울 것으로 예상된다.96 그러나 의학교육자가 평가를 개혁하는 데 도움이 될 요인들이 확인되었고, 유용할 수 있다.97 특히 합격/불합격 평가 패러다임에서는 교수 평가자가 충분히 견고해야 할 역량 기준에 못 미치는 학생을 비판적으로 평가하고 필요할 때 보충교육(remediation)을 시행할 용기가 필요하다.4,42 임상실습에서 불합격 성적을 부여하는 일은 역사적으로 드물었으므로 이를 위해서는 의도적인 노력이 필요하다.98 의학교육자는 학생이 의료행위를 하도록 최선을 다해 준비시켜야 하며, 동시에 역량 기준을 충족할 수 없는 학생에게는 불합격 판정을 내릴 준비도 해야 한다.
결론 (Conclusion)
의료행위에 필요한 의과대학생의 역량을 평가하는 이상적인 방식은 의학을 성공적이고 안전하고 효과적으로 실천하는 데 필요한 모든 기술의 발달을 비판적으로 평가하면서, 동시에 미래 의사 인력의 개별적 관심, 기여, 다양성을 촉진해야 한다. 학생 개인이나 집단에 해를 끼쳐서는 안 된다. 최근 자료가 축적되면서 등급별 성적평가가 더 높은 스트레스, 우울, 불안, 불공정하다는 인식, 학생 간 응집력 저하, 전문직 정체성 형성 저해, 인종적 격차와 관련된다는 근거가 늘어나는 만큼, 의학교육자와 그들을 지원하는 학교는 교육과정에서 등급별 성적평가가 차지하는 위치를 재고해야 한다. 의학교육자는 교육의 모범적인 실천(best practices)과 새롭게 등장하는 교육학적 전문지식에 익숙해야 한다.99 다른 모든 교육자와 마찬가지로 그들은 ‘제도화된 교육이 조장할 수 있는 부정의에 민감해야 한다. 이는 단순한 숙련도가 아니라 인격의 문제다’.100(p31) 여기에는 영웅적인 교육과정 변화(heroic curricular change)를 수용하고 실현하려는 의학 분야 학문적 지도자의 용기도 필요하다.101 대안적 비등급별 평가를 조사하고, 나아가 그 방식으로 전환하는 것은 반드시 필요하다. 최소한 등급별 성적평가 체계를 유지하는 학교는, 이 방식과 관련된 해로운 영향을 고려할 때 그 사용을 정당화하도록 요구받아야 한다. 이러한 부정적 영향을 해결하지 않은 채 두는 것은 그 영향을 용인해도 된다는 인상을 주며, 의학교육에서 등급별 성적평가가 문제를 안고 지속되는 현상을 암묵적으로 지지한다.
'논문 읽기 (with AI)' 카테고리의 다른 글
| 인공지능, 인지적 풍요, 보건의료인의 다층적 역량 (J Contin Educ Health Prof. 2026) (0) | 2026.09.26 |
|---|---|
| 의학교육에서의 인공지능에 관한 조시아 메이시 주니어 재단 회의: 회의 경과와 권고안 (Acad Med. 2025) (0) | 2026.09.26 |
| 학부 의학교육을 위한 기초 역량 (AAMC, AACOM, ACGME, 2024) (0) | 2026.09.26 |
| 의대 성적에 등급을 매기는 관행, 도대체 어디서 온 걸까? (Teaching and Learning in Medicine. 2026) (0) | 2026.09.01 |
| AI는 의학교육을 어떻게 바꿀까 — Macy Foundation 혁신 보고서 Part II (Acad Med, 2025) (0) | 2026.09.01 |

































































