The Historical Roots of Tiered Grading in US Medical Education

🤔 질문 하나로 시작해 볼까요
임상실습(clerkship)이 끝나면 학생들에게 Honors, High Pass, Pass 같은 등급을 매깁니다. 너무 당연해서 아무도 묻지 않는 관행이죠. 그런데 이 등급식 평가(tiered grading)는 대체 언제, 왜, 무슨 근거로 시작된 걸까요?
이 논문은 바로 그 질문을 던집니다. 그리고 저자들이 250년치 문헌을 뒤진 끝에 내놓은 답은 꽤 불편합니다. 등급식 평가는 임상역량을 재려고 만들어진 게 아니었다는 겁니다. 의과대학이 대학(university) 체제 안으로 편입되는 과정에서 그냥 딸려 들어온 것에 가깝다는 거죠.
저자들이 쓰는 용어를 먼저 정리하면 이렇습니다. 관찰 도구가 평가(assessment), 그 자료로 내리는 판단이 평정(evaluation), 그 판단에 따른 의사결정이 성적 부여(grading)입니다. 그리고 이 논문이 겨냥하는 건 그중에서도 규준참조(norm-referenced) 방식으로 학생을 서열화하는 등급식 평가입니다.
🏛️ 1부. 의학교육이 대학으로 들어가기까지
미국 의학교육의 출발점은 1765년 John Morgan입니다. 도제식 교육을 넘어 대학과 같은 원리 위에 의학교육을 세우자고 주장했죠. 다만 그가 평가 체계를 구체적으로 설계한 건 아니었습니다. 학위 수여 전에 제대로 된 판단이 필요하다는 정도의 신념은 있었어요.
"그렇다면 우리는 합당한 보상으로 진가를 가려내고, 진정한 공적에 마땅한 영예를 부여하는 것을 목표로 삼읍시다."
"Let us aim then to distinguish worth with adequate reward and confer due honors on real merit." (Morgan, 1765)
문제는 19세기입니다. 대학 밖에 영리 의과대학(proprietary medical school)이 우후죽순 생겨났는데, 입학 기준도 교육과정도 제각각이었고 졸업 요건은 마지막 시험 한 번이 전부인 경우가 많았습니다. 여기서 흥미로운 대목이 있어요. 학생이 학교를 떠나는 이유는 학업 부진보다 등록금을 못 내서인 경우가 훨씬 많았습니다. 교수 수입이 학생 등록금에서 나왔으니 낙제를 시킬 유인이 없었던 거죠.
그러다 1847년 미국의사협회(AMA) 설립, 1910년 Flexner Report를 거치며 의학교육은 본격적으로 대학 안으로 들어갑니다. 그리고 이때 대학의 문화와 환경이 함께 따라 들어옵니다. 평가 방식까지 통째로요.
🎓 2부. 등급제의 진짜 기원: 학문이 아니라 규율
그럼 대학은 그 등급제를 어디서 가져왔을까요? 논문은 영국, 특히 케임브리지의 수학 경시대회 Tripos를 지목합니다. 원래는 자발적 참가 경쟁이었고 학위 수여와 무관했는데, 점수화가 유럽 대학 전반으로 퍼졌고 미국까지 건너왔습니다.
미국 최초의 서열화는 1785년 예일대의 Ezra Stiles 총장이었습니다. 학생들을 optimi, secondary optimi, inferiors, pejores의 네 등급으로 나눴죠. 목적이 뭐였는지가 중요합니다. 성적이 낮은 학생이 느낄 수치심(humiliation)이 더 열심히 공부하게 만들 거라고 기대한 겁니다.
학생들 반응이요? 1786년 4월, 나흘간 폭동이 일어났습니다. 창문에 벽돌을 던지고 튜터들 집 문을 부수려 했다고 해요. (총장 관저는 무사했다고 합니다. 😅)
이 대목이 이 논문에서 가장 인상적인 부분이라고 생각합니다. 역사학자 David Allmendinger는 일상 과제에 점수를 매기고, 석차를 내고, 성적표를 부모에게 보내는 이 모든 것이 "규율 절차로 도입된 개혁"(reforms introduced as disciplinary procedures)이었지 학문 수준을 높이기 위한 수단이 아니었다고 정리합니다.
즉, 등급제는 타당한 교수학습 원리에서 나온 게 아니라 수치심과 낭패감을 통해 행동을 통제하려는 장치로 출발했다는 겁니다.
이후 흐름은 빠릅니다. Mount Holyoke가 1884년 A-F 문자 등급을 도입했고, 1930년경에는 대부분의 대학이 5단계 문자 등급을 쓰게 됩니다.
⚠️ 3부. 사실 초기부터 비판은 있었습니다
여기서 논문이 파고드는 지점이 있습니다. 등급제는 도입 직후부터 계속 비판받아 왔다는 것.
미주리대 심리학자 Max Meyer는 등급제의 신뢰도 문제를 지적하면서, 교수들끼리도 학생들끼리도 서로를 의심의 눈초리로 보게 되고 이것이 공동체 의식을 해친다고 했습니다.
1910년 미국심리학회장 J. McKeen Cattell은 하버드 교사협회 연설에서 이렇게 말했죠.
"학생들이 석차를 놓고 경쟁하도록 설득해서 학업을 향상시키려는 계획은 헛되고 다소 반도덕적입니다. 무미건조하고 소득 없는 공부를 경쟁으로 재미있게 만들려는 것은 자동차 앞에 냄새를 두는 격입니다."
"Futile and somewhat anti-moral is the plan proposed of trying to improve scholarship by trying to persuade students to compete for class rank...to try to make dull and profitless work interesting by competition puts the smell before the automobile." (Cattell, 1910)
더 뼈아픈 건 등급제 지지자들의 인정입니다. 교육심리학자 S.S. Colvin은 1912년에 등급제가 제대로 이해된 적도 일관되게 운영된 적도 없다고 하면서, 이렇게 덧붙입니다.
"그것을 고안한 사람들이나 운영한 사람들의 선견지명 때문이 아니라, 우연히 자라난 것이다."
"...had grown up by chance rather than because of any foresight on the part of those who devised it, or those who administered it." (Colvin, 1912)
그리고 Tripos 출신인 수학자 G.H. Hardy(하디-바인베르크 평형의 그 Hardy 맞습니다)는 1926년에 아주 직설적으로 말합니다.
"나는 Tripos를 개혁하고 싶은 것이 아니라 없애 버리고 싶다."
"I do not want to reform the Tripos but to destroy it." (Hardy, 1926)
🩺 4부. 의과대학에 옮겨붙다
18-19세기 의과대학의 평가는 학업 마지막에 치르는 비공개 시험과 학위논문(inaugural thesis) 공개 발표 정도였습니다. 교육과정 중간에 학생을 등급으로 나누고 서열화하는 일은 없었습니다.
그런데 대학 편입과 함께 상황이 바뀝니다. 1900년 노스캐롤라이나대 의학부 학장 R.H. Whitehead의 진술이 이 변화를 잘 보여줍니다.
"학문적 방식이 지배하고, 학업 수준은 높으며, 의과대학생은 다른 학생들과 동일한 일반 규율의 적용을 받는다."
"...academic methods prevail, the standard of scholarship is high, and the medical student is subject to the same rules of general discipline with his academic fellows." (Whitehead, 1900)
문제는 이 구조가 임상 현장에 필요한 지식과 술기를 기르는 방향으로 설계된 적이 없다는 점입니다. 오히려 암기 편중을 정당화하고 가속했습니다. 1908년 Murray Galt Motter는 요약집과 시험 대비서가 넘쳐나는 현실을 이렇게 꼬집었습니다.
"단순 암기법이 얼마나 널리 길러지고 있는지를 보여 주는 딱한 증거다."
"...are sorry evidence to the extent to which the mere memory method is being cultivated." (Motter, 1908)
Flexner 본인도 나중에 후회 비슷한 말을 남깁니다. 대학 환경을 그토록 밀어붙였던 사람이 1925년에 이렇게 씁니다.
"우리의 현재 족쇄는 형편없는 의과대학들이 부적격한 학생들에게 '더 나은' 교육을 제공하도록 강제하기 위해 벼려진 것이었다."
"...our present fetters were therefore forged in order to compel wretched medical schools to give unfit medical students a 'better' training." (Flexner, 1925)
그리고 인턴 선발도 곧 시험 점수 중심으로 굳어집니다. 1899년 시카고 카운티병원의 선발 방식을 두고 Bayard Holmes는 필기시험만으로 전문가적 능력을 재는 것은 전적으로 부적절하며, 지원자의 건강, 도덕적 자질, 이전 임상 경력이 완전히 배제된다고 지적했습니다.
📉 5부. 성적은 좋은 의사를 예측하지 못한다
1960년대에 들어 실증 연구가 나오기 시작합니다.
- Price 등(1964): 학점으로 측정한 형식 교육에서의 수행은 의사로서의 수행과 관련된 요인들과 "거의 완전히 독립적"(almost completely independent)이라는 결론.
- Geertsma & Chapman(1967): 문자 등급과 석차는 학생이 의사의 역할과 기능을 향해 나아가는 진전을 적절히 대변하지 못한다는 지적.
정신건강 이슈는 더 오래된 이야기입니다. 1832년 Daniel Drake는 이미 의과대학생의 소화불량, 두통, 심계항진, 무기력을 언급했고, 1864년 Samuel Chew는 시험 전 24시간 이상 잠을 못 자고 불면, 두통, 현훈, 사고 혼란, 기억력 저하를 겪는 학생을 기술했습니다. 1937년 Strecker 등은 정신과의사 4명의 분석 결과 졸업반 학생의 46% 이상이 상당한 수준의 신경증적 부담을 지고 있다고 보고했고요.
그런데 여기서 저자들이 짚는 지점이 날카롭습니다. 당시 대응은 학습 환경을 바꾸는 게 아니라 학생 개인에게 해결을 맡기는 쪽이었습니다. Drake는 절제된 생활과 야외 운동을, Chew는 무리한 노력을 삼가라고 권했죠. 90년이 지난 지금도 구조를 문제 삼기보다 학생의 회복탄력성을 주문하는 방식, 어딘가 익숙하지 않으신가요?
📌 6부. 그래서 지금은
현재 미국 의과대학 155곳 중 약 84%가 필수 임상실습에서 어떤 형태로든 등급식 평가를 사용하고 있고, 이 비율은 오히려 늘고 있습니다.
저자들은 두 가지 해석을 제시합니다.
- 하나는 USMLE Step 1의 pass/fail 전환 이후 변별 수단이 사라지면서 다른 대안(WBA, EPA, holistic review, programmatic assessment)을 쓰기 어려워 등급제로 회귀했다는 해석.
- 다른 하나는 애초에 등급제의 기원이 이렇게 허술하다는 사실 자체가 인식되지 않았기 때문이라는 해석입니다.
이 논문에서 가장 핵심적인 한 문장을 꼽으라면 저는 이걸 고르겠습니다.
"등급식 평가는 향후 훈련과 진료에서의 성공에 요구되는 준비도, 신뢰가능성, 숙련도에 잘 맞지 않는 대리지표다."
"Tiered grading is an ill-fitting proxy for the readiness, trustworthiness, and mastery" required for success in future training and practice. (Smith & Piemonte, 2026)
🔭 7부. 저자들이 제안하는 다음 단계
정리하면 이렇습니다.
- 필기시험 자체를 없애자는 게 아닙니다. 필기시험은 학생이 자신의 성취와 진전을 확인하는 도구이고, 그 자체로 학습 경험이 될 수 있습니다. 문제는 필기시험 결과에 근거한 등급식 서열화입니다.
- WBA는 새로운 아이디어가 아닙니다. 1911년 존스홉킨스의 Lewellys Barker는 학생들이 소그룹으로 병동에서 일하고 선임 의사가 직접 관찰해야 한다고 했습니다. 그 의사들은 학생 및 전공의와 긴밀히 접촉하며 "통제하고, 비판하고, 검토하고, 제안하고, 격려해야"(controlling, criticizing, reviewing, suggesting, encouraging) 한다고요. WBA의 핵심 요소가 100년 전에 이미 서술돼 있었던 셈입니다.
- 인증평가 기구를 지렛대로. LCME가 USMLE 합격률로 교육과정 효과성을 측정하는 방식은 결국 시험 점수 중심 문화를 재생산합니다. 저자들은 일차의료 진출 졸업생 수, 의료취약지 근무 졸업생 수 같은 지표를 대안으로 제안합니다.
- Programmatic assessment로의 전환. 잦은 피드백, 다양한 평가 방법의 통합, 코칭, 그리고 비례성(고부담 결정은 충분한 근거로 뒷받침되어야 한다는 원칙). 저자들은 이것이 오히려 도제교육 시절 스승이 직접 관찰하며 임상추론을 길러 주던 역사적 뿌리로 돌아가는 길이라고 봅니다.
- 그리고 저자들의 바람 하나. "기말고사(final exam)"라는 용어를 의학교육에서 은퇴시키자는 것입니다. 의사의 경력에서 학습이 "최종"인 시점은 없으니까요.
- 마지막으로, 교수들에게 전하는 안심의 메시지가 있습니다. 등급제에서 벗어나는 것은 학생 평가의 발전 과정에서 극단적인 단절이 아니라, 애초에 등급제가 제대로 검증된 적이 없었다는 사실을 인정하는 일이라는 겁니다.
💭 읽고 나서 든 생각
이 논문은 실증 연구가 아니라 Observations 형식의 역사적 논평입니다. 그래서 "등급제를 없애면 이렇게 된다"는 인과적 근거를 기대하면 아쉬울 수 있습니다. 미국 맥락 중심이라는 한계도 분명하고요.
그럼에도 이 논문이 유용한 이유는 논쟁의 프레임을 바꾸기 때문입니다. 보통 우리는 "등급제를 없앨 만큼 충분한 근거가 있느냐"고 묻습니다. 그런데 이 논문은 방향을 뒤집습니다. 애초에 등급제를 도입할 만한 근거가 있었느냐고요. 기본값(default)이 무엇인지, 입증 책임이 어느 쪽에 있는지가 달라지는 질문입니다.
Kuper 등의 표현대로 역사는 "의학교육의 많은 부분이 구성된 것이고 따라서 변경 가능하다는 점을 보여 주는 효과적인 방법"입니다. 익숙한 것이 곧 타당한 것은 아니라는 얘기죠.
우리 맥락에서도 생각해 볼 지점이 있습니다. 임상실습 성적을 상대평가로 산출하는 관행, 전공의 선발에서의 성적 활용, 그리고 최근의 pass/fail 논의까지. 우리는 이 관행들을 언제, 왜, 어떤 근거로 도입했는지 스스로에게 물어본 적이 있을까요. 아마 대부분은 미국과 일본을 거쳐 들어온 대학 관행의 유산일 가능성이 큽니다. 그렇다면 우리도 같은 질문을 던져야 할 것 같습니다.
서론 (Introduction)
학술의학의 복잡한 쟁점들 가운데 학생 사정(student assessment)과 평가(student evaluation)를 적절히 사용하고, 그 형식을 정하며, 적용하는 일은 특히 어렵다. 이는 사정과 평가가 의료교육자에게, 환자 진료, 자기 돌봄, 전문직 발달에 평생 헌신하는 데 필요한 기술, 추진력, 끈기를 갖춘 다양하고 협력적이며 회복탄력적인 의사 인력을 길러내고 있다는 확신을 주어야 하기 때문에 더욱 그러하다. 사정과 평가는 의과대학생의 학습, 역량 보장(competency assurance), 대중의 신뢰(public trust)에 필요하다는 점이 널리 받아들여지고 있다.1 사정과 평가는 끊임없이 변화하는 보건의료 환경에서도 타당하고 신뢰할 수 있어야 하며, 의과대학생이 장차 봉사하게 될 대중에게도 의미가 있어야 한다. 의학교육을 위해 개발되고 사용되는 사정도구(assessment instruments)와 이에 근거한 후속 평가가 잠재적으로 서로 경합하는 이러한 요구를 충족하지 못하는 정도는, 의과대학생의 사정과 평가가 어떤 형식을 취해야 하며 어떻게 적용되어야 하는지를 둘러싼 논쟁의 토대가 되어 왔다. 이 점에서 단계형 성적평가는 전형적인 논쟁 사례라고 할 수 있다.2
이러한 복잡성과 어려움을 더하는 요인에는 ‘사정(assessment)’, ‘평가(evaluation)’, ‘성적평가(grading)’라는 용어의 다양한 사용방식과 해석이 있다.3 이 논의에서 우리는
- ‘사정’을 학습자의 숙달도(proficiency)에 대한 관찰을 뜻하는 용어로 사용한다. 이는 대개 필기시험이나 선다형 문항시험(multiple-choice question examinations), 또는 관찰 가능한 술기의 성공적 수행을 기술한 체크리스트 등의 도구를 사용하는 것과 관련된다.
- ‘평가’는 사정자료에 근거해 학습자에 관하여 내리는 해석과 판단을 뜻한다. 이는 대개 안전하고 효과적인 의료실무에 필요한 임상지식, 의사소통기술, 프로페셔널리즘(professionalism) 등의 영역에서 역량을 판정하는 것으로 나타난다. 평가는 규준참조 패러다임(norm-referenced paradigm)으로 더 확장될 수 있다. 이 평가 패러다임에서는 학습자가 역량을 범주적으로 입증하는 데 그치지 않고, 동료들의 수행과 비교되어 추가로 분류된다.
- ‘성적평가’라는 용어는 학습자에 대한 사정과 평가를 토대로 의사결정을 내리는 행위를 가리킨다. 성적평가는 일반적으로 의학교육과정의 더 높은 단계로 진급하는 결과로 이어진다. 이 글에서는 단계형 성적평가에 초점을 맞추며, 이를 규준참조 사정과 평가에 근거하여 학생을 평정(rating), 순위화(ranking), 또는 분류(sorting)하는 행위로 간주한다.
대부분의 학술의료기관에서 학생 사정과 평가는 여전히 학생끼리 규준참조 패러다임에 따라 비교하는 전통적 학문 지향성을 유지하고 있다. 다시 말해 수행 수준을 구별하기 위해 학생을 여러 범주로 순위화한다. 이 범주는 다양한 형식으로 표현되며, 문자등급(letter grades), 숫자점수(numeric scores), 그리고/또는 ‘통과(pass)’, ‘우수통과(high pass)’, ‘최우수(honors)’ 같은 질적 기술어(qualitative descriptors)를 포함할 수 있다. 이는 임상실습(clerkship) 학년에서 가장 두드러진다.4 학생의 단계형 성적평가는 기본의학교육(undergraduate medical education, UME)에서 졸업후의학교육(graduate medical education, GME)으로 이행하기 위한 전공의 선발(residency selection) 과정의 필수 구성요소로 설명되어 왔다.5 또한 의과대학생의 학습과 수행을 촉진하는 동기요인으로도 제시되어 왔다.6,7 그러나 이러한 규정은 단계형 성적평가가 학생의 스트레스와 불안, 번아웃, 집단 응집성 저하, 경쟁 심화, 과소대표 소수집단(under-represented minority) 학생의 불리함과 연결된다는 근거를 부차화하거나 심지어 무시한다.8–11 따라서 기관들이 단계형 성적평가를 넘어 다른 형태의 사정과 평가로 전환하기를 주저하는 것은 당혹스럽고 우려스럽다.
성적평가가 기반을 두는 사정 및 평가 관행을 포함하여 의과대학생 성적평가의 역사적 발달을 탐색하면 이러한 쟁점을 더 잘 이해할 수 있다. 역사적 관점은 현재의 쟁점과 논쟁을 그것이 출현하고 발달한 맥락 속에서 바라볼 수 있게 한다. 더욱이 역사적 관점은 “의학교육의 많은 부분이 구성된 것이며, 따라서 변화할 수 있다는 본질을 보여주는 효과적인 방법”이 될 수 있다.12 (p.e850) 의학교육 개선에 대한 고려의 폭을 넓히는 일은 전문직적 겸손(professional humility)과 지속적 변화에 대한 개방성을 촉진할 수 있다.13
초기 및 현대 미국 의학교육의 역사를 학술적으로 개괄한 문헌이 존재한다.14–16 이 문헌들은 사용된 사정방법을 언급하지만, 의과대학생 성적평가의 역사적 발달과 진화를 구체적으로 탐색하지는 않는다. 사실 역사적 서술은 단계형 성적평가를 의과대학생 교육에서 당연히 전제되고 필요한 특성으로 취급하면서, 이 평가형식이나 다른 사정·평가 형식의 실제 기원을 거의 고려하지 않는 것으로 보인다. 학부교육(baccalaureate education) 과정에서 대학생 성적평가의 역사적 경향을 요약한 문헌고찰17–19도 존재하지만, 의과대학생이나 다른 대학원 수준 학생의 사정을 탐색하지는 않는다. 의학 학습자 사정의 최근 경향20,21은 문헌에 기술되어 있지만, 이 연구들도 단계형 성적평가의 역사적 출현을 구체적으로 탐색하지 않는다. 의과대학생을 사정하는 가장 효과적인 방법을 둘러싼 현재의 논의에 기여하고자, 우리는 미국 의과대학생 사정과 평가의 역사를 간략히 검토했던 이전 연구2를 확장하고자 한다. 이 ‘관찰(Observations)’ 논문에서 우리는 미국 의학교육에서 단계형 성적평가의 뿌리와, 그 뿌리가 오늘날 의학교육에서 우리가 마주한 가장 시급한 쟁점 가운데 일부를 어떻게 계속 지탱하고 형성하는지를 구체적으로 탐색한다.
미국의 초기 의학교육 (Early medical education in the US)
미국 의학교육의 발달은 잘 기록되어 있다.14–16 초기 도제식 교육(apprenticeship-based education)에서 공식적인 대학 기반 교육(university-based education)으로의 전환은 특정한 시점을 경계로 일어난 것이 아니라, 지리적 여건, 영리 사립 의학교육(proprietary medical education)의 흥망, 의료실무의 질에 대한 대중의 불만, 19세기와 20세기를 특징짓는 과학지식 기반의 급속한 확대 등 국가적·지역적 영향에 의해 형성되었다. 현대 의학교육의 역사적 발달을 심층적으로 검토하는 것은 이 논문의 범위를 벗어나지만, 의과대학생이 과거와 현재에 언제, 어떻게, 왜 사정되고 평가되었는지에 관한 논의에 정보를 제공하기 위해 몇 가지 주요 지점을 아래에 개괄한다.
의학 도제교육, 군 의료 경험, 유럽에서의 수련을 모두 거친 John Morgan은 1765년 아메리카의 영국 식민지에 이상적인 의학교육 형태를 제시한 중요한 논문을 출판했다.22 그는 의학교육이 도제교육을 넘어 공식화되고 대학 교육과 동일한 원리에 기초해야 한다고 주장했다.23 Morgan은 자신이 제안한 의과대학에 구체적인 사정·평가 체계를 명시하지는 않았지만, 학위 수여 전 엄정한 판단이 적어도 가치 있으며 어쩌면 필수적이라고 분명히 생각했다. “그러므로 합당한 보상으로 가치를 구별하고 진정한 공로에는 마땅한 영예를 수여하도록 힘쓰자. 이는 교육기관을 완전하게[원문 표기: compleat] 만들고 학생들에게 가능한 모든 격려를 제공할 것이다.”22 (p. 36) Morgan의 선견지명 있는 구상은 당시 어느 정도 회의적인 반응을 받았지만, 여러 유력 대학은 해당 교육기관의 학문 원리와 행정구조에 기초한 의학부를 설립했다.24 대학 입장에서 의학부의 존재는 학문적 명성을 높이고 학생에게 매력적인 전문직 진로를 추가했다. 또한 대학 교수진을 이루기 시작한 신흥 학술 과학자들에게 자연스럽고 실용적인 초점을 제공했다.
19세기에는 대학 기반 의학부와 별개인 독립적 영리 사립 의과대학이 미국에 출현하면서 의심스러운 형태의 학생 사정과 평가도 함께 등장했다.25,26 이 학교들은 의문스러운 입학 기준, 임의적인 교육과정, 제각기 다른 수학기간, 흔히 교육과정 말미의 단 한 차례 시험만을 포함하는 모호한 졸업요건을 특징으로 했다.15 신규 졸업생이 이후에 얻게 되는 직업적 평판이 그 역량을 충분히 입증하는 것으로 여겨졌으며, ‘상류사회’ 고객군을 확보하는 것은 전문직적 성취의 증거가 되었다.15 학업 실패는 드물었고, 교수진의 단순 과반수 투표로 졸업이 결정되었다. 의학교수들은 의과대학생의 등록금 수입에 의존했고 교수라는 지위로 직업적·사회적 평판이 높아졌으므로, 학생이 학교를 떠나는 이유는 학업성취 부족보다 등록금을 내지 못해서인 경우가 훨씬 많았다.27 교육자들이 의과대학생을 낙제시키면 수입을 잃을 뿐 아니라, 의학학위를 가장 쉽고 저렴하고 빠르게 취득할 방법을 찾는 예비 학생의 반감을 살 수 있었으므로 당연히 낙제시키기를 꺼렸다. 대학과 관계를 유지한 의과대학조차 엄격한 학문적 기준을 보장하지는 못했다. 실제로 일부 대학 기반 의학부는 명목상으로만 모체 대학과 연계되어 있었다.28 이처럼 미약한 대학과의 연계는 “교육학적 의미에서 거의 가치가 없는 것”으로 평가되었다.27 (p. 764)
1847년 미국의사협회(American Medical Association)가 학문적 기준을 강화함으로써 의료인의 대중적 인식, 사회적 지위, 전문직적 위상을 높이라는 최초의 과업을 부여받으면서 영리 사립 의과대학의 폐지가 주요 목표가 되었다.29 대학 기반 의학교육과 Morgan의 원래 구상이 우세해진 것은 기존 의과대학이 대학과 공식적으로 연계되거나 대학이 자체 의학교육 부서를 설립한 결과였다.28 1910년 Abraham Flexner가 카네기 교육진흥재단(Carnegie Foundation for the Advancement of Teaching)에 제출한 보고서(‘Flexner 보고서’)30는 의학교육이 대학의 환경, 문화, 영향권으로 전환되는 과정을 가속한 현대적 변곡점으로 널리 인정된다.15 이는 의학 수학과정 이수 후 주 면허요건(state licensure requirements)이 만들어진 시기와 일치했다.31 이는 안전하고 효과적인 진료를 제공할 수 없는, 제대로 사정되지 않았고 자격이 부족하며 무능한 의료인이 과잉 배출된 데 대한 대중의 자연스러운 대응이었다.
의학교육이 비구조화된 도제교육에서 대학의 공식적 환경으로 전환되면서, 의과대학생의 사정과 평가는 아마도 당연하게 대학 학습자를 평가하는 특성을 띠게 되었다. 미국 의과대학에서 단계형 성적평가가 출현한 과정을 이해하려면, 미국의 학사과정 대학에서 그것이 언제, 어떻게, 왜 발달했는지를 검토하는 것이 유용하다. 대학과 의과대학의 사정 및 평가에 관한 전반적인 연대기를 ‘한눈에’ 볼 수 있도록 표 1에 제시했다.
초기 미국 대학의 학생 사정
(Student assessment in early US colleges and universities)
처음에는 학사과정 학생이 ‘졸업시험(leaving exam)’ 또는 ‘학위시험(degree exam)’을 성공적으로 치러 학위를 받는 것으로 학업성취를 표시했다.17 Harvard와 Yale 같은 대학은 졸업 전에 졸업시험을 시행하고 척도체계(scale system)에 따라 졸업생 대표(valedictorian)와 차석 졸업생(salutatorian)을 선발했다.17 그러나 학생의 수학과정 말미에 단 한 번 치르는 이 시험은 시험관의 편향이 개입하기 쉬웠다. 시험관은 주로 대학의 튜터(하급 교수), 교수, 이사회 구성원이었다.17 이들은 식민지와 초기 미국 사회의 계급 구분을 영속시키기 위해 학생 가문의 세습 귀족성과 저명 동문의 배경을 의식했을 가능성이 크다.31 이러한 엘리트 배경의 학생은 자연스럽게 특권의식을 느끼고 수행이나 출석과 관계없이 학위를 받을 것으로 기대했으며, 일부는 최종 사정 자체를 완전히 피하기도 했다.32 대학이라는 협소한 울타리 밖의 시험관을 추가하고 시험관 수를 늘린 것은 학생 수행에 대한 최종 평가에서 교수진 편향을 줄이려 한 초기 시도의 사례였다.17
표 1. 미국 의학교육 사정 및 평가의 연대기 (Timeline of assessments and evaluations in U.S. medical education)
| 시기 | 사건 |
| 1600–1800 | 도제식 의학교육(apprenticeship medical education) |
| 1650–1800 | 수학과정 말미에 대학 ‘졸업시험(leaving exams)’ 시행 |
| 1765 | John Morgan이 엄정한 학생 사정을 포함한 공식적 의학교육을 기술 |
| 1700–1800 | Cambridge의 Tripos 경연이 유럽 대학과 미국의 단계형 성적평가를 촉진 |
| 1785 | Yale University가 학사학위 후보자의 수행 순위를 도입 |
| 1750–1850 | 의학학위 수여 전 유일한 평가로서 의학 수학과정 말미에 ‘취임논문(inaugural thesis)’이 등장 |
| 1800–1900 | 모호한 졸업요건을 가진 영리 사립 의과대학의 증가 |
| 1847 | 의학교육 기준 강화를 위해 미국의사협회 설립 |
| 1884 | Mt. Holyoke College가 문자등급 체계를 도입 |
| 1910 | Flexner 보고서가 의학교육의 대학 환경 편입을 가속 |
| 1900 | 의학교육에서 단계형 성적평가의 역할에 관한 우려가 등장 |
| 1900–1920 | 미국 대학 대부분이 문자등급을 채택 |
| 1900–1930 | 대학에서 단계형 성적평가에 대한 초기 유보가 등장 |
| 1960–1970 | 성적과 의사 수행 간 상관관계가 부족하다는 초기 우려가 의학교육계에서 등장 |
| 현재 | 미국 의과대학 155개교 중 약 84%가 필수 임상실습에서 어떤 형태로든 단계형 성적평가를 사용하며, 그 비율은 증가 추세임 |
이 표는 중요한 시기와 사건을 대표하여 제시한 것이며, 망라하려는 것이 아니다.

단계형 성적평가는 학계 인사들이 유럽, 특히 영국 대학을 방문하며 경험한 교육모형을 따라 미국에 유입되었을 가능성이 크다.33 18세기 Cambridge University에서는 Tripos라는 수학 경연이 만들어졌으며, 그 상에는 안정적인 학문직과 연금을 통한 경제적 안정이 포함되었다.33,34 Tripos는 수상자를 가장 정확하고 공정하게 가려낼 수 있도록 채점되었다. 일반적으로 점수체계는 수행을 장려하고 경쟁을 자극하며 탁월한 성취를 인정하는 것으로 여겨졌다.33,35–37 중요한 점은 Tripos가 처음에는 자발적으로 참여하는 경쟁대회였고 그 점수가 학위 수여 결정에 반영되지 않았다는 것이다. 그럼에도 이러한 점수화는 결국 유럽 대학 환경 전반으로 확장되었고, 단계형 성적평가가 유럽 대학에서 확대되면서 미국 교육체계에도 편입되었다.37,38 단계형 성적평가는 대학의 학문환경과 동의어가 되었고, 의무교육(compulsory schooling)의 등장과 함께 결국 초등·중등·고등교육 전반으로 확산되었다.39
미국 대학에서 최초로 학생을 단계별로 순위화한 사례는 18세기 후반 Yale College에서 나타난 것으로 보인다.17 Yale 총장이던 Ezra Stiles는 1785년과 1786년에 학생들이 시험을 치르기 전에 대학을 떠나면서도 학위를 받을 것으로 기대하는 현실에 주목하고, 학생 규율과 학문적 엄격성을 높이고자 했다.32 Stiles는 학생들이 떠나기 전에 시험을 치를 수 있도록 1785년 봄 최종시험 일정을 앞당겼다. 또한 학생을 학업성취에 따라 optimi, secondary optimi, inferiors, pejores의 네 범주로 순위화했다.17,33,38 이 네 범주 체계는 벨기에 Louvain University에서 개발된 유사 체계(rigorosi, transibilies, gratiosi, 그리고 명칭이 없는 네 번째 하위 성취 집단)17와 영국의 체계(Honor Men, Pass Men, Charity Passes, 그리고 “이름이 공표되지 않았기 때문에 익살스럽게 ‘언급할 수 없는 자들[Unmentionables]’이라고 부를 법한” 집단17 (p. 108))를 모방했다. Yale 학생을 순위화한 데 어느 정도 교육학적 근거가 있었을 수 있으나, 다른 미국 학교에서는 이전에 이런 일이 없었다. Stiles는 성취가 낮은 학생이 자신의 상대적으로 낮은 수행을 알게 되었을 때 경험하는 굴욕감이 이후 시험을 앞두고 더 열심히 공부하도록 자극하기를 기대했다.32 주목할 점은 Yale 학사과정 학생들이 이 새로운 시험일정과 수행 순위화의 대상이 되리라는 사실을 깨닫자, 1786년 4월 나흘 동안 폭동을 일으켜 창문에 벽돌을 던지고 튜터의 집 문을 부수려 했다는 것이다. Stiles의 집은 피해를 면한 것으로 보인다.32
학생에 대한 평정과 순위화는 다른 대학기관으로 확대되었는데, 특히 사회·경제적으로 더욱 다양해진 학생 집단으로 인해 학생 상호 간, 학생과 교수진 간, 학생과 지역주민 간 긴장과 폭력이 발생하던 북동부에서 그러했다. 이러한 학문적 환경에서 단계형 성적평가는 학생의 학업행동에 영향을 미치고, 중요하게는 사회적 행동을 통제하기 위한 방법으로 출현했다. 역사가 David F. Allmendinger는 다음과 같이 서술했다.
- 일상 학업에 점수를 부여하고, 교과 수행에 따라 학생의 순위를 정하고, 우수자 명부를 만들고, 부모에게 정기적으로 보고하는 개혁은 규율 절차로 도입된 것이지, 미국에서 학문의 수준을 높이기 위한 수단만으로 도입된 것이 결코 아니었다.40 (p. 82)
학업성취에 근거해 학생을 평정하고 순위화하는 것은 강건하고 타당한 교육학적 원리라기보다 굴욕과 수치심을 통해 행동규율을 심어주는 방법으로 출현했다.41 Harvard를 포함한 여러 대학은 학생 순위를 정할 때 처음에는 100점 척도를 사용했다. Mount Holyoke는 ‘A’에서 ‘E’까지 각 문자가 백분율 점수를 나타내고 ‘E’가 낙제를 뜻하는 문자등급 체계를 최초로 채택한 대학으로 알려져 있다.33 1884년에는 처음 다섯 문자와 연계된 백분율을 조정하면서 ‘F’가 이 성적체계에 추가되었다.17 ‘E’는 시험을 다시 치를 수 있는 낙제등급이었고, ‘F’는 과목을 재이수해야 하는 낙제등급이었다. 문자등급을 사용하는 단계형 체계가 학업성취를 층화하는 더 효율적이고 정확한 방법이라는 인식과 함께,33 1930년 무렵에는 대부분의 대학이 5단계 문자등급을 사용했으며 ‘E’는 사라졌다.17
미국 교육체계가 단계형 성적평가를 비교적 빠르게 채택했음에도, 그 한계와 신뢰할 수 없음은 일찍부터 인식되었다. 이는 초등·중등교육뿐 아니라 대학에서도 지적되었다.39,40,42 대학에서 단계형 성적평가를 둘러싼 초기의 곤란한 경험과 관찰된 부정적 영향은 오늘날 의학교육에서 나타나는 어려움을 예고했다.
대학 수준에서 단계형 성적평가에 대한 유보
(Reservations about tiered grading at the collegiate level)
대학 내·대학 간 단계형 성적평가의 일관성과 표준화가 부족해 학생과 교수진 사이에 경쟁, 혼란, 심지어 적대감까지 생겼다. University of Missouri 최초의 심리학 교수였던 Max Meyer는 단계형 성적평가의 신뢰도 부족을 일찍부터 비판했다. 그는 다음과 같이 지적했다. “그 결과 교수진과 학생 모두가 서로를 의심의 눈초리로 바라본다. 이러한 태도가 일체감에 해롭다는 사실은…아무리 피상적으로 관찰하는 사람에게도 분명하다.”43 (p. 661) 단계형 성적평가는 초등·중등교육 수준에서도 의심스럽지만 고착된 교육의 특성으로 등장했고, 주관적이고 신뢰할 수 없으며 불공정하다는 지적을 받았다.39 이러한 한계는 때때로 교수(teaching)의 도덕적 차원으로 표현되었다. 미국심리학회 제4대 회장 J. McKeen Cattell은 1910년 Harvard Teachers’ Association 연설에서 다음과 같이 말했다. “학생들에게 석차 경쟁을 하도록 설득하여 학업을 향상하려는 제안은 무익하고 어느 정도 비도덕적이다…경쟁을 통해 따분하고 보람 없는 학업을 흥미롭게 만들려는 것은 자동차 앞에 냄새를 두는 격이다.”44 (p. 379)
역설적이게도, 학업 수행을 장려하는 수단으로 단계형 성적평가를 일찍부터 지지한 사람들도 그것이 미국 교육에서 허술하게 출현했다는 점을 인정했다. 교육심리학자 S. S. Colvin이 1912년에 기술했듯, 단계형 성적평가의 근거 자체는 “…지적으로 이해된 적도, 일관되게 운영된 적도 없었고…”, “…그것을 고안하거나 운영한 사람들의 선견지명 때문이 아니라 우연히 생겨났다.”35 (p. 561)
단계형 성적평가의 영감 가운데 하나였을 것으로 추정되는 Cambridge Mathematical Tripos의 학생 수행 층화조차,33,34 1926년 수학자 Godfrey Harold Hardy(‘Hardy-Weinberg’ 법칙의 Hardy)의 도전을 받았다. Hardy 자신도 Cambridge 학생 시절 Tripos에 참가했지만, 이후 수학경연과 다른 학문분야에서 대학생의 순위를 매기는 것이 초래할 수 있는 해악을 깨달았다.
- …나는 [Tripos] 체계가 원리상 해롭고, 그 해악은 흔히 개혁이라 부르는 것으로 해결하기에는 너무 근본적이라는 견해를 고수한다…나는 Tripos를 개혁하려는 것이 아니라 없애려 한다. 그리고 Tripos가 특수한 사례인지, 아니면 내가 말한 내용이 다른 모든 고등 우등시험(high-grade honours examinations)에도 적용되는지 묻는다면, 내가 아는 한 그렇다고 답할 수밖에 없다.45 (p. 144)
성인학습(adult learning)에 관한 새로운 원리가 출현하면서 대학의 정통적 관행이 지닌 한계는 더욱 분명해졌다. 현대 성인교육학(adult pedagogy)의 가장 초기 주창자로 볼 수 있는 Eduard Lindeman은 1926년에 “성인학습자란 권위적이고 관습적인 교육기관의 경직되고 타협 없는 요구에 의해 지적 열망이 촉발될 가능성이 가장 낮은 바로 그 사람들”이라고 지적했다.46 (p. 28) 그럼에도 대학 기반 의학교육이 발전하면서 대학 문화, 환경, 학생 사정·평가의 속성이 의학교육과정에 적용되었다.47,48
의과대학 학생 사정 및 평가의 전환
(The transition of student assessment and evaluation in medical schools)
대학이 의과대학·의학교·의학부를 흡수하거나 설립하면서, 대학 학사과정 학생에게 사용하던 사정방법과 단계형 성적평가 패러다임은 의과대학생의 사정과 평가를 크게 형성했다. 역설적이게도 의학교육 개혁을 위한 전문직적 추진력이 강했고 Flexner 보고서 이후에는 대중의 관심도 높았지만, 단계형 성적평가가 의과대학생 사정과 평가의 지배적 형식으로 전환된 과정은 다소 은밀하게 진행되었다. 18세기와 19세기의 여러 의과대학에서 의과대학생 숙달도에 대한 유일한 사정과 평가는 학업 말미에 이루어졌으며, 의과대학 교수진이 실시하는 비공개시험과 학생이 자신의 ‘취임논문(inaugural thesis)’을 발표하고 방어하는 후속 공개시험으로 구성되었다.14,49 때로는 최고의 논문을 쓴 학생에게 상금이나 특별 표창을 주었지만, 논문의 질을 순위화한 것은 졸업 시점이었고 수학과정 중에는 아니었다. 따라서 교육과정 중 학생을 공식적으로 순위화하거나 평정하거나 분류하지 않았다.
의학의 실무에 필요한 능력, 술기, 전문직 속성을 판단하기 위해 의도적으로 고안된 교육학적으로 타당한 접근법이 아니라, 의학계의 단계형 성적평가는 대학 환경에 적응하는 과정에서 출현했다. 당시 University of North Carolina 의학부 학장이던 R. H. Whitehead는 1900년에 “…학문적 방법이 지배하고, 학문의 기준이 높으며, 의과대학생은 대학의 동료 학생들과 마찬가지로 일반 규율의 적용을 받는다”고 기술했다.47 (p. 523) 1920년대 중반이 되자 의학교육은 대학의 학문환경에 확고히 자리 잡았고, 대학 총장들은 의학교육의 그 위치를 강하게 옹호했다.50 미국 의과대학에서 단계형 성적평가에 대한 유보가 곧 나타났다.
의과대학의 단계형 성적평가에 대한 유보 (Reservations about tiered grading in medical school)
Flexner 자신도 의학교육에서 대학 학문환경이 잠재적으로 억압적인 역할을 할 수 있음을 인식했다. 그는 영리 사립 의과대학을 없애기 위해 이러한 학문환경을 열렬히 장려했던 인물이기도 했다.51 최초 보고서가 나온 지 약 15년이 지난 1925년, Flexner는 의학교육의 상태를 성찰하며 “…따라서 현재 우리를 옭아매는 족쇄는 형편없는 의과대학이 부적합한 의과대학생에게 ‘더 나은’ 수련을 제공하도록 강제하기 위해 만들어진 것”이라고 지적했다.51 (p. 142) Flexner는 단계형 성적평가를 포함한 대학 환경이 의과대학생에게 미칠 해로운 영향을 예견했을지도 모른다. “…대학의 ‘학급정신(class spirit)’이 대학 의과대학에 침투했다…유능하게 지도를 받는 성숙한 학생은 ‘학교에서 바지를 입기 시작한 어린 학동’처럼 감시받을 필요가 없다.”30 (p. 76)
Flexner가 말한 ‘감시(policing)’는 제한적이고 일률적으로 고정된(lock-step) 의과대학 교육과정의 형식뿐 아니라, 단계형 성적평가, 암기를 강조하는 시험, 의과대학생의 학업행동 사이의 관계를 인정한 표현이었을 수 있다. Flexner 보고서가 배포되기 전인 1908년에도 Murray Galt Motter는 American Academy of Medicine 회의에서 발표한 논문에서 “퀴즈 요약집, 개요서, 시험 대비자료 등이 매우 많고 훨씬 더 큰 인기를 끄는 현실은 단순 암기법이 얼마나 조장되고 있는지를 보여주는 유감스러운 증거”라고 지적했다.52 (pp. 18–19)
이러한 비판에도 불구하고 단계형 성적평가는 일반적으로 의과대학생의 진전을 신뢰할 수 있게 ‘내부적으로’ 사정하고, 학생이 한 학교에서 다른 학교로 옮길 때 역량을 ‘외부적으로’ 전달할 수 있게 한다고 여겨졌다.33,53 또한 성적은 학생의 성취를 인정하고 좋은 수행을 유도하는 ‘당근’이라는 유인책(그 연장선에서 ‘채찍’이라는 억제책)을 제공하려는 것이었는데, 이는 대학 환경에서 보편화된 관행이었다.47 단계형 성적평가는 의과대학생의 학업 수행을 장려하여 의학의 전문직적 위상을 향상하는 방법으로 찬양되거나 적어도 용인되었다.
따라서 의과대학생은 규율과 학문 양 측면에서 당시 대학 학계에 지배적이던 철학을 위해 개발된 구인(construct)에 의해 평가되었다. 이 구인은 의과대학생이 장차 몸담을 임상실무 환경에 필요한 지식과 술기의 발달을 촉진하는 토대 위에서 개발된 것이 아니었다. 불행히도 이는 선망받는 병원 인턴십에 들어갈 의학 졸업생을 정할 때 총체적 선발과정(holistic selection process)보다 등급이 매겨진 시험점수를 더 중시하는 관행이 일찍부터 확대되는 데 기여했다.54 1899년 Chicago County Hospital의 인턴 선발과정을 논평하면서 의학교육자이자 외과의사·세균학자였던 Bayard Holmes는 다음과 같이 지적했다. “…전문직 능력의 검증 수단으로서 필기시험 체계는 전적으로 부적절하다…지원자의 건강, 도덕적 자질, 이전의 의학 관련 업무는 전혀 고려되지 않는다.”54 (p. 927)
의과대학 성적과 의사 수행 간 상관관계가 없음을 보여주는 의학교육 연구가 출현하면서 단계형 성적평가의 적절성에 대한 초기 의구심은 더욱 강해졌다.
- 예를 들어 Price와 동료들은 1964년 의과대학 성적의 타당성에 대한 사정 결과를 보고하며, “…평균평점(grade-point average)으로 측정한 공식교육에서의 수행은 의사로서의 수행과 관련된 모든 요인으로부터 거의 완전히 독립된 요인으로 나타난다”고 지적했다.55 (p. 208)
- 마찬가지로 University of Kansas의 Geertsma와 Chapman은 1967년에 “…전통적인 문자등급과 학급 내 숫자 순위는 의사의 전문직적 역할과 기능을 향해 의과대학에서 이루는 진전을 적절히 나타내지 못한다”고 지적했다.56 (p. 938)
더불어 의학교육의 스트레스와 그것이 의과대학생의 웰빙에 미치는 영향은 미국 의학교육의 초기부터 인식되었다.
- Medical College of Ohio 교수였던 Daniel Drake는 1832년에 의과대학생이 “소화불량, 두통…심계항진, 건강염려증, 권태[무기력], 동요증[쉼 없는 신체 움직임], 안절부절못함, 그 밖의 신경과민 형태”에 취약하다고 언급했다.57 (p. 56) 그는 절제된 생활방식과 야외운동으로 이를 예방할 수 있다고 제안했다.
- 1863년에 사망하기 전 University of Maryland 교수 Samuel Chew는 의과대학의 정서적 스트레스와 시험과정 사이의 연관성을 지적했다. 그는 “…불면, 두통, 현기증, 사고의 혼란, 기억력 감퇴, 그리고 신경계의 심각한 장애를 시사하는 여러 다른 증상”58 (p. 55)을 겪는 의과대학생을 묘사했다. 이 학생은 최종시험에서의 수행을 반복적으로 걱정했으며, 시험 전에 24시간 넘게 잠을 자지 않는 일이 흔했다. Chew는 그 학생에게 “지나치거나 조절되지 않은 노력”을 삼가라고 제안했다.58 (p. 56)
시험을 포함한 의과대학의 학문환경과 학생 정신건강 사이의 더 광범위한 연관성은 거의 90년 전에도 분명히 인식되었다.59,60 1937년 Strecker 등은 시험불안의 기여를 지적하며 “…네 명의 정신과 의사가 면밀히 분석한 결과, 한 대표적인 의과대학 최종학년 학생의 46%를 약간 넘는 수가 중대한 성격의 신경증적 장애를 겪는 것으로 나타났다면, 의과대학에 심각한 정신위생 문제가 존재하는 것”이라고 했다.60 (pp. 1228–9) 그러나 그들은 이에 기여했을 수 있는 교육환경의 속성을 다루기보다, 학생과 교수진의 긴밀한 관계가 불안과 스트레스를 완화할 수 있다고 제안했다.59 역사적으로 의과대학생의 웰빙과 정신건강에 대한 위협은 학문환경과 연결되어 있었다. 그러나 해결의 책임은 고통에 기여하는 학문환경의 속성을 비판적으로 검토하는 대신 학생 자신에게 부과되었다. 놀랍지 않게도 불안, 우울, 번아웃을 포함한 중대한 정서·정신적 고통의 위험은 오늘날 의과대학생에게도 지속되고 있다.8
역사적 관점의 현대적 관련성 (Contemporary relevance of historical perspectives)
임상실습 학년에서 단계형 성적평가가 널리 사용된다는 사실은 그것이 현대 의학교육에 확고히 자리 잡았음을 보여준다. 현재 미국 의과대학 155개교의 약 84%가 필수 임상실습에서 어떤 형태로든 단계형 성적평가를 사용하며, 그 비율은 증가하고 있다.4 이처럼 두드러진 위상은 환자와 환자집단의 요구를 충족할 수 있는 의사 인력을 양성하는 데 단계형 성적평가가 효과적이고 타당하다는 견고한 역사적 토대가 있음을 시사할 법하다. 그러나 그러한 역사적 토대는 존재하지 않는 것으로 보인다. 임상실습 학년에서 단계형 성적평가 사용이 증가하는 추세는 직무현장 기반 사정(workplace-based assessments, WBAs), 위임가능 전문직업무(entrustable professional activities),61,62 지원자의 고유한 속성에 대한 총체적 검토(holistic review),63,64 프로그램화 평가(programmatic assessment)65 등 졸업후의학교육 지원자를 선발하는 다른 패러다임적 접근법이 사라졌거나 효과적으로 사용하기 어려워진 데 대한 대응일 수 있다. 또는 이러한 추세는 애초에 의과대학생을 위한 타당한 사정·평가도구로서 단계형 성적평가가 지닌 역사적 맥락과 의심스러운 기원을 인식하지 못한 결과일 수 있다. 오늘날 단계형 성적평가를 통한 의과대학생 평가는 의료실무의 다양한 차원에 대한 타당도에 초점을 맞추고 있지만, 의과대학생과 미래의 환자를 더 잘 섬기려면 우선 의학교육에서 단계형 성적평가의 역사적 토대 자체가 타당한지에 주목하는 편이 나을 수 있다. 단계형 성적평가는 향후 수련과 실무에서의 성공에 필요한 준비도(readiness), 신뢰가능성(trustworthiness), 숙달(mastery)을 제대로 대변하지 못하는 부적합한 대리지표(proxy)이다.
단계형 성적평가는 현대 의학교육을 여전히 괴롭히는 과학적 사실의 암기와 회상에 대한 과도한 의존을 정당화했으며—가속했다고 볼 수도 있다. 시험 수행 향상을 목표로 하는 학습보조자료와 시험 코칭이 교육과정에 넘쳐나면서 학습자의 탐구심은 효율성이라는 명분 아래 희생된다. 이에 대한 문제의식이 일찍부터(Flexner에게서조차) 있었음에도, 미국에서 대안적인 사정·평가 패러다임을 진지하게 고려하고 실행하려 하면 흔히 저항에 부딪힌다. 이는 학생 동기, 기관의 평판, 전공의 선발과정에 부정적 영향을 줄 것이라는 두려움 때문일 수 있다. 그러나 미국 의과대학 대다수의 임상실습에서 숙달학습(mastery learning)을 단계형 성적보다 계속 부차적으로 취급하면, 숙달학습의 달성 여부와 관계없이 시험 수행과 학급 순위에 지향된 학문적 사고방식이 영속된다. 그 결과 내재적 동기, 집단 응집성, 의사 인력의 다양성을 포함하여 의료실무에 중요한 다른 속성들은 과거에도 부정적 영향을 받았고 지금도 그러하다.
마지막으로 20세기 초 단계형 성적평가가 고착되면서 학생 사정과 학생 정신건강 사이의 연관성도 인식되었다. 그러나 이러한 인식은 의과대학생 사정과 평가의 목표와 올바른 형식을 비판적으로 검토하도록 촉진하기에 충분하지 않았다. 단계형 성적평가가 의과대학생의 스트레스와 불안, 번아웃, 집단 응집성 저하, 경쟁 심화, 의학계에서 과소대표된 학생의 불리함과 연관된다는 문헌이 발전하고 있음에도, 이러한 비판적 검토의 부재가 놀랍게도 계속되고 있다.8–11
미래에 정보를 제공하기 위한 과거의 탐색 (Exploring the past to inform the future)
단계형 성적평가의 본래 의도 가운데 하나였던 학생의 사회적·학업적 행동에 영향을 미치는 수단으로서의 단계형 성적평가를 넘어서려면, 실제로 숙달학습과 더 나은 환자 결과(patient outcomes)로 이어지는 선택지를 탐색해야 한다. 이는 필기시험이 중요한 사정도구로 남아서는 안 된다는 뜻이 아니다. 필기시험은 의학교육에서 역사적으로나 현재에도 토대가 되는 역할을 한다. 사정의 한 형태로서 필기시험—가장 흔하게는 선다형 시험문항—은 학생이 의과대학 교육과정에서 자신이 이룬 성취와 진전을 파악할 수 있게 한다. 필기시험은 효율적인 지식 사정도구일 뿐 아니라 그 자체가 잠재적인 학습경험이기도 하다.66 비판적으로 검토해야 할 것은 주로 필기시험 결과에 근거한 단계형 성적평가이다.
직무현장 기반 사정(WBA)은 더 나은 환자 결과로 이어지는 임상역량을 사정하는 논리적인 방법이며, 실제로 100여 년 전에도 권장되었다. 1911년 Johns Hopkins Hospital의 내과부장이었던 Lewellys F. Barker는 학생이 병동에서 소집단으로 일해야 하며, 고참 의사가 학생의 전문직적 진전을 직접 관찰해야 한다고 지적했다. 그 고참 의사는 “직접 학생 및 하급 직원과 긴밀한 접촉을 유지하면서—통제하고, 비평하고, 검토하고, 제안하고, 격려해야 한다.”67 (p. 618) 표면적으로는 명령조인 이 역사적 서술은 임상환경에서 교수와 학습자 사이의 능동적이고 실질적인 관계를 묘사하며, 이는 WBA의 초석이다. 또한 이 서술은 현대의 ‘서브인턴십(subinternship)’을 예견한다. 이는 WBA에 적합할 수 있고 전공의 프로그램 책임자가 선발 목적으로 사용할 수 있는 교육적·임상적으로 의미 있는 경험이다.68
WBA와 더불어 전공의 지원자에 대한 총체적 검토는 지원자의 인품이나 기관 사명과의 적합성(mission fit)을 시사하는 속성을 사정하는 데 도움이 될 수 있다.63,64 그러나 전공의 선발에서 총체적 검토를 시행하려면 교수자, 학습자, 행정 인력의 시간과 자원이 더 많이 필요하며, 이러한 자원을 확보하기 어렵다는 점은 오래전부터 인식되어 왔다. Holmes는 1899년 전공의 선발에서 필기시험 결과만 강조하는 현실을 개탄하면서, 의학 졸업생에 대한 의무진의 더 총체적인 검토가 지닌 어려움도 인정했다.
- “…[의무진은] 전적으로 필기시험만을 근거로 인턴을 선발하기로 했다. 지원자의 적합성과 능력을 검증하는 다른 모든 방법은 생각해보지 않았거나, 적용이 어렵다고 여겨져 제쳐두었거나, 비인격적인 방식으로 적용할 수 없다는 이유로 배제되었다.”54 (p. 927)
총체적 검토의 부담에도 불구하고 의과대학과 전공의 지원자 선발에서 그 사용은 증가하고 있다.63 그러나 일부 기관에서는 미국 의사면허시험(United States Medical Licensing Examination, USMLE)의 ‘절단점(cut-off)’ 같은 특정 지표를 충족한 뒤에야 총체적 검토가 이루어진다.63 USMLE Step 1이 범주형 합격-불합격 지표(categorical pass-fail metric)로 바뀌면서 학급 순위와 USMLE Step 2 점수 같은, 대안적이면서도 편의적인 선별·선발 기준을 찾으려는 움직임이 심화되었다. USMLE는 전공의 선발과정에서 지원자를 변별하기 위한 도구로 설계되지 않았으며 현재도 그러한 용도를 의도하지 않는다.69 그러나 전공의 수련프로그램 책임자는 여전히 USMLE Step 2 점수, 단계형 성적평가, 학급 순위 등의 지표를 사용해 전공의를 선발하며, 그 결과 기본의학교육 교육과정에서 이러한 지표에 대한 강조와 그로 인한 해로운 영향이 영속된다.70,71
기본의학교육에서 졸업후의학교육으로 이행할 때 단계형 성적평가와 학급 순위를 사용하는 것은, 모든 전문과목의 전공의 수련을 위해 총체적으로 교육받고 회복탄력적이며 다양한 지원자 풀을 강화할 수 있는 대안적 교육과정 설계를 의과대학이 탐색할 역량도 제한한다. 단계형 성적평가를 중단하고 준거기반(criterion-based) ‘합격-불합격’ 평가 패러다임을 확립한 곳에서는 학생들이 긍정적으로 반응했으며,72 교수진은 교육자이자 평가자로서 변화하는 자신의 역할에 호기심과 낙관을 보였다.73 단계형 성적평가를 사용하는 의과대학 출신 전공의를 프로그램 책임자가 더 선호하지는 않는다는 관찰은, 전공의 선발과정에 미칠 영향에 관한 우려를 어느 정도 완화한다.74
약 150년 전 잘 훈련된 의사를 보장하기 위해 면허요건과 의사면허시험 같은 주 법률의 개입이 등장했던 것과 유사하게,31 오늘날 의학교육합동위원회(Liaison Committee on Medical Education, LCME)와 졸업후의학교육인증위원회(Accreditation Council for Graduate Medical Education, ACGME) 같은 인증기구가 교육혁신을 촉진하고 기본의학교육에서 졸업후의학교육으로 이행할 때 시험점수, 학급 순위, 단계형 성적평가에 과도하게 의존하지 않도록 의미 있는 효율성을 창출하는 기준을 마련할 수 있을 것이다. 주 면허요건은 의학 ‘학위공장(diploma mills)’이 결국 사라지고 기본의학교육의 전반적 기준이 높아지는 과정을 가속했다.31 마찬가지로 인증을 통한 감독은 기본의학교육과 졸업후의학교육의 교육환경에 영향을 줄 수 있고 실제로 영향을 주며,75–77 기본의학교육에서 졸업후의학교육으로의 이행에 의미 있는 개혁을 일으키도록 활용할 수 있다.
- 예를 들어 ACGME는 전공의·전임의 프로그램 졸업자의 전문의 인증시험(board certification) 합격률로 프로그램 효과성을 평가한다.78 따라서 프로그램 책임자는 이러한 시험에 불합격할 가능성이 가장 낮은 지원자를 선발하려 한다. USMLE 점수와, 그보다 정도는 덜하지만, 의과대학 성적이 전문의 인증시험 성공을 예측하는 데 도움이 되므로 프로그램 책임자는 전공의 선발과정에서 자연스럽게 이러한 지표에 초점을 맞춘다.
- 마찬가지로 LCME가 의과대학 인증에서 USMLE 합격률을 교육과정 효과성의 측정치로 사용하면79 시험점수와 그 밖의 정량적 성공지표에 대한 과도한 의존이 영속된다.
그러므로 ACGME와 LCME는 의과대학생과 수련생의 교육환경에 영향을 미치기 위해 교육효과성에 관한 대안적 측정치를 강조할 수 있다. 어쩌면 일차진료 전공의 수련에 진입하는 의과대학 졸업생의 수와, 의료취약 농촌 및 도시 지역에서 진료를 시작하는 전공의 프로그램 졸업생의 수에 주목하고 이를 강조하는 것이 학술의료체계가 봉사하는 인구집단에 더 의미 있는 대안적 효과성 지표가 될 수 있다.
이러한 역사적·현대적 쟁점을 모두 고려하여 우리는 몇 가지 ‘다음 단계(next steps)’를 제안한다.
- 첫째, 학술의료센터와 교수진은 교육과정의 발전과 개혁을 고려할 때 미국 학생 사정과 평가의 역사적 뿌리를 참작해야 한다. 단계형 성적평가에서 벗어나는 전환은 학생 평가의 발전 과정에서 발생하는 극단적인 단절이 아니라, 의과대학생의 단계형 성적평가가 애초에 적절히 검증되지 않았음을 인정하는 것이라는 점에서 안심해도 된다. 이는 지역·권역·전국 수준의 발표와 기관 내·기관 간 대화를 통해 이루어질 수 있다.
- 둘째, 현재 미국 전역의 의과대학에서 고려하거나 시행 중인 사정·평가 패러다임 가운데 프로그램화 평가(programmatic assessment)—필수 역량과 술기를 발달시키는 학습자의 진전을 포괄적·종단적으로 조망하기 위해 전체 교육프로그램에 걸쳐 여러 출처의 자료를 수집하고 분석하여 학생 학습을 평가하는 접근법—는 이 논문에서 제기한 여러 역사적 우려를 다루는 것으로 보인다.65 빈번한 피드백, 여러 사정방법의 통합, 코칭, 비례성(proportionality: ‘고부담’ 평가를 그에 비례하는 탄탄한 사정으로 뒷받침하는 것)을 포함한 프로그램화 평가의 특성은 임상추론(clinical reasoning)을 촉진하는 데 적합해 보인다. 역사적으로 의사 도제의 임상추론 능력은 의사 멘토의 지도와 직접관찰을 통해 촉진되고 평가되었다. 학생-교수 간 충분한 접촉을 갖춘 프로그램화 평가는 초기 미국 의사교육의 역사적 뿌리를 상기시키는 접근법이다. 이 접근법에는 더 많은 교수자의 시간과 노력뿐 아니라, 의과대학생에게 시의적절하고 진정성 있으며 의미 있고 효과적인 사정과 피드백을 제공하는 역량을 강화하기 위한 상당한 교수개발(faculty development)이 필요하다.65,73 임상실습 경험 말미의 평가는 여러 사정방법에 근거해야 하며, 모든 의학 전문과목에 공통으로 필요한 기본 임상술기를 개선할 기회를 포함해야 한다. 우리는 하나의 지향점으로서 의학교육에서 ‘최종시험(final exam)’이라는 용어와, 그러한 시험의 수행 결과에 따른 학생의 단계형 성적평가를 퇴장시키고자 한다. 의사 경력의 어느 단계에서도 학습은 결코 ‘최종’이 아니라고 믿기 때문이다. 프로그램화 평가를 향한 패러다임 전환은 의학교육 사정과 평가의 역사적 뿌리를 인정하는 것이며, 긍정적인 전진이다.
결론 (Conclusion)
지난 250년 동안 의과대학생 수행에 대한 단계형 성적평가가 언제, 어떻게, 왜 진화했는지를 성찰하면, 학생과 그들이 돌보게 될 환자 및 지역사회를 가장 잘 지원하는 사정·평가 패러다임을 결정하는 데 따르는 어려움을 더 잘 이해하게 된다. 강력한 교육학적 토대의 부재, 숙달학습보다 암기에 몰두해 온 관행, 의과대학생의 역량·진전·성공을 확실히 판정할 수 없다는 초기의 인식, 고부담시험과 의과대학생 정신건강 사이의 연관성에 대한 초기 발견은 단계형 성적평가가 흔히 초래하는 해로운 영향에 관한 현재의 논의에 정보를 제공해야 한다. 사정과 평가를 둘러싼 지속적인 논쟁에 대한 우리의 집단적 대응은 의학교육에서 단계형 성적평가가 지닌 역사적 합리성과 지속적인 결과를 모두 고려해야 한다.
'논문 읽기 (with AI)' 카테고리의 다른 글
| 의학교육에서의 인공지능에 관한 조시아 메이시 주니어 재단 회의: 회의 경과와 권고안 (Acad Med. 2025) (0) | 2026.09.26 |
|---|---|
| 학부 의학교육을 위한 기초 역량 (AAMC, AACOM, ACGME, 2024) (0) | 2026.09.26 |
| AI는 의학교육을 어떻게 바꿀까 — Macy Foundation 혁신 보고서 Part II (Acad Med, 2025) (0) | 2026.09.01 |
| AI는 지금 의학교육의 어디쯤 와 있을까 — Macy Foundation 혁신 보고서 Part I (Acad Med, 2025) (0) | 2026.09.01 |
| AI를 의학교육에 어떻게 넣을 것인가: AI-PACE 프레임워크 (npj Digital Medicine, 2026) (0) | 2026.09.01 |