최고 성적을 받는 역량일수록 AI가 가장 잘 위조한다
이탈리아 보코니 대학 신입생 1,000여 명 대상 무작위 실험에서 GPT-4o 사용 학생들이 과제 점수를 크게 높였지만, 실제 학습이 개선됐는지는 검증되지 않았습니다. 현재 채점 기준이 완성도와 구조를 중시해 AI를 활용한 부정행위에 취약하다는 점이 핵심 문제로 지적됩니다.
최고 성적을 받는 역량일수록 AI가 가장 잘 위조한다
핵심 요점
보코니 대학교 신입생 1,000여 명을 대상으로 한 실험에서 GPT-4o가 경영 과제 성적을 크게 향상시킨 것으로 나타났다. 인과 추론(causal reasoning)에 관한 짧은 강의는 기존 방식의 점수를 높이지는 않았지만, 학생들이 더 다양하고 독창적인 해결책을 내놓도록 이끌었다. AI 사용이 실제 학습도 개선했는지 여부는 여전히 답이 없다. ChatGPT 없이 진행된 후속 테스트가 없었기 때문이다.
ChatGPT는 학생 과제의 품질을 크게 향상시켰고, 교육적 개입은 더 다양하고 독창적인 해결책을 장려했다. AI가 학습 자체도 향상시키는지는 열린 질문으로 남아 있다.
무엇이 좋은 학생 과제를 만들며, 그중 어떤 부분을 AI가 개선할 수 있을까? 보코니 대학교 신입생 1,053명을 대상으로 한 무작위 실험에서 GPT-4o는 경영 과제에서 유의미하게 높은 성적을 받도록 도왔다. 인과 추론에 관한 짧은 강의는 기존 점수를 높이지 못했지만, 학생들이 더 다양한 해결책과 원인·가정·제안의 실제 작동 방식에 대한 깊은 사고로 이끌었다.
GPT-4o는 채점 성과에 큰 향상을 가져왔다
2025년 11월, 경영 입문 강좌 13개 분반이 통제군, 인과 추론 강의군, GPT-4o 접근군, 또는 두 가지 모두의 네 그룹으로 무작위 배정되었다. 학생들은 대학 기념품 매장을 위한 마케팅 제안을 180단어 이내로 작성해야 했다. 강의는 일관된 인과 논리, 반증 가능성(falsifiability), 그리고 제안된 행동이 어떻게 원하는 결과로 이어질 수 있는지를 다뤘다.
GPT-4o를 사용한 학생들은 1~5점 척도에서 거의 1점 가까이 높은 점수를 받았다. 그들의 답안은 평균적으로 약 2개 더 많은 아이디어를 담고 있었으며, 논리적으로 더 일관성 있었고, 세 명의 해당 분야 전문가들의 권고사항과 더 가까웠다. 연구진이 논증 품질, 아이디어 수, 아이디어 다양성, 텍스트 특성을 통제한 후에도 측정 가능한 GPT-4o의 우위는 남아 있었다. 저자들은 이를 학생 지식의 증가가 아닌 더 높은 콘텐츠 품질 때문으로 돌렸다.
인과 추론 강의는 기존 점수를 높이지 못했다. 오히려 이 그룹 학생들의 과제는 평균적으로 약간 낮은 점수를 받았지만, 제안된 행동이 왜 효과가 있어야 하는지, 어떤 조건에서 실패할 수 있는지를 더 자주 설명했다. 또한 다른 학생들이 쓴 내용과 달리 더 다양한 아이디어를 만들어냈다. 강의와 GPT-4o를 결합해도 기존 점수에는 추가적인 향상이 없었다. 인과 추론 지표에서는 두 접근 방식이 상호 보완적이었으며, 강의 그룹의 더 큰 아이디어 다양성은 유지되었다.
채점 기준은 관습적인 답안에 유리했다
더 많은 아이디어, 더 일관된 논증, 단일 답안 내 더 큰 아이디어 다양성은 모두 높은 점수와 상관관계가 있었다. 하지만 더 강한 반증 가능성, 제안된 행동의 작동 방식에 대한 더 상세한 설명, 다른 학생들과의 차별성은 오히려 낮은 점수와 상관관계가 있었다. 이것이 독창성이 전반적으로 페널티를 받았다는 의미는 아니다. 이 과제에서 기존 점수는 주로 예상되는 해결 범위 안에 머무는 잘 구조화된 답안에 보상을 주었다. 저자들은 다양성과 독창성이 점수에 반영되어야 한다면 채점 기준에 명시적으로 포함되어야 한다고 결론짓는다.
하지만 현재의 채점 시스템은 세련됨, 구조, 완전성을 측정할 뿐 학습과 이해를 측정하지 못한다. 이로 인해 AI를 부정행위 도구로 활용하기 쉬워진다.
이 연구가 보여주지 않는 것
학생들이 ChatGPT 없이 실제로 무엇을 이해하고 유지했는지 보여줘야 하는 후속 테스트가 없었다. 저자들은 GPT의 우위가 학생이 실제로 얻은 지식에서 비롯된 것인지, 아니면 단순히 AI 도움으로 더 나은 결과물이 나온 것을 반영하는지 불분명하다고 명시적으로 인정한다. 이 연구는 이 과제에서 채점 성과가 개선되었음을 보여줄 뿐, 학습이 개선되었음을 보여주지 않는다. 실험은 단일 대학의 신입생들이 좁은 범위의 마케팅 과제를 수행하는 것만을 다뤘다.