LLM 분류는 특성 공학이다
LLM을 직접 분류기로 쓰면 교정(calibration) 불가, 정형 데이터 반영 불확실, 해석 가능성 부족 등의 문제가 있다는 지적입니다. 저자는 LLM의 판정을 로지스틱 회귀의 하나의 '특성(feature)'으로 사용하면 표준 ML 알고리즘의 편의성과 LLM의 성능을 동시에 얻을 수 있다고 주장합니다. 실무자에게는 LLM 판정을 후처리 모델로 감싸는 접근법이 실용적인 대안이 될 수 있습니다.
LLM을 분류기로 사용하는 방식(프롬프트를 컨텍스트에 적용하고 라벨을 반환하는 방식)은 다루기가 까다롭다. 특히 성능이 꽤 괜찮게 나오는 경우가 많아서 더욱 고통스럽다. 분류기에 바라는 몇 가지 특성을 살펴보고 LLM 분류기가 어떻게 평가되는지 보자.
교정(Calibration) / 임계값 제어 LLM의 판정은 대개 하드 라벨(hard label)이다. 토큰 로그 확률(log probability)을 얻을 수는 있지만 이것이 잘 교정되어 있다고 믿을 메커니즘이 없다. LLM에게 신뢰도를 물어볼 수도 있지만 그 답변이 잘 교정되어 있으리라 볼 근거도 없다. 관련 문제로, 이런 라벨로는 정밀도(precision)와 재현율(recall)을 체계적으로 조절하기가 상당히 어렵다.
가용한 모든 정보의 반영 LLM은 비정형 데이터를 다루는 데 훌륭하지만, 우리는 종종 좋은 정형(structured) 데이터도 갖고 있다. 이를 프롬프트에 붙여넣을 수는 있지만 LLM이 반드시 이를 사용해야 하는 것은 아니다. 프롬프트의 산문 부분조차 LLM이 실제로 사용했는지 알 수 없다. 최소한으로도 답답한 일이고, 아마도 일부 신호를 잃고 있을 것이다. LLM에는 사전 학습된 사전 정보(prior)가 내장되어 있는데, 이것이 우리의 데이터 분포와 잘 맞지 않을 수 있다. 예를 들어 LLM은 우리가 양성 클래스가 희귀한 모집단을 테스트하고 있는지, 양성 클래스가 비교적 흔한 강화된 집단을 테스트하고 있는지 알지 못한다. 이런 맥락을 프롬프트에 줄 수는 있지만, 그러려면 새 모집단마다 이를 수정해야 하고, 첫 번째 문제에서처럼 LLM이 이를 판단에 적절히 반영할지도 불분명하다.
해석 가능성(Interpretability) 어떤 면에서 LLM 프롬프트는 매우 해석 가능하다. 결국 산문으로 쓰여 있으니까. 하지만 불행히도 LLM 내부에서 정확히 무슨 일이 일어나는지, 프롬프트의 어떤 부분이 올바르게(혹은 전혀) 따라지고 있는지 우리가 정확히 알지 못한다.
이러한 실패는 LLM의 잘못이 아니다. LLM은 애초에 분류기로 설계되지 않았고, 실제로 위의 일부 기능을 그럴듯하게 수행할 메커니즘 자체가 없다. 다만 우리가 문제를 잘못 생각하고 있을 뿐이다…
LLM 분류는 특성 공학(feature engineering)이다
LLM의 힘을 활용하는 적절한 프레임워크를 갖추면 표준 ML 알고리즘의 편의성과 함께 LLM의 강력함을 얻을 수 있다. 가능한 일의 맛보기로, LLM 판정을 간단한 로지스틱 회귀로 감싸보자:
p(y = 1 | x) = σ(α + β · LLM(x))
β → ∞인 특수한 경우에는 기본적으로 원래의 LLM 분류기가 회복된다는 점에 유의하라! 하지만 그건 어리석은 파라미터 선택 정책이다. 대신 평소처럼 훈련 데이터로 파라미터를 추정하자. 그러면 두 가지 경우로 귀결되며 경험적(empirical) 추정값을 얻는다.
p(y = k | LLM(x) = 1) = Σᵢ I(yᵢ = k 그리고 LLM(xᵢ) = 1) / Σᵢ I(LLM(xᵢ) = 1)
이제 요구사항을 다시 살펴보자.
교정 / 임계값 제어: 앞서 말했듯이 LLM 예측을 하나의 특성으로 사용하면 경험적 비율에 따른 두 개의 예측값을 얻는다(따라서 기대값 기준으로 교정됨). 더 많은 특성을 추가하면(다음 항목 참고) 더 많은 고유한 지점을 얻게 되고, 모델이 충분히 유연하다면 대략적으로 잘 교정된 결과를 얻을 수 있다(이를 개선할 방법도 있다). 그리고 실제 확률값이 출력되므로 필요에 따라 정밀도와 재현율을 조절하는 운영 임계값을 선택할 수 있다.
가용한 모든 정보의 반영: 이건 그냥 로지스틱 회귀이므로 당연히 다른 공변량(covariate)을 추가할 수 있다. 서로 다른 기저율(baseline)에 적응하기 위해 로지스틱 회귀는 훈련 데이터셋에 맞춰 학습되므로 해당 기저율과 공변량 구조에 적응한다. 관심 있는 다른 분포를 겨냥하도록 예제에 가중치를 다시 부여할 수도 있다.
해석 가능성: LLM 판정 자체를 해석하는 문제는 여전히 남아 있지만, 이제 그 판정이 최종 결정에 어떻게 기여하는지(특히 다른 공변량이 있는 경우) 더 잘 파악할 수 있다.