[20260715 특별세미나] Interpretable Reward Modeling with Active Concept Bot…

페이지 정보

profile_image
작성자 정송희
댓글 0건 조회 92회 작성일 26-07-15 15:09

본문

[일시] 2026.07.15.

[세미나 주제]

Interpretable Reward Modeling with Active Concept Bottlenecks

[발표자]

정송희

[요약]

본 발표에서는 기존 Concept Bottleneck Model(CBM)의 해석 가능성을 유지하면서 Human Intervention 비용 문제를 해결하기 위한 Learning to Intervene on Concept Bottlenecks와 이를 Reward Modeling에 적용하고 Active Learning을 통해 Concept Label 비용을 줄이는 Interpretable Reward Modeling with Active Concept Bottlenecks 논문을 리뷰하였다.

기존 CBM은 입력(Input)과 최종 예측(Prediction) 사이에 사람이 이해할 수 있는 Concept Bottleneck을 추가하여, 먼저 Concept를 추론한 뒤 이를 기반으로 최종 Prediction을 수행하는 모델이다. 기존 딥러닝 모델은 입력에서 바로 결과를 예측하기 때문에 모델이 어떤 근거로 판단했는지 해석하기 어렵지만, CBM은 중간 Concept를 통해 모델의 판단 과정을 분석하고 사람이 개입할 수 있다는 장점을 가진다.

CBM은 크게 두 가지 장점을 가진다. 첫째, Interpretability를 통해 모델이 어떤 Concept를 기반으로 Prediction을 수행했는지 확인할 수 있다. 둘째, Human Intervention을 통해 모델이 잘못 예측한 Concept를 사람이 수정하고, 수정된 Concept를 기반으로 최종 Prediction을 수행할 수 있다. 그러나 이러한 장점은 사람이 직접 Concept Label을 제공해야 한다는 비용 문제를 발생시킨다. 또한 모든 입력에 대해 Human Intervention을 수행할 경우 높은 Annotation 및 Intervention Cost가 요구된다는 한계가 존재한다.

Learning to Intervene on Concept Bottlenecks는 이러한 문제를 해결하기 위해 Concept Bottleneck Memory Model(CB2M)을 제안하였다. CB2M은 기존 CBM 구조에 Memory Module을 추가하여 과거에 사람이 수정했던 Concept Intervention 정보를 저장하고, 이후 유사한 입력이 발생했을 때 해당 정보를 재사용하는 방식을 제안한다. 이를 통해 반복적인 Human Intervention을 줄이고 효율적인 Concept 기반 예측을 수행한다.

Interpretable Reward Modeling with Active Concept Bottlenecks는 CBM 구조를 LLM Reward Model에 적용하여 Reward Model의 판단 근거를 Concept 단위로 해석 가능하게 만드는 Concept Bottleneck Reward Model(CB-RM)을 제안하였다. 기존 Reward Model은 단순히 선호 점수만 출력하기 때문에 왜 특정 응답을 선호하는지 설명하기 어렵지만, CB-RM은 LLM Feature를 Concept Predictor를 통해 Concept Representation으로 변환하고 이를 기반으로 Reward를 예측하여 해석 가능한 Reward Modeling을 가능하게 한다.

하지만 CB-RM 역시 Concept Label을 확보하기 위한 Human Annotation 비용 문제가 존재한다. 이를 해결하기 위해 본 논문은 Active Learning 기반 Acquisition Function을 적용하여 모든 Concept Label을 받는 대신, 모델 학습에 가장 정보 가치가 높은 Sample-Concept Pair를 선택적으로 Human에게 질문하는 방법을 제안한다.

본 논문에서는 Random Selection, Concept Variance, CwIS(Concept-wise Influence Score), EIG(Expected Information Gain)를 비교하였다. EIG는 해당 Concept Label을 얻었을 때 모델의 불확실성을 가장 많이 감소시킬 수 있는 Sample-Concept Pair를 선택한다.

실험 결과, EIG 기반 Active Learning은 다른 방법 대비 높은 Concept Accuracy를 달성하여 더 효율적으로 Concept Predictor를 학습할 수 있음을 보였다. 또한 Preference Accuracy는 기존 방법과 유사한 수준을 유지하여, Concept 기반 해석 가능성을 향상시키면서도 Reward Model의 성능 저하 없이 유지할 수 있음을 확인하였다.

[Q&A]

Q : Preference Accuracy에서는 왜 EIG와 다른 Acquisition Function 간의 차이가 거의 없나요? 그리고 왜 Preference Accuracy를 평가했나요?

A :
이 논문의 핵심 목표는 Concept Bottleneck을 활용해서 Reward Model을 해석 가능하게 만들면서도 기존 Reward Model의 성능을 유지할 수 있는지 확인하는 것입니다. 그래서 실험에서는 Concept Accuracy와 Preference Accuracy를 함께 평가했습니다.
Concept Accuracy는 Active Learning 전략이 사람이 정의한 Concept을 얼마나 효율적으로 학습하도록 도와주는지를 확인하기 위한 지표입니다. EIG는 모델이 가장 많은 정보를 얻을 수 있는 Concept Label을 선택하기 때문에 Concept Accuracy 측면에서 가장 높은 성능을 보입니다.
반면 Preference Accuracy는 최종 Reward Model이 사람의 선호 비교 결과를 얼마나 정확하게 예측하는지를 의미합니다. 이 지표를 평가한 이유는 Concept 학습 성능이 좋아지더라도 최종 Reward 성능이 떨어진다면 실제 Reward Model로 활용하기 어렵기 때문입니다. 즉, Concept Accuracy는 높이면서도 기존의 선호 예측 성능은 유지되는지를 확인하기 위해 사용한 것입니다.
Preference Accuracy에서 EIG와 다른 방법들의 차이가 거의 나타나지 않는 이유는 Active Learning의 목적이 최종 Preference Prediction 성능을 직접 향상시키는 것이 아니라, Reward Model 내부의 Concept 표현을 더 효율적으로 학습하는 것이기 때문입니다.
또한 최종 Reward는 여러 Concept들의 조합을 기반으로 결정되기 때문에, 특정 Concept 학습 방식의 차이가 전체 Preference Accuracy에는 크게 영향을 주지 않을 수 있습니다.
따라서 EIG가 Concept Accuracy에서는 큰 향상을 보였지만 Preference Accuracy에서는 비슷한 성능을 유지한 것은, EIG가 Reward 성능을 유지하면서 더 적은 Concept Label로 더 좋은 해석 가능한 표현을 학습했다는 의미로 볼 수 있습니다.

[관련논문]

- Learning to Intervene on Concept Bottlenecks
- Interpretable Reward Modeling with Active Concept Bottlenecks

[녹화영상]

https://us06web.zoom.us/rec/component-page?accessLevel=meeting&action=viewdetailpage&sharelevel=meeting&useWhichPasswd=meeting&requestFrom=pwdCheck&clusterId=us06&componentName=need-password&meetingId=rEo_iXApQH7hg7NFoa2fmCtpXt5j-VjZMWGR8P_Ceivk3fOVM6yRwnhhPeowaxq7.JgjBzVWB2lvth0ke&originRequestUrl=https%3A%2F%2Fus06web.zoom.us%2Frec%2Fshare%2FjV0JArkbgwlCDGbIHNTpeqoxpfqL_2MhkOhZ0LxHq6LsTudXRg7xxwgnkKltS0kJ.6N62QYDUFKlsj8T7

첨부파일

댓글목록

등록된 댓글이 없습니다.